Extracción de texto a partir de imágenes mediante modelos VLM

dc.contributor.advisorLandeta López, Pablo Andrés
dc.contributor.authorCordero Navarrete, Edwin Ramiro
dc.contributor.departmentTecnologías de la Informaciónes_EC
dc.coverageIbarra. Ecuadores_EC
dc.date.accessioned2026-09-01T14:15:22Z
dc.date.available2026-09-01T14:15:22Z
dc.date.created2026-08-28
dc.date.issued2026-09-01
dc.description.abstractLa presente investigación aborda la extracción automatizada de texto en documentos con alto grado de deterioro físico y complejidad visual, un escenario donde los sistemas de Reconocimiento Óptico de Caracteres (OCR) tradicionales presentan fallos estructurales. El objetivo fue desarrollar y evaluar un pipeline computacional híbrido basado en Modelos de Visión- Lenguaje (VLM), comparando motores locales y en la nube frente al paradigma convencional. La metodología fue aplicada y experimental, centrada en dos modelos base, InternVL2-2B y Qwen2.5-VL-3B, optimizados mediante fine-tuning QLoRA. Se construyó un corpus propio de 26 imágenes con documentos bancarios, manuscritos cursivos, recetas médicas y grafitis. La evaluación se realizó bajo un protocolo hold-out estratificado sobre cinco documentos nunca utilizados en entrenamiento, con normalización homogénea de salidas y anotación de referencia en transcripción literal. Los resultados demostraron la superioridad de los modelos de visión-lenguaje sobre EasyOCR, que registró un Character Error Rate (CER) promedio de 0.628. InternVL2-2B con adaptador LoRA redujo el error a 0.475, Qwen2.5-VL-3B alcanzó 0.254 y Gemini 2.5 Flash obtuvo el menor error del estudio con un CER de 0.193, una reducción del 69.3 % respecto de la línea base; dado el tamaño muestral, estos valores se reportan como estadística descriptiva. Se validó la viabilidad en hardware de consumo: InternVL2-2B operó con un pico medido de 4.49 GB sobre 6 GB disponibles mediante gestión secuencial excluyente de memoria, mientras que Qwen2.5-VL-3B alcanzó 8.12 GB y excedió ese presupuesto, delimitando el compromiso entre precisión y viabilidad de despliegue. El estudio aporta además un hallazgo metodológico: cuando la anotación de referencia no es una transcripción literal, las métricas de distancia de edición invierten el orden de desempeño al penalizar la fidelidad. Finalmente se propone una arquitectura híbrida adaptativa con enrutamiento gobernado por un índice de confianza visual previo a la inferencia.es_EC
dc.description.degreeIngenieríaes_EC
dc.identifier.mfn0000047448es_EC
dc.identifier.other04/ITI/ 017es_EC
dc.identifier.urihttps://repositorio.utn.edu.ec/handle/123456789/20225
dc.language.isospaes_EC
dc.rightsopenAccesses_EC
dc.rightsAtribución-NoComercial-CompartirIgual 3.0 Ecuador*
dc.rights.urihttp://creativecommons.org/licenses/by-nc-sa/3.0/ec/*
dc.subjectAUTOMATIZACIÓNes_EC
dc.subjectANÁLISIS AUTOMÁTICO DE TEXTOSes_EC
dc.subjectTECNOLOGÍA DE LA INFORMACIÓNes_EC
dc.titleExtracción de texto a partir de imágenes mediante modelos VLMes_EC
dc.typebachelorThesises_EC

Files

Original bundle

Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
04 IT 017 logo.jpg
Size:
54.47 KB
Format:
Joint Photographic Experts Group/JPEG File Interchange Format (JFIF)
Description:
Logo
Loading...
Thumbnail Image
Name:
04 IT 017 TRABAJO GRADO.pdf
Size:
10.52 MB
Format:
Adobe Portable Document Format
Description:
Trabajo de Grado

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.56 KB
Format:
Item-specific license agreed upon to submission
Description: