Extracción de texto a partir de imágenes mediante modelos VLM
Loading...
Date
item.page.document-date
2026-08-28
Authors
item.page.advisor
item.page.mfn
0000047448
item.page.location-code
04/ITI/ 017
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
La presente investigación aborda la extracción automatizada de texto en documentos con alto grado de deterioro físico y complejidad visual, un escenario donde los sistemas de Reconocimiento Óptico de Caracteres (OCR) tradicionales presentan fallos estructurales. El objetivo fue desarrollar y evaluar un pipeline computacional híbrido basado en Modelos de Visión- Lenguaje (VLM), comparando motores locales y en la nube frente al paradigma convencional. La metodología fue aplicada y experimental, centrada en dos modelos base, InternVL2-2B y Qwen2.5-VL-3B, optimizados mediante fine-tuning QLoRA. Se construyó un corpus propio de 26 imágenes con documentos bancarios, manuscritos cursivos, recetas médicas y grafitis. La evaluación se realizó bajo un protocolo hold-out estratificado sobre cinco documentos nunca utilizados en entrenamiento, con normalización homogénea de salidas y anotación de referencia en transcripción literal. Los resultados demostraron la superioridad de los modelos de visión-lenguaje sobre EasyOCR, que registró un Character Error Rate (CER) promedio de 0.628. InternVL2-2B con adaptador LoRA redujo el error a 0.475, Qwen2.5-VL-3B alcanzó 0.254 y Gemini 2.5 Flash obtuvo el menor error del estudio con un CER de 0.193, una reducción del 69.3 % respecto de la línea base; dado el tamaño muestral, estos valores se reportan como estadística descriptiva. Se validó la viabilidad en hardware de consumo: InternVL2-2B operó con un pico medido de 4.49 GB sobre 6 GB disponibles mediante gestión secuencial excluyente de memoria, mientras que Qwen2.5-VL-3B alcanzó 8.12 GB y excedió ese presupuesto, delimitando el compromiso entre precisión y viabilidad de despliegue. El estudio aporta además un hallazgo metodológico: cuando la anotación de referencia no es una transcripción literal, las métricas de distancia de edición invierten el orden de desempeño al penalizar la fidelidad. Finalmente se propone una arquitectura híbrida adaptativa con enrutamiento gobernado por un índice de confianza visual previo a la inferencia.
Description
Citation
Collections
Endorsement
Review
Supplemented By
Referenced By
Creative Commons license
Except where otherwised noted, this item's license is described as openAccess

