Extracción de texto a partir de imágenes mediante modelos VLM

Loading...
Thumbnail Image

item.page.document-date

2026-08-28

item.page.mfn

0000047448

item.page.location-code

04/ITI/ 017

Journal Title

Journal ISSN

Volume Title

Publisher

Abstract

La presente investigación aborda la extracción automatizada de texto en documentos con alto grado de deterioro físico y complejidad visual, un escenario donde los sistemas de Reconocimiento Óptico de Caracteres (OCR) tradicionales presentan fallos estructurales. El objetivo fue desarrollar y evaluar un pipeline computacional híbrido basado en Modelos de Visión- Lenguaje (VLM), comparando motores locales y en la nube frente al paradigma convencional. La metodología fue aplicada y experimental, centrada en dos modelos base, InternVL2-2B y Qwen2.5-VL-3B, optimizados mediante fine-tuning QLoRA. Se construyó un corpus propio de 26 imágenes con documentos bancarios, manuscritos cursivos, recetas médicas y grafitis. La evaluación se realizó bajo un protocolo hold-out estratificado sobre cinco documentos nunca utilizados en entrenamiento, con normalización homogénea de salidas y anotación de referencia en transcripción literal. Los resultados demostraron la superioridad de los modelos de visión-lenguaje sobre EasyOCR, que registró un Character Error Rate (CER) promedio de 0.628. InternVL2-2B con adaptador LoRA redujo el error a 0.475, Qwen2.5-VL-3B alcanzó 0.254 y Gemini 2.5 Flash obtuvo el menor error del estudio con un CER de 0.193, una reducción del 69.3 % respecto de la línea base; dado el tamaño muestral, estos valores se reportan como estadística descriptiva. Se validó la viabilidad en hardware de consumo: InternVL2-2B operó con un pico medido de 4.49 GB sobre 6 GB disponibles mediante gestión secuencial excluyente de memoria, mientras que Qwen2.5-VL-3B alcanzó 8.12 GB y excedió ese presupuesto, delimitando el compromiso entre precisión y viabilidad de despliegue. El estudio aporta además un hallazgo metodológico: cuando la anotación de referencia no es una transcripción literal, las métricas de distancia de edición invierten el orden de desempeño al penalizar la fidelidad. Finalmente se propone una arquitectura híbrida adaptativa con enrutamiento gobernado por un índice de confianza visual previo a la inferencia.

Description

Citation

Endorsement

Review

Supplemented By

Referenced By

Creative Commons license

Except where otherwised noted, this item's license is described as openAccess