Lab DOC01: LAB-M01 · Recorrer la imagen hasta el texto con el pipeline de OCR clásico y explicar qué información se pierde. **Entorno:** laboratorio 034 con un lote de documentos que cubre los tipos de la unidad (documento raster, PDF digital, PDF escaneado y texto basado en imagen), un motor de OCR clásico del curso y un modelo de lenguaje para la capa de corrección lingüística. **Cuenta de formación:** `[email protected]`. **Resultado observable:** el texto extraído de cada documento del lote y la lista razonada de lo que el pipeline clásico no recupera de la página.
Un informe del recorrido completo de un documento del lote por las etapas del pipeline (preprocesado, detección de texto, reconocimiento de caracteres y corrección lingüística), con el texto resultante y, junto a él, el inventario de lo que se ha perdido: relaciones espaciales, estructura semántica, orden de lectura, tablas complejas, diagramas y contexto visual.
Tu reto: Tu reto: El informe sitúa cada documento del lote por su tipo real, distingue los casos en que el OCR es estrictamente necesario de los que ya traen texto y demuestra cada pérdida con la página original y el texto extraído, sin limitarse a enumerar las limitaciones de la unidad.
Necesitas
Pasos
Checklist de calidad
Comparte con tu equipo
Resultado final
Un informe del recorrido completo de un documento del lote por las etapas del pipeline (preprocesado, detección de texto, reconocimiento de caracteres y corrección lingüística), con el texto resultante y, junto a él, el inventario de lo que se ha perdido: relaciones espaciales, estructura semántica, orden de lectura, tablas complejas, diagramas y contexto visual.