IA aplicada a documentos. 38 módulos publicados y 101 horas de estudio, del fundamento al sistema en producción.
Qué es el OCR: convertir los píxeles de un documento en texto manipulable por una máquina.
Modelo de objetos del PDF: el documento como un grafo de objetos numerados.
La precisión del OCR depende en gran medida de la preparación de la imagen.
Tesseract como motor de referencia del OCR clásico.
Los pipelines modernos combinan OCR con parsing y reconstrucción del layout.
Un documento es una estructura espacial, no solo una secuencia de caracteres.
El enfoque monolítico pide a un único modelo entender la página entera.
Las tablas son uno de los elementos más difíciles del Document AI.
Aplicaciones: facturas, órdenes de compra, formularios fiscales, documentos de identidad, formularios administrativos y documentos de seguros.
Detección de fórmulas: localizar las ecuaciones dentro de la página.
Los gráficos contienen información semántica que no queda representada como texto plano de OCR.
Los modelos multimodales pueden razonar de forma conjunta sobre texto e imágenes.
Los modelos pequeños importan por su menor coste de inferencia.
El Document AI aporta valor cuando la salida es accionable por máquina y no texto libre.
Nunca se confía ciegamente en la extracción generativa: toda salida pasa por validación.
El alumno construye benchmarks reproducibles y no impresiones sobre capturas de pantalla.
Los documentos deben considerarse entrada no confiable.
El Document AI moderno introduce una clase de ataque nueva: la instrucción que viaja dentro del documento.
Datos personales identificables (PII) presentes en documentos.
La arquitectura se organiza alrededor de la confianza en la extracción, no de la comodidad del flujo.
Principio de partida: el fichero original y el conocimiento derivado son cosas distintas y se guardan por separado.
Cómo fragmenta el RAG tradicional: bloques de tamaño fijo, uno detrás de otro.
El pipeline completo encadenado: documento, parseo, estructura, fragmentación semántica, embeddings, base vectorial, recuperación, reranking y LLM.
Punto de partida: hay información que no se puede representar adecuadamente como texto.
Punto de partida: los documentos contienen entidades y relaciones.
El alumno construye APIs de producción, no solo scripts de procesamiento.
Regla de partida: los documentos grandes no deben bloquear las peticiones HTTP.
Punto de partida: la eficiencia de la GPU depende en gran medida del batching.
El alumno aprende a servir modelos multimodales.
Continuous batching: las peticiones entran y salen del lote en cada paso de decodificación, no en lotes cerrados.
Pods como unidad de ejecución del pipeline.
Escalado por eventos: la señal es la cola, no el consumo de CPU.
El movimiento de imágenes puede consumir una parte significativa del tiempo de un pipeline documental.
Todo documento debe ser rastreable a través del sistema.
Tres cifras de referencia que hay que saber calcular.
Plataformas que se comparan: Azure AI Document Intelligence, Google Document AI y AWS Textract.
Los documentos pasan a ser herramientas que los agentes pueden usar.
Agente de contratos: extracción de cláusulas, detección de obligaciones, identificación de riesgos y comparación.