Lab DOC24: LAB-M24 · Construir recuperación multimodal que combine embeddings de texto e imagen sobre documentos con gráficos y tablas complejas **Entorno:** laboratorio 034 con documentos que contienen gráficos, diagramas y tablas complejas, y un índice conjunto de texto e imagen. **Cuenta de formación:** `[email protected]`. **Resultado observable:** una consulta sobre el contenido de un gráfico devuelve la imagen correspondiente y una respuesta fundamentada en ella.
Índice multimodal en funcionamiento y una consulta documentada que solo se puede resolver por vía visual, con la imagen recuperada y la respuesta del modelo de visión.
Tu reto: Tu reto: El índice contiene embeddings de texto y de imagen; la consulta devuelve la modalidad correcta; la respuesta se apoya en el contenido de la imagen recuperada y no en el texto extraído del documento.
Necesitas
Pasos
Checklist de calidad
Comparte con tu equipo
Resultado final
Índice multimodal en funcionamiento y una consulta documentada que solo se puede resolver por vía visual, con la imagen recuperada y la respuesta del modelo de visión.