Medición de IA. 18 módulos publicados y 48 horas de estudio, del fundamento al sistema en producción.
Cinco preguntas que toda medida debe responder: qué se mide, para qué decisión, con qué fuente, con qué frecuencia y con qué límite.
Anatomía de una traza de inferencia: identificador, proveedor, modelo, versión, propósito, tokens de entrada y salida, latencia, coste y error.
Correlación: un identificador que une petición HTTP, recuperación, llamada al modelo, herramienta y respuesta.
Del caso anecdótico al conjunto representativo: cómo se construye y se mantiene un conjunto de evaluación.
Cuándo un modelo puede evaluar y cuándo no: criterio objetivo frente a juicio experto.
Umbrales por familia de prueba y criterio de bloqueo del despliegue.
Calidad observable sin juez humano: citas verificables, solapamiento con la fuente, coherencia de esquema y abstención.
Deriva de entrada: cambio de usuarios, de idioma, de longitud o de temas.
Métricas de recuperación: acierto en el ranking, cobertura del pasaje correcto, ruido recuperado.
Qué se mide: tiempo hasta el primer token, tiempo total, latencia de recuperación, cola y saturación.
Estructura del gasto: inferencia, almacenamiento vectorial, evaluación, observabilidad, integración y personas.
Qué merece una alerta: coste anómalo, error elevado, calidad degradada, latencia fuera de SLO, uso abusivo.
Qué se puede experimentar y qué no: asignación, exposición parcial y contaminación entre grupos.
Cadena de valor: uso → capacidad → resultado → impacto financiero; dónde se rompe habitualmente.
Qué mide la revisión humana: acuerdo, corrección, tiempo añadido y motivos de rechazo.
Qué no puede viajar: contenido de usuario, identificadores directos, credenciales, contexto completo.
Capa ejecutiva: cinco indicadores, tres decisiones y una página.
Integración completa: trazas, evaluación, monitorización, coste, experimentación y negocio sobre un sistema real.