Lab BLD01: LAB-M01 · Misma tarea en tres o cuatro modelos, puntuada a ciegas con rúbrica de calidad, coste, latencia y privacidad

Hoja comparativa con rúbrica previa, cinco casos, respuestas puntuadas a ciegas, coste por tarea con precio fechado, latencia mediana, valoración de privacidad y decisión de tres frases.

Tu reto: LAB-M01 · Misma tarea en tres o cuatro modelos, puntuada a ciegas con rúbrica de calidad, coste, latencia y privacidad

Necesitas

  • Cuentas de prueba en dos o tres proveedores de modelos o en un agregador de API
  • Hoja de cálculo para la rúbrica y los resultados
  • Opcional: Ollama instalado con un modelo abierto pequeño

Pasos

1. Elige una tarea real de tu producto y escribe una rúbrica de tres a cinco criterios observables, puntuados de 0 a 2, antes de ejecutar nada.

2. Prepara cinco entradas con datos ficticios:

tres típicas, una difícil y una que debería rechazarse.

3. Ejecuta cada entrada dos o tres veces en tres o cuatro modelos, uno local con Ollama si tu equipo lo permite, y anota tokens y latencia.

4. Copia las respuestas con etiquetas A, B, C y D, puntúalas a ciegas y calcula el coste por tarea con el precio fechado de cada proveedor.

5. Pondera los cuatro ejes según tu caso y redacta la decisión en tres frases:

qué modelo, por qué y qué te haría cambiar.

Checklist de calidad

Resultado final

Tabla comparativa reproducible y una decisión de modelo fechada, justificada por calidad, coste, latencia y privacidad.