Lab BLD01: LAB-M01 · Misma tarea en tres o cuatro modelos, puntuada a ciegas con rúbrica de calidad, coste, latencia y privacidad
Hoja comparativa con rúbrica previa, cinco casos, respuestas puntuadas a ciegas, coste por tarea con precio fechado, latencia mediana, valoración de privacidad y decisión de tres frases.
Tu reto: LAB-M01 · Misma tarea en tres o cuatro modelos, puntuada a ciegas con rúbrica de calidad, coste, latencia y privacidad
Necesitas
- Cuentas de prueba en dos o tres proveedores de modelos o en un agregador de API
- Hoja de cálculo para la rúbrica y los resultados
- Opcional: Ollama instalado con un modelo abierto pequeño
Pasos
1. Elige una tarea real de tu producto y escribe una rúbrica de tres a cinco criterios observables, puntuados de 0 a 2, antes de ejecutar nada.
2. Prepara cinco entradas con datos ficticios:
tres típicas, una difícil y una que debería rechazarse.
3. Ejecuta cada entrada dos o tres veces en tres o cuatro modelos, uno local con Ollama si tu equipo lo permite, y anota tokens y latencia.
4. Copia las respuestas con etiquetas A, B, C y D, puntúalas a ciegas y calcula el coste por tarea con el precio fechado de cada proveedor.
5. Pondera los cuatro ejes según tu caso y redacta la decisión en tres frases:
qué modelo, por qué y qué te haría cambiar.
Checklist de calidad
Resultado final
Tabla comparativa reproducible y una decisión de modelo fechada, justificada por calidad, coste, latencia y privacidad.
Entrega
Lo que escribas aquí queda registrado en tu expediente y lo evalúa la rúbrica del módulo: escribe qué has construido y dónde está (enlace, salida, captura) y cómo comprobaste que funciona. Puedes volver a entregar cuando quieras.