Lab DOC29: LAB-M29 · Servir un modelo multimodal en GPU y medirlo bajo carga **Entorno:** laboratorio 034 con una GPU y un servidor de inferencia local sobre el modelo multimodal del curso. **Cuenta de formación:** `[email protected]`. **Resultado observable:** el servidor responde a las peticiones del pipeline documental bajo la carga declarada, con el consumo de memoria, la concurrencia y los límites de tokens registrados.
Despliegue de inferencia en funcionamiento, más una tabla de medidas con el consumo de memoria de GPU, la concurrencia alcanzada, el rendimiento bajo carga y los límites de tokens aplicados.
Tu reto: Tu reto: El modelo multimodal se sirve y responde a las peticiones del pipeline; el consumo de memoria y la concurrencia están medidos y no estimados; los límites de tokens están declarados y se respetan; el alumno explica qué recurso se agota primero y por qué.
Necesitas
Pasos
Checklist de calidad
Comparte con tu equipo
Resultado final
Despliegue de inferencia en funcionamiento, más una tabla de medidas con el consumo de memoria de GPU, la concurrencia alcanzada, el rendimiento bajo carga y los límites de tokens aplicados.