Lab DOC30: LAB-M30 · Recorrer una petición de documentos desde la API hasta la GPU con el motor vLLM **Entorno:** laboratorio 034 con vLLM sirviendo el modelo documental del curso, puesto por delante de una cola que recibe la llegada irregular de documentos. **Cuenta de formación:** `[email protected]`. **Resultado observable:** el recorrido de una petición desde la API hasta la GPU, con las técnicas del motor activadas de una en una y su efecto medido sobre la misma carga documental.

El despliegue de vLLM con la arquitectura API, cola, motor y GPU documentada, más una tabla en la que cada técnica —continuous batching, PagedAttention, prefix caching, chunked prefill, tensor parallelism y speculative decoding— aparece con el problema de la carga documental que resuelve y la medida de su efecto, incluida la comparación del tiempo de proceso de un mismo documento repetido con la caché de prefijo apagada y encendida.

Tu reto: Tu reto: La petición se puede describir de extremo a extremo: entra por la API, espera en la cola y la consume el motor, que habla con la GPU; la cola está presente y actúa como amortiguador entre la llegada irregular de documentos y el consumo constante de la GPU; cada técnica está asociada al problema real que atiende, con documentos largos, muchas páginas o picos de tráfico; la ganancia de la caché de prefijo sobre un documento repetido está medida y no supuesta.

Necesitas

Pasos

Checklist de calidad

Comparte con tu equipo

Resultado final

El despliegue de vLLM con la arquitectura API, cola, motor y GPU documentada, más una tabla en la que cada técnica —continuous batching, PagedAttention, prefix caching, chunked prefill, tensor parallelism y speculative decoding— aparece con el problema de la carga documental que resuelve y la medida de su efecto, incluida la comparación del tiempo de proceso de un mismo documento repetido con la caché de prefijo apagada y encendida.