Lab DOC30: LAB-M30 · Recorrer una petición de documentos desde la API hasta la GPU con el motor vLLM **Entorno:** laboratorio 034 con vLLM sirviendo el modelo documental del curso, puesto por delante de una cola que recibe la llegada irregular de documentos. **Cuenta de formación:** `[email protected]`. **Resultado observable:** el recorrido de una petición desde la API hasta la GPU, con las técnicas del motor activadas de una en una y su efecto medido sobre la misma carga documental.
El despliegue de vLLM con la arquitectura API, cola, motor y GPU documentada, más una tabla en la que cada técnica —continuous batching, PagedAttention, prefix caching, chunked prefill, tensor parallelism y speculative decoding— aparece con el problema de la carga documental que resuelve y la medida de su efecto, incluida la comparación del tiempo de proceso de un mismo documento repetido con la caché de prefijo apagada y encendida.
Necesitas
Pasos
Checklist de calidad
Comparte con tu equipo
Resultado final
El despliegue de vLLM con la arquitectura API, cola, motor y GPU documentada, más una tabla en la que cada técnica —continuous batching, PagedAttention, prefix caching, chunked prefill, tensor parallelism y speculative decoding— aparece con el problema de la carga documental que resuelve y la medida de su efecto, incluida la comparación del tiempo de proceso de un mismo documento repetido con la caché de prefijo apagada y encendida.