vLLM v0.19.0
Disponible · 3 avril 2026
vLLM se positionne comme la solution de serving LLM haute performance pour les équipes qui ont besoin de throughput maximum sur GPU. La version 0.19 affiche des débits 8 à 9 fois supérieurs à Ollama sous charge soutenue, principalement grâce à son PagedAttention et à son batching continu qui optimise l'utilisation des VRAM.
Le speculative decoding est affiné pour les modèles avec des têtes d'attention de tailles différentes. LoRA serving est amélioré pour permettre de basculer dynamiquement entre plusieurs adaptateurs LoRA sur un modèle de base, sans recharger les poids du modèle.
vLLM 0.19 supporte les dernières générations de modèles (Llama 4, Mistral 3, Gemma 3) avec des niveaux de quantization GPTQ et AWQ optimisés pour réduire l'empreinte mémoire sans dégradation significative de la qualité.