Retour aux articles
Meta publie Llama 4 Scout et Maverick : les modèles open source qui rivalisent avec GPT-4o
IATech30 juillet 20262 min de lecture1 vue

Meta publie Llama 4 Scout et Maverick : les modèles open source qui rivalisent avec GPT-4o

Meta a publié Llama 4 Scout (17 milliards de paramètres actifs, MoE) et Llama 4 Maverick (400 milliards total) en open weights. Les deux surclassent leurs prédécesseurs sur les benchmarks et se rapprochent des modèles propriétaires. État des lieux.

Llama 4 est disponible. Meta a publié fin juillet 2026 deux nouveaux modèles en open weights : Scout, un modèle Mixture-of-Experts (MoE) avec 17 milliards de paramètres actifs sur 109 milliards au total, et Maverick, un modèle plus grand avec 400 milliards de paramètres au total. Les deux sont téléchargeables gratuitement, utilisables commercialement avec quelques restrictions pour les très grandes plateformes.

Architecture MoE : plus efficace que les dense models

Llama 4 Scout utilise l'architecture Mixture-of-Experts : le modèle ne fait pas tourner ses 109 milliards de paramètres pour chaque token, mais active sélectivement 17 milliards de paramètres selon le contenu. Le résultat est un modèle qui consomme la mémoire et le calcul d'un 17B, mais avec la capacité d'un modèle plus large.

Sur les benchmarks de code (HumanEval, MBPP), de raisonnement (MATH, GSM8K) et de compréhension (MMLU), Scout dépasse clairement Llama 3.1 70B et se positionne juste en dessous de GPT-4o mini. Maverick, lui, rivalise directement avec Claude 3.7 Sonnet et GPT-4o standard sur la plupart des benchmarks.

Ce qui a changé dans l'entraînement

Llama 4 a été entraîné sur un dataset de 40 trillions de tokens, contre 15 trillions pour Llama 3. Meta a aussi introduit du synthetic data à grande échelle dans la phase post-training, ce qui améliore significativement le suivi d'instructions et la cohérence des réponses longues. La fenêtre de contexte de Scout passe à 1 million de tokens.

Comment le tester localement

Ollama supporte Scout depuis le jour de la sortie. Pour le lancer localement (recommandé sur une machine avec au moins 16 Go de RAM pour la version quantisée) :

ollama run llama4:scout

La version quantisée en 4 bits (Q4_K_M) tient dans environ 12 Go de VRAM, ce qui la rend accessible sur une RTX 3090 ou 4090. Pour un usage API, Groq et Together AI proposent déjà Scout avec une latence très compétitive.

Cet article a été partiellement rédigé ou modifié à l'aide d'une intelligence artificielle.