Anthropic a publié Claude 4 Opus début août 2026, et les benchmarks parlent d'eux-mêmes : le modèle dépasse GPT-4o et Gemini 1.5 Ultra sur SWE-bench (résolution de bugs réels), GPQA (sciences avancées) et MATH-500.
Ce qui distingue Claude 4
Anthropic met en avant trois avancées majeures :
- Raisonnement étendu : Claude 4 peut raisonner plusieurs minutes sur des problèmes complexes avant de répondre, avec une fenêtre de contexte de 400 000 tokens. Les tâches d'analyse de grandes codebases ou de longs documents juridiques en bénéficient directement.
- Coding agent autonome : le mode "computer use" amélioré permet à Claude 4 d'exécuter des tâches de dev complètes en autonomie — ouvrir un terminal, modifier des fichiers, lancer des tests, corriger les erreurs.
- Moins d'hallucinations : Anthropic annonce une réduction de 40% des hallucinations factuelles par rapport à Claude 3.5, mesurée sur leur benchmark interne SimpleQA.
Tarification
Claude 4 Opus coûte 15$/million de tokens en entrée et 75$/million en sortie via l'API. Claude 4 Sonnet, plus abordable (3$/M entrée), sera disponible fin août avec des performances proches.
Impact sur les outils dev
Cursor et Windsurf ont déjà intégré Claude 4 Opus comme option dans leurs éditeurs. Les premiers retours des développeurs soulignent une meilleure compréhension du contexte projet et moins de code hallucination sur les APIs peu connues.