OpenAI a annoncé mi-août la disponibilité générale d'o3-mini-high sur l'API, rendant les capacités de raisonnement avancé accessibles à des prix qui rendent viables les applications en production.
Performances
o3-mini-high atteint 80% des performances de o3 sur les benchmarks de coding (SWE-bench) et de mathématiques, pour un coût de 1,10$/M tokens en entrée et 4,40$/M en sortie — soit environ 5x moins cher que o3.
Sur les tâches de débogage de code, d'analyse de logs et de raisonnement multi-étapes, le delta avec o3 est souvent imperceptible. Le modèle brille particulièrement sur les problèmes qui nécessitent un plan avant d'exécuter.
Latence réduite
OpenAI a réduit la latence médiane de 40% par rapport à la version précédente. Les premières tokens arrivent en moins de 2 secondes pour la majorité des requêtes, ce qui ouvre la porte aux usages interactifs en temps réel.
Adoption
GitHub Copilot, Cursor et plusieurs startups de legal-tech et de finance ont déjà basculé leurs pipelines de raisonnement sur o3-mini-high. La réduction de coût change l'équation économique pour les usages qui nécessitaient auparavant des modèles GPT-4o moins précis.