Microsoft Azure a annoncé début septembre le déploiement en production de ses processeurs Maia 2, la deuxième génération de sa puce IA maison. C'est une étape stratégique majeure dans la course des hyperscalers à réduire leur dépendance aux GPU NVIDIA.
Performances
Selon Microsoft, Maia 2 offre :
- 2,4x plus de performance d'inférence que Maia 1 pour les modèles de langage
- Une efficacité énergétique 60% supérieure aux H100 pour les workloads d'inférence (non d'entraînement)
- Un coût d'inférence 40% inférieur aux instances GPU NVIDIA équivalentes sur Azure
Ces chiffres sont pour l'inférence uniquement. Pour l'entraînement de gros modèles, les H100 et H200 restent supérieurs et Microsoft ne prévoit pas de remplacer NVIDIA pour ces workloads.
Disponibilité
Les instances Maia 2 sont disponibles en preview privée sur Azure AI et dans les datacenters américains. Les régions européennes suivront au T1 2027. Azure OpenAI Service fera tourner une partie de ses workloads ChatGPT sur Maia 2 d'ici fin 2026.
La stratégie des Big Tech
Microsoft n'est pas seul : Google a ses TPUs v5, Amazon a les Trainium 2 et Inferentia 3. La dépendance massive aux GPU NVIDIA est une vulnérabilité stratégique et économique pour ces entreprises. NVIDIA conserve cependant une avance durable sur l'entraînement et sa part de marché sur l'inférence reste dominante à plus de 70%.