Retour aux articles
Cloudflare Workers AI atteint 1 milliard de requêtes/jour : l'edge computing IA change la donne
DevTech28 juillet 20261 min de lecture

Cloudflare Workers AI atteint 1 milliard de requêtes/jour : l'edge computing IA change la donne

Cloudflare Workers AI traite désormais plus d'un milliard de requêtes d'inférence par jour sur son réseau edge. Des dizaines de modèles disponibles directement depuis le code Workers, sans cold start, à des prix inférieurs aux APIs cloud classiques.

Cloudflare a publié ses chiffres Workers AI pour le premier semestre 2026 : le service traite désormais plus d'un milliard de requêtes d'inférence par jour. Pour un service lancé fin 2023, c'est une croissance spectaculaire. Et ce qui le rend intéressant pour les développeurs n'est pas tant le volume que le modèle d'exécution.

Inférence depuis le code Workers

Workers AI permet d'appeler des modèles d'IA directement depuis un Cloudflare Worker, sans configuration d'infrastructure, sans gestion de GPU, sans cold start. La latence est faible car les modèles tournent sur le réseau Cloudflare, au plus proche de l'utilisateur :

export default {
  async fetch(request, env) {
    const response = await env.AI.run("@cf/meta/llama-3.1-8b-instruct", {
      prompt: "Explique les closures en JavaScript en 2 phrases",
    });
    return Response.json(response);
  }
};

Le catalogue inclut maintenant plus de 60 modèles : LLMs (Llama 4 Scout, Mistral, Phi), modèles d'embedding, de traduction, de speech-to-text (Whisper), de génération d'images (Stable Diffusion), et de classification.

Le pricing qui change la donne

Workers AI facture à l'unité de neurone (compute unit) plutôt qu'au token. Sur Llama 3.1 8B, le coût est d'environ 0,0003$ pour 1 000 tokens générés, soit 3 à 5 fois moins cher que l'équivalent via OpenAI ou Anthropic. Pour des usages haute fréquence (résumés de documents, classification, extraction d'entités), la différence de coût devient significative rapidement.

Limites à connaître

Les modèles disponibles sur Workers AI sont limités aux modèles open source (pas de GPT-4o, pas de Claude). Les fenêtres de contexte sont réduites par rapport aux APIs complètes. Et la latence, bien que faible, reste plus haute que des inférences sur GPU dédiés pour les modèles lourds. Workers AI brille pour les tâches courtes et fréquentes, pas pour les analyses longues.

Cet article a été partiellement rédigé ou modifié à l'aide d'une intelligence artificielle.