Cloudflare a publié ses chiffres Workers AI pour le premier semestre 2026 : le service traite désormais plus d'un milliard de requêtes d'inférence par jour. Pour un service lancé fin 2023, c'est une croissance spectaculaire. Et ce qui le rend intéressant pour les développeurs n'est pas tant le volume que le modèle d'exécution.
Inférence depuis le code Workers
Workers AI permet d'appeler des modèles d'IA directement depuis un Cloudflare Worker, sans configuration d'infrastructure, sans gestion de GPU, sans cold start. La latence est faible car les modèles tournent sur le réseau Cloudflare, au plus proche de l'utilisateur :
export default {
async fetch(request, env) {
const response = await env.AI.run("@cf/meta/llama-3.1-8b-instruct", {
prompt: "Explique les closures en JavaScript en 2 phrases",
});
return Response.json(response);
}
};
Le catalogue inclut maintenant plus de 60 modèles : LLMs (Llama 4 Scout, Mistral, Phi), modèles d'embedding, de traduction, de speech-to-text (Whisper), de génération d'images (Stable Diffusion), et de classification.
Le pricing qui change la donne
Workers AI facture à l'unité de neurone (compute unit) plutôt qu'au token. Sur Llama 3.1 8B, le coût est d'environ 0,0003$ pour 1 000 tokens générés, soit 3 à 5 fois moins cher que l'équivalent via OpenAI ou Anthropic. Pour des usages haute fréquence (résumés de documents, classification, extraction d'entités), la différence de coût devient significative rapidement.
Limites à connaître
Les modèles disponibles sur Workers AI sont limités aux modèles open source (pas de GPT-4o, pas de Claude). Les fenêtres de contexte sont réduites par rapport aux APIs complètes. Et la latence, bien que faible, reste plus haute que des inférences sur GPU dédiés pour les modèles lourds. Workers AI brille pour les tâches courtes et fréquentes, pas pour les analyses longues.
- Cloudflare Workers AI documentation — Cloudflare, 2026
- Cloudflare Blog — Cloudflare, juillet 2026