Ce que les développeurs disent utiliser et ce qu’ils utilisent vraiment en production, c’est souvent deux choses très différentes. RunPod, la plateforme cloud d’IA, vient de publier son premier rapport State of AI – et les données de trafic réel contredisent plusieurs narratifs dominants de l’industrie.
Le chiffre qui va faire parler : Qwen d’Alibaba a détrôné Llama de Meta comme grand modèle de langage auto-hébergé le plus déployé sur la plateforme. Et Llama 4, malgré son lancement très médiatisé, affiche « une adoption quasi nulle » en production – les utilisateurs restent massivement sur la branche 3.x. « Le marché est pragmatique et optimise le rapport performance-prix ainsi que la latence d’inférence », résume Brennen Smith, directeur technique de RunPod.
vLLM, ComfyUI et Blackwell : les vrais gagnants de l’infrastructure IA
Côté framework d’inférence, vLLM s’est imposé comme le standard de facto avec 40 % de tous les points de terminaison LLM sur la plateforme. Pour l’IA visuelle, ComfyUI capte plus de 70 % des flux de travail d’imagerie – un outil de pipeline basé sur des nœuds qui est devenu une infrastructure incontournable sans faire beaucoup de bruit médiatique.
Sur le matériel, les GPU B200 de Nvidia ont vu leur utilisation multipliée par 25 en 2025, et l’offre Blackwell devrait quasi quadrupler d’ici mi-2026. Les charges de travail vidéo révèlent un modèle « ébauche puis raffinement » : les points de terminaison d’upscaling sont deux fois plus nombreux que ceux de génération brute – les équipes génèrent d’abord des ébauches basse résolution avant d’allouer la puissance de calcul à la production finale.
Géographiquement, les États-Unis arrivent en tête, l’Inde en deuxième position, et l’Europe représente collectivement près d’un tiers du trafic mondial. Près de deux tiers des utilisateurs de RunPod opèrent dans des secteurs autres que l’IA elle-même, avec la HealthTech (santé) et la FinTech (finance) en tête.


