Visuel de la version quantifiée GGUF du modèle GLM-5.3-Flash hébergé sur Hugging Face

Mystère Ox Alpha résolu : c’était donc GLM-5.3-Flash en open weight sous licence MIT

Le mystère Ox Alpha est enfin levé ! La startup Z.ai publie les poids de son modèle multimodal GLM-5.3-Flash sous licence libre MIT sur Hugging Face. Propulsé par des puces chinoises et une architecture MoE, il casse les prix d’API.

Les acteurs chinois orchestrent encore et toujours une offensive majeure sur le terrain de l’open weight. Après une semaine de spéculations intenses sur la plateforme OpenRouter, la société Z.ai (anciennement Zhipu AI) a levé le voile sur l’énigmatique modèle « Ox Alpha ». Dans une publication de Z.ai sur X et un billet de blog officiel de Z.ai, l’entreprise confirme qu’il s’agit du modèle GLM-5.3-Flash, son premier système nativement multimodal dont les poids sont distribués sous la très permissive licence MIT.

Pendant sa phase de test anonyme, le modèle avait déjà séduit plus de 503 000 utilisateurs uniques et traité plus de 44 billions de jetons, suscitant les éloges de figures de la tech comme Patrick Collison, PDG de Stripe.

Architecture MoE et souveraineté matérielle chinoise

Sur le plan technique, GLM-5.3-Flash s’appuie sur une architecture à mélange d’experts (Mixture-of-Experts – MoE) totalisant 320 milliards de paramètres, mais n’en activant que 18 milliards par jeton. Ce découpage permet de conserver une très haute capacité de raisonnement tout en réduisant drastiquement l’empreinte de calcul lors de l’inférence. Le modèle accepte nativement des entrées en texte, image et vidéo, avec une fenêtre de contexte étendue à 1 million de jetons.

Au-delà de ses caractéristiques algorithmiques, cette publication marque une étape cruciale pour l’indépendance technologique chinoise. L’ensemble de la plateforme d’inférence de GLM-5.3-Flash fonctionne exclusivement sur des accélérateurs d’IA de fabrication nationale, couplés à une pile d’optimisation personnalisée basée sur SGLang qui a multiplié par trois les performances globales. Une démonstration d’autonomie industrielle qui contourne les restrictions d’exportation américaines sur les processeurs graphiques NVIDIA.

Performances de pointe… pour un dixième du prix

En matière de programmation et de résolution de problèmes complexes, les résultats affichés bousculent les standards actuels. Sur le benchmark spécialisé DeepSWE v1.1, le modèle atteint le score de 63,4 (contre 46,2 pour la version précédente GLM-5.2). Sur les bancs d’essai internes de développement, Z.ai affirme égaler quasiment les capacités de Claude Opus 4.8.

Modèle / Métrique Score DeepSWE v1.1 Tarif entrée (par M jetons) Tarif sortie (par M jetons)
GLM-5.3-Flash (Z.ai) 63,4 0,14 € (0,15 $) 0,46 € (0,50 $)
GLM-5.2 (Génération précédente) 46,2
Alternatives propriétaires équivalentes ~29,5 (Benchmark interne) ~1,40 € ~4,60 €

Mise à disposition en open weight

En rendant les poids du modèle librement téléchargeables sur le dépôt Hugging Face de GLM-5.3-Flash et sur ModelScope, Z.ai permet aux entreprises d’auto-héberger cette solution sans aucune contrainte commerciale. L’éditeur déploie également l’outil sur sa plateforme AutoClaw pour l’exécution d’agents autonomes.

Cette stratégie agressive d’open weight (Ndlr : combinant gratuité des poids sous licence libre, hébergement souverain et coûts d’API divisés par dix) confirme la montée en puissance des modèles chinois face au duopole OpenAI/Anthropic.

🦋 L’actualité de l’open source en français dans votre flux. Suivez Goodtech sur Bluesky (ou vos applications AT Protocol comme W Social et Mu) grâce à notre compte officiel. Suivez, partagez, abonnez-vous à @goodtech.info !

Retour en haut