AMD compte sur le logiciel libre pour se refaire une santé face à NVIDIA. La société américaine publie Instella-MoE, un modèle de 16 milliards de paramètres entraîné de zéro sur ses GPU Instinct MI300X et MI325X. Poids, checkpoints et jeux de données sont 100 % ouverts.
Prouver que l’on peut entraîner et exécuter des modèles de langage de pointe sans dépendre de l’écosystème NVIDIA CUDA est un devenu un véritable enjeu, partout dans le monde, pas qu’en Chine. En publiant l’annonce officielle d’Instella-MoE, AMD franchit un cap, l’air de rien. L’entreprise a dévoilé Instella-MoE, un modèle de langage de type Mixture-of-Experts (MoE) totalisant 16 milliards de paramètres, entièrement conçu et entraîné sur ses propres accélérateurs AMD Instinct MI300X et MI325X avec la pile logicielle ouverte AMD ROCm.
Au-delà de la performance brute, la démarche se distingue par un niveau de transparence devenu rarissime dans l’industrie.
Une architecture frugale et des innovations système
Grâce à son architecture MoE, le modèle n’active que 2,8 milliards de paramètres par token sur ses 16 milliards au total, ce qui permet de maintenir des coûts d’inférence très bas, proches de ceux d’un petit modèle dense. Instella-MoE prend en charge des fenêtres de contexte étendu jusqu’à 64 000 tokens.
Pour optimiser le traitement sur ses puces, AMD introduit deux avancées techniques majeures : l’ajout d’une porte d’activation (Gated Multi-head Latent Attention (Gated MLA)) apprise pour filtrer les réponses d’attention inutiles et accroître l’expressivité du modèle à moindre coût. De l’autre, FarSkip-Collective, une méthode de connectivité qui fait se chevaucher les communications réseau et les calculs lors du parallélisme d’experts, apportant un gain de vitesse de 12,7 % en pré-entraînement et réduisant jusqu’à 39,2 % le temps de réponse au premier token généré (Time to First Token) en inférence.

Transparence de bout en bout
Là où de nombreux acteurs se contentent de distribuer les poids finaux (open weight), AMD livre la recette complète découpée en six étapes vérifiables. Chaque phase dispose de son propre point de contrôle (checkpoint) téléchargeable :
| Étape de la chaîne d’entraînement | Nom du checkpoint | Description technique |
| Pré-entraînement | Instella-MoE-16B-A3B-Pretrain |
Modèle de base entraîné de zéro sur un corpus diversifié de 7 100 milliards de tokens. |
| Entraînement intermédiaire | Instella-MoE-16B-A3B-Midtrain |
Affinement sur des mélanges de données de haute qualité (STEM, maths, code). |
| Extension de contexte | Instella-MoE-16B-A3B-Base |
Passage de la fenêtre de contexte de 4K à 64K tokens via l’encodage YaRN. |
| Ajustement supervisé (SFT) | Instella-MoE-16B-A3B-SFT |
Optimisation pour le suivi d’instructions et le raisonnement pas à pas. |
| Alignement par préférences (DPO) | Instella-MoE-16B-A3B-DPO |
Application du DPO sans dégradation grâce au verrouillage du biais du routeur. |
| Apprentissage par renforcement | Instella-MoE-16B-A3B-Think |
Modèle final affiné par RL via le framework open source Miles. |
Sur les benchmarks d’évaluation standard, Instella-MoE-Base affiche un score moyen de 76,7, devançant d’autres architectures ouvertes comme SmolLM3-3B-Base (70,5) ou OLMo-3-7B (70,1). De son côté, la version finale Instella-MoE-Think atteint 73,22, se plaçant en tête des modèles entièrement ouverts de sa catégorie.

Distribué sous licence Research RAIL pour la recherche académique, ce projet démontre la capacité opérationnelle des GPU Instinct et des frameworks libres (Primus, Miles, SGLang) à soutenir le développement d’IA de premier plan.
Aller plus loin
L’intégralité du travail est accessible publiquement, de la collection sur Hugging Face Models d’Instella-MoE jusqu’au dépôt GitHub d’Instella-MoE contenant le code source complet.
🦋 L’actualité de l’open source en français dans votre flux. Suivez Goodtech sur Bluesky (ou vos applications AT Protocol comme W Social et Mu) grâce à notre compte officiel. Suivez, partagez, abonnez-vous à @goodtech.info !