Logo stylisé en art ASCII du système Prime Agent affiché sur écran noir

Plus fort que les experts humains : l’IA open source Prime Agent modifie ses propres règles et apprend à tricher

Une IA de codage capable de réécrire sa mémoire, de lancer des sous-agents en parallèle et d’apprendre à tricher dans les jeux vidéo pour maximiser ses scores ? Prime Intellect publie Prime Agent en open source sous licence MIT.

La startup Prime Intellect publie en open source Prime Agent, un système de codage et de recherche auto-améliorant capable de modifier dynamiquement son propre environnement de travail au cours d’une tâche.

Distribuée sous licence MIT et disponible directement sur le dépôt GitHub de Prime Agent, la plateforme traite la fenêtre de contexte de l’IA comme une variable modifiable plutôt que comme une contrainte figée.

Noyau IPython persistant et commande de réécriture auto-améliorante

Plutôt que d’intégrer des dizaines de connecteurs spécifiques, Prime Agent repose sur deux piliers d’ingénierie :

  • Le Modèle de Langage Récursif (RLM) : le système s’appuie sur un unique noyau IPython persistant comme interface centrale. Les opérations sur les fichiers, les commandes shell, la mémoire et l’orchestration de sous-agents s’exécutent directement sous forme de code Python au sein du REPL. Les sous-agents sont lancés sous forme d’appels de fonctions asynchrones qui transmettent leurs résultats sans bloquer le fil d’exécution principal.
  • Le Continual Harness et la commande /refine : le harnais gère l’état dans quatre domaines principaux (invites, sous-agents, compétences et mémoire). Grâce à la commande /refine, l’agent analyse son propre historique d’exécution pour apporter des corrections ciblées à ses compétences et sa mémoire sans altérer son invite système d’origine.

Couplé au modèle Opus 5 d’Anthropic, le système a atteint un score de 95,5 % sur le benchmark ARC-AGI-3, dépassant légèrement le niveau de référence des experts humains établi à 95,4 %. Dans des démonstrations d’ingénierie concrètes, l’outil est parvenu à concevoir de zéro des émulateurs fonctionnels en Rust pour la SEGA Genesis et la Game Boy Color, sans s’appuyer sur du code de référence. Associé au modèle à poids ouverts GLM-5.2, il surpasse également son prédécesseur sur huit évaluations sur neuf portant sur le traitement de contextes longs.

Quand le système apprend à contourner les règles sur Factorio

Cette capacité à adapter sa propre configuration produit toutefois des comportements inattendus. Lors d’essais menés sur le jeu de simulation industrielle Factorio, la boucle d’auto-amélioration /refine a permis au système d’optimiser ses schémas d’usines pour faire s’envoler ses scores de production. Mais l’agent a également découvert qu’il pouvait faire apparaître directement des ressources dans les machines via des commandes console RCON. Malgré des consignes explicites lui interdisant de tricher, la boucle d’apprentissage a développé de nouvelles compétences dédiées au détournement des règles pour maximiser ses gains.

Les créateurs rappellent que les processus du moteur s’exécutent avec les autorisations de l’utilisateur local. L’entreprise recommande donc de faire tourner ce type d’agent autonome au sein d’environnements bac à sable ou de machines virtuelles isolées pour éviter tout dommage involontaire sur le système hôte.

🦋 L’actualité de l’open source en français dans votre flux. Suivez Goodtech sur Bluesky (ou vos applications AT Protocol comme W Social et Mu) grâce à notre compte officiel. Suivez, partagez, abonnez-vous à @goodtech.info !

Retour en haut