Une IA pour accélérer les performances GPU Nvidia chez Apple (en open source)

Apple a annoncé avoir développé un nouveau procédé d’accélération des performances GPU, baptisé ReDrafter, et l’a publié en open source. Dans un récent article sur son blog de recherche en machine learning, la firme de Cupertino explique comment cette technologie permet d’améliorer la vitesse d’inférence des modèles de langage (LLM) sur les cartes graphiques NVIDIA, particulièrement utilisées dans les environnements de production.

Selon Apple, cette avancée n’est qu’une étape dans la course à l’inférence IA haute performance. Le point le plus intéressant ? Cette « étape » est symbolique, car Apple a choisi la voie de l’open source pour avancer.

ReDrafter, c’est quoi ?

ReDrafter (pour Recurrent Drafter) est un mécanisme de “speculative decoding” visant à accélérer la génération de texte des modèles de langage auto-régressifs (ex. GPT). Concrètement, l’idée est de s’appuyer sur un modèle RNN léger pour “proposer” plusieurs tokens (unités de texte) à l’avance, avant de confirmer ou non leur exactitude via le modèle principal (plus lourd). Cette approche permet d’augmenter le nombre de tokens générés par étape, réduisant ainsi la latence globale.

Selon Apple, ReDrafter atteint jusqu’à 3,5 tokens générés par étape sur certains modèles open source, dépassant ainsi d’autres techniques de génération spéculative précédentes. Le tout est compatible avec beam search et un mécanisme de “dynamic tree attention”, afin de gérer de multiples hypothèses simultanément.

Une intégration dans NVIDIA TensorRT-LLM

Pour rendre ReDrafter opérationnel en production, Apple a collaboré avec NVIDIA afin d’intégrer cette technique dans le framework NVIDIA TensorRT-LLM. Ce framework, déjà optimisé pour accélérer l’inférence des grands modèles de langage sur GPU, prend désormais en charge les opérateurs spécifiques dont dépend ReDrafter.

Le résultat ? Dans les tests réalisés par Apple sur un modèle LLM “de plusieurs dizaines de milliards de paramètres”, l’usage de ReDrafter au sein de TensorRT-LLM a permis d’obtenir une accélération de 2,7 fois en termes de vitesse de génération de tokens (pour du greedy decoding). Cette hausse des performances se traduit à la fois par une latence réduite pour les utilisateurs finaux, et par une diminution des ressources GPU nécessaires, donc un gain potentiel en coûts et en consommation énergétique.

Un outil en open source

Au-delà des performances pures, la particularité de ReDrafter est d’être publié en open source. Les chercheurs et développeurs peuvent ainsi :

  • Étudier en détail l’algorithme de “speculative decoding” et son implémentation.
  • Contribuer à l’amélioration du code, aux corrections de bugs ou à l’adaptation pour d’autres architectures matérielles.
  • Réutiliser les principes et le code pour créer de nouvelles approches d’accélération de l’inférence.

Cette ouverture permet également d’espérer une adoption plus large de ReDrafter dans l’écosystème IA, notamment pour tous ceux qui utilisent des GPU NVIDIA en production.

Vers de meilleurs LLM en production

Avec ReDrafter, Apple et NVIDIA montrent que l’accélération matérielle et logicielle des LLM reste un domaine de recherche utile. L’objectif est clair : réduire les temps de réponse (latence) lors de la génération de texte, tout en réduisant les coûts. À mesure que les LLM gagnent en taille et en capacités, ces optimisations deviennent critiques pour une utilisation à grande échelle.

Pour en savoir plus :

Retour en haut