Logo officiel de Luciole composé d'un grand anneau en forme de lettre C aux nuances de bleu, de vert et de jaune, orné de deux petites étoiles étincelantes. À droite, un texte explicatif présente la gamme de modèles 1B, 8B et 23B et les volumes de données d'apprentissage, surmontant deux boutons d'action bleus.

Le collectif OpenLLM France publie Luciole, une nouvelle lignée de modèles d’IA entièrement ouverts

L’écosystème européen de l’intelligence artificielle franchit une étape importante en matière de transparence et de reproductibilité scientifique. Le consortium OpenLLM France et la société LINAGORA viennent d’annoncer la mise à disposition de Luciole, une famille de trois modèles de langage fondations multilingues massivement entraînés sur le français. Conçus comme de véritables communs numériques pour la communauté des développeurs et des chercheurs, l’intégralité de ces modèles est accessible au téléchargement au sein de la collection Luciole sur Hugging Face.

L’épisode de la solution conversationnelle LUCIE, dont l’accès public avait été temporairement suspendu en janvier 2025, en raison d’un déploiement prématuré et d’un manque de données d’instruction adaptées, est désormais bel et bien derrière les équipes d’OpenLLM. Le collectif semble avoir tiré les enseignements de cette expérience en recentrant ses efforts sur la recherche fondamentale. Avec Luciole, l’objectif n’est pas de fournir un assistant grand public clé en main, mais de livrer des blocs de construction bruts et hautement qualifiés pour l’apprentissage spécifique et l’adaptation à des besoins métiers.

Une mise en garde essentielle sur la nature de ces modèles

Le président et fondateur de LINAGORA, Alexandre Zapolsky, insiste sur la nature purement scientifique de cette initiative en rappelant qu’il ne s’agit pas d’outils commerciaux destinés aux utilisateurs finaux. Ce sont des instruments de recherche fondamentale développés intégralement à partir de zéro (from scratch). Selon lui, la souveraineté numérique européenne exige une vraie diversité d’acteurs pour garantir la résilience de l’écosystème régional, sans dépendre d’une unique réussite industrielle, aussi remarquable soit-elle à l’image de celle de Mistral AI.

Cette approche collaborative se traduit par une politique d’ouverture radicale et sans concession, qui tranche avec la pratique de nombreux modèles dits ouverts dont seules les configurations finales sont partagées.

Pour Luciole, l’ensemble des composants est distribué sous des licences libres reconnues, explique Jean-Pierre LORRE, responsable de la recherche IA de Linagora :

  • Les poids des modèles et les points de contrôle d’apprentissage adoptent la licence Apache 2.0.

  • Les scripts d’entraînement ainsi que le code de traitement des informations sont publiés sous licence AGPL v3, le dépôt principal étant accessible sur le répertoire GitHub Luciole Training.

  • L’intégralité du corpus d’apprentissage est mise à disposition sous licence CC-BY-SA 4.0 via le jeu de données Luciole sur Hugging Face.

Une infrastructure nationale pour un entraînement à grande échelle

Soutenus financièrement par les pouvoirs publics par le biais du programme d’investissement France 2030 et pilotés avec l’appui de Bpifrance, les travaux d’entraînement ont été réalisés sur le supercalculateur national Jean Zay, opéré par le CNRS, GENCI et l’IDRIS. L’infrastructure logicielle repose sur l’environnement de développement NVIDIA NeMo et a permis de traiter un volume massif de 5 000 milliards de jetons textuels multilingues.

Le corpus d’apprentissage a fait l’objet d’un ciblage linguistique rigoureux. L’anglais représente 41,9 % des données et le français s’impose comme un citoyen de premier ordre avec 30,4 % de l’ensemble. Le reste du jeu de données se partage entre les grandes langues européennes, l’arabe, ainsi qu’une enveloppe de 0,4 % explicitement dédiée aux langues régionales de France métropolitaine, aux variantes linguistiques territoriales et aux créoles à base de français du monde entier.

Trois gabarits pour explorer de nouvelles architectures

La gamme se décline en trois dimensions techniques distinctes afin de couvrir des scénarios d’usage variés. Le modèle Luciole-1B s’appuie sur une architecture Transformer classique, idéale pour des déploiements locaux sur des terminaux aux ressources matérielles limitées. À l’opposé, la déclinaison Luciole-23B offre la capacité maximale de la famille pour les tâches de raisonnement complexes et l’adaptation à des contextes métiers hautement spécialisés.

Le modèle intermédiaire Luciole-8B suscite un intérêt tout particulier pour la recherche en ingénierie logicielle. Il abandonne la structure traditionnelle au profit d’une architecture hybride associant les technologies Mamba et Transformer. Cette conception permet de traiter de très longs contextes textuels tout en optimisant l’empreinte en mémoire vive, offrant ainsi une référence publique à grande échelle pour évaluer l’efficacité de ces nouvelles approches architecturales.

🦋 L’actualité de l’open source dans votre flux. Suivez Goodtech sur Bluesky (ou vos applications AT Protocol préférées) grâce à notre bot officiel. Suivez, partagez, c’est par ici !

Note de transparence : Linagora finance l’hébergement de Goodtech.info (ex Toolinux) depuis mai 2000.

Retour en haut