4 milliards de paramètres pour piloter un véhicule autonome : l’équipe Qwen d’Alibaba publie Qwen-Drive-1.0 sous licence Apache 2.0 ! Perception 3D et planification réunies dans un modèle compact. Petit point technique sur cette nouvelle innovation asiatique.
Quatre milliards de paramètres pour percevoir l’espace en trois dimensions, analyser une scène routière complexe et calculer les trajectoires d’un véhicule : l’équipe Qwen d’Alibaba, associée aux chercheurs de l’Université des sciences et technologies de Huazhong, prend l’industrie automobile de court. Dans son annonce officielle de Qwen-Drive, le groupe chinois publie sous licence Apache 2.0 son tout nouveau modèle vision-langage taillé pour le pilotage automobile : Qwen-Drive-1.0-4B. Loin de la course à la puissance brute et aux clusters de serveurs inaccessibles, ce lancement démontre qu’une architecture compacte et ouverte peut rivaliser avec les systèmes propriétaires les plus lourds du marché.
Perception 3D, vue aérienne et planification
Le tour de force architectural détaillé dans le rapport de recherche sur arXiv repose sur l’intégration de flux hétérogènes au sein d’une même représentation latente. Plutôt que d’empiler des briques logicielles isolées comme le font les systèmes conventionnels, Qwen-Drive traite simultanément les flux vidéo multi-caméras, les questions visuelles en langage naturel et le calcul dynamique des points de passage à une fréquence de 10 Hz sur un horizon prédictif de cinq secondes.
L’architecture s’articule autour de deux composants clés greffés sur le réseau multimodal. Une tête externe extrait la géométrie 3D de la scène, prédit l’occupation volumique et cartographie les voies de circulation tout en offrant une interface d’audit inspectable par les développeurs. Ensuite, un transformateur de diffusion calcule le déplacement du véhicule par apprentissage par imitation supervisée (SFT) ou par apprentissage par renforcement (RL), s’appuyant sur 2,83 millions d’échantillons publics harmonisés. Enfin, le décodeur de langage d’origine reste intact, permettant au système d’expliquer textuellement ses choix de conduite ou de répondre à des interrogations complexes sur la sécurité routière.

Du GPU propriétaire au processeur RISC-V
La publication intégrale des poids et du code source sur le dépôt GitHub de Qwen-Drive ainsi que sur Hugging Face et Modelscope s’inscrit dans un plan d’émancipation industrielle bien plus vaste. Quelques jours avant cette sortie logicielle, Alibaba créait l’événement matériel en faisant tourner nativement son modèle de langage de 27 milliards de paramètres sur son propre processeur RISC-V XuanTie C950, sans la moindre carte graphique NVIDIA ni émulation logicielle.
Gravée en 5 nm, cette puce CPU intègre directement ses propres accélérateurs matriciels et vectoriels. En mariant des modèles compacts de 4 milliards de paramètres sous licence libre à du silicium open hardware RISC-V, l’écosystème démontre que le futur des véhicules connectés et des systèmes autonomes ne sera pas nécessairement prisonnier des plateformes propriétaires fermées.
🌐 L’actualité de l’open source et des technologies éthiques dans votre flux
🐘 Fediverse / Mastodon : suivez notre profil officiel @ depuis votre application ou votre instance favorite.
🦋 Bluesky (AT Protocol) : retrouvez nos actualités condensées et abonnez-vous à @goodtech.info.
