Introducing
Robostral Navigate
Thinking
Summary
Robostral Navigate est un modèle 8B qui permet aux robots de naviguer de façon autonome dans des environnements complexes avec une seule caméra RGB. Il atteint 76,6 % de réussite sur les benchmarks R2R-CE unseen, dépassant les approches multicapteurs tout en étant plus efficace. Développé entièrement en interne avec des données simulées et des techniques efficaces en tokens, il se généralise à plusieurs types de robots et s’adapte à des obstacles réels jamais vus pendant l’entraînement. Le modèle combine navigation par pointage et apprentissage par renforcement pour s’améliorer en continu, ouvrant la voie à une IA incarnée unifiée pour la robotique.
Aujourd’hui, nous présentons Robostral Navigate, notre premier modèle conçu pour la navigation incarnée. C’est un modèle 8B qui prend des images RGB et une instruction en langage naturel, puis déplace un robot dans un environnement :
« Quittez le hall, avancez dans le couloir, entrez dans la réserve et arrêtez-vous face à la deuxième étagère. »
Pour effectuer ce type de tâches, d’autres modèles utilisent souvent des capteurs de profondeur, du LiDAR ou plusieurs caméras coordonnées. Robostral Navigate utilise une seule caméra RGB ordinaire et aucun capteur de profondeur, tout en atteignant 76,6 % sur R2R-CE (Room-to-Room in Continuous Environments) en validation unseen, le benchmark de suivi d’instructions dans des environnements exclus de l’entraînement. Il dépasse ainsi la meilleure approche à caméra unique de 9,7 points, et le meilleur système utilisant la profondeur ou plusieurs caméras de 4,5 points, sans utiliser ni l’un ni l’autre.
Navigation
Notre modèle est conçu pour la navigation robotique. Il permet aux robots de naviguer de façon autonome dans des environnements complexes, notamment des bureaux, des bâtiments résidentiels et commerciaux, ainsi que des espaces extérieurs.
Robostral Navigate fonctionne de façon entièrement autonome sur un long itinéraire d’instruction dans un bureau en activité.
Cette technologie ouvre de nombreux cas d’usage dans l’industrie, la livraison, la logistique et l’hôtellerie. C’est aujourd’hui l’une des capacités les plus demandées par nos clients. Donnez une instruction à Robostral Navigate : il accomplit toute la tâche seul, dans un espace réel rempli de personnes et d’obstacles qu’il n’a jamais vus, avec la capacité de s’adapter à chaque environnement.
Points clés
Performances à l’état de l’art sur R2R-CE
Taux de réussite de 79,4 % en validation seen
Taux de réussite de 76,6 % en validation unseen
Fonctionne avec une seule caméra RGB, sans LiDAR ni capteurs de profondeur
Modèle 8B, développé en interne et entraîné entièrement en simulation
S’exécute sur des robots à roues, à pattes et volants, et se généralise à différentes tailles de robots
Robuste aux différences d’intrinsèques caméra
Entraînement efficace en tokens grâce au prefix-caching
Navigation par pointage
À partir d’une tâche et d’un historique d’observations, Robostral Navigate prédit où le robot doit aller ensuite par pointage : il déduit les coordonnées image de l’emplacement cible dans la vue caméra actuelle du robot, ainsi que l’orientation souhaitée à l’arrivée. Contrairement aux commandes fondées sur des déplacements métriques, le pointage rend la policy naturellement robuste aux variations d’intrinsèques caméra et d’échelle du monde.
Cette méthode ne peut toutefois pas gérer les cas où l’emplacement cible se situe hors du champ de vision actuel. Lorsque le pointage ne s’applique pas, le modèle revient à des déplacements dans le repère local du robot, par exemple :
« Avancez de 2 mètres, décalez-vous de 1,5 mètre vers la gauche, puis tournez de 25 degrés à gauche. »
Conçu de bout en bout
Robostral Navigate est développé entièrement en interne et ne s’appuie sur aucun VLM open source existant.
Le modèle est initialisé à partir de notre modèle vision-langage spécialisé dans les tâches d’ancrage, comme le pointage, le comptage et la localisation d’objets. La navigation apparaît comme une extension naturelle de ces capacités : Une fois qu’il comprend où se trouvent les objets, il apprend à se déplacer.
Nous avons construit un pipeline efficace de génération de données entièrement en simulation. Cela nous a permis d’itérer rapidement sur les données, pour aboutir à un jeu de données d’environ 2,4 millions de trajectoires collectées dans 350 000 scènes.
Entraînement supervisé efficace
Un élément clé de Robostral Navigate est un algorithme d’entraînement efficace basé sur le prefix-caching. En utilisant une stratégie de masquage d’attention arborescente, notre méthode compresse un épisode entier en une seule séquence. Elle permet ainsi l’entraînement sur tous les pas de temps en une seule passe forward, tout en évitant les fuites d’information entre les pas de temps.
Par rapport à un entraînement avec un échantillon par pas de temps, notre approche réduit le nombre de tokens d’entraînement de 22× tout en conservant tous les signaux d’apprentissage. En pratique, cette méthode transforme des entraînements qui prendraient des mois en entraînements terminés en quelques jours.
Apprentissage par renforcement en ligne
Nous utilisons notre savoir-faire en post-training de LLM à grande échelle, avec de l’apprentissage par renforcement en ligne, pour améliorer les performances de Robostral Navigate. Après l’étape d’entraînement supervisé, nous améliorons encore les performances du modèle avec CISPO, un algorithme d’apprentissage par renforcement en ligne. Le modèle peut ainsi apprendre par essai-erreur, se remettre d’échecs et acquérir des comportements exploratoires, ce qui atténue efficacement le problème de décalage de distribution propre au clonage comportemental standard. À lui seul, cet apport a amélioré le taux de réussite de 3,2 %. Nous n’observons pas de plateau, et nous pensons que davantage d’entraînement et d’expérimentations continueront à faire progresser ce chiffre.
La suite
Robostral Navigate n’est que la première étape vers un agent incarné unifié.
Nous pensons que la navigation est une capacité fondamentale pour la robotique généraliste. En combinant simulation à grande échelle, entraînement efficace et solides a priori d’ancrage, Robostral Navigate montre qu’une navigation incarnée à l’état de l’art peut être obtenue avec un modèle compact et une seule caméra RGB.
Commencez votre parcours vers l’IA incarnée de pointe, échangez avec notre équipe.
Au fait, nous recrutons.
La version de nos modèles de navigation marque une avancée importante, mais notre parcours est loin d’être terminé. Notre ambition est de permettre aux robots de naviguer de façon autonome dans des environnements complexes — bureaux, logements, bâtiments commerciaux et espaces extérieurs —, et il reste beaucoup à faire. Nous agrandissons activement notre équipe robotique et recherchons des chercheurs et ingénieurs talentueux qui partagent notre ambition.
Si vous souhaitez nous rejoindre dans notre mission pour apporter une navigation fluide aux robots partout, nous serons heureux de recevoir votre candidature pour rejoindre notre équipe.
Par Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh, Olivier Duchenne - AI Science Robotics
Rapport technique
Lisez le rapport technique de Robostral Navigate pour consulter l’architecture complète, la configuration d’entraînement et les résultats de benchmark.




