Les robots n’ont pas seulement besoin de plus de démos. Ils doivent atteindre plus de 99 % de performances et de fiabilité.

Découvrez Toutatis v1, notre moteur efficace d'apprentissage par renforcement (RL), conçu pour passer de démonstrations humaines à une fiabilité de production en quelques jours.

Un moteur IA physique RL pour la fiabilité et le déploiement à plus de 99 %

Un robot qui réussit une tâche une fois prouve sa capacité ; celui qui la réussit de manière fiable, cycle après cycle, crée de la valeur.

Les robots peuvent désormais sélectionner des objets inédits et suivre des instructions linguistiques , plier des textiles et manipuler des matériaux déformables , et effectuer des manipulations riches en contacts. En grande partie motivée par les politiques tirées des démonstrations humaines, l’IA physique a progressé rapidement ces dernières années, introduisant dans les laboratoires des tâches qui, malgré leur apparente simplicité, dépassaient les robots il y a seulement quelques années.

Mais une exécution réussie en laboratoire ne répond qu’à une seule question : le robot peut-il accomplir la tâche ? La production en pose une plus difficile : à quelle fréquence peut-il l’accomplir, à la vitesse requise, sans intervention humaine ? De petites différences de taux de réussite deviennent de grandes différences opérationnelles lorsqu’un robot répète la même tâche des milliers de fois.

POURQUOI LES DERNIERS 0,9 % SONT IMPORTANTS Pannes attendues toutes les 1 000 opérations
Prototype 95% 50 échecs
Résultat de laboratoire solide 99% 10 échecs
Objectif de production 99,9% ≈ 1 échec

Les clients n’achètent pas de belles courbes d’apprentissage ou des vidéos soignées ; ils achètent des cycles réussis entre les interventions , c'est pourquoi la fiabilité n'est pas une mesure parmi tant d'autres pour Toutatis , mais le produit final.

L’IA physique ne manque pas de données de démonstration humaine. La téléopération, l'apprentissage par imitation et des modèles de robots pré-entraînés de plus en plus performants peuvent donner aux robots de solides comportements de départ à partir d'exemples réels. Ce dont l’industrie a encore besoin, c’est d’un moyen rapide et reproductible de transformer ces comportements de départ en performances à plus de 99 % .

Mais les données de démonstration enseignent à un robot ce que les gens ont fait, pas nécessairement ce qui maximisera le succès, réduira le temps de cycle ou éliminera les rares pannes qui empêchent un système de fonctionner sans supervision. L'apprentissage par renforcement est la clé pour convertir cette capacité démontrée en robotique au niveau de la production. Cela permet au robot de s'améliorer par rapport aux mesures de fonctionnement réelles au lieu de simplement devenir meilleur en imitation.

Le déploiement commence là où s'arrêtent les données de démonstration humaine, à mesure que les objets bougent, que le tissu se plie différemment, que les câbles s'accrochent, que les frottements changent et que les tolérances s'accumulent. À l’échelle industrielle, « fonctionne habituellement » signifie toujours « nécessite une supervision », ce qui est le problème du dernier kilomètre que Toutatis est censé résoudre.


01 · Le moteur

Présentation de Toutatis

Toutatis est le moteur de déploiement RL de Gobano : une boucle d'apprentissage efficace qui fait passer un robot d'un ensemble de données de démonstration humaine à la cible de « Fiabilité » requise par l'opération.

Nous commençons par un petit jeu de données spécifique à la tâche : généralement 10 à 200 démonstrations humaines initiales, selon sa complexité. À partir de ces données, nous entraînons une politique d'apprentissage par imitation fondée sur le flow matching. Cette politique donne au robot un comportement de départ utile : il peut approcher l'objet, exécuter la séquence générale et générer des épisodes sans tout apprendre à partir de zéro.

En parallèle, nous formons un modèle du monde spécifique à une tâche à partir des mêmes démonstrations humaines. Il construit une représentation latente et compacte de la scène : ce qui est présent, comment la scène peut changer sous l'action d'une action, quelles transitions créent un progrès et où les échecs ont tendance à émerger. Toutatis combine deux échelles de temps d'apprentissage : le modèle du monde actualise périodiquement cette représentation à mesure que la couverture du monde réel s'étend, tandis que notre algorithme interne d'apprentissage par renforcement l'utilise pour une amélioration rapide des politiques.

La boucle RL optimise le résultat réel de la tâche plutôt que la seule imitation : la tâche a-t-elle réussi, avec quelle fiabilité et à quelle vitesse ? Chaque tentative autonome devient des données permettant des mises à jour rapides des politiques et des itérations rapides lors de la formation finale. À mesure que ces tentatives élargissent les états, les contacts et les modes de défaillance couverts par la tâche, elles actualisent également le modèle du monde à un rythme plus lent.

La promesse de fonctionnement est simple : une fois la configuration robotique et l'infrastructure de collecte de données en place, Toutatis peut passer des premières démonstrations humaines à un contrôleur à fiabilité optimisée en quelques jours . Le robot passe ce temps à s’améliorer par rapport au résultat réel plutôt que d’attendre un autre grand cycle de collecte de données. Les délais complets du projet peuvent également inclure l'outillage, l'intégration de cellules et la validation opérationnelle ; la vitesse décrite ici est la boucle d'apprentissage elle-même.

01Démontrer 10 à 200 démonstrations initiales
02Capacité de tâches émergentes Apprentissage par imitation pure
Moteur Toutatis RL 03Atteignez une fiabilité de plus de 99 % Modèle du monde de tâches + RL interne
04Déployer et renforcer Accélérez l’exécution et réintégrez les échecs rares dans la formation
Cheminement typique · 2 à 3 semaines avant le déploiement
02 · Notre thèse

RL est le dernier kilomètre du déploiement

L’histoire récente de l’IA générative offre une analogie utile. Les modèles d'IA générative modernes commencent par un pré-entraînement, qui consiste à lire d'énormes quantités de texte et de code pour apprendre la suite ; ce faisant, ils acquièrent de vastes connaissances, des représentations utiles et des capacités latentes remarquables. Pourtant, la prédiction du prochain jeton n’optimise pas à elle seule la manière dont cette capacité est utilisée.

L'apprentissage par renforcement est un élément central du processus post-formation qui transforme ce potentiel latent en comportement que les gens peuvent réellement utiliser . Les formateurs génèrent les réponses des candidats et les évaluent à l'aide de résultats vérifiables, de préférences humaines , de commentaires de l'IA ou de principes explicites. RL optimise alors des qualités que la pré-formation n'apprend qu'indirectement : l'exactitude, le respect des instructions, l'utilité et la sécurité.

DeepSeek-R1-Zero a concrétisé l'idée : à partir d'une base pré-entraînée, le RL pur (sans exemples de raisonnement supervisé) a produit une réflexion, une vérification et un raisonnement long, surpassant les bases de référence solides, notamment GPT-4o, sur des références de raisonnement exigeantes. Le même principe façonne la post-formation à la frontière : OpenAI entraîne ses modèles de raisonnement GPT-5.6 avec RL, tandis que l'IA constitutionnelle d'Anthropic suit l'apprentissage supervisé avec l'apprentissage par renforcement à partir des commentaires de l'IA. Les recettes diffèrent, mais dans les deux cas, les résultats (et non la seule prédiction) façonnent le comportement après le pré-entraînement.

La préformation crée des capacités. L'apprentissage par renforcement convertit les capacités en performances et en alignement.

La robotique et l’IA physique dans leur ensemble suivent le même chemin. L'apprentissage par imitation peut fournir une politique initiale efficace, mais les démonstrations humaines n'optimisent pas directement le taux de réussite, la durée du cycle, la récupération ou le taux d'intervention. Ce sont des résultats – et c’est dans ces résultats que l’apprentissage par renforcement est le plus efficace.

Dès l’origine, Toutatis s’est construit autour d’un modèle du monde spécifique à chaque opération , plutôt que de s’appuyer uniquement sur des intégrations héritées de la politique de départ. Sa représentation est façonnée conjointement par l'apprentissage par imitation, la reconstruction visuelle, la prédiction de dynamiques conditionnées par l'action et la prédiction de récompense ou de progression d'une tâche. L’état latent qui en résulte est donc plus qu’une fonction d’imitation compressée : il est conçu pour répondre aux questions que l’algorithme RL doit résoudre : ce qui est susceptible de se produire ensuite, si une action crée un progrès et quelle est la valeur du résultat qui en résulte. Cette représentation compacte et soucieuse des résultats devient l’espace d’état pour un apprentissage rapide des politiques et des valeurs tout au long de la tâche.

Au sein de la stack d'apprentissage, notre thèse est volontairement audacieuse : le RL est nécessaire et suffisant au déploiement . Cela est nécessaire car le déploiement est défini par des résultats plutôt que par des démonstrations humaines, et les clients industriels fixent des seuils d'acceptation impitoyables en matière de taux de réussite, de temps de cycle et d'interventions. C’est suffisant car, une fois qu’une politique de démarrage efficace existe, le robot peut s’améliorer en agissant sur la tâche réelle et en optimisant le résultat réel.

Une grande partie de l’industrie a parié jusqu’à présent que la robotique serait à elle seule résolue à grande échelle. Nous pensons que le déploiement a une forme différente : commencer par la vraie tâche, exécuter le vrai robot, optimiser la vraie métrique et itérer rapidement.


03 · Architecture

Un système d’apprentissage pratique à deux échelles de temps

L'apprentissage par renforcement visuel de bout en bout est coûteux car chaque mise à jour doit passer par la pile de vision complète. Le simple fait de figer un encodeur visuel générique est plus rapide, mais une représentation généraliste peut manquer des détails spécifiques à une tâche, tels que des états de contact précis, une géométrie précise et des configurations d'objets subtiles, nécessaires pour résoudre la tâche proprement.

Des travaux fondamentaux sur les modèles mondiaux , l'apprentissage dans l'espace latent et l'adaptation de robots réels ont montré que les représentations prédictives compactes peuvent être utilisées efficacement pour le contrôle en aval. Toutatis applique cette idée en apprenant un modèle du monde spécifique à une tâche à partir de données de tâches réelles accumulées : démonstrations humaines initiales, suivies d'une expérience robot collectée tout au long de l'amélioration et du déploiement. Sa représentation latente compacte de scène et de contexte est entraînée avec quatre signaux complémentaires : comportement de flow matching en plusieurs étapes, reconstruction visuelle, prédiction dynamique conditionnée par l'action et prédiction de récompense ou de progression de la tâche.

L’objectif politique d’adéquation des flux fonde la représentation dans l’action ; la reconstruction visuelle préserve la géométrie de la scène ; la dynamique conditionnée par l'action capture la façon dont la scène change ; et la prédiction des récompenses ou des progrès code ce qui compte pour la réussite de la tâche. Ensemble, ces objectifs produisent un état latent soigneusement conçu qui capture ce que le robot voit, ce qui est susceptible de se produire ensuite et si un résultat fait progresser la tâche .

TOUTATIS / APPRENTISSAGE DE L'ARCHITECTURE Un modèle de tâche, deux délais d'apprentissage
Boucle de représentation Boucle RL rapide
La boucle bleue apprend le modèle du monde spécifique à la tâche et l'actualise à mesure que la couverture du monde réel s'étend. La boucle orange est notre algorithme RL interne rapide et hors politique , formé sur une expérience robot réelle pour cibler la récompense des tâches ou le taux de réussite selon les besoins du déploiement.

Nous gelons ensuite l'encodeur visuel et l'utilisons pour générer des intégrations compressées pour les données réelles du robot collectées. La boucle RL traite ces représentations comme son espace d’état et forme des modèles compacts de politiques et de valeurs à partir d’expériences réelles (et non de transitions imaginées) sans se propager de manière répétée à travers le modèle de vision complète.

Toutatis utilise deux échelles de temps d'apprentissage. La représentation figée prend en charge des mises à jour rapides des politiques et des itérations rapides lors de la formation finale, tandis qu'une nouvelle expérience du monde réel actualise périodiquement le modèle du monde à mesure que la couverture des tâches s'étend.

L'apprentissage par renforcement opère donc sur la représentation de la scène latente du modèle du monde tout en apprenant de l'expérience collectée sur le robot réel.

Fondamentalement, le modèle du monde est cumulatif : chaque nouvel épisode étend sa couverture des configurations de scène, des contacts, des transitions et des états de défaillance. À mesure que cette couverture devient plus dense, la représentation latente devient plus précise là où les décisions de contrôle sont importantes, donnant à chaque mise à jour de politique une vision plus cohérente des comportements réussis et des modes d’échec restants.

04 · Optimisation de la fiabilité

Entraînez-vous pour le taux de réussite, et pas seulement pour la récompense des tâches.

Le déploiement d'un contrôleur peut être bloqué soit par son temps de cycle, soit par son taux de défaillance. Un objectif RL conventionnel maximise la récompense moyenne d'une tâche, qui allie généralement vitesse d'exécution et réussite de la tâche. Ceci est utile pour améliorer la capacité et le temps de cycle, mais la moyenne peut augmenter alors que de rares pannes subsistent. Toutatis inclut un mode d'optimisation de fiabilité dédié développé spécifiquement pour combler cet écart.

En mode « Fiabilité » , la formation donne explicitement la priorité à la réussite répétée jusqu'à ce que le contrôleur atteigne le seuil d'acceptation requis. Le mode « Performance » récompense alors une réalisation plus précoce tout en protégeant ce niveau de fiabilité. Il s’agit d’objectifs de formation différents, et pas seulement de différentes manières de mesurer le même contrôleur.

La séquence suit les critères d'acceptation du client : d'abord fiabiliser la tâche, puis réduire le temps de cycle sans sacrifier cette fiabilité. Les comportements qui fonctionnent déjà restent ancrés, tandis que les échecs non résolus restent visibles au lieu d’être dilués par les succès de routine. Toutatis optimise donc le résultat qui importe en fin de compte à la production : des cycles réussis entre les interventions.

TÂCHE 2D SIMPLE Une tâche. Deux objectifs de formation.
Comparaison des objectifs « Performance » et « Fiabilité » de Toutatis sur une tâche 2D simple pendant 700 000 mises à jour de politique
Dynamique d'entraînement mesurée sur une tâche simple de manipulation 2D pendant 700 000 mises à jour de politique. Les deux objectifs améliorent la récompense avec des gains marginaux décroissants. L'objectif « Performance » conserve une légère avance en récompense, mais continue d'échanger de rares échecs contre de la vitesse ; l'objectif « Fiabilité » atteint des fenêtres de réussite à 100 % et ne passe que rarement sous ce niveau. Les quatre derniers échecs correspondent généralement à de rares cas limites ; chacun est réintégré aux données d'entraînement afin que le contrôleur suivant apprenne à ne pas reproduire le même échec.

Les mêmes cibles restent disponibles à mesure que les conditions d’exploitation évoluent. La nouvelle expérience du robot réintègre immédiatement la boucle rapide RL ; des changements plus larges dans la couverture des tâches actualisent le modèle du monde sur une échelle de temps plus lente.


05 · Résultats

Résultats en simulation et sur configurations réelles

Nous utilisons des tests de simulation contrôlés pour isoler l'algorithme d'apprentissage, puis des configurations réelles pour tester ce qui compte en fin de compte : si le système complet peut survivre aux variations physiques et atteindre un objectif opérationnel. Les deux formes de preuves répondent à des questions différentes et ne doivent pas être confondues.

Simulation

Benchmark de simulation Robomimic

Nous évaluons d’abord notre système sur la suite de benchmarks classique Robomimic. Pour les deux tâches, nous partons de démonstrations humaines, apprenons la représentation de la tâche et exécutons notre algorithme interne d'apprentissage par renforcement sur les intégrations résultantes.

Avant le début de RL, la reconstruction nous donne une sonde simple et interprétable de la représentation compacte du modèle du monde. La première rangée montre les démonstrations originales des deux caméras d'entraînement ; la seconde montre ce que le modèle du monde reconstruit après avoir compressé cette scène dans son état latent. La reconstruction n'est pas la représentation elle-même, ni un résultat de contrôleur, mais elle montre quelle géométrie et quel contexte de tâche survivent à la compression.

MODÈLE MONDIAL TOUTATIS : Apprendre à voir
Square Tâche de précision de difficulté moyenne · 96 × 96 images
Original Reconstruction du modèle du monde
Accrochage de l'outil Tâche de manipulation difficile à long horizon · 128 × 128 images
Original Reconstruction du modèle du monde

Comme le montrent ces vidéos, les reconstructions restent remarquablement proches des observations originales . Malgré sa taille compacte, l'espace latent du modèle du monde préserve la géométrie de la scène, l'état de l'objet et le contexte de la tâche nécessaires à la reconstruction de la scène . Il s’agit d’une analyse interprétable de la représentation apprise, et non d’un déploiement de politique.

Nous gelons ensuite cette représentation spécifique à la tâche et exécutons notre algorithme interne d'apprentissage par renforcement sur ses intégrations compressées. Les preuves ci-dessous associent des évaluations finales inspectables à une convergence dans la région critique de 90 à 100 %, où les défaillances restantes déterminent si un contrôleur est prêt pour la production.

MOTEUR TOUTATIS RL : Apprendre à performer
Square · 1 000 réussites / 0 échec
Tool Hang · 998 réussites / 2 échecs

Chaque vidéo couvre 1 000 épisodes. Les cinq premiers et les cinq derniers se déroulent en temps réel ; les 990 du milieu sont affichés à une vitesse de 10× sans pause. Un compteur persistant indique les succès et les échecs, et les deux observations utilisées par le contrôleur restent visibles tout au long de la vidéo.

Courbes de réussite sur les 1 000 derniers épisodes, au-dessus de 90 %, pour Robomimic Square et Tool Hang
La courbe mesure le taux de réussite sur les 1 000 derniers épisodes d’évaluation. Sur leurs meilleures fenêtres enregistrées, Square atteint 1 000/1 000 réussites (100,0 %) et Tool Hang 998/1 000 (99,8 %).
De vraies configurations

Benchmarks en configuration réelle

La simulation fournit un environnement contrôlé pour itérer sur l'algorithme d'apprentissage. Mais le test décisif est de savoir si cela fonctionne sur une configuration physique, en utilisant uniquement des données réelles . Nous présentons ici les résultats de trois tests de R&D, chacun conçu pour exposer un défi de déploiement réel différent :

  • Ball Picking : un test de sélection simple à un seul bras avec des données initiales limitées.
  • Pliage de serviettes : une référence à deux bras pour plier une serviette à partir de configurations plates variées.
  • Insertion de serre-câble : une référence à deux bras pour une manipulation et une insertion précises.

Pour chaque tâche, nous inspectons d’abord ce que le modèle du monde retient de la scène, puis mesurons comment le contrôleur RL s’améliore grâce à l’expérience du monde réel.

MODÈLE MONDIAL TOUTATIS : Apprendre à voir

La reconstruction révèle dans quelle mesure la scène originale survit à la compression dans l'espace latent spécifique à la tâche, y compris la géométrie, l'état de l'objet et le contexte de la tâche. Il s’agit d’une sonde du modèle du monde et non d’un résultat de contrôleur.

Cueillette de balle
Original Reconstruction du modèle du monde
La reconstruction montre que le modèle du monde spécifique à la tâche préserve la balle, la géométrie de la pince et le contexte de la scène à travers les observations utilisées pour le contrôle.
Pliage des serviettes
Original Reconstruction du modèle du monde
La reconstruction montre que le modèle du monde spécifique à une tâche conserve un modèle remarquablement détaillé de l'état du tissu , comprenant les plis, les rides, les bords et la géométrie locale à travers les points de vue.
Insertion de serre-câble
Original Reconstruction du modèle du monde
La reconstruction montre que le modèle du monde spécifique à la tâche préserve l'alignement fin entre la pince, le serre-câble et le point d'insertion, nécessaire à un contact précis et pertinent pour le contrôle. En revanche, les serre-câbles déjà fixés, sans incidence sur le contrôle ni sur la réussite de la tâche, sont reconstruits avec moins de précision.

La même boucle de données réelles pilote les trois contrôleurs. La préhension de balle a atteint 108/108, le pliage de serviette 99/100 et l'insertion de serre-câble — la tâche la plus sensible à la précision présentée ici — 31/31 malgré ses tolérances d'alignement serrées.

MOTEUR TOUTATIS RL : Apprendre à performer

Les courbes de progression suivent chaque politique IL de base tout au long du processus RL jusqu'à plus de 99 % de réussite.

Cueillette de balle Évaluation autonome · Lecture 3×, puis 9×
108 / 108
PROGRÈS DE L'APPRENTISSAGE Succès au cours des 100 derniers déploiements
Taux de réussite de la préhension de balle sur les 100 derniers épisodes réels

À partir de seulement 11 démonstrations humaines, la politique IL initiale a obtenu 24/100 succès. Sur 854 épisodes réels, la collecte répétée d'épisodes et l'entraînement RL ont ensuite permis d'atteindre 101/107, 121/123 puis 108/108 en évaluation.

PLIAGE DES SERVIETTES Évaluation autonome · Vitesse 8×
99 / 100
PROGRÈS DE L'APPRENTISSAGE Succès au cours des 100 derniers déploiements
Taux de réussite du pliage de serviette sur les 100 derniers épisodes réels

À partir de 135 démonstrations humaines, le contrôleur a bien fonctionné sur des cas simples, mais la collecte initiale couvrait une gamme trop étroite de configurations et omettait les cas plus difficiles. RL peut renforcer une politique performante, mais il ne peut pas récupérer une partie de la tâche que les données n'exposent jamais. Nous avons donc collecté 215 démonstrations supplémentaires autour de ces cas difficiles au cours d'un cycle d'amélioration comprenant 2 633 épisodes réels. L'évaluation finale atteint 99/100.

INSERTION DE SERRE-CÂBLE Insertion de haute précision · Vitesse 8×
31 / 31
PROGRÈS DE L'APPRENTISSAGE Succès validé au fil des épisodes cumulés
Taux de réussite de l’insertion de serre-câble sur des évaluations réelles validées successives

À partir de 107 démonstrations humaines, sept contrôleurs intermédiaires ont été testés au cours de 177 évaluations autonomes contrôlées, tandis que le système apprenait à partir de 3 375 épisodes réels axés sur l'insertion. Le contrôleur final a réussi les 31 essais de son lot d'évaluation.

06 · Efficacité du déploiement

Petits modèles, boucles serrées et faible calcul

Toutatis est conçu pour partir de petits ensembles de données spécifiques à une tâche plutôt que de nécessiter une pré-formation du robot à grande échelle. Les résultats concrets présentés dans cet article commencent par 11 démonstrations humaines pour le ramassage de balles, 107 pour l'insertion d'attaches zippées et 135 pour le pliage de serviettes. Les déploiements autonomes densifient alors la couverture sur quelques jours de temps robot et améliorent le taux de réussite. Lorsque l’ensemble de données initial laisse de côté un comportement ou une partie de l’espace opérationnel, des démonstrations humaines ciblées sont collectées pour combler le vide.

Le gel de l'encodeur spécifique à la tâche nous permet de mettre en cache les intégrations visuelles au lieu de les recalculer à chaque mise à jour RL. Sur le même benchmark, cela a rendu la formation aux politiques environ 10 fois plus rapide que notre configuration RL visuelle de bout en bout équivalente.

Par ailleurs, la politique de RL et les réseaux de valeurs eux-mêmes sont délibérément compacts. Nous les avons formés sur un PC de jeu et, pour des tâches plus simples, même sur un ordinateur portable . Grâce à des techniques d'optimisation modernes, les politiques déployées ont été exécutées localement sur un ordinateur portable de jeu, l'inférence prenant environ 3 millisecondes par étape de contrôle pour le Ball Picking et environ 10 millisecondes pour le Pliage des serviettes . Les deux laissent la majeure partie du budget de contrôle disponible pour la détection, la communication et la rétroaction, tout en réduisant l'exposition aux problèmes de retard d'inférence des politiques fragmentées d'action , y compris les pauses et les discontinuités aux limites des fragments.

Cette compacité est intentionnelle et constitue en soi un résultat important : une IA physique fiable ne nécessite pas toujours un modèle massif ou un cluster de calcul distant, notamment pour les tâches répétitives au périmètre opérationnel naturellement bien défini.

Au-delà de ces contrôleurs compacts, la même recette ouvre la voie à l’amélioration des VLA pré-entraînés et des modèles d’action mondiaux. Leurs priorités plus larges peuvent fournir une capacité de démarrage plus forte, tandis que Toutatis adapte la représentation à l'opération réelle et optimise le résultat du déploiement grâce à la même boucle RL efficace.

07 · À votre étage

D'une tâche répétitive à une main d'œuvre robotisée

Gobano vise à automatiser les tâches physiques répétitives. Toutatis est conçu pour rendre ces déploiements plus rapides et plus fiables. Lorsqu'une tâche convient bien, nous partons des objets réels, des contraintes d'exploitation et du rythme attendu, puis construisons la configuration, enseignons le robot, l'améliorons grâce à un apprentissage réel et le validons par rapport au résultat requis.

La tâche peut être simple mais répétitive, ou physiquement difficile à automatiser avec des règles fixes : manipulation de pièces variables, pliage de textiles, manipulation de sacs, câbles, sangles ou emballages irréguliers. Dans les deux cas, le déploiement est construit autour de la tâche réelle et de ses conditions de fonctionnement réelles , notamment le matériau, la friction, l'usure, l'outillage et les variations que le robot rencontrera sur votre sol.

Montre-nous la tâche

Définir les objets, les conditions de travail, le temps de cycle et les critères de réussite.

Nous enseignons la tâche

Collectez des démonstrations, entraînez le modèle de tâche et apprenez des tentatives autonomes.

Déployez, puis optimisez la vitesse

Une fois que la tâche atteint son objectif de fiabilité, déployez le robot. Les itérations d'apprentissage ultérieures utilisent une expérience d'exploitation réelle pour réduire le temps de cycle sans sacrifier la fiabilité.

Toutatis est le moteur d'apprentissage de cette main-d'œuvre. Il transforme un petit ensemble de démonstrations humaines en un contrôleur initial, puis utilise l'expérience autonome pour améliorer les pannes et les limites de temps de cycle qui empêchent le déploiement. Le résultat n’est pas un modèle de recherche ou une collection de démonstrations isolées, mais une main-d’œuvre robotique déployée mesurée par des cycles réussis, un débit et des interventions par équipe.

99 % est un jalon, pas la ligne d'arrivée. Une fois que la fiabilité atteint le seuil d'acceptation du client, Toutatis peut réorienter l'objectif vers des temps de cycle plus courts tout en continuant à apprendre des défaillances qui surviennent en exploitation.

Nous faisons désormais progresser Toutatis sur deux fronts : rendre les contrôleurs fiables plus rapides sur nos configurations R&D, et apporter cette autonomie aux robots travaillant avec nos premiers clients. Restez à l'écoute : nous partagerons les résultats des deux pistes dans les prochains articles.

Construire une IA physique fiable nécessite un travail exceptionnel sur l’ensemble de la pile, depuis les algorithmes d’apprentissage et les modèles mondiaux jusqu’aux systèmes robotiques et au déploiement dans le monde réel. Nous sommes toujours à la recherche de scientifiques, d'ingénieurs et de roboticiens de classe mondiale qui souhaitent contribuer à transformer cette technologie en un travail robotique fiable. Si cela vous ressemble, explorez nos postes ouverts .

Si votre opération contient une tâche physique répétitive, apportez-nous la tâche . Nous évaluerons ce qu'il faut pour déployer une main-d'œuvre robotisée par rapport à votre objectif opérationnel.