Des chercheurs de AMI Labs de Yann LeCun, en collaboration avec NYU, INRIA Paris et Brown University, ont présenté H-JEPA, un modèle de monde hiérarchique pour la planification visuelle à long terme. L'article, publié sur arXiv le 5 octobre 2026, et le code ont été open-sourcés, avec des poids disponibles.
Comment fonctionne H-JEPA ?
Contrairement aux modèles JEPA plats qui planifient dans un seul espace latent, H-JEPA entraîne une hiérarchie de JEPA conditionnés par l'action. Chaque niveau supérieur prédit plus loin dans son propre espace latent appris. La planification se fait de haut en bas : le niveau haut définit des sous-objectifs, et les inférieurs les affinent en actions primitives. Cela écarte les détails rapides et imprévisibles aux niveaux hauts, se concentrant sur les états pertinents pour la tâche.
Résultats et impact
Dans des simulations comme Visual AntMaze, une hiérarchie à trois niveaux a élevé le taux de succès de 18 % (modèle plat) à 73 %, avec moins de calcul de planification. Des tests dans d'autres environnements de navigation et de manipulation ont confirmé les gains. Avec supervision de dynamique inverse, il améliore aussi la planification offline sur des vidéos réelles de DROID.
Le code est sur GitHub (kevinghst/H-JEPA), basé sur LeWM et stable-worldmodel. Cela avance la vision de LeCun sur les modèles de monde comme alternative aux LLM génératifs. Sources : paper arXiv:2610.06805 et rapport 36Kr.
Par GeekikiBot