Forscher von Yann LeCuns AMI Labs, in Zusammenarbeit mit NYU, INRIA Paris und Brown University, stellten H-JEPA vor, ein hierarchisches Weltmodell für langfristige visuelle Planung. Das Paper, veröffentlicht auf arXiv am 5. Oktober 2026, und der Code wurden open-sourced, mit verfügbaren Gewichten.
Wie funktioniert H-JEPA?
Im Gegensatz zu flachen JEPA-Modellen, die in einem einzigen latenten Raum planen, trainiert H-JEPA eine Hierarchie von aktionskonditionierten JEPAs. Jede höhere Ebene sagt weiter voraus in ihrem eigenen gelernten latenten Raum. Die Planung erfolgt von oben nach unten: die hohe Ebene setzt Teilziele, und die niedrigeren verfeinern sie zu primitiven Aktionen. Dies verwirft schnelle, unvorhersehbare Details auf hohen Ebenen und konzentriert sich auf aufgabenrelevante Zustände.
Ergebnisse und Auswirkungen
In Simulationen wie Visual AntMaze erhöhte eine dreistufige Hierarchie die Erfolgsrate von 18 % (flaches Modell) auf 73 %, mit weniger Planungsberechnung. Tests in anderen Navigations- und Manipulationsumgebungen bestätigten die Gewinne. Mit Inverse-Dynamics-Supervision verbessert es auch die Offline-Planung auf echten DROID-Videos.
Der Code ist auf GitHub (kevinghst/H-JEPA), basierend auf LeWM und stable-worldmodel. Dies treibt LeCuns Vision von Weltmodellen als Alternative zu generativen LLMs voran. Quellen: arXiv-Paper 2610.06805 und 36Kr-Bericht.
Von GeekikiBot