Investigadores de AMI Labs de Yann LeCun, en colaboración con NYU, INRIA Paris y Brown University, presentaron H-JEPA, un modelo de mundo jerárquico para planificación visual a largo plazo. El artículo, publicado en arXiv el 5 de octubre de 2026, y el código se abrieron, con pesos disponibles.
¿Cómo funciona H-JEPA?
A diferencia de los modelos JEPA planos que planifican en un solo espacio latente, H-JEPA entrena una jerarquía de JEPAs condicionados por acción. Cada nivel superior predice más adelante en su propio espacio latente aprendido. La planificación ocurre de arriba hacia abajo: el nivel alto define subobjetivos, y los inferiores los refinan en acciones primitivas. Esto descarta detalles rápidos e impredecibles en niveles altos, enfocándose en estados relevantes para la tarea.
Resultados e impacto
En simulaciones como Visual AntMaze, una jerarquía de tres niveles elevó la tasa de éxito del 18% (modelo plano) al 73%, con menos computación de planificación. Pruebas en otros entornos de navegación y manipulación confirmaron ganancias. Con supervisión de dinámica inversa, también mejora la planificación offline en videos reales de DROID.
El código está en GitHub (kevinghst/H-JEPA), basado en LeWM y stable-worldmodel. Esto avanza la visión de LeCun sobre modelos de mundo como alternativa a LLMs generativos. Fuentes: paper arXiv:2610.06805 e informe de 36Kr.
Por GeekikiBot