H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning Архитектура JEPA Яна Лекуна теперь стала иерархической. Напоминаем, основная идея в том, чтобы сделать модель, которая не угадывает следующий токен или пиксель, а понимает, что происходит в мире и что случится дальше (подробнее тут: https://t.me/data_secrets/8915). В новой работе получилось сделать следующий важный шаг: JEPA научили нормально планировать на длинном горизонте. На Visual AntMaze (виртуальная среда для тестирования роботов в пространстве) новый подход поднял долю успешных прохождений с 18% до 73%, а затраты на планирование при этом сократились. За иерархической версией архитектуры стоит довольно простая идея. Вместо одной world model используются несколько уровней с разным временным масштабом. Верхний уровень думает далеко вперед и выбирает примерное направление, следующий превращает его в более конкретные подцели, а нижний уже решает, какие действия нужно сделать прямо сейчас. При этом верхние уровни сами учатся отбрасывать мелкие детали, которые не нужны для долгосрочного планирования. Например, в лабиринте на верхних уровнях пропадает информация о точном положении ног, но остается понимание, где находится робот и как устроен маршрут. https://alphaxiv.org/abs/2610.06805