По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility __Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox__ Статья: https://arxiv.org/abs/2608.10860 Проект: https://flex-pi.github.io/ # TL;DR ЧТО сделали: Представили FLEX-$\pi$ — модель мира и действий (world-action model, WAM) на 6B параметров, которая одновременно предсказывает непрерывные действия робота, будущие RGB-кадры, 3D-карты точек (pointmaps) и семантические представления DINOv3. Ключевая находка: 3D-карты точек из Depth Anything 3 можно напрямую кодировать в латентное пространство замороженного RGB-видеоавтоэнкодера (Wan-2.2) вообще без специализированного 3D-предобучения. Благодаря дропауту визуальных потоков и межмодальному форсированию (cross-modality forcing) в бэкбоне Mixture-of-Transformers, один и тот же чекпоинт гибко переключается между быстрым инференсом только действий (~60 мс) и полноценной совместной генерацией мира и действий (~193 мс). ПОЧЕМУ это важно: Обычные универсальные политики роботов вынуждены выбирать между быстрой реакцией VLA-моделей и богатой предиктивной регуляризацией WAM, предсказывающих только RGB. FLEX-$\pi$ устраняет этот компромисс, доказывая, что физический граундинг в 3D-геометрию и семантику можно добавить в генеративные политики без дополнительных датчиков глубины, без кастомных 3D-архитектур и без неизбежных задержек на инференсе. Модель показывает прирост успешности в 2–6 раз по сравнению с современными SOTA-бейзлайнами на субмиллиметровых и деформируемых задачах двуручной манипуляции. Для практиков: Чтобы робот уверенно манипулировал предметами, ему нужно понимать глубину сцены, семантику объектов и предвидеть визуальные последствия своих действий. Современные модели обычно генерируют только будущие пиксели с камер — они передают цвет и текстуру, но плохо улавливают точную 3D-геометрию. FLEX-$\pi$ генерирует 3D-формы и высокоуровневые семантические признаки параллельно с траекториями робота. При этом не требуется дорогое железо: геометрия и семантика извлекаются из обычных RGB-камер готовыми моделями. Во время работы робот может динамически переключаться: генерировать полную симуляцию будущего для максимальной точности или предсказывать только действия на высокой частоте для управления в реальном времени. Роботы тут: https://t.me/gonzo_ML_podcasts/4790