По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility __Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox__ Статья: https://arxiv.org/abs/2608.10860 Проект: https://flex-pi.github.io/ # TL;DR ЧТО сделали: Представили FLEX-$\pi$ — модель мира и действий (world-action model, WAM) на 6B параметров, которая одновременно предсказывает непрерывные действия робота, будущие RGB-кадры, 3D-карты точек (pointmaps) и семантические представления DINOv3. Ключевая находка: 3D-карты точек из Depth Anything 3 можно напрямую кодировать в латентное пространство замороженного RGB-видеоавтоэнкодера (Wan-2.2) вообще без специализированного 3D-предобучения. Благодаря дропауту визуальных потоков и межмодальному форсированию (cross-modality forcing) в бэкбоне Mixture-of-Transformers, один и тот же чекпоинт гибко переключается между быстрым инференсом только действий (~60 мс) и полноценной совместной генерацией мира и действий (~193 мс). ПОЧЕМУ это важно: Обычные универсальные политики роботов вынуждены выбирать между быстрой реакцией VLA-моделей и богатой предиктивной регуляризацией WAM, предсказывающих только RGB. FLEX-$\pi$ устраняет этот компромисс, доказывая, что физический граундинг в 3D-геометрию и семантику можно добавить в генеративные политики без дополнительных датчиков глубины, без кастомных 3D-архитектур и без неизбежных задержек на инференсе. Модель показывает прирост успешности в 2–6 раз по сравнению с современными SOTA-бейзлайнами на субмиллиметровых и деформируемых задачах двуручной манипуляции. Для практиков: Чтобы робот уверенно манипулировал предметами, ему нужно понимать глубину сцены, семантику объектов и предвидеть визуальные последствия своих действий. Современные модели обычно генерируют только будущие пиксели с камер — они передают цвет и текстуру, но плохо улавливают точную 3D-геометрию. FLEX-$\pi$ генерирует 3D-формы и высокоуровневые семантические признаки параллельно с траекториями робота. При этом не требуется дорогое железо: геометрия и семантика извлекаются из обычных RGB-камер готовыми моделями. Во время работы робот может динамически переключаться: генерировать полную симуляцию будущего для максимальной точности или предсказывать только действия на высокой частоте для управления в реальном времени. Роботы тут: https://t.me/gonzo_ML_podcasts/4790
По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with…
Из этого канала
- #5931Прикольная работа про экономию памяти для работы с длинными…
Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика…
- #5935Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку.
- #5942Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный…
- #5922Тема про термодинамические вычисления развивается (мы писали про неё тут, тут и…
Тема про термодинамические вычисления развивается (мы писали про неё тут, тут и тут). Extropic анонсировал новую Z1 в дополнение к X0/XTR-0.
- #5917Любопытный результат про работу LLM с табличными данными, где LLM довольно…
Любопытный результат про работу LLM с табличными данными, где LLM довольно хреновы и сильно уступают классике ML.