Прикольный метод улучшения генеративных моделей, которым надо работать с много-модальными распределениями (где много мод, а не модальностей). По дефолту MSE лосс сглаживает всё в одну моду, что на практике бесполезно и даже вредно, приводит к разблюренной серости (старые добрые проблемы с VAE были вроде бы точно такими же). В предложенном методе Explorative Modeling (XM) эксплорейшн переносится на этап обучения (в отличие от медленного test-time эксплорейшна), когда генерятся несколько кандидатов, но бэкпроп потом делается только через лучшего. Метод идейно настолько простой, что задним умом удивительно, что его не использовали раньше. Авторы показали, что этот подход даёт ещё одну ось скейлинга и отлично дополняет скейлинг по данным и по параметрам. На следующем GTC Дженсен Хуанг будет рад нарисовать эту ещё одну ось, а в идеале скрестить и этот train-time scaling, и старый добрый test-time scaling. Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation __Alexi Gladstone, Heng Ji, Yilun Du__ Статья: https://arxiv.org/abs/2607.27372 Ревью: https://arxiviq.substack.com/p/explorative-modeling-unlocking-a Код: https://github.com/alexiglad/XM Сайт: https://explorative-modeling.github.io/ # TL;DR ЧТО сделали: Авторы представляют Explorative Modeling (XM) — новую парадигму предобучения генеративных моделей, которая переносит факторизацию из процесса генерации в цикл обучения. Генерируя `K` кандидатов (или сравнивая с `K` сэмплами данных) на каждом шаге обучения и прогоняя градиенты исключительно через наилучшее совпадение, XM предотвращают размытие мод (mode blurring), повышают генеративную выразительность и позволяют делать сквозную (end-to-end) генерацию за один проход. ПОЧЕМУ это важно: Традиционные реконструкционные генеративные модели полагаются на многошаговую факторизацию траектории при инференсе, что приводит к накоплению ошибок и сдвигу распределения (exposure bias). Explorative Modeling вводит генеративную выразительность как недостающую третью ось предобучения наряду с количеством параметров и размером датасета. Подход достигает около-SOTA результатов (1.43 unguided FID на ImageNet 256x256), улучшая FLOP-эффективность в 4.1 раза, эффективность по сэмплам в 6.2 раза и эффективность по параметрам на 47%. В робототехнике и моделировании мира XM сравниваются с диффузией по качеству, требуя в 16–256 раз меньше шагов инференса. Для практиков: Вместо того чтобы разворачивать генерацию в сотни последовательных шагов при инференсе, исследовательское моделирование переносит поиск внутрь цикла обучения. Совершая «выбор из `K` кандидатов» во время предобучения, модель фиксируется на конкретных модах, что позволяет свернуть инференс до одного прохода без потери покрытия мод. Выигрыш в эффективности не насыщается, а растёт с увеличением масштаба модели и объёма данных. Искать моды тут: https://t.me/gonzo_ML_podcasts/4731
Прикольный метод улучшения генеративных моделей, которым надо работать с…
Из этого канала
- #5867Снова про эмерджентность (https://t.me/gonzoML/1031). В работе прослеживают её…
Снова про эмерджентность (https://t.me/gonzoML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных…
- #5875Любопытная работа про основанные на биологии нейромодели от корифеев области.…
Любопытная работа про основанные на биологии нейромодели от корифеев области. Когда ж в редактор телеги доедет поддержка латеха? Издевательство какое-то.
- #5881Свежее интервью с Маском. Любопытно.…
Свежее интервью с Маском. Любопытно. https://youtu.be/XuoqKYxDHVc?si=TwxHL2JakvqJ-IP
- #5852Интересное про жизнь и статфизику. Пользуясь случаем, хочу передать привет…
Интересное про жизнь и статфизику. Пользуясь случаем, хочу передать привет Андрею :) Directing Open-Ended Evolution in Artificial Life via Multi-Scale Path…
- #5851Прорывы в математике продолжаются. За $2000 в цене токенов (правда от другой…
Прорывы в математике продолжаются. За $2000 в цене токенов (правда от другой модели, Sol) внутренняя версия OpenAI'ной следующей модели Astra нашла новые или…