Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские подходы к self-supervised. Почти по всем упомянутым работам (DINO, Barlow Twins, VICReg, SIGReg, LeJEPA, LpJEPA) нашлась ссылка на разбор в нашем канале. Теперь VISReg. Лекуна в соавторах нет, но есть Рэндалл. VISReg: Variance-Invariance-Sketching Regularization for JEPA training __Haiyu Wu, Randall Balestriero, Morgan Levine__ Статья: https://arxiv.org/abs/2606.02572 Ревью: https://arxiviq.substack.com/p/visreg-variance-invariance-sketching Сайт: https://haiyuwu.github.io/visreg Код: https://github.com/HaiyuWu/visreg # TL;DR ЧТО сделали: Авторы представили VISReg (Variance-Invariance-Sketching Regularization) — математически обоснованный метод регуляризации для self-supervised learning в архитектурах JEPA, свободный от эвристик. Он заменяет стандартную ковариационную регуляризацию целевой функцией скетчинга на базе расстояния Слайс-Вассерштейна (Sliced-Wasserstein). Метод выравнивает нормализованные эмбеддинги с изотропным гауссовым априорным распределением вдоль случайных одномерных проекций, используя при этом независимый член регуляризации масштаба для контроля дисперсии. ПОЧЕМУ это важно: Этот подход решает проблему затухающих градиентов, которая возникает у предыдущих методов скетчинга распределений при коллапсе представлений, сохраняя линейную вычислительную сложность `O(NDK)`. Для практиков: Метод полностью избавляет от хрупких инженерных трюков (таких как моментум-энкодеры, асимметрия «ученик-учитель» или приёмы с центрированием и «заострением» распределений). При этом он обеспечивает отличную обобщающую способность на out-of-distribution (OOD) выборках, сравнимую с DINOv2 на даунстрим-задачах, несмотря на использование в 10 раз меньшего объёма данных для предобучения. Обучать джепы тут: https://t.me/gonzo_ML_podcasts/4663
Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские…
Из этого канала
- #5838Интересные находки про обучение малых LLM из предобученных больших. Small LLMs:…
Интересные находки про обучение малых LLM из предобученных больших. Small LLMs: Pruning vs.
- #5843Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the…
Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data Shikai Qiu, Marc…
- #5851Прорывы в математике продолжаются. За $2000 в цене токенов (правда от другой…
Прорывы в математике продолжаются. За $2000 в цене токенов (правда от другой модели, Sol) внутренняя версия OpenAI'ной следующей модели Astra нашла новые или…
- #5823"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков…
"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями.
- #5822Если что, прямо сейчас Фристон выступает…
Если что, прямо сейчас Фристон выступает https://www.youtube.com/watch?v=qRA1DoMCCSc