"Интересный заход на конвертацию видео-диффузионки в универсальную модель. Пробую в первый раз формат статьи, где картинки внутри и есть поддержка формул. Редактор, конечно, пока пипец какой глючный... Video Generation Models are General-Purpose Vision Learners __Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir and Cristian Sminchisescu__ Paper: https://arxiv.org/abs/2607.09024 Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы представили GenCeption — унифицированный фреймворк, который превращает предобученную text-to-video диффузионную модель в одношаговую модель прямого прохода (feed-forward) для компьютерного зрения. Он проецирует разнородные плотные задачи (такие как оценка глубины, нормалей поверхностей и позы камеры) в единое трёхканальное RGB-пространство, а редкие задачи (например, 3D-ключевые точки) решает с помощью обучаемых токенов-запросов (queries), управляя всем процессом через текстовые инструкции. ПОЧЕМУ это важно: Работа доказывает, что масштабное предобучение генерации видео работает как мощная ""модель мира"", неявно усваивая 4D-пространственно-временную динамику, геометрию и законы физики. Вместо медленного итеративного денойзинга GenCeption извлекает эти богатые представления за один прямой проход. Модель не уступает специализированным SOTA-решениям, требуя при этом до 500 раз меньше данных для обучения и демонстрируя отличную zero-shot генерализацию на не встречавшиеся ранее категории. Для практиков: Если вам нужны точные пространственные и физические представления для робототехники или пространственных вычислений, тяжёлые видеогенераторы (вроде WAN 2.1) могут дать мощнейший zero-shot буст без необходимости собирать терабайты специализированной разметки. Играться с видеомоделями тут: https://t.me/gonzo_ML_podcasts/4777"