Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его новомодными улучшениями (мы разбирали ModernBERT, https://t.me/gonzo_ML/3090) в том, что с ростом модели репрезентации финальных слоёв контринтуитивно деградируют и бесполезны для множества реальных задач. А всё потому, что они работают на две цели одновременно: понимание высокоуровневой семантики и восстановление локального токена. Если цели разделить (что в работе и сделали), то становится всё хорошо. Лекун и ко улучшили репрезентации! Separating Representation from Reconstruction Enables Scalable Text Encoders __Megi Dervishi, Mathurin Videau, Yann LeCun__ Paper: https://arxiv.org/abs/2607.04011 Review: https://arxiviq.substack.com/p/separating-representation-from-reconstruction Code: https://github.com/facebookresearch/lingua Model: N/A # TL;DR ЧТО сделали: Авторы представили CrossBERT — новую двудольную (bipartite) архитектуру текстового энкодера, которая полностью разделяет обучение репрезентаций и реконструкцию токенов. Благодаря использованию глубокого энкодера для формирования представлений и лёгкого предиктора исключительно на базе кросс-аттеншена (cross-attention) для реконструкции, CrossBERT позволяет использовать высокую долю маскирования (`≥ 50%`). Вместе с этим исследователи внедрили параллельную стратегию комплементарного маскирования (Complementary Masking Strategy, CMS), которая кардинально ускоряет обучение и гарантирует монотонный рост качества репрезентаций по мере масштабирования. ПОЧЕМУ это важно: Стандартные плоские двунаправленные энкодеры, обучаемые через Masked Language Modeling (MLM) (такие как классический BERT), страдают от серьёзной деградации качества репрезентаций при увеличении масштаба. Это происходит потому, что их финальные слои слишком сильно специализируются на восстановлении локальных токенов из словаря вместо того, чтобы сохранять высокоуровневую семантику. CrossBERT изящно решает это структурное узкое горлышко. Теперь текстовые эмбеддинги предсказуемо масштабируются с ростом вычислений, а замороженные репрезентации не уступают или даже превосходят полноценно дообученные бейзлайны в задачах поиска и семантического анализа. Для практиков: CrossBERT открывает возможность использовать мощные замороженные текстовые бэкбоны для таких задач, как плотный поиск документов (dense passage retrieval), семантический поиск и RAG. Это избавляет от необходимости дорогостоящего и сложного файнтюнинга под конкретные задачи на инференсе, предлагая при этом ускорение пропускной способности данных до `1.68x`. Улучшать Берт здесь: https://t.me/gonzo_ML_podcasts/4574
Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его…
Из этого канала
- #5791Хм... https://www.anthropic.com/news/claude-opus-5
Хм... https://www.anthropic.com/news/claude-opus-5
- #5778Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и…
Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и выдаёт текстовый ответ, близкие (но несовпадающие) решения часто неразличимы.
- #5772Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов.…
Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов. Построено на идее, что агент — это параметры модели + харнесс, At = (θt, Σt).
- #5767Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge…
Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge устройств.