Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с циклами и пропусками (например тут и тут). Текущая работа делает прикольный заход — рассматривает каждый слой как функцию и собирает отдельную маленькую сеть, обучающуюся генерировать композицию этих функций под конкретный вход. Результат стабильно лучше по качеству а часто ещё и быстрее. Отдельно прикольно, что выкидывание слоёв тоже улучшает результат. Как показали другие статьи, глубже — не обязательно лучше. Skip a Layer or Loop It? Learning Program-of-Layers in LLMs __Ziyue Li, Yang Li, Tianyi Zhou__ Paper: https://arxiv.org/abs/2606.06574 Code: https://github.com/tianyi-lab/PoLar Model: N/A ЧТО сделали: Представили Program-of-Layers (PoLar) — метод без дообучения базовой модели (training-free), который рассматривает слои предобученной LLM как библиотеку вызываемых функций. Вместо прогона каждого входа через жёсткий последовательный прямой проход (forward pass), легковесный предиктор на 2.1 млн параметров генерирует под конкретный запрос программу исполнения, динамически пропуская (skip), сохраняя (keep) или зацикливая (repeat) непрерывные сегменты слоёв. ПОЧЕМУ это важно: Работа наглядно доказывает, что статичный порядок слоёв фиксированной глубины задействует лишь малую часть внутреннего потенциала рассуждений LLM. Динамическая компиляция путей исполнения на этапе инференса позволяет перераспределять скрытые вычисления: модель заметно прибавляет в точности и снижает задержку, при этом веса самой базовой модели не меняются и не дообучаются. Для практиков: Современные трансформеры тратят одинаковое количество вычислительных шагов как на элементарные запросы, так и на сложнейшие математические задачи. PoLar внедряет мета-контроллер, который планирует исполнение замороженной модели под каждый конкретный запрос: пропускает лишние внутренние слои на простых задачах для экономии времени и повторяет аналитические блоки на сложных для повышения точности. Такой стиринг архитектуры снижает задержку и ощутимо улучшает качество на сложных бенчмарках без дорогостоящего файнтюнинга. Собирать программу из слоёв тут: https://t.me/gonzo_ML_podcasts/4795
Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много…
Из этого канала
- #5956Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See…
Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See the Basis, but Adam Does Devender Singh Paper: https://arxiv.org/abs/2608.05136…
- #5942Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный…
- #5935Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку.
- #5931Прикольная работа про экономию памяти для работы с длинными…
Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика…