Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с циклами и пропусками (например тут и тут). Текущая работа делает прикольный заход — рассматривает каждый слой как функцию и собирает отдельную маленькую сеть, обучающуюся генерировать композицию этих функций под конкретный вход. Результат стабильно лучше по качеству а часто ещё и быстрее. Отдельно прикольно, что выкидывание слоёв тоже улучшает результат. Как показали другие статьи, глубже — не обязательно лучше. Skip a Layer or Loop It? Learning Program-of-Layers in LLMs __Ziyue Li, Yang Li, Tianyi Zhou__ Paper: https://arxiv.org/abs/2606.06574 Code: https://github.com/tianyi-lab/PoLar Model: N/A ЧТО сделали: Представили Program-of-Layers (PoLar) — метод без дообучения базовой модели (training-free), который рассматривает слои предобученной LLM как библиотеку вызываемых функций. Вместо прогона каждого входа через жёсткий последовательный прямой проход (forward pass), легковесный предиктор на 2.1 млн параметров генерирует под конкретный запрос программу исполнения, динамически пропуская (skip), сохраняя (keep) или зацикливая (repeat) непрерывные сегменты слоёв. ПОЧЕМУ это важно: Работа наглядно доказывает, что статичный порядок слоёв фиксированной глубины задействует лишь малую часть внутреннего потенциала рассуждений LLM. Динамическая компиляция путей исполнения на этапе инференса позволяет перераспределять скрытые вычисления: модель заметно прибавляет в точности и снижает задержку, при этом веса самой базовой модели не меняются и не дообучаются. Для практиков: Современные трансформеры тратят одинаковое количество вычислительных шагов как на элементарные запросы, так и на сложнейшие математические задачи. PoLar внедряет мета-контроллер, который планирует исполнение замороженной модели под каждый конкретный запрос: пропускает лишние внутренние слои на простых задачах для экономии времени и повторяет аналитические блоки на сложных для повышения точности. Такой стиринг архитектуры снижает задержку и ощутимо улучшает качество на сложных бенчмарках без дорогостоящего файнтюнинга. Собирать программу из слоёв тут: https://t.me/gonzo_ML_podcasts/4795