Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на длинных горизонтах. Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent __Agents-A1 Team, Shanghai Artificial Intelligence Laboratory__ Paper: https://arxiv.org/abs/2606.30616 Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters Code: https://github.com/InternScience/Agents-A1 Model: https://huggingface.co/InternScience/Agents-A1 # TL;DR ЧТО сделали: Авторы представили Agents-A1 — агентную MoE-модель на 35 миллиардов параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45 тысяч токенов. Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов. ПОЧЕМУ это важно: Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров. Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом. Для практиков: Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс). Дистиллировать учителей здесь: https://t.me/gonzo_ML_podcasts/4496
Большие модели — это, конечно, классно, но это удел избранных. Нам, простым…
Из этого канала
- #5760Just in case, я неожиданно стал соорганизатором конференции Superintelligence…
Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете…
- #5752"В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей…
"В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.
- #5747Развитие темы про добавление памяти в различные архитектуры. В работе решают…
Развитие темы про добавление памяти в различные архитектуры. В работе решают проблему ограниченного размера рекуррентного состояния в SSM-подобных моделях…
- #5742"Базу для хранения жизненного опыта агентов подвезли. Ждём новый…
"Базу для хранения жизненного опыта агентов подвезли. Ждём новый инфраструктурный стартап? Experience Graphs: The Data Foundation for Self-Improving Agents…