Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на длинных горизонтах. Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent __Agents-A1 Team, Shanghai Artificial Intelligence Laboratory__ Paper: https://arxiv.org/abs/2606.30616 Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters Code: https://github.com/InternScience/Agents-A1 Model: https://huggingface.co/InternScience/Agents-A1 # TL;DR ЧТО сделали: Авторы представили Agents-A1 — агентную MoE-модель на 35 миллиардов параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45 тысяч токенов. Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов. ПОЧЕМУ это важно: Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров. Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом. Для практиков: Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс). Дистиллировать учителей здесь: https://t.me/gonzo_ML_podcasts/4496