Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов. Построено на идее, что агент — это параметры модели + харнесс, A_t = (θ_t, Σ_t). Нет чувства, что это что-то новое. Зато историческая часть, как обычно у Шмидхубера, глубока :) Self-Improvements in Modern Agentic Systems: A Survey __Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R.B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber__ Статья: https://arxiv.org/abs/2607.13104 Ревью: https://arxiviq.substack.com/p/self-improvements-in-modern-agentic Код: https://github.com/selfimproving-agent/Awesome-Self-Improving-Agents Модель: N/A # TL;DR ЧТО сделали: Авторы представили подробный математический аппарат и систематическую таксономию самосовершенствующихся ИИ-агентов на базе больших моделей. Они формализовали состояние агента как совместную конфигурацию параметров базовой модели и внешней системной обвязки (скаффолдинга), разделив подходы к улучшению на два ключевых направления: параметрическое (обновление самой базовой модели) и беспараметрическое (модификация структуры обвязки). ПОЧЕМУ это важно: Современные автономные агенты переходят от статичных, вручную спроектированных скриптов к динамическим системам непрерывного обучения. Новая теоретическая база связывает современные LLM-архитектуры с классическими концепциями ИИ (такими как Гёделевская машина), закладывая фундамент для безопасного проектирования систем, способных развиваться без участия человека. Для практиков: Архитектура самосовершенствования позволяет обойти жёсткие ограничения контекстного окна за счёт переноса опыта в веса модели (параметрический путь) или быстро адаптироваться без дорогостоящего дообучения через динамическую генерацию промптов и инструментов (беспараметрический путь). При этом критически важно изолировать среду выполнения агента и контролировать процесс оценки, чтобы избежать reward hacking. Улучшать агентов тут: https://t.me/gonzo_ML_podcasts/4543