Снова про эмерджентность (https://t.me/gonzo_ML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных задач. Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns __Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov__ Статья: https://arxiv.org/abs/2606.25010 Ревью: https://arxiviq.substack.com/p/emergent-capabilities-arise-randomly Код: N/A Модель: N/A # TL;DR ЧТО сделали: Авторы провели детальное исследование внутренних механизмов моделей (mechanistic study), которое показало, что внезапное, стохастическое появление прикладных способностей (downstream capabilities) у трансформеров в процессе обучения вызвано резким обнаружением паттернов разреженной маршрутизации внимания (sparse attention routing patterns), специфичных для конкретной задачи. Анализируя предобученные LLM и конструируя контролируемые синтетические задачи, они выделили длину контекста и разреженность паттернов как главные узкие горлышка (bottlenecks), ограничивающие этот процесс обучения, а также продемонстрировали, что альтернативные архитектуры или стратегии предварительного предобучения могут значительно ускорить эмерджентность. ПОЧЕМУ это важно: Это исследование демистифицирует «эмерджентные способности», смещая парадигму от необъяснимого, зависящего от масштаба феномена или «иллюзии метрик» к конкретной проблеме оптимизационного поиска. Понимание того, что эмерджентность соответствует обнаружению разреженных цепей маршрутизации (routing circuits), открывает чёткий путь в обход дорогостоящего масштабирования «в лоб» (brute-force scaling). Вместо этого исследователи могут проектировать новые архитектуры, специализированные пайплайны синтетического предобучения или вводить оптимизационные баесы (optimization biases), которые сделают выучивание таких разреженных паттернов внимания крайне эффективным с точки зрения расхода данных. Для практиков: Вместо бесконечного скейлинга моделей для достижения эмерджентности стоит сфокусироваться на предварительном предобучении (pre-pretraining) на структурированных синтетических датасетах (например, на языках Дика / Dyck) и использовать гибридные архитектуры, эффективные при позиционной маршрутизации (такие как MLP-Mixer), чтобы снизить оптимизационную сложность для трансформеров. Искать эмерджентность тут: https://t.me/gonzo_ML_podcasts/4752