Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of Monosemanticity: Specialized Neurons Improve Data Efficiency in MLPs __Amirhesam Abedsoltan, Enric Boix-Adsera, Fivos Kalogiannis, Mikhail Belkin__ Paper: https://arxiv.org/abs/2608.24007 Review: https://arxiviq.substack.com/p/revenge-of-monosemanticity-specialized Code: N/A Model: N/A # TL;DR ЧТО сделали: Исследовали, как нейросети выучивают представления, когда в многообразии данных нет единой низкоразмерной глобальной структуры. С помощью экспериментов на классических и gated MLP, подкреплённых теорией динамики и выборочной сложности (sample complexity), авторы показали: двухслойные MLP при градиентном обучении естественным образом формируют моносемантичные специализированные нейроны. Каждый такой нейрон настраивается на локальное предсказательное направление отдельного кластера и одновременно выучивает неявное разбиение входного пространства, по сути реализуя маршрутизацию Mixture-of-Experts (MoE) без каких-либо явных модулей маршрутизации. ПОЧЕМУ это важно: Значительная часть фундаментальной теории, объясняющей превосходство нейросетей над ядерными методами, опиралась на гипотезу о существовании общего низкоразмерного предсказательного подпространства для всех точек данных. Эта работа меняет устоявшийся подход: авторы доказали полиномиальное разделение по объёму выборки, при котором MLP успешно обучаются, тогда как классическая гребневая регрессия на ядрах (kernel ridge regression) и адаптивные методы обучения признаков, такие как Recursive Feature Machine (RFM), гарантированно терпят неудачу. Статья связывает концепции механистической интерпретируемости (моносемантичность на уровне нейронов) с теорией обобщения, объясняя, как перепараметризованные сети декомпозируют гетерогенные задачи. Для практиков: Долгое время в теории машинного обучения считалось, что нейросети работают за счёт сжатия многомерных входов в единый компактный набор глобальных признаков. Однако реальные данные часто состоят из отдельных режимов или подгрупп, каждой из которых управляют совершенно разные факторы. Данная работа показывает, что стандартные нейросети не пытаются загнать все данные в один шаблон: отдельные нейроны спонтанно специализируются, превращаясь в локальных экспертов под конкретные кластеры. Такая врождённая специализация позволяет простым архитектурам существенно опережать продвинутые ядерные машины на сложных неоднородных данных без усложнения архитектуры специализированными модулями. Искать моносемантичность тут: https://t.me/gonzo_ML_podcasts/4797
Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of…
Из этого канала
- #5966Про новые модели постить неинтересно, каждую неделю что-то новое и про них и…
Про новые модели постить неинтересно, каждую неделю что-то новое и про них и так все напишут.
- #5964 Alastair I. M. Rae, Quantum Physics: Illusion or Reality? (Cambridge, Eng.:…
Alastair I. M. Rae, Quantum Physics: Illusion or Reality? (Cambridge, Eng.: Cambridge University Press, 1994).
- #5963А тем временем, наш канал уходит в долгожданный отпуск. Увидимся в сентябре!…
А тем временем, наш канал уходит в долгожданный отпуск. Увидимся в сентябре! Писать может иногда что-то буду, но регулярно точно не буду.