По свежим запросам читателей. Это какая-то интересная статья — получается, что достаточно двух случайно инициализированных голов внимания, в правильном порядке и применённых нужное количество раз, чтобы интерполировать любой батч последовательностей токенов и перевести его в любой другой целевой батч. Проблема только, что это теорема существования (доказали, что можно), но она не предлагает конкретной конструктивной процедуры (чтобы знать, сколько слоёв нужно). Математика тяжёлая для меня, надо вникать, сходу проверить не могу. Специалисты вэлкам (deepseek не предлагать)! Universal Interpolation for Deep Residual Self-Attention Networks __Sibylle Marcotte, Joan Bruna__ Paper: https://arxiv.org/abs/2610.01981 Code: https://github.com/sibyllema/attention_universality Review: https://arxiviq.substack.com/p/universal-interpolation-for-deep ЧТО сделали: Доказали теорему об универсальной интерполяции для глубоких остаточных сетей самовнимания: фиксированный словарь из нескольких замороженных блоков внимания со случайными гауссовыми весами переводит любой батч из N последовательностей токенов в любой целевой батч лишь за счёт выбора порядка слоёв, их знаков и скалярных коэффициентов. ЧТО получили: Для некаузального внимания с одной головой ширины r >= d ровно двух замороженных случайных блоков хватает для универсальной интерполяции при любых размерах батча N >= 1 и длинах последовательностей n >= 2 на открытом связном множестве полной меры. В численных тестах ранга на 576 конфигурациях (r < d) словари из m = ceil (d/r) блоков достигли полного ранга алгебры Ли в 94/96 запусков (дисперсия 1) и 96/96 (дисперсия 1/d) при допуске 10E-8 (89/96 и 90/96 по всем трём допускам), тогда как при m = ceil (d/r) - 1 получилось 0/96. ПОЧЕМУ это важно: Результат показывает, что глубина и композиция способны полностью заменить настройку параметров каждого отдельного слоя в рекуррентных моделях. Главное ограничение: конструкция не даёт верхних оценок на требуемую глубину сети. Искать универсальность здесь: https://t.me/gonzo_ML_podcasts/4819
По свежим запросам читателей. Это какая-то интересная статья — получается, что…
Из этого канала
- #6072Недавно писал про прикольный подход Recirculation, а тут уже и его развитие…
Недавно писал про прикольный подход Recirculation, а тут уже и его развитие подоспело (от конкурирующей команды) Write Back the Δ: Revisiting the Same Tokens…
- #6068В работе с таблицами, кажется, случается свой Jev-moment — вышла новая…
В работе с таблицами, кажется, случается свой Jev-moment — вышла новая маленькая и быстрая фундаментальная табличная модель, которая бьёт всех на zero-shot,…
- #6065Команда из DeepMind продолжает поиски сознания. From cacophony to hierarchy: a…
Команда из DeepMind продолжает поиски сознания. From cacophony to hierarchy: a principled framework for assessing AI consciousness Shamil Chandaria, Arvo Muñoz…