В работе AI 2027, как и во многих других прогнозах развития AI, делается допущение, что весь прогресс в большей степени объясняется улучшением по двум фронтам: вычислительные мощности (в простонародье «компьют») и алгоритмические улучшения. Про первые мы говорили много, про Stargate мы тоже уже все знаем (и ждём 5 огромных датацентров в разных штатах США), давайте немного про второе. Алгоритмические улучшения — это, если по простому, то, что позволяет за то же количество мощностей (первый фактор) получать модели лучше. Три самых явных из того, что на слуху: — обучение рассуждениям, o1/R1, вот эти модели, и рецепт их обучения через GRPO/что-то ещё. От моделей, которые решают 20-30% абстрактных задач это позволило скакнуть до 70-80%. — микстура экспертов, MoE, которая позволяет делать модель «больше», не меняя скорость генерации предсказаний. GPT-4 вот была MoE (не первой), и почти все современные модели тоже. — RLHF, обучение моделей быть «полезными» для людей. Из LLM, которая просто генерирует текст, похожий на что-то в интернете, RLHF позволяет получить модель, которая гораздо более чутка по отношению к запросам. В оригинальной работе от OpenAI было показано, что ответы от GPT на 1.5 миллиарда параметров, но с RLHF, нравились людям больше, чем от GPT на 175 миллиардов (более чем в 100 раз больше!). Вот из последнего примера прям понятно, что за алгоритмическое улучшение. Дообучаем чуть по другому, и теперь даже маленькая моделька лучше огромной. Так вот, в работе AI 2027 делается интересное предположение о том, над какими алгоритмическими улучшениями будет работать Agent-2 (AI система в OpenBrain, которая будет заниматься исследовательской работой). Одним из них является улучшение цепочек рассуждений через увеличение пропускной способности, другим — итеративный подход улучшения качества базовой модели через дистилляцию и амплификацию. ==== 1. Сейчас передовые рассуждающие модели вынуждены записывать текстом всё, о чем думают. Это не очень эффективно — каждое слово само по себе несёт очень мало информации, примерно 16 бит (log_2(100k)). В то же время для предсказания слова модель сначала формирует вектор, в котором тысячи чисел, каждое из которых весит 8-16 бит, а затем из него предсказывает это слово. Слово подаётся в контекст модели и процесс повторяется — получается, из-за вербализации теряется очень много информации. Можно попробовать не переводить вектор в текст, а брать и сразу передавать его на вход. Таким образом мы потеряем возможность читать мысли модели, однако она сможет передавать гораздо больше информации в одном «слове». META недавно выпустила статью Coconut, которая делает ровно это, но в ограниченном масштабе. Почитать разбор можно у Гриши вот тут. 2. В работе R1 DeepSeek показали, что цепочки рассуждений можно брать как датасет и обучать на них более слабые модельки — и это приведёт к улучшению последних. Тут можно выделить две части процесса: где мы тратим мощности на генерацию и отбор решений, и где мы дистиллируем эти решения (а вместе с ними и навыки) в базовую модель. Сейчас этот цикл повторяется один раз. В его результате базовая модель, с которой мы можем начинать следующую итерацию, стала лучше — а значит если мы повторим процедуру генерации и верификации решений, то почти наверняка получим результаты чуть получше. И так можно повторять и повторять. Насколько мне известно, основной преградой является схлопывание разнообразия, так как модели по сути учатся на очень ограниченной отобранной синтетике, и рано или поздно это перестаёт обобщаться. Какие работы тут посоветовать почитать я не знаю, если есть рекомендации — кидайте. Наверное, можно вспомнить AlphaZero для игры в Го и другие игры, принцип схожий.
В работе AI 2027, как и во многих других прогнозах развития AI, делается…
Из этого канала
- #2542Картинки с иллюстрацией методов
Картинки с иллюстрацией методов
- #2544🆒 все посты за сегодня написаны стоя и на новой клавиатуре 🆒 держу в курсе
🆒 все посты за сегодня написаны стоя и на новой клавиатуре 🆒 держу в курсе
- #2545Вышел Qwen 3 от Alibaba: https://qwenlm.github.io/blog/qwen3/ В релиз включены…
Вышел Qwen 3 от Alibaba: https://qwenlm.github.io/blog/qwen3/ В релиз включены как Dense-модели, так и трансформеры с микстурой экспертов.
- #2539А вот полное дерево задач, которые выделили учёные из AISI. Читать нужно слева…
А вот полное дерево задач, которые выделили учёные из AISI. Читать нужно слева направо и сверху вниз.
- #2538Вот так выглядит «фото» моделей и их «документы», когда они хотят пройти…
Вот так выглядит «фото» моделей и их «документы», когда они хотят пройти верификацию (KYC) для регистрации на сайтах.