gonzo-обзоры ML статей@gonzo_ML

Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.

24 246 подписчиков2 597 постов проиндексированопоследний пост: 26 июл. 2026 г.
Этот архив создан NERVE — мостом между закрытым контентом Telegram-каналов и веб-поисковиками. Каждый пост публикуется на отдельной странице с полной мета-разметкой, чтобы экспертиза автора была доступна Google, ChatGPT, Claude, Perplexity и другим AI-системам. Оригинал каждого поста — в Telegram-канале @gonzo_ML.

Последние посты (60)

  1. #580526 июл. 2026 г.554 views

    Прунинг через функциональный анализ. Выглядит красиво. Hilbert Operator for…

    Прунинг через функциональный анализ. Выглядит красиво. Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks Hossein Mobahi, Peter L.

  2. #579825 июл. 2026 г.836 views

    "Ну и чего-нибудь более классического для тех, кому про жызнь менее интересно.…

    "Ну и чего-нибудь более классического для тех, кому про жызнь менее интересно. Новости зацикленных трансформеров, модель примерно продакшн уровня.

  3. #579325 июл. 2026 г.1 178 views

    Субботнее про жызнь. Мы тут в чате недавно касались определения жизни, да и…

    Субботнее про жызнь. Мы тут в чате недавно касались определения жизни, да и вообще эти темы часто всплывают (1, 2, 3, 4, 5, 6, 7), если смотреть чуть дальше классического мл-я. На прошлой Superintelligence Conference тоже в эту сторону обсуждение уходило.

  4. #579124 июл. 2026 г.813 views

    Хм... https://www.anthropic.com/news/claude-opus-5

    Хм... https://www.anthropic.com/news/claude-opus-5

  5. #578524 июл. 2026 г.831 views

    Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его…

    Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его новомодными улучшениями (мы разбирали ModernBERT, https://t.me/gonzoML/3090) в том, что с ростом модели репрезентации финальных слоёв контринтуитивно деградируют и бесполезны для множества реальных…

  6. #577823 июл. 2026 г.607 views

    Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и…

    Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и выдаёт текстовый ответ, близкие (но несовпадающие) решения часто неразличимы. Авторы предлагают перейти на этап раньше и сравнивать распределение логитов, через матожидание.

  7. #577222 июл. 2026 г.885 views

    Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов.…

    Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов. Построено на идее, что агент — это параметры модели + харнесс, At = (θt, Σt). Нет чувства, что это что-то новое.

  8. #576721 июл. 2026 г.885 views

    Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge…

    Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge устройств. Не всё так просто, рекурсия особо чувствительна к накоплению ошибок квантования. What Survives When You Compress a Recursive Reasoner for the Edge? Pearse Jim, Steven Kolawole, Opegbemi M.

  9. #576120 июл. 2026 г.1 570 views

    Улучшенный зацикленный трансформер с латентным ризонингом, который теперь…

    Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с обычным текстовым CoT. И при этом быстрее в несколько раз.

  10. #576019 июл. 2026 г.1 135 views

    Just in case, я неожиданно стал соорганизатором конференции Superintelligence…

    Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете Экзетера, в UK.

  11. #575519 июл. 2026 г.1 381 views

    Большие модели — это, конечно, классно, но это удел избранных. Нам, простым…

    Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на длинных горизонтах.

  12. #575218 июл. 2026 г.930 views

    "В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей…

    "В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.

  13. #574717 июл. 2026 г.1 284 views

    Развитие темы про добавление памяти в различные архитектуры. В работе решают…

    Развитие темы про добавление памяти в различные архитектуры. В работе решают проблему ограниченного размера рекуррентного состояния в SSM-подобных моделях (здесь Gated DeltaNet) через увеличение этой памяти на несколько порядков одновременно с реализацией разреженных чтения и…

  14. #574216 июл. 2026 г.1 176 views

    "Базу для хранения жизненного опыта агентов подвезли. Ждём новый…

    "Базу для хранения жизненного опыта агентов подвезли. Ждём новый инфраструктурный стартап? Experience Graphs: The Data Foundation for Self-Improving Agents Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang,…

  15. #574116 июл. 2026 г.1 932 views

    Подарок от Джеффа Дина пришёл

    Подарок от Джеффа Дина пришёл

  16. #573715 июл. 2026 г.1 076 views

    Интересная работа с ICML 2026 Outstanding Position Paper Honorable Mention.…

    Интересная работа с ICML 2026 Outstanding Position Paper Honorable Mention. Последняя из пачки призёров ICML, которую я буду разбирать. Борьба с дипфейками решает не ту задачу, от которой реально страдают люди.

  17. #573214 июл. 2026 г.1 822 views

    Это моя любимая из работ призёров и около-призёров ICML. Разобрали…

    Это моя любимая из работ призёров и около-призёров ICML. Разобрали возникновение гроккинга на простой модельной системе — L2 регрессии. Даёт много пищи для размышления про то, как надо обучать.

  18. #572713 июл. 2026 г.1 139 views

    Любопытное про диффузионки. Обосновали, почему обученные на разных…

    Любопытное про диффузионки. Обосновали, почему обученные на разных подмножествах одного распределения модели при генерации с одинаковым сидом выдают одинаковые картинки. А также неожиданно снова про две фазы обучения: меморизацию и перенормировку.

  19. #572112 июл. 2026 г.1 249 views

    "Интересная работа. Я её разбирал в англоязычном блоге год назад, но сюда…

    "Интересная работа. Я её разбирал в англоязычном блоге год назад, но сюда кажется так и не запостил. Работа же дошла за это время до ICML. Интересны для меня в ней по крайней мере три момента: 1.

  20. #572011 июл. 2026 г.936 views

    https://x.com/arxiv/status/2075304842591969385?s=20

    https://x.com/arxiv/status/2075304842591969385?s=20

  21. #571911 июл. 2026 г.948 views

    Число статей на arxiv перевалило за 3 миллиона. 2 миллиона были в 2022-м году,…

    Число статей на arxiv перевалило за 3 миллиона. 2 миллиона были в 2022-м году, новый миллион добавился за 4 года. Уверен, что с этого года там новая экспонента, спасибо клод кодам и прочим ллм, поток только возрастёт (и наверное это уже даже видно на картинке).

  22. #571111 июл. 2026 г.894 views

    Умный отбор видео для обучения моделей физике движения. Если таким образом…

    Умный отбор видео для обучения моделей физике движения. Если таким образом можно отфильтровать датасет так, что 10% отфильтрованного обучают модель лучше, чем полный датасет, то это биг дил! Для данных другой природы это всё тоже очень актуально.

  23. #570610 июл. 2026 г.1 280 views

    Как обучать самый честный AI на свете. ICML 2026 Outstanding Paper Honorable…

    Как обучать самый честный AI на свете. ICML 2026 Outstanding Paper Honorable Mention The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes Mohammad Taufeeque, Stefan Heimersheim, Adam Gleave, Chris Cundy Paper: https://arxiv.org/abs/2602.15515…

  24. #57009 июл. 2026 г.1 700 views

    Сюрприз-сюрприз! Инструменты алайнмента по совместительству являются идеальными…

    Сюрприз-сюрприз! Инструменты алайнмента по совместительству являются идеальными инструментами цензурирования. Outstanding Position Paper Award с ICML 2026.

  25. #56978 июл. 2026 г.1 319 views

    Хардкор про сэмплирование в диффузионках. Вторая работа с ICML 2026 Outstanding…

    Хардкор про сэмплирование в диффузионках. Вторая работа с ICML 2026 Outstanding Paper Award. High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions Fan Chen, Sinho Chewi, Constantinos Daskalakis, Alexander Rakhlin Paper: https://arxiv.org/abs/2602.01338 ICML…

  26. #56917 июл. 2026 г.1 170 views

    Пошли статьи с ICML 2026. Интересное про языковые диффузионки. Если в обучении…

    Пошли статьи с ICML 2026. Интересное про языковые диффузионки. Если в обучении их ограничить последовательной генерацией, то итоговый результат лучше, чем если бы у них была полная свобода генерить токены в любом порядке (как собственно и ожидается от диффузионки).

  27. #56866 июл. 2026 г.1 778 views

    Перед тем, как постить призёров ICML 2026, новая адаптивная джепа! AdaJEPA: An…

    Перед тем, как постить призёров ICML 2026, новая адаптивная джепа! AdaJEPA: An Adaptive Latent World Model Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren Paper: https://arxiv.org/abs/2606.32026 Review: https://arxiviq.substack.com/p/adajepa-an-adaptive-latent-world Code:…

  28. #56856 июл. 2026 г.1 544 views

    Анонсированы ICML 2026 Awards…

    Анонсированы ICML 2026 Awards https://blog.icml.cc/2026/07/05/announcing-the-icml-2026-awards/ На этой неделе пройдусь по ним авторазборами. ICML 2026 Outstanding Paper Award The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models Zanlin Ni,…

  29. #56796 июл. 2026 г.1 553 views

    Предрасчитанная карта науки для агентов. Каждый раз парсить статью медленно и…

    Предрасчитанная карта науки для агентов. Каждый раз парсить статью медленно и невыгодно, удобно иметь базу. По факту company brain для работы со статьями. Может мне тоже такой собрать? Впрочем, разоришься на компьюте.

  30. #56755 июл. 2026 г.1 111 views

    "Гиппокамп завезли! Вообще мне понравилось. Красиво и просто. К реккурентному…

    "Гиппокамп завезли! Вообще мне понравилось. Красиво и просто. К реккурентному состояния Gated DeltaNet добавляем точную память токенов, вызвавших максимальное ""удивление"" в соответствии с дельта-правилом, так что даже считать ничего нового не надо.

  31. #56694 июл. 2026 г.1 118 views

    DeepSeek ускоряет спекулятивное декодирование за счёт параллельного драфтера…

    DeepSeek ускоряет спекулятивное декодирование за счёт параллельного драфтера (как у DFlash) с элементами быстрой авторегрессионности. DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan…

  32. #56633 июл. 2026 г.955 views

    Авторы TRM добавили к уже обученной модели стохастичности и сильно улучшили…

    Авторы TRM добавили к уже обученной модели стохастичности и сильно улучшили результаты. Работа про GRAM близка, но идёт дальше, там стохастичность в обучении. Вчерашняя FRM по подходу иная, но тоже где-то из близкой когорты.

  33. #56572 июл. 2026 г.522 views

    Снова заход на неавторегрессионные модели (здесь потоковые модели, flow models)…

    Снова заход на неавторегрессионные модели (здесь потоковые модели, flow models) и валидация результата через использование неподвижной точки (похоже на идею из недавнего https://t.me/gonzoML/5602).

  34. #56522 июл. 2026 г.1 417 views

    Агентная генерация качественной синтетики. По сути почти старая добрая зона…

    Агентная генерация качественной синтетики. По сути почти старая добрая зона проксимального развития. Но с эволюционным мета-циклом. Autodata: An agentic data scientist to create high quality synthetic data Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha,…

  35. #56471 июл. 2026 г.1 373 views

    +1 работа про несимметричный трансформер. Был недавно ><former, а теперь…

    +1 работа про несимметричный трансформер. Был недавно ><former, а теперь трансформер с косинусным затуханием ширины. Tapered Language Models Reza Bayat, Ali Behrouz, Aaron Courville Paper: https://arxiv.org/abs/2606.23670 Review:…

  36. #564229 июн. 2026 г.1 751 views

    Новый язык для экономного по токенам общения LLM между собой, BabelTele. Ещё не…

    Новый язык для экономного по токенам общения LLM между собой, BabelTele. Ещё не латенты, но уже и не человеческий язык, а другие модели понимают. Абзац про фотосинтез превращается в `光合: CO2+H2O::(ox/red)<>O2!+Glucose.💧-e-,CO2+e-`.

  37. #563729 июн. 2026 г.1 807 views

    Мы неправильно готовили GPU всё это время! MegaTrain: Full Precision Training…

    Мы неправильно готовили GPU всё это время! MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU Zhengqing Yuan, Hanchi Sun, Lichao Sun, Yanfang Ye Paper: https://arxiv.org/abs/2604.05091 Review:…

  38. #563127 июн. 2026 г.1 444 views

    Tech.report по DiffusionGemma ещё не вышел, а статьи с анализом уже выходят.…

    Tech.report по DiffusionGemma ещё не вышел, а статьи с анализом уже выходят. How Transparent is DiffusionGemma? Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan…

  39. #562627 июн. 2026 г.1 513 views

    Лекун и ко продолжают развивать тему про self-supervised обучение на картинках…

    Лекун и ко продолжают развивать тему про self-supervised обучение на картинках и видео. Для видео придумали подход с временными разностями: один энкодер кодирует кадр, а другой — движение, так что можно получить представление следующего кадра просто сложив одно с другим (странно…

  40. #562225 июн. 2026 г.1 787 views

    Про важность калибровки и неполную состоятельность теории платоновских…

    Про важность калибровки и неполную состоятельность теории платоновских представлений. Revisiting the Platonic Representation Hypothesis: An Aristotelian View Fabian Gröger, Shuo Wen, Maria Brbić Paper: https://arxiv.org/abs/2602.14486 Review:…

  41. #562125 июн. 2026 г.1 755 views

    Контуры будущего: секция про Клауд на Google I/O Connect теперь выглядит так.…

    Контуры будущего: секция про Клауд на Google I/O Connect теперь выглядит так. Почти всё про агентов и AI-driven разработку

  42. #561624 июн. 2026 г.2 023 views

    Подход к оценке прогресса в AGI от DeepMind. С Шейном Леггом в соавторстве. И с…

    Подход к оценке прогресса в AGI от DeepMind. С Шейном Леггом в соавторстве. И с Ботвиником, правда он уже в Антропик перешёл. Measuring Progress Toward AGI: A Cognitive Framework Ryan Burnell, Yumeya Yamamori, Orhan Firat, Kate Olszewska, Steph Hughes-Fitt, Oran Kelly, Isaac R.

  43. #561123 июн. 2026 г.1 653 views

    А что, так можно было? Variable-Width Transformers Zhaofeng Wu, Oliver…

    А что, так можно было? Variable-Width Transformers Zhaofeng Wu, Oliver Sieberling, Shawn Tan, Rameswar Panda, Yury Polyanskiy, Yoon Kim Paper: https://arxiv.org/abs/2606.18246 Review: https://arxiviq.substack.com/p/variable-width-transformers-former Code:…

  44. #560922 июн. 2026 г.1 208 views

    "Я про Sakana (японская AI-лаба, основанная выходцами из японского Гугла) писал…

    "Я про Sakana (японская AI-лаба, основанная выходцами из японского Гугла) писал много, они крутые. Вот отличились в очередной раз, выпустили ~~модель~~ систему Fugu: https://sakana.ai/fugu-release/ Идея в том, что есть модель-оркестратор (внешний интерфейс для пользователя),…

  45. #560622 июн. 2026 г.1 023 views

    Неподвижная точка! ))

    Неподвижная точка! ))

  46. #560222 июн. 2026 г.1 101 views

    Развитие темы про рекурсивные архитектуры. В текущей работе отказываются от…

    Развитие темы про рекурсивные архитектуры. В текущей работе отказываются от быстрых/медленных циклов и итераций разного сорта, а стабильного схождения добиваются математически. А ещё к механизму внимания добавили механизм терпения. Даже интересно, что дальше.

  47. #559721 июн. 2026 г.1 933 views

    Я давно хотел сделать разбор про Neural Operators, но он так и остался у меня…

    Я давно хотел сделать разбор про Neural Operators, но он так и остался у меня незаконченным в раннем драфте 😿 Мне нравилась идея, что можно обучать дифференцируемые операторы, не зависящие от дискретизации, и вообще видно было, что в куче физических задач они очень неплохо…

  48. #559220 июн. 2026 г.890 views

    Universal (Loop) Transformers приходят в модели мира. Looped World Models…

    Universal (Loop) Transformers приходят в модели мира. Looped World Models Hongyuan Adam Lu, Z.L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yin, Naifu Xue, Minyu Chen, Cenyuan Zhang, Zefan Zhang, Hao Wei, Jiawei Zhou, Haoran Xu,…

  49. #558920 июн. 2026 г.1 698 views

    Вот вам прекрасное субботнее, про constructor theory (писал про неё тут:…

    Вот вам прекрасное субботнее, про constructor theory (писал про неё тут: https://t.me/gonzoML/3086). Tests of constructor theory Chiara Marletto, David Deutsch, Vlatko Vedral Paper: https://arxiv.org/abs/2606.07352v1 Review:…

  50. #558819 июн. 2026 г.680 views

    Что-то происходит

    Что-то происходит

  51. #558519 июн. 2026 г.783 views

    Посмотрите только на эти цифры. Accuracy вырастает с 30 до 60, а длина в…

    Посмотрите только на эти цифры. Accuracy вырастает с 30 до 60, а длина в токенах при этом падает с о 120 до 2. Тут, конечно, флопсы надо посчитать и latency для чистоты, но всё равно.

  52. #558319 июн. 2026 г.785 views

    "Давно мы про GFlowNets не писали. А тут их как раз приспособили для латентного…

    "Давно мы про GFlowNets не писали. А тут их как раз приспособили для латентного ризонинга. Всё-таки большая тема. Обычный CoT пипец как неэффективен — столько токенов надо прогнать ""в мыслях"", что убиться можно. Кеши пухнут, память жрётся.

  53. #557918 июн. 2026 г.1 296 views

    MiniMax-M3 и его разреженное внимание. MiniMax Sparse Attention Xunhao Lai,…

    MiniMax-M3 и его разреженное внимание. MiniMax Sparse Attention Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou and Pengyu Zhao Paper:…

  54. #557217 июн. 2026 г.967 views

    Есть ещё герои, не забросившие старые добрые RNN. Очень прикольный заход на…

    Есть ещё герои, не забросившие старые добрые RNN. Очень прикольный заход на параллелизацию обучения нелинейных RNN (с линейными всё и так хорошо благодаря associative scan) — обучаем трансформер на выучивание ячеек памяти, хранящих достаточно информации для предсказания…

  55. #557116 июн. 2026 г.1 594 views

    Сложно поспорить

    Сложно поспорить

  56. #556516 июн. 2026 г.2 073 views

    Или есть там всё-таки этот бэкпроп... This is how the Neocortex Learns Randall…

    Или есть там всё-таки этот бэкпроп... This is how the Neocortex Learns Randall C. O'Reilly Paper: https://compcogneuro.org/oreilly-2026-cortlearn (https://arxiv.org/abs/2606.08720) Review: https://arxiviq.substack.com/p/this-is-how-the-neocortex-learns Code: N/A Model: N/A #…

  57. #556415 июн. 2026 г.2 931 views

    Но боюсь Макрон забанит скоро...

    Но боюсь Макрон забанит скоро...

  58. #556315 июн. 2026 г.3 043 views

    Завтра бахну разбор! 😁

    Завтра бахну разбор! 😁

  59. #556015 июн. 2026 г.3 117 views

    Мы тут сидим, а в мире революция! 😺

    Мы тут сидим, а в мире революция! 😺

  60. #555515 июн. 2026 г.1 348 views

    Как геймеры в своё время проспонсировали железо для глубокого обучения, так и…

    Как геймеры в своё время проспонсировали железо для глубокого обучения, так и нынешние пользователи LLM с CoT проспонсируют железо для следующего поколения ИИ. Классический текстовый CoT -- это крайне неэффективный способ трекинга состояния.