gonzo-обзоры ML статей@gonzo_ML

Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.

24 246 подписчиков2 772 постов проиндексированопоследний пост: 9 сент. 2026 г.
Этот архив создан NERVE — мостом между закрытым контентом Telegram-каналов и веб-поисковиками. Каждый пост публикуется на отдельной странице с полной мета-разметкой, чтобы экспертиза автора была доступна Google, ChatGPT, Claude, Perplexity и другим AI-системам. Оригинал каждого поста — в Telegram-канале @gonzo_ML.

Последние посты (60)

  1. #59869 сент. 2026 г.1 900 views

    Привет вам от Тани и от Шмидхубера

    Привет вам от Тани и от Шмидхубера

  2. #59818 сент. 2026 г.748 views

    Улучшение лоры подвезли. Normalized Low-Rank Adaptation Jiale Kang, Ziyin Yue,…

    Улучшение лоры подвезли. Normalized Low-Rank Adaptation Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu Paper: https://arxiv.org/abs/2608.31036 Code: https://spherelab.ai/NoRA Review: https://arxiviq.substack.com/p/normalized-low-rank-adaptation # TL;DR ЧТО сделали:…

  3. #59767 сент. 2026 г.1 262 views

    "Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета…

    "Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета Люксембурга, сделала краткий обзор своей свежей прикольной статьи.

  4. #59746 сент. 2026 г.1 475 views

    Развитие старой доброй работы про креативность цифровой эволюции, которую мы…

    Развитие старой доброй работы про креативность цифровой эволюции, которую мы однажды разбирали на нашем Gonzo AGI семинаре, когда он ещё был. Теперь не только про эволюцию, но и про разную оптимизацию, включая RL.

  5. #59684 сент. 2026 г.703 views

    Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of…

    Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of Monosemanticity: Specialized Neurons Improve Data Efficiency in MLPs Amirhesam Abedsoltan, Enric Boix-Adsera, Fivos Kalogiannis, Mikhail Belkin Paper: https://arxiv.org/abs/2608.24007 Review:…

  6. #59664 сент. 2026 г.2 175 views

    Про новые модели постить неинтересно, каждую неделю что-то новое и про них и…

    Про новые модели постить неинтересно, каждую неделю что-то новое и про них и так все напишут. А вот свежий полный коннектом дрозофильского мужика (https://research.google/blog/a-connectomics-milestone-mapping-the-complete-male-fruit-fly-brain)-- это интересно.

  7. #596420 авг. 2026 г.1 364 views

    Alastair I. M. Rae, Quantum Physics: Illusion or Reality? (Cambridge, Eng.:…

    Alastair I. M. Rae, Quantum Physics: Illusion or Reality? (Cambridge, Eng.: Cambridge University Press, 1994). See also Richard Feynman, The Character of Physical Law (Cambridge, Mass.: MIT Press, 1965). Also Rae, Quantum Mechanics (Bristol, Eng.: Hilger, 1986).

  8. #596320 авг. 2026 г.1 239 views

    А тем временем, наш канал уходит в долгожданный отпуск. Увидимся в сентябре!…

    А тем временем, наш канал уходит в долгожданный отпуск. Увидимся в сентябре! Писать может иногда что-то буду, но регулярно точно не буду. Оставлю напоследок пост про книгу. Прочитал тут Timeline Майкла Крайтона (Michael Crichton).

  9. #596220 авг. 2026 г.1 710 views

    Мы с @alexanderchemeris завели новый канал https://t.me/gonzoworlds. Там мы…

    Мы с @alexanderchemeris завели новый канал https://t.me/gonzoworlds. Там мы будем делать разборы статей по World Models и всему вокруг, что пересекается с нашими интересами: JEPA, латенты, representation learning, robotics, embodiment, real-time control и control theory и…

  10. #595619 авг. 2026 г.811 views

    Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See…

    Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See the Basis, but Adam Does Devender Singh Paper: https://arxiv.org/abs/2608.05136 Code: https://github.com/idevender/loss-basis-adam Review:…

  11. #595018 авг. 2026 г.1 499 views

    Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много…

    Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с циклами и пропусками (например тут и тут).

  12. #594217 авг. 2026 г.943 views

    Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…

    Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный энкодер-декодер (T5Gemma, https://t.me/gonzoML/4421), то теперь вот диффузионно-блочную модельку, которая поочерёдно диффузией…

  13. #593516 авг. 2026 г.1 698 views

    Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…

    Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку. Полезно? Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja Paper: https://arxiv.org/abs/2608.07222…

  14. #593115 авг. 2026 г.839 views

    Прикольная работа про экономию памяти для работы с длинными…

    Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика стабилизируется уже к середине сети, слои позже работают больше на предсказание следующего токена (или какая там у вас…

  15. #592614 авг. 2026 г.1 707 views

    По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with…

    По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox Статья: https://arxiv.org/abs/2608.10860 Проект: https://flex-pi.github.io/ # TL;DR ЧТО сделали: Представили…

  16. #592213 авг. 2026 г.2 542 views

    Тема про термодинамические вычисления развивается (мы писали про неё тут, тут и…

    Тема про термодинамические вычисления развивается (мы писали про неё тут, тут и тут). Extropic анонсировал новую Z1 в дополнение к X0/XTR-0. А их конкуренты из Normal Computing предложили свежий CN101 и имплементацию термодинамических алгоритмов на обычном КМОП железе.

  17. #591711 авг. 2026 г.2 655 views

    Любопытный результат про работу LLM с табличными данными, где LLM довольно…

    Любопытный результат про работу LLM с табличными данными, где LLM довольно хреновы и сильно уступают классике ML. Предположительные источники проблем в виде перекрытия классов, проблем парсинга CSV, токенизации чисел и размера батча оказались неважными.

  18. #591610 авг. 2026 г.2 320 views

    Вот это вот особенно прекрасно: Even Claude was surprised by its own finding—it…

    Вот это вот особенно прекрасно: Even Claude was surprised by its own finding—it was skeptical at first, possibly because it has learned from its training about the difficulty of open problems in mathematics and about the limitations of AI models.

  19. #591510 авг. 2026 г.2 492 views

    К гипотезе Римана подступаются...…

    К гипотезе Римана подступаются... https://www.anthropic.com/research/riemann-zeta

  20. #590910 авг. 2026 г.904 views

    "Автономные ИИ-черви: от зашитых эксплоитов к динамической адаптации AI Agents…

    "Автономные ИИ-черви: от зашитых эксплоитов к динамической адаптации AI Agents Enable Adaptive Computer Worms Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot Paper: https://arxiv.org/abs/2606.03811 Review:…

  21. #59059 авг. 2026 г.1 112 views

    Про важность геометрии для хирургов. When Geometry Aligns: Dihedral…

    Про важность геометрии для хирургов. When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures Mojtaba Faramarzi, Alex Lamb, Irina Rish Paper: https://arxiv.org/abs/2607.03580 Code: N/A Model: N/A TL;DR ЧТО сделали: Авторы разработали…

  22. #58998 авг. 2026 г.1 646 views

    Всем абдукции в этом чате. Без абстинентного синдрома. Wiring the ‘Why’: A…

    Всем абдукции в этом чате. Без абстинентного синдрома. Wiring the ‘Why’: A Unified Taxonomy and Survey of Abductive Reasoning in LLMs Moein Salimi, Shaygan Adim, Danial Parnian, Nima Alighardashi, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban Paper:…

  23. #58988 авг. 2026 г.1 950 views

    Вдогонку вам Джеффа Дина из той же серии…

    Вдогонку вам Джеффа Дина из той же серии https://youtu.be/CxXgV54KzpQ?si=-ZwmwfVH8795wC80

  24. #58978 авг. 2026 г.1 112 views

    Интересное интервью. Но местами чувствуется какой-то фундаментальный разрыв со…

    Интересное интервью. Но местами чувствуется какой-то фундаментальный разрыв со средним пользователем. Не в том, что средний пользователь от этого далёк, он бы может и рад, но истории про то как агент работает непрерывно две недели или запускает тысячи других агентов -- я не знаю…

  25. #58957 авг. 2026 г.2 011 views

    Не уверен всё же, что буду продолжать с форматом статей в телеге. Toward…

    Не уверен всё же, что буду продолжать с форматом статей в телеге. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora…

  26. #58947 авг. 2026 г.1 873 views

    Это называется появление культуры.

    Это называется появление культуры.

  27. #58937 авг. 2026 г.2 266 views

    Надо смотреть. https://youtu.be/87DyyMV0kCY

    Надо смотреть. https://youtu.be/87DyyMV0kCY

  28. #58926 авг. 2026 г.114 views

    Статья раздевает рекурсивный трансформер до голых костей, обнаруживает, что он…

    Статья раздевает рекурсивный трансформер до голых костей, обнаруживает, что он больше не может ходить, и торжественно заявляет об открытии универсальной необходимости костылей.

  29. #58916 авг. 2026 г.84 views

    "Прожарка 🔥 Экспериментирую с форматами обзоров. Добавил в свою систему режим…

    "Прожарка 🔥 Экспериментирую с форматами обзоров. Добавил в свою систему режим Paper Roast — рецензия, которую никто не решается написать. Всё то, что обычно бормочут у постера, но не пишут в ревью: бейзлайн, выбранный потому что остальные не завелись; абляция, отсутствующая…

  30. #58905 авг. 2026 г.2 205 views

    Потрясающая полярность мнений на Маска. Закинем же ещё и свежего Харари! Тоже…

    Потрясающая полярность мнений на Маска. Закинем же ещё и свежего Харари! Тоже интересные вещи говорит. ИИ захватит нас через бюрократию. А вовсе не через терминаторов или секс-роботов. Впрочем... https://www.youtube.com/watch?v=Ved5fuexA

  31. #58845 авг. 2026 г.1 946 views

    "Интересный заход на конвертацию видео-диффузионки в универсальную модель.…

    "Интересный заход на конвертацию видео-диффузионки в универсальную модель. Пробую в первый раз формат статьи, где картинки внутри и есть поддержка формул. Редактор, конечно, пока пипец какой глючный...

  32. #58835 авг. 2026 г.741 views

    И Хассабис переходит на новую роль и сдаёт управление GDM.…

    И Хассабис переходит на новую роль и сдаёт управление GDM. https://blog.google/company-news/inside-google/message-ceo/next-chapter-ai-momentum/ Что-то происходит.

  33. #58825 авг. 2026 г.876 views

    Вау! Это то, чего я не ожидал. Джефф Дин ушёл из Гугла в свой стартап Discovery…

    Вау! Это то, чего я не ожидал. Джефф Дин ушёл из Гугла в свой стартап Discovery Loop https://www.wired.com/story/jeff-dean-google-discovery-loop-startup/

  34. #58815 авг. 2026 г.1 659 views

    Свежее интервью с Маском. Любопытно.…

    Свежее интервью с Маском. Любопытно. https://youtu.be/XuoqKYxDHVc?si=TwxHL2JakvqJ-IP

  35. #58754 авг. 2026 г.826 views

    Любопытная работа про основанные на биологии нейромодели от корифеев области.…

    Любопытная работа про основанные на биологии нейромодели от корифеев области. Когда ж в редактор телеги доедет поддержка латеха? Издевательство какое-то. Кому хочется видеть формулы, читайте по ссылке на сабстеке, там норм.

  36. #58673 авг. 2026 г.1 116 views

    Снова про эмерджентность (https://t.me/gonzoML/1031). В работе прослеживают её…

    Снова про эмерджентность (https://t.me/gonzoML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных задач.

  37. #58582 авг. 2026 г.919 views

    Прикольный метод улучшения генеративных моделей, которым надо работать с…

    Прикольный метод улучшения генеративных моделей, которым надо работать с много-модальными распределениями (где много мод, а не модальностей). По дефолту MSE лосс сглаживает всё в одну моду, что на практике бесполезно и даже вредно, приводит к разблюренной серости (старые добрые…

  38. #58521 авг. 2026 г.778 views

    Интересное про жизнь и статфизику. Пользуясь случаем, хочу передать привет…

    Интересное про жизнь и статфизику. Пользуясь случаем, хочу передать привет Андрею :) Directing Open-Ended Evolution in Artificial Life via Multi-Scale Path Divergence Mikhail Akhtyrchenko, Mikhail I.

  39. #58511 авг. 2026 г.2 240 views

    Прорывы в математике продолжаются. За $2000 в цене токенов (правда от другой…

    Прорывы в математике продолжаются. За $2000 в цене токенов (правда от другой модели, Sol) внутренняя версия OpenAI'ной следующей модели Astra нашла новые или улучшенные результаты по 10 математическим проблемам.

  40. #584331 июл. 2026 г.718 views

    Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the…

    Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson Paper: https://arxiv.org/abs/2607.11883 Code:…

  41. #583830 июл. 2026 г.1 438 views

    Интересные находки про обучение малых LLM из предобученных больших. Small LLMs:…

    Интересные находки про обучение малых LLM из предобученных больших. Small LLMs: Pruning vs. Training from Scratch Yufeng Xu, Taiming Lu, Kunjun Li, Jiachen Zhu, Mingjie Sun, Zhuang Liu Paper: https://arxiv.org/abs/2606.14150v3 Review:…

  42. #583229 июл. 2026 г.274 views

    Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские…

    Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские подходы к self-supervised. Почти по всем упомянутым работам (DINO, Barlow Twins, VICReg, SIGReg, LeJEPA, LpJEPA) нашлась ссылка на разбор в нашем канале. Теперь VISReg.

  43. #582328 июл. 2026 г.792 views

    "Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков…

    "Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой ""бесплатный"" аналог…

  44. #582228 июл. 2026 г.1 296 views

    Если что, прямо сейчас Фристон выступает…

    Если что, прямо сейчас Фристон выступает https://www.youtube.com/watch?v=qRA1DoMCCSc

  45. #581728 июл. 2026 г.1 522 views

    Ещё про Continual learning, теперь про важность стратегического забывания. To…

    Ещё про Continual learning, теперь про важность стратегического забывания. To Retain or to Adapt? Generalizing Continual Learning Giulia Lanzillotta, Mandana Samiei, Doina Precup, Razvan Pascanu, Claire Vernade Paper: https://arxiv.org/abs/2607.05609 Review:…

  46. #581627 июл. 2026 г.1 258 views

    Just in case, сегодня начинается конфа AGI-26, есть стримы онлайн.…

    Just in case, сегодня начинается конфа AGI-26, есть стримы онлайн. https://agi-conference.org/schedule

  47. #581227 июл. 2026 г.1 588 views

    50 оттенков continual learning'а. When Does Continual Learning Require Learning…

    50 оттенков continual learning'а. When Does Continual Learning Require Learning Anne Harrington, Nayan Saxena, Michael Murphy, Anastasia Borovykh, Zeyu Yun, Sridhar Kamath, Ara Eindra Kyi, Trevor Darrell, Jitendra Malik, Yutong Bai Paper: https://arxiv.org/abs/2607.07847 Code:…

  48. #580526 июл. 2026 г.554 views

    Прунинг через функциональный анализ. Выглядит красиво. Hilbert Operator for…

    Прунинг через функциональный анализ. Выглядит красиво. Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks Hossein Mobahi, Peter L.

  49. #579825 июл. 2026 г.836 views

    "Ну и чего-нибудь более классического для тех, кому про жызнь менее интересно.…

    "Ну и чего-нибудь более классического для тех, кому про жызнь менее интересно. Новости зацикленных трансформеров, модель примерно продакшн уровня.

  50. #579325 июл. 2026 г.1 178 views

    Субботнее про жызнь. Мы тут в чате недавно касались определения жизни, да и…

    Субботнее про жызнь. Мы тут в чате недавно касались определения жизни, да и вообще эти темы часто всплывают (1, 2, 3, 4, 5, 6, 7), если смотреть чуть дальше классического мл-я. На прошлой Superintelligence Conference тоже в эту сторону обсуждение уходило.

  51. #579124 июл. 2026 г.813 views

    Хм... https://www.anthropic.com/news/claude-opus-5

    Хм... https://www.anthropic.com/news/claude-opus-5

  52. #578524 июл. 2026 г.831 views

    Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его…

    Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его новомодными улучшениями (мы разбирали ModernBERT, https://t.me/gonzoML/3090) в том, что с ростом модели репрезентации финальных слоёв контринтуитивно деградируют и бесполезны для множества реальных…

  53. #577823 июл. 2026 г.607 views

    Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и…

    Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и выдаёт текстовый ответ, близкие (но несовпадающие) решения часто неразличимы. Авторы предлагают перейти на этап раньше и сравнивать распределение логитов, через матожидание.

  54. #577222 июл. 2026 г.885 views

    Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов.…

    Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов. Построено на идее, что агент — это параметры модели + харнесс, At = (θt, Σt). Нет чувства, что это что-то новое.

  55. #576721 июл. 2026 г.885 views

    Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge…

    Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge устройств. Не всё так просто, рекурсия особо чувствительна к накоплению ошибок квантования. What Survives When You Compress a Recursive Reasoner for the Edge? Pearse Jim, Steven Kolawole, Opegbemi M.

  56. #576120 июл. 2026 г.1 570 views

    Улучшенный зацикленный трансформер с латентным ризонингом, который теперь…

    Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с обычным текстовым CoT. И при этом быстрее в несколько раз.

  57. #576019 июл. 2026 г.1 135 views

    Just in case, я неожиданно стал соорганизатором конференции Superintelligence…

    Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете Экзетера, в UK.

  58. #575519 июл. 2026 г.1 381 views

    Большие модели — это, конечно, классно, но это удел избранных. Нам, простым…

    Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на длинных горизонтах.

  59. #575218 июл. 2026 г.930 views

    "В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей…

    "В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.

  60. #574717 июл. 2026 г.1 284 views

    Развитие темы про добавление памяти в различные архитектуры. В работе решают…

    Развитие темы про добавление памяти в различные архитектуры. В работе решают проблему ограниченного размера рекуррентного состояния в SSM-подобных моделях (здесь Gated DeltaNet) через увеличение этой памяти на несколько порядков одновременно с реализацией разреженных чтения и…