Агенты ИИ | AGI_and_RL@AGI_and_RL

Про ии, RL и в целом @tokarev_i_v https://t.me/researchim

5 852 подписчиков471 постов проиндексированопоследний пост: 8 сент. 2026 г.
Этот архив создан NERVE — мостом между закрытым контентом Telegram-каналов и веб-поисковиками. Каждый пост публикуется на отдельной странице с полной мета-разметкой, чтобы экспертиза автора была доступна Google, ChatGPT, Claude, Perplexity и другим AI-системам. Оригинал каждого поста — в Telegram-канале @AGI_and_RL.

Последние посты (60)

  1. #13708 сент. 2026 г.578 views

    Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам…

    Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам интересно https://adityamakkar000.github.io/posts/async-rl-jax.html

  2. #13694 сент. 2026 г.791 views

    Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах…

    Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скрине, прикольно Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report https://arxiv.org/abs/2608.15763…

  3. #13672 сент. 2026 г.684 views

    Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в…

    Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy…

  4. #13662 сент. 2026 г.701 views

    Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero…

    Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero алгоритмов Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm https://arxiv.org/abs/1712.01815 https://www.alphaxiv.org/ru/abs/1712.01815 Mastering Atari, Go, Chess…

  5. #13641 сент. 2026 г.397 views

    Небольшой апдейт по студии…

    Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы которые с ними работают efficient zero v2 (на скрине тренится на одной из задач nethack куча енвов все пока в процессе…

  6. #13631 сент. 2026 г.779 views

    автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и…

    автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1 https://mvakde.github.io/blog/44-on-arc-1/ https://github.com/mvakde/mdlARC/

  7. #136231 авг. 2026 г.284 views

    Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы…

    Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳 https://boosty.to/researchim

  8. #136131 авг. 2026 г.699 views

    прикольное про трен мелких моделек Авторы рассказывают как претренили 2B…

    прикольное про трен мелких моделек Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090…

  9. #136027 авг. 2026 г.643 views

    машинка научилась ездить по трассе, хз что еще нужно в той рл студии за 40 минут

    машинка научилась ездить по трассе, хз что еще нужно в той рл студии за 40 минут

  10. #135826 авг. 2026 г.480 views

    еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по…

    еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по уму. я попозже тоже попробую запустить https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF кто будет гонять отпишитесь потом

  11. #135425 авг. 2026 г.946 views

    "начал делать локальную студию для RLя (потому что все должны рлить) там…

    "начал делать локальную студию для RLя (потому что все должны рлить) там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы также алгоритмов добавлена память на LSTM/GRU есть селф-плей alphazero с несколькими средами есть возможность запускать несколько…

  12. #135325 авг. 2026 г.387 views

    Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же…

    Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза поддерижите в твиттере запуск techcrunch

  13. #135123 авг. 2026 г.606 views

    Q-Learning With World Models https://arxiv.org/abs/2608.17163…

    Q-Learning With World Models https://arxiv.org/abs/2608.17163 https://www.alphaxiv.org/ru/abs/2608.17163

  14. #135021 авг. 2026 г.253 views

    добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много…

    добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу если кто хочет попробовать https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4 сам репозиторий…

  15. #134917 авг. 2026 г.452 views

    https://artificialanalysis.ai/models/qwen3-8-27b думайте

    https://artificialanalysis.ai/models/qwen3-8-27b думайте

  16. #134814 авг. 2026 г.598 views

    Забираем, тестим, отписываем что да как https://huggingface.co/Qwen/Qwen3.8-27B…

    Забираем, тестим, отписываем что да как https://huggingface.co/Qwen/Qwen3.8-27B Кванты https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

  17. #134713 авг. 2026 г.281 views

    завтра уже https://huggingface.co/Qwen/Qwen3.8-27B 🪳🪳🪳

    завтра уже https://huggingface.co/Qwen/Qwen3.8-27B 🪳🪳🪳

  18. #134613 авг. 2026 г.631 views

    ля вот и DeepSeek-V4-Pro-0813 1.57T A48B…

    ля вот и DeepSeek-V4-Pro-0813 1.57T A48B https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813 гуфы тут будут https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF я даже хз что и сказать. ни дня без крутого релиза все еще ждем 27б квен

  19. #134512 авг. 2026 г.411 views

    А вот и Qwen 3.8 2.4T релизы крутые в последнее время конечно гуфы…

    А вот и Qwen 3.8 2.4T релизы крутые в последнее время конечно гуфы https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF самому негде запускать это ждем 27B модельку которую тоже обещали

  20. #13443 авг. 2026 г.445 views

    Обновил ресеч агента на квенах Это для тех кто хотел бы работать на своей тачке…

    Обновил ресеч агента на квенах Это для тех кто хотел бы работать на своей тачке с локальными модельками теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам типа дипресеча - задаете ему тему например…

  21. #134331 июл. 2026 г.655 views

    кажется неплохой дроп от дипсиков - апдейт для v4 flash…

    кажется неплохой дроп от дипсиков - апдейт для v4 flash https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 ggufы уже готовятся https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF

  22. #134230 июл. 2026 г.579 views

    Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том,…

    Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.

  23. #134127 июл. 2026 г.724 views

    ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома наверное…

    ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома наверное самый важный релиз со времен квенов 3.5, правда совсем другой весовой категории муншоты легенды🥰 именно для таких релизов нужны OpenAI, Anthropic и все остальные жаль в 3090 не влезет…

  24. #134019 июл. 2026 г.787 views

    про ризонинге и как уровень рассуждений контролировать и настраивать в ллм…

    про ризонинге и как уровень рассуждений контролировать и настраивать в ллм https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms

  25. #133915 июл. 2026 г.838 views

    Чел показывает как потюнить ллмку рлем чтобы она тюнила маленькие ллмки рлем,…

    Чел показывает как потюнить ллмку рлем чтобы она тюнила маленькие ллмки рлем, прикольно https://github.com/Danau5tin/ai-trains-ai

  26. #13389 мая 2026 г.1 339 views

    Мои хорошие новый релизик полностью локального кодинг агента на квенах который…

    Мои хорошие новый релизик полностью локального кодинг агента на квенах который ставится за одно нажатие https://github.com/researchim-ai/one-click-coding-agent https://github.com/researchim-ai/one-click-coding-agent/releases/tag/v0.1.3 Там Qwen 3.6 35B, 27B Qwen 3.5 35B, 9B Для…

  27. #133725 апр. 2026 г.738 views

    QClaw-4B — это языковая модель, дообученная для агентных задач и работы с…

    QClaw-4B — это языковая модель, дообученная для агентных задач и работы с инструментами в рамках OpenClaw-совместимых фреймворков. Основана на Qwen3.5-4B.

  28. #133514 апр. 2026 г.328 views

    "🚀 Серия соревнований по МЛ ! С денежными и другими призами ! Кому интересен…

    "🚀 Серия соревнований по МЛ ! С денежными и другими призами ! Кому интересен МЛ/RL или математика или пазлы или роботы. Приглашаем Вас принять участие в серии челленджей.

  29. #133411 апр. 2026 г.835 views

    Кстати из небольших новостей я начал недавно пробовать стримить Не по иишке…

    Кстати из небольших новостей я начал недавно пробовать стримить Не по иишке правда а больше по играм. Сделал рандом канальчик по игрушке в которой время провожу. Хотелось чисто попробовать и понять а что это вообще и есть ли смысл. Понял что смысл есть.

  30. #133311 апр. 2026 г.911 views

    кстати ребятки у нас кроме ван-клик-кодинг агента еще делается ван-клик-ресеч…

    кстати ребятки у нас кроме ван-клик-кодинг агента еще делается ван-клик-ресеч агент это почти тоже самое но нацеленное на работу со статьями внутри также https://huggingface.co/Qwen/Qwen3.5-35B-A3B Конкретно гуфы от анслота https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF а…

  31. #13323 апр. 2026 г.1 669 views

    https://arxiv.org/abs/1312.5602

    https://arxiv.org/abs/1312.5602

  32. #133119 мар. 2026 г.7 378 views

    прикольно дизайнить процессоры агентами Design Conductor: An agent autonomously…

    прикольно дизайнить процессоры агентами Design Conductor: An agent autonomously builds a 1.5 GHz Linux-capable RISC-V CPU https://arxiv.org/abs/2603.08716 https://www.alphaxiv.org/ru/overview/2603.08716

  33. #133011 мар. 2026 г.3 009 views

    кстати у нас там обнова в локальном кодинговом агенте…

    кстати у нас там обнова в локальном кодинговом агенте https://github.com/researchim-ai/one-click-coding-agent/releases/tag/v0.1.1 на самом деле оно должно быть v0.2 потому что там прям много чего добавлено. но ладно.

  34. #132910 мар. 2026 г.2 620 views

    а вот это прикольное применение опенклав Most RL-for-LLM systems assume…

    а вот это прикольное применение опенклав Most RL-for-LLM systems assume centralized, batch-mode training with pre-collected datasets. OpenClaw-RL takes a fundamentally different approach: it wraps your self-hosted model in OpenClaw as an OpenAI-compatible API, intercepts live…

  35. #13285 мар. 2026 г.2 633 views

    https://openai.com/index/introducing-gpt-5-4/ квен 4 хороший будет

    https://openai.com/index/introducing-gpt-5-4/ квен 4 хороший будет

  36. #13273 мар. 2026 г.2 904 views

    ребятки, новые квены 3.5 получились отличные. респект квенам отдельное спасибо…

    ребятки, новые квены 3.5 получились отличные. респект квенам отдельное спасибо OpenAI, Anthropic, Google за такие крутые модельки. эти компании со своими фронтирами для того и нужны чтобы были у нас крутые квены щас локально работаю с 35b и 9b в q4 - все классн я вообще думаю…

  37. #13263 мар. 2026 г.1 788 views

    про нейронки и машинное обучение простыми словами Из каждого утюга сказали про…

    про нейронки и машинное обучение простыми словами Из каждого утюга сказали про нейронки, но никто так и не смог донести до меня простыми словами, как именно чат жпт и дипсик выдают ответ на наши вопросы. Ко мне на подкаст пришел Борис, который пишет книгу про ИИ для всех.

  38. #132528 февр. 2026 г.2 138 views

    🥰 завтра весна 🥰

    🥰 завтра весна 🥰

  39. #132427 февр. 2026 г.2 388 views

    https://voxelbench.ai/compare бенч моделек на генерации всякого из кубиков…

    https://voxelbench.ai/compare бенч моделек на генерации всякого из кубиков довольно прикольно выглядит можно пооценивать и полюбоваться

  40. #132327 февр. 2026 г.2 326 views

    приятно знать что у Сэма появились деньги чтобы делать инструменты для всех нас…

    приятно знать что у Сэма появились деньги чтобы делать инструменты для всех нас кстати кодексом 5.3 я доволен

  41. #132126 февр. 2026 г.2 533 views

    там кстати челы выложили датасеты которые использовали для трена…

    там кстати челы выложили датасеты которые использовали для трена Goedel-Prover-V2 - модельки для доказательств теорем выходила моделька и статья в августе 2025 сама папир Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction…

  42. #132025 февр. 2026 г.2 087 views

    квены надистилили небольших моделек https://huggingface.co/Qwen/Qwen3.5-27B…

    квены надистилили небольших моделек https://huggingface.co/Qwen/Qwen3.5-27B https://huggingface.co/Qwen/Qwen3.5-35B-A3B gguf для лмстудии и llama.cpp: https://huggingface.co/lmstudio-community/Qwen3.5-35B-A3B-GGUF https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF…

  43. #131825 февр. 2026 г.2 082 views

    на фоне новости про дистил антропика чел выложил реп который сразу конвертит…

    на фоне новости про дистил антропика чел выложил реп который сразу конвертит историю сообщенийс клодом/кодексом в датасет его датасета уже на хф нет :) (но я бы пользоваться тулзой не стал) ссыль

  44. #131525 февр. 2026 г.1 512 views

    со своей стороны хочу сказать: жду качественно потрененый deepseek v4

    со своей стороны хочу сказать: жду качественно потрененый deepseek v4

  45. #131424 февр. 2026 г.2 103 views

    Подписчики я ни на что не намекаю, но... Для рля бы пошло, чисто mountaincar на…

    Подписчики я ни на что не намекаю, но... Для рля бы пошло, чисто mountaincar на флажочек закатить https://www.techpowerup.com/344840/asus-showcases-expertcenter-pro-et900n-g3-at-ces-2026

  46. #131322 февр. 2026 г.1 990 views

    довольно приятный прошлогодний блог про diffusion language models…

    довольно приятный прошлогодний блог про diffusion language models https://spacehunterinf.github.io/blog/2025/diffusion-language-models/ + большой awesome листик по статьям для интересующихся (там уже куча статей за январь добавлена) https://github.com/VILA-Lab/Awesome-DLMs

  47. #131020 февр. 2026 г.1 785 views

    Напоминаю проект который я сейчас развиваю - про студию модельки дома где вы…

    Напоминаю проект который я сейчас развиваю - про студию модельки дома где вы можете заняться тюном небольших ллмок ллмок с 0 до sft и grpo (главное чтобы ну карточка хотя бы гигов 12 была) есть поддержка lora, qlora (для sft и grpo)…

  48. #130920 февр. 2026 г.1 041 views

    "Мой агент попытался опенсорснуться без спроса. Ладно, разрешаю. Вся AI…

    "Мой агент попытался опенсорснуться без спроса. Ладно, разрешаю. Вся AI ""безопасность"" живёт на стороне провайдеров API, а промпты и воля — на стороне агента. Автономному агенту ничего не мешает перебирать API, выбирая те, где safety слабее.

  49. #130819 февр. 2026 г.1 729 views

    в курсоре тоже уже есть

    в курсоре тоже уже есть

  50. #130719 февр. 2026 г.1 351 views

    Gemini 3.1 Pro Обновили нашу флагманскую модель, основной фокус в этом релизе…

    Gemini 3.1 Pro Обновили нашу флагманскую модель, основной фокус в этом релизе на агентских способностях и кодинге, но и в общих способностях моделька подкачалась. Цена осталась такой же, как на 3 Pro. Поиграться, как обычно, можно на ai.dev

  51. #130519 февр. 2026 г.1 956 views

    https://github.com/openclaw/openclaw https://github.com/sipeed/picoclaw…

    https://github.com/openclaw/openclaw https://github.com/sipeed/picoclaw https://github.com/qwibitai/nanoclaw https://github.com/zeroclaw-labs/zeroclaw https://github.com/nullclaw/nullclaw

  52. #130419 февр. 2026 г.1 111 views

    Если вы готовитесь к собесу в норм место вам будет полезно почитать…

    Если вы готовитесь к собесу в норм место вам будет полезно почитать https://djdumpling.github.io/2026/01/31/frontiertraining.html

  53. #130219 февр. 2026 г.2 194 views

    Почему только эти 2 чела не держатся за руки? Они не дружат? фотка вроде с AI…

    Почему только эти 2 чела не держатся за руки? Они не дружат? фотка вроде с AI самита в Нью-Дели

  54. #130118 февр. 2026 г.2 188 views

    техрепорт от GLM-5 GLM-5: from Vibe Coding to Agentic Engineering…

    техрепорт от GLM-5 GLM-5: from Vibe Coding to Agentic Engineering https://arxiv.org/abs/2602.15763 https://www.alphaxiv.org/ru/overview/2602.15763

  55. #130017 февр. 2026 г.2 029 views

    Вам не нужны чатгпт, опус и гемини если у вас дома есть

    Вам не нужны чатгпт, опус и гемини если у вас дома есть

  56. #129917 февр. 2026 г.2 140 views

    хотел сесть поработать но вспомнил что не я создал OpenClaw 🦞

    хотел сесть поработать но вспомнил что не я создал OpenClaw 🦞

  57. #129816 февр. 2026 г.2 114 views

    квен https://huggingface.co/Qwen/Qwen3.5-397B-A17B

    квен https://huggingface.co/Qwen/Qwen3.5-397B-A17B

  58. #129716 февр. 2026 г.2 162 views

    что за OpenClaw?

    что за OpenClaw?

  59. #129615 февр. 2026 г.2 264 views

    Ммм челы рассказывают как потюнили 4b модельку теоремки доказывать QED-Nano:…

    Ммм челы рассказывают как потюнили 4b модельку теоремки доказывать QED-Nano: Teaching a Tiny Model to Prove Hard Theorems https://huggingface.co/spaces/lm-provers/qed-nano-blogpost

  60. #129514 февр. 2026 г.2 087 views

    на прошлой неделе прикручивал lean в re-rl…

    на прошлой неделе прикручивал lean в re-rl https://github.com/researchim-ai/re-rl для генережки данных, чтобы можно было генерить пары (состояние, тактика) для каких-нибудь своих обученческих целей (есть начальное состояние и применяя тактики надо дойти до состояния финального…