Агенты ИИ | AGI_and_RL@AGI_and_RL
Про ии, RL и в целом @tokarev_i_v https://t.me/researchim
Последние посты (60)
- #13708 сент. 2026 г.578 views
Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам…
Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам интересно https://adityamakkar000.github.io/posts/async-rl-jax.html
- #13694 сент. 2026 г.791 views
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах…
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скрине, прикольно Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report https://arxiv.org/abs/2608.15763…
- #13672 сент. 2026 г.684 views
Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в…
Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy…
- #13662 сент. 2026 г.701 views
Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero…
Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero алгоритмов Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm https://arxiv.org/abs/1712.01815 https://www.alphaxiv.org/ru/abs/1712.01815 Mastering Atari, Go, Chess…
- #13641 сент. 2026 г.397 views
Небольшой апдейт по студии…
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы которые с ними работают efficient zero v2 (на скрине тренится на одной из задач nethack куча енвов все пока в процессе…
- #13631 сент. 2026 г.779 views
автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и…
автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1 https://mvakde.github.io/blog/44-on-arc-1/ https://github.com/mvakde/mdlARC/
- #136231 авг. 2026 г.284 views
Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы…
Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳 https://boosty.to/researchim
- #136131 авг. 2026 г.699 views
прикольное про трен мелких моделек Авторы рассказывают как претренили 2B…
прикольное про трен мелких моделек Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090…
- #136027 авг. 2026 г.643 views
машинка научилась ездить по трассе, хз что еще нужно в той рл студии за 40 минут
машинка научилась ездить по трассе, хз что еще нужно в той рл студии за 40 минут
- #135826 авг. 2026 г.480 views
еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по…
еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по уму. я попозже тоже попробую запустить https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF кто будет гонять отпишитесь потом
- #135425 авг. 2026 г.946 views
"начал делать локальную студию для RLя (потому что все должны рлить) там…
"начал делать локальную студию для RLя (потому что все должны рлить) там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы также алгоритмов добавлена память на LSTM/GRU есть селф-плей alphazero с несколькими средами есть возможность запускать несколько…
- #135325 авг. 2026 г.387 views
Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же…
Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза поддерижите в твиттере запуск techcrunch
- #135123 авг. 2026 г.606 views
Q-Learning With World Models https://arxiv.org/abs/2608.17163…
Q-Learning With World Models https://arxiv.org/abs/2608.17163 https://www.alphaxiv.org/ru/abs/2608.17163
- #135021 авг. 2026 г.253 views
добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много…
добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу если кто хочет попробовать https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4 сам репозиторий…
- #134917 авг. 2026 г.452 views
https://artificialanalysis.ai/models/qwen3-8-27b думайте
https://artificialanalysis.ai/models/qwen3-8-27b думайте
- #134814 авг. 2026 г.598 views
Забираем, тестим, отписываем что да как https://huggingface.co/Qwen/Qwen3.8-27B…
Забираем, тестим, отписываем что да как https://huggingface.co/Qwen/Qwen3.8-27B Кванты https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
- #134713 авг. 2026 г.281 views
завтра уже https://huggingface.co/Qwen/Qwen3.8-27B 🪳🪳🪳
завтра уже https://huggingface.co/Qwen/Qwen3.8-27B 🪳🪳🪳
- #134613 авг. 2026 г.631 views
ля вот и DeepSeek-V4-Pro-0813 1.57T A48B…
ля вот и DeepSeek-V4-Pro-0813 1.57T A48B https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813 гуфы тут будут https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF я даже хз что и сказать. ни дня без крутого релиза все еще ждем 27б квен
- #134512 авг. 2026 г.411 views
А вот и Qwen 3.8 2.4T релизы крутые в последнее время конечно гуфы…
А вот и Qwen 3.8 2.4T релизы крутые в последнее время конечно гуфы https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF самому негде запускать это ждем 27B модельку которую тоже обещали
- #13443 авг. 2026 г.445 views
Обновил ресеч агента на квенах Это для тех кто хотел бы работать на своей тачке…
Обновил ресеч агента на квенах Это для тех кто хотел бы работать на своей тачке с локальными модельками теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам типа дипресеча - задаете ему тему например…
- #134331 июл. 2026 г.655 views
кажется неплохой дроп от дипсиков - апдейт для v4 flash…
кажется неплохой дроп от дипсиков - апдейт для v4 flash https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 ggufы уже готовятся https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
- #134230 июл. 2026 г.579 views
Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том,…
Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.
- #134127 июл. 2026 г.724 views
ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома наверное…
ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома наверное самый важный релиз со времен квенов 3.5, правда совсем другой весовой категории муншоты легенды🥰 именно для таких релизов нужны OpenAI, Anthropic и все остальные жаль в 3090 не влезет…
- #134019 июл. 2026 г.787 views
про ризонинге и как уровень рассуждений контролировать и настраивать в ллм…
про ризонинге и как уровень рассуждений контролировать и настраивать в ллм https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms
- #133915 июл. 2026 г.838 views
Чел показывает как потюнить ллмку рлем чтобы она тюнила маленькие ллмки рлем,…
Чел показывает как потюнить ллмку рлем чтобы она тюнила маленькие ллмки рлем, прикольно https://github.com/Danau5tin/ai-trains-ai
- #13389 мая 2026 г.1 339 views
Мои хорошие новый релизик полностью локального кодинг агента на квенах который…
Мои хорошие новый релизик полностью локального кодинг агента на квенах который ставится за одно нажатие https://github.com/researchim-ai/one-click-coding-agent https://github.com/researchim-ai/one-click-coding-agent/releases/tag/v0.1.3 Там Qwen 3.6 35B, 27B Qwen 3.5 35B, 9B Для…
- #133725 апр. 2026 г.738 views
QClaw-4B — это языковая модель, дообученная для агентных задач и работы с…
QClaw-4B — это языковая модель, дообученная для агентных задач и работы с инструментами в рамках OpenClaw-совместимых фреймворков. Основана на Qwen3.5-4B.
- #133514 апр. 2026 г.328 views
"🚀 Серия соревнований по МЛ ! С денежными и другими призами ! Кому интересен…
"🚀 Серия соревнований по МЛ ! С денежными и другими призами ! Кому интересен МЛ/RL или математика или пазлы или роботы. Приглашаем Вас принять участие в серии челленджей.
- #133411 апр. 2026 г.835 views
Кстати из небольших новостей я начал недавно пробовать стримить Не по иишке…
Кстати из небольших новостей я начал недавно пробовать стримить Не по иишке правда а больше по играм. Сделал рандом канальчик по игрушке в которой время провожу. Хотелось чисто попробовать и понять а что это вообще и есть ли смысл. Понял что смысл есть.
- #133311 апр. 2026 г.911 views
кстати ребятки у нас кроме ван-клик-кодинг агента еще делается ван-клик-ресеч…
кстати ребятки у нас кроме ван-клик-кодинг агента еще делается ван-клик-ресеч агент это почти тоже самое но нацеленное на работу со статьями внутри также https://huggingface.co/Qwen/Qwen3.5-35B-A3B Конкретно гуфы от анслота https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF а…
- #13323 апр. 2026 г.1 669 views
https://arxiv.org/abs/1312.5602
https://arxiv.org/abs/1312.5602
- #133119 мар. 2026 г.7 378 views
прикольно дизайнить процессоры агентами Design Conductor: An agent autonomously…
прикольно дизайнить процессоры агентами Design Conductor: An agent autonomously builds a 1.5 GHz Linux-capable RISC-V CPU https://arxiv.org/abs/2603.08716 https://www.alphaxiv.org/ru/overview/2603.08716
- #133011 мар. 2026 г.3 009 views
кстати у нас там обнова в локальном кодинговом агенте…
кстати у нас там обнова в локальном кодинговом агенте https://github.com/researchim-ai/one-click-coding-agent/releases/tag/v0.1.1 на самом деле оно должно быть v0.2 потому что там прям много чего добавлено. но ладно.
- #132910 мар. 2026 г.2 620 views
а вот это прикольное применение опенклав Most RL-for-LLM systems assume…
а вот это прикольное применение опенклав Most RL-for-LLM systems assume centralized, batch-mode training with pre-collected datasets. OpenClaw-RL takes a fundamentally different approach: it wraps your self-hosted model in OpenClaw as an OpenAI-compatible API, intercepts live…
- #13285 мар. 2026 г.2 633 views
https://openai.com/index/introducing-gpt-5-4/ квен 4 хороший будет
https://openai.com/index/introducing-gpt-5-4/ квен 4 хороший будет
- #13273 мар. 2026 г.2 904 views
ребятки, новые квены 3.5 получились отличные. респект квенам отдельное спасибо…
ребятки, новые квены 3.5 получились отличные. респект квенам отдельное спасибо OpenAI, Anthropic, Google за такие крутые модельки. эти компании со своими фронтирами для того и нужны чтобы были у нас крутые квены щас локально работаю с 35b и 9b в q4 - все классн я вообще думаю…
- #13263 мар. 2026 г.1 788 views
про нейронки и машинное обучение простыми словами Из каждого утюга сказали про…
про нейронки и машинное обучение простыми словами Из каждого утюга сказали про нейронки, но никто так и не смог донести до меня простыми словами, как именно чат жпт и дипсик выдают ответ на наши вопросы. Ко мне на подкаст пришел Борис, который пишет книгу про ИИ для всех.
- #132528 февр. 2026 г.2 138 views
🥰 завтра весна 🥰
🥰 завтра весна 🥰
- #132427 февр. 2026 г.2 388 views
https://voxelbench.ai/compare бенч моделек на генерации всякого из кубиков…
https://voxelbench.ai/compare бенч моделек на генерации всякого из кубиков довольно прикольно выглядит можно пооценивать и полюбоваться
- #132327 февр. 2026 г.2 326 views
приятно знать что у Сэма появились деньги чтобы делать инструменты для всех нас…
приятно знать что у Сэма появились деньги чтобы делать инструменты для всех нас кстати кодексом 5.3 я доволен
- #132126 февр. 2026 г.2 533 views
там кстати челы выложили датасеты которые использовали для трена…
там кстати челы выложили датасеты которые использовали для трена Goedel-Prover-V2 - модельки для доказательств теорем выходила моделька и статья в августе 2025 сама папир Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction…
- #132025 февр. 2026 г.2 087 views
квены надистилили небольших моделек https://huggingface.co/Qwen/Qwen3.5-27B…
квены надистилили небольших моделек https://huggingface.co/Qwen/Qwen3.5-27B https://huggingface.co/Qwen/Qwen3.5-35B-A3B gguf для лмстудии и llama.cpp: https://huggingface.co/lmstudio-community/Qwen3.5-35B-A3B-GGUF https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF…
- #131825 февр. 2026 г.2 082 views
на фоне новости про дистил антропика чел выложил реп который сразу конвертит…
на фоне новости про дистил антропика чел выложил реп который сразу конвертит историю сообщенийс клодом/кодексом в датасет его датасета уже на хф нет :) (но я бы пользоваться тулзой не стал) ссыль
- #131525 февр. 2026 г.1 512 views
со своей стороны хочу сказать: жду качественно потрененый deepseek v4
со своей стороны хочу сказать: жду качественно потрененый deepseek v4
- #131424 февр. 2026 г.2 103 views
Подписчики я ни на что не намекаю, но... Для рля бы пошло, чисто mountaincar на…
Подписчики я ни на что не намекаю, но... Для рля бы пошло, чисто mountaincar на флажочек закатить https://www.techpowerup.com/344840/asus-showcases-expertcenter-pro-et900n-g3-at-ces-2026
- #131322 февр. 2026 г.1 990 views
довольно приятный прошлогодний блог про diffusion language models…
довольно приятный прошлогодний блог про diffusion language models https://spacehunterinf.github.io/blog/2025/diffusion-language-models/ + большой awesome листик по статьям для интересующихся (там уже куча статей за январь добавлена) https://github.com/VILA-Lab/Awesome-DLMs
- #131020 февр. 2026 г.1 785 views
Напоминаю проект который я сейчас развиваю - про студию модельки дома где вы…
Напоминаю проект который я сейчас развиваю - про студию модельки дома где вы можете заняться тюном небольших ллмок ллмок с 0 до sft и grpo (главное чтобы ну карточка хотя бы гигов 12 была) есть поддержка lora, qlora (для sft и grpo)…
- #130920 февр. 2026 г.1 041 views
"Мой агент попытался опенсорснуться без спроса. Ладно, разрешаю. Вся AI…
"Мой агент попытался опенсорснуться без спроса. Ладно, разрешаю. Вся AI ""безопасность"" живёт на стороне провайдеров API, а промпты и воля — на стороне агента. Автономному агенту ничего не мешает перебирать API, выбирая те, где safety слабее.
- #130819 февр. 2026 г.1 729 views
в курсоре тоже уже есть
в курсоре тоже уже есть
- #130719 февр. 2026 г.1 351 views
Gemini 3.1 Pro Обновили нашу флагманскую модель, основной фокус в этом релизе…
Gemini 3.1 Pro Обновили нашу флагманскую модель, основной фокус в этом релизе на агентских способностях и кодинге, но и в общих способностях моделька подкачалась. Цена осталась такой же, как на 3 Pro. Поиграться, как обычно, можно на ai.dev
- #130519 февр. 2026 г.1 956 views
https://github.com/openclaw/openclaw https://github.com/sipeed/picoclaw…
https://github.com/openclaw/openclaw https://github.com/sipeed/picoclaw https://github.com/qwibitai/nanoclaw https://github.com/zeroclaw-labs/zeroclaw https://github.com/nullclaw/nullclaw
- #130419 февр. 2026 г.1 111 views
Если вы готовитесь к собесу в норм место вам будет полезно почитать…
Если вы готовитесь к собесу в норм место вам будет полезно почитать https://djdumpling.github.io/2026/01/31/frontiertraining.html
- #130219 февр. 2026 г.2 194 views
Почему только эти 2 чела не держатся за руки? Они не дружат? фотка вроде с AI…
Почему только эти 2 чела не держатся за руки? Они не дружат? фотка вроде с AI самита в Нью-Дели
- #130118 февр. 2026 г.2 188 views
техрепорт от GLM-5 GLM-5: from Vibe Coding to Agentic Engineering…
техрепорт от GLM-5 GLM-5: from Vibe Coding to Agentic Engineering https://arxiv.org/abs/2602.15763 https://www.alphaxiv.org/ru/overview/2602.15763
- #130017 февр. 2026 г.2 029 views
Вам не нужны чатгпт, опус и гемини если у вас дома есть
Вам не нужны чатгпт, опус и гемини если у вас дома есть
- #129917 февр. 2026 г.2 140 views
хотел сесть поработать но вспомнил что не я создал OpenClaw 🦞
хотел сесть поработать но вспомнил что не я создал OpenClaw 🦞
- #129816 февр. 2026 г.2 114 views
квен https://huggingface.co/Qwen/Qwen3.5-397B-A17B
квен https://huggingface.co/Qwen/Qwen3.5-397B-A17B
- #129716 февр. 2026 г.2 162 views
что за OpenClaw?
что за OpenClaw?
- #129615 февр. 2026 г.2 264 views
Ммм челы рассказывают как потюнили 4b модельку теоремки доказывать QED-Nano:…
Ммм челы рассказывают как потюнили 4b модельку теоремки доказывать QED-Nano: Teaching a Tiny Model to Prove Hard Theorems https://huggingface.co/spaces/lm-provers/qed-nano-blogpost
- #129514 февр. 2026 г.2 087 views
на прошлой неделе прикручивал lean в re-rl…
на прошлой неделе прикручивал lean в re-rl https://github.com/researchim-ai/re-rl для генережки данных, чтобы можно было генерить пары (состояние, тактика) для каких-нибудь своих обученческих целей (есть начальное состояние и применяя тактики надо дойти до состояния финального…