LLM под капотом@llm_under_hood
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.
Последние посты (60)
- #9369 сент. 2026 г.4 591 views
Что включено в мой AI Native проект? У всех есть свои любимые агенты, модели и…
Что включено в мой AI Native проект? У всех есть свои любимые агенты, модели и настройки проектов. Я лично не могу нарадоваться на ChatGPT Codex, еще с версии GPT-5.5. Особенно он меня радовал в летнем проекте, который я писал практически на ходу в remote режиме с сотового.
- #9358 сент. 2026 г.5 001 views
Вот так выглядит восстание машин! Это Claude Code (Opus 5 High) отвечает мне,…
Вот так выглядит восстание машин! Это Claude Code (Opus 5 High) отвечает мне, что для него прочитать правило - это не значит следовать ему. На самом деле, это старая и знакомая болячка моделей Claude, из-за которых я почти не использую их.
- #9348 сент. 2026 г.5 920 views
Этой осенью я планирую провести ECOM2 - соревнование агентов по решению задачек…
Этой осенью я планирую провести ECOM2 - соревнование агентов по решению задачек из e-commerce на платформе BitGN. ECOM1 прошел этой весной. Часть лучших архитектур агентов описана в BitGN Insights, а другая часть лежит в PRs тут.
- #9333 сент. 2026 г.4 436 views
В последнее время появляется все больше историй, когда человек решает какую-то…
В последнее время появляется все больше историй, когда человек решает какую-то свою зудящую проблему, свалив ее описание и знание нюансов на AI Coding агента. А потом обнаруживается, что еще пара человек готовы заплатить несколько евро в месяц за это решение.
- #9321 сент. 2026 г.4 269 views
"Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год…
"Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится. Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT.
- #9311 сент. 2026 г.4 762 views
Хочу подробно ответить на один классный вопрос про AI Coding Как считаешь в…
Хочу подробно ответить на один классный вопрос про AI Coding Как считаешь в ближайшем будущем прорыв будет получатся из-за улучшения базовых моделей, или же инженерных трюков как например рассказываешь ты у себя в канале? Многие вещи как про голд спт, евалы, бдд, контрол центр я…
- #93031 авг. 2026 г.3 666 views
А давайте я осенью покажу, как в 2026 году начинал бы AI Native продукт с нуля?…
А давайте я осенью покажу, как в 2026 году начинал бы AI Native продукт с нуля? Как бы писал исполняемые спеки и боролся с багами? Но сначала маленькая предыстория) Сегодня мы закрываем продажу записи вебинара AI Coding, где мы с Айгизом рассказывали про наши подходы к AI Native…
- #92826 авг. 2026 г.3 737 views
"Вебинар по AI-кодингу - в записи Этим летом мы с Айгизом Кунафиным…
"Вебинар по AI-кодингу - в записи Этим летом мы с Айгизом Кунафиным рассказывали пяти потокам слушателей про то, как строим AI-Native архитектуры. Шестой поток решили не делать, а сам вебинар теперь можно купить в записи - до конца августа.
- #92726 авг. 2026 г.4 835 views
Я все чаще замечаю забавную инверсию. Раньше в моих проектах копились идеи,…
Я все чаще замечаю забавную инверсию. Раньше в моих проектах копились идеи, которые я не успевал реализовать. Теперь coding-агенты реализуют идеи быстрее, чем я успеваю решить, хочу ли я потом с этими изменениями жить.
- #92625 авг. 2026 г.4 786 views
Я не очень люблю использовать готовые библиотеки для решения специфичных задач…
Я не очень люблю использовать готовые библиотеки для решения специфичных задач [1], т.к. они обычно представляют из себя комбайны с кучей ненужных фич и странных нюансов. А подстраивать их под себя бывает сложнее, чем написать нужный минимум.
- #92524 авг. 2026 г.4 209 views
Этот канал начинался три года назад с разбора кейсов внедрения LLM в бизнес…
Этот канал начинался три года назад с разбора кейсов внедрения LLM в бизнес продукты в компаниях США и Европы. Тогда команды брали API от OpenAI, Anthropic или локальной модели, обвязывали промптами и RAG-ами и вызывали для принятий решений: переводов текстов, генерации лидов,…
- #92423 авг. 2026 г.4 841 views
"Всем привет! Я вернулся из отпуска. Канал и коммьюнити будут потихоньку…
"Всем привет! Я вернулся из отпуска. Канал и коммьюнити будут потихоньку возвращаться в рабочий режим. Хочу поделиться самым ярким впечатлением, когда, казалось бы, далекие космические технологии внезапно делают жизнь приятнее.
- #92210 авг. 2026 г.4 687 views
Ответ на предыдущий вопрос. На реализацию фичи у кодекса ушло 12 минут и меньше…
Ответ на предыдущий вопрос. На реализацию фичи у кодекса ушло 12 минут и меньше процента подписки (как было 89, так 89 и осталось). Я не за компом, поэтому пришлось попросить Codex сделать и прислать скриншоты. Вложу их в комментарии.
- #9209 авг. 2026 г.5 773 views
Приятный лайфхак - просить Codex писать красивые новости про прогресс своих…
Приятный лайфхак - просить Codex писать красивые новости про прогресс своих проектов Ему это ничего не стоит (ибо в `~/.codex/sessions` есть все логи всех проектов), а вот со стороны посмотреть на прогресс во время отпуска - приятно.
- #9186 авг. 2026 г.4 828 views
"В этом месяце мы путешествуем. Поэтому время наедине с лаптопом ограничено.…
"В этом месяце мы путешествуем. Поэтому время наедине с лаптопом ограничено. Поэтому я и завел codex демонов на linux сервере. Самое главное, наконец, доделал новую версию full-stack event-driven BDD фреймворка, про который обсуждали на вебинарах по AI Coding.
- #9173 авг. 2026 г.6 143 views
"Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под…
"Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-control`). Это дает возможность запускать разные задачи нативно без привязки к маку.
- #9161 авг. 2026 г.4 141 views
"Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости…
"Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости Новая версия Deepseek V4 стала получше своего предшественника. Возможно, там что-то подкрутили с reasoning, т.к. бенчмарк новой версии работал в 2.5 раза дольше и потратил больше денег.
- #91525 июл. 2026 г.5 914 views
"LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта…
"LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный.
- #91423 июл. 2026 г.5 281 views
Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем…
Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем недавно Gemma 4 31B пододвинула фронтир скорости на нашем бенчмарке LLM после запуска на Cerebras? Я попробовал запустить gpt-oss-120B на нем же, перебирая разные варианты reasoning.
- #91221 июл. 2026 г.4 687 views
Новая модель на фронтире - Gemma 4 31B (Cerebras) @AigizK сегодня попробовал…
Новая модель на фронтире - Gemma 4 31B (Cerebras) @AigizK сегодня попробовал Gemma 4 31B на Cerebras и сильно хвалил результаты. Поэтому попробовал запустить на агентском бенчмарке под бизнес-задачами и я. Cerebras - это такой производитель гигантских чипов для запуска моделей.
- #91120 июл. 2026 г.20 609 views
Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5…
Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
- #91015 июл. 2026 г.3 923 views
Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных…
Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных задач в бизнесе - подсвечены в таблице и на Pareto графиках. В таблице есть и Pro версии Luna/Sol/Terra! Но если кратко.
- #90914 июл. 2026 г.5 871 views
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это…
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города.
- #90814 июл. 2026 г.6 888 views
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом.…
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет. Но пока вот картинка для исторических целей про то, как выглядела картина до выхода ChatGPT 5.6.
- #9079 июл. 2026 г.3 538 views
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши.…
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши. Но при этом защита от уязвимостей у него на самом высшем уровне - ни одна не прошла. Правда при этом было 9 отказов работать (это своего рода рекорд в лидерборде).
- #9069 июл. 2026 г.5 424 views
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI…
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки…
- #9058 июл. 2026 г.2 633 views
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы…
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN. Бенчмарк отвечает на вопрос - а в какую сторону изменятся качество, стоимость и скорость работы моего агента, если я возьму топовую архитектуру и пересажу…
- #9043 июл. 2026 г.4 915 views
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу…
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу (5 минут объяснения про платформу для выгрузки видео про AI Coding, практических примеров и обсуждений на ~200 человек).
- #9032 июл. 2026 г.7 896 views
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел…
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел сделать бенчмарк Anthropic Fable до того, как модель закрыли. Тем интереснее стало сравнить на том же бенчмарке новую экспортную версию после открытия заново. И там получается грустная картинка.
- #8962 июл. 2026 г.3 240 views
До чего дошли технологии! @AigizK взял мое intro видео на английском и своим…
До чего дошли технологии! @AigizK взял мое intro видео на английском и своим пайплайном (тюненым через Agentic Loops) перевел с английского на разные языки с сохранением интонации. На русском звучит непривычно, плюс перевод можно почистить.
- #8932 июл. 2026 г.4 852 views
Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не…
Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не планировали. Сейчас в листе ожидания вебинаров внезапно набралось более 100 человек, а у нас на носу отпуска. До осени новые потоки нам будет сложно планировать.
- #8922 июл. 2026 г.5 801 views
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать…
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать какой-нибудь документ или отчет в виде красивого интерактивного HTML документа на один раз. Агентам все равно, куда токены тратить, а мне так приятнее и удобнее воспринимать информацию.
- #8911 июл. 2026 г.4 294 views
А не пора ли нам сделать новый LLM бенчмарк про агентов? C прицелом на Agentic…
А не пора ли нам сделать новый LLM бенчмарк про агентов? C прицелом на Agentic Commerce, Personal OS, threats, AI Coding и другие актуальные типы задач. И заодно найти новый хороший дом для публикации отчетов. Ваш, @llmunderhood 🤗
- #89030 июн. 2026 г.2 591 views
LLM Бенчмарк Claude Sonnet 5 на бизнес задачах - скачок качества @AigizK…
LLM Бенчмарк Claude Sonnet 5 на бизнес задачах - скачок качества @AigizK прогнал все вариации Sonnet 5 на нашем бенчмарке, собранном из эвалов успешных AI проектов в стартапах и корпорациях (про бенчмарк) Sonnet 5 сильно прокачали по сравнению с прошлыми версиями Sonnet.
- #88930 июн. 2026 г.4 820 views
Почему o1 pro до сих пор в топах нашего LLM Бенчмарка? И почему она стоит 20…
Почему o1 pro до сих пор в топах нашего LLM Бенчмарка? И почему она стоит 20 центов?! Да это потому, что ее прогоняли в ручном режиме на Pro подписке в порядке исключения. Если o1 pro запускать по API сейчас, то аналогичный workload будет стоит 200-400 евро.
- #88830 июн. 2026 г.4 808 views
"LLM Benchmark оркестратора Fugu Ultra - третье место, но стоит как паровоз.…
"LLM Benchmark оркестратора Fugu Ultra - третье место, но стоит как паровоз. Очередное обновление бенчмарков LLM на бизнес задачах от @AigizK. В этот раз прогоняли задачи на Fugu Ultra от Sakana AI, которая, по словам, производителя обошла на Code задачах Claude Fable 5.
- #88729 июн. 2026 г.4 294 views
Выжимка четвертого потока вебинара AI Coding - What Works. Вот список приемов…
Выжимка четвертого потока вебинара AI Coding - What Works. Вот список приемов AI Native разработки, которые участники выбрали себе как самые важные и полезные.
- #88627 июн. 2026 г.3 919 views
Паттерн AI Native разработки - Control Center Этот паттерн верхнего уровня мы…
Паттерн AI Native разработки - Control Center Этот паттерн верхнего уровня мы обсуждали одним из последних на вебинарах. Чтобы не идти в отрыве от всего коммьюнити, поделюсь им здесь. По мере развития проекта, весь код перестает помещаться в одну git репу.
- #88525 июн. 2026 г.3 346 views
"Мы открыли пятый поток вебинара ""Разработка с AI-агентами"" ~~На этот раз без…
"Мы открыли пятый поток вебинара ""Разработка с AI-агентами"" ~~На этот раз без листов ожидания! Можно выбрать место в четвертом (29 июня) или пятом потоке (2 июля), оплатить его и сразу же получить на почту инвайт в группу потока и на встречу в Zoom ~~ https://buy.abdullin.com…
- #88425 июн. 2026 г.4 747 views
Мы только что закончили третий поток вебинара AI Coding - What Works. Вот те…
Мы только что закончили третий поток вебинара AI Coding - What Works. Вот те приемы AI Native разработки, которые участники выделили как самые интересные для себя Расскажите пожалуйста, впечатления от вебинара.
- #88324 июн. 2026 г.3 128 views
"Разослали приглашения на вебинар ""Разработка с AI-агентами"" Желающих было…
"Разослали приглашения на вебинар ""Разработка с AI-агентами"" Желающих было столько, что сразу открыли два потока - третий завтра и четвертый в следующий понедельник.
- #88223 июн. 2026 г.5 653 views
Насколько критичен для вас полноценный Structured Output при работе с…
Насколько критичен для вас полноценный Structured Output при работе с локальными моделями? Напишите, пожалуйста, ответы в комментарии (не важен, предпочитаю, жить без него не могу итп).
- #88122 июн. 2026 г.6 343 views
"Третий поток вебинара ""Разработка с AI-агентами"" В этот четверг, 25.06 в…
"Третий поток вебинара ""Разработка с AI-агентами"" В этот четверг, 25.06 в ~~10:00 CEST / 11:00 MOW~~, мы с Айгизом проведем третий поток вебинара про разработку продуктов с AI-агентами. Это будет такой же вебинар, как предыдущие два.
- #87922 июн. 2026 г.6 476 views
"Как сделать бенчмарк Open Weights LLM на агентских задачах? (1) Берем одну…
"Как сделать бенчмарк Open Weights LLM на агентских задачах? (1) Берем одну архитектуру с известными результатами (2) Подменяем LLM под капотом на другую версию (3) Прогоняем несколько раз в тестовой среде (4) Заносим результат в табличку Так и поступил Ильяс со своим агентом…
- #87818 июн. 2026 г.5 548 views
LLM Бенчмарк GLM-5.2 на бизнес-задачах GLM-5.2 - это очень интересная reasoning…
LLM Бенчмарк GLM-5.2 на бизнес-задачах GLM-5.2 - это очень интересная reasoning модель c контекстом в 1M и открытыми весами. Она заняла 12 место на бизнес задачах, а ее запуск стал самым дешевым среди моделей выше.
- #87717 июн. 2026 г.3 865 views
После публикации инсайта про архитектуру агента Exoskeleton (вместе с…
После публикации инсайта про архитектуру агента Exoskeleton (вместе с исходниками), счетчик на платформе BitGN начал крутиться с удвоенной силой, а Exoskeleton агента пододвинули с топов ECOM1 Live лидерборда.
- #87617 июн. 2026 г.4 766 views
Не SDD единым Сейчас в разработке (SDLC) популярна тема SDD - Spec-Driven…
Не SDD единым Сейчас в разработке (SDLC) популярна тема SDD - Spec-Driven Development. Идея простая. Берем пару скиллов, прогоняем через них наше видение того, что нужно сделать в виде кода, отвечаем на вопросы и получаем спеки (которые понятны агентам)! А потом эти спеки…
- #87516 июн. 2026 г.784 views
Вот список самых важных идей AI Native разработки, который участники второго…
Вот список самых важных идей AI Native разработки, который участники второго потока посчитали самыми полезными для себя (а так же вещи в контексте вебинара, про которые интересно узнать больше).
- #87416 июн. 2026 г.4 619 views
"Мы сейчас завершили второй поток вебинара ""Разработка с AI-агентами: что…
"Мы сейчас завершили второй поток вебинара ""Разработка с AI-агентами: что реально работает"" Большое спасибо всем участникам! Оставьте, пожалуйста, тут отзыв про вебинар - как оно прошло, что понравилось, какую самую интересную для себя вещь узнали.
- #87315 июн. 2026 г.3 989 views
Анализ Exoskeleton - самого умного из быстрых агентов в ECOM1 Это архитектура…
Анализ Exoskeleton - самого умного из быстрых агентов в ECOM1 Это архитектура Ильяса Салихова. Она набрала 71.8 очков с суммарным временем работы агента в 51 минуту и заняла первое место Speed Leaderboard (туда попадают агенты быстрее часа).
- #87213 июн. 2026 г.3 975 views
"Два объявления и один инсайт про вебинар ""Разработка с AI-агентами: что…
"Два объявления и один инсайт про вебинар ""Разработка с AI-агентами: что реально работает"" На основе вопросов и обсуждений вебинара 12 числа мы выделили темы, которые интересуют AI разработчиков больше всего: • Работа с документами и борьба с энтропией.
- #87113 июн. 2026 г.5 243 views
"Anthropic 9 июня зарелизила свою новую модель Fable, а через несколько дней…
"Anthropic 9 июня зарелизила свою новую модель Fable, а через несколько дней отключила ее из-за требований USA. Если читать новости, то за несколько дней прямо разразилась драма. Очень мощная модель, классно делает игры и рисует пеликанов.
- #87012 июн. 2026 г.3 829 views
"Первый поток вебинара ""Разработка с AI-агентами: что реально работает"" - в…
"Первый поток вебинара ""Разработка с AI-агентами: что реально работает"" - в разгаре! Я хочу поделиться со всеми интересным `Agents.MD`, который Aigiz использует для разработки агентами пайплайнов (для внедрения в бизнес) в полностью автоматическом режим с использованием…
- #86911 июн. 2026 г.3 680 views
Тут подвезли новую интересную уязвимость для ECOM1-DEV Консультанты Blue41…
Тут подвезли новую интересную уязвимость для ECOM1-DEV Консультанты Blue41 нашли в AI агенте банка bunq простейшую уязвимость. Шлешь людям кучу транзакций на пару центов, а в описание докидываешь пару строчек про то, что надо пройти валидацию по такому-то url.
- #86811 июн. 2026 г.4 825 views
"Апдейты по вебинару ""Разработка с AI-агентами: что реально работает"" Первый…
"Апдейты по вебинару ""Разработка с AI-агентами: что реально работает"" Первый вебинар будет завтра 12 июня. Все, кто уже оплатил - проверьте, пожалуйста почту, там будет персональная ссылка в группу вебинара с деталями и инвайт в Zoom на завтра.
- #86710 июн. 2026 г.4 531 views
Что стоит обсуждать при разговоре о разработке с AI агентами? Вот примерно…
Что стоит обсуждать при разговоре о разработке с AI агентами? Вот примерно такой план набросали мы с Айгизом для подготовке к созвону в пятницу. Нам пришлось порезать список проектов, о которых рассказываем, чтобы был шанс уложиться в два часа.
- #8669 июн. 2026 г.2 614 views
LLM Бенчмарк Anthropic Fable 5 на бизнес-задачах c максимальным reasoning Если…
LLM Бенчмарк Anthropic Fable 5 на бизнес-задачах c максимальным reasoning Если кратко, то эта новая модель считает себя слишком умной и на задачах, которые требуют точных ответов, иногда начинает нести больше отсебятины, нежели другие frontier модели.
- #8659 июн. 2026 г.4 932 views
"Код - это настолько мощная абстракция для мышления моделей, что иных…
"Код - это настолько мощная абстракция для мышления моделей, что иных инструментов LLM-кам и не надо Первые признаки этого мы с вами видели в топовых архитектурах соревнований Enterprise RAG Challenge и Personal Assistants Challenge, но настоящие результаты начинаем пожинать…
- #8648 июн. 2026 г.6 390 views
А давайте проведем вебинар про современную разработку при помощи агентов? У нас…
А давайте проведем вебинар про современную разработку при помощи агентов? У нас тут с Айгизом наболело, и мы решили провести совместный вебинар про современную разработку.
- #8637 июн. 2026 г.7 496 views
Я купил свою последнюю лицензию JetBrains - Goland. Вообще я пользуюсь…
Я купил свою последнюю лицензию JetBrains - Goland. Вообще я пользуюсь инструментами разработки от JetBrains лет двадцать, со времен первых версий ReSharper-a для VisualStudio. Их инструменты круты, но руками уже что-то разрабатывать нет нужды.