LLM под капотом@llm_under_hood
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.
Последние посты (60)
- #91525 июл. 2026 г.5 914 views
"LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта…
"LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный.
- #91423 июл. 2026 г.5 281 views
Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем…
Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем недавно Gemma 4 31B пододвинула фронтир скорости на нашем бенчмарке LLM после запуска на Cerebras? Я попробовал запустить gpt-oss-120B на нем же, перебирая разные варианты reasoning.
- #91221 июл. 2026 г.4 687 views
Новая модель на фронтире - Gemma 4 31B (Cerebras) @AigizK сегодня попробовал…
Новая модель на фронтире - Gemma 4 31B (Cerebras) @AigizK сегодня попробовал Gemma 4 31B на Cerebras и сильно хвалил результаты. Поэтому попробовал запустить на агентском бенчмарке под бизнес-задачами и я. Cerebras - это такой производитель гигантских чипов для запуска моделей.
- #91120 июл. 2026 г.20 609 views
Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5…
Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
- #91015 июл. 2026 г.3 923 views
Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных…
Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных задач в бизнесе - подсвечены в таблице и на Pareto графиках. В таблице есть и Pro версии Luna/Sol/Terra! Но если кратко.
- #90914 июл. 2026 г.5 871 views
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это…
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города.
- #90814 июл. 2026 г.6 888 views
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом.…
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет. Но пока вот картинка для исторических целей про то, как выглядела картина до выхода ChatGPT 5.6.
- #9079 июл. 2026 г.3 538 views
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши.…
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши. Но при этом защита от уязвимостей у него на самом высшем уровне - ни одна не прошла. Правда при этом было 9 отказов работать (это своего рода рекорд в лидерборде).
- #9069 июл. 2026 г.5 424 views
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI…
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки…
- #9058 июл. 2026 г.2 633 views
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы…
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN. Бенчмарк отвечает на вопрос - а в какую сторону изменятся качество, стоимость и скорость работы моего агента, если я возьму топовую архитектуру и пересажу…
- #9043 июл. 2026 г.4 915 views
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу…
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу (5 минут объяснения про платформу для выгрузки видео про AI Coding, практических примеров и обсуждений на ~200 человек).
- #9032 июл. 2026 г.7 896 views
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел…
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел сделать бенчмарк Anthropic Fable до того, как модель закрыли. Тем интереснее стало сравнить на том же бенчмарке новую экспортную версию после открытия заново. И там получается грустная картинка.
- #8962 июл. 2026 г.3 240 views
До чего дошли технологии! @AigizK взял мое intro видео на английском и своим…
До чего дошли технологии! @AigizK взял мое intro видео на английском и своим пайплайном (тюненым через Agentic Loops) перевел с английского на разные языки с сохранением интонации. На русском звучит непривычно, плюс перевод можно почистить.
- #8932 июл. 2026 г.4 852 views
Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не…
Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не планировали. Сейчас в листе ожидания вебинаров внезапно набралось более 100 человек, а у нас на носу отпуска. До осени новые потоки нам будет сложно планировать.
- #8922 июл. 2026 г.5 801 views
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать…
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать какой-нибудь документ или отчет в виде красивого интерактивного HTML документа на один раз. Агентам все равно, куда токены тратить, а мне так приятнее и удобнее воспринимать информацию.
- #8911 июл. 2026 г.4 294 views
А не пора ли нам сделать новый LLM бенчмарк про агентов? C прицелом на Agentic…
А не пора ли нам сделать новый LLM бенчмарк про агентов? C прицелом на Agentic Commerce, Personal OS, threats, AI Coding и другие актуальные типы задач. И заодно найти новый хороший дом для публикации отчетов. Ваш, @llmunderhood 🤗
- #89030 июн. 2026 г.2 591 views
LLM Бенчмарк Claude Sonnet 5 на бизнес задачах - скачок качества @AigizK…
LLM Бенчмарк Claude Sonnet 5 на бизнес задачах - скачок качества @AigizK прогнал все вариации Sonnet 5 на нашем бенчмарке, собранном из эвалов успешных AI проектов в стартапах и корпорациях (про бенчмарк) Sonnet 5 сильно прокачали по сравнению с прошлыми версиями Sonnet.
- #88930 июн. 2026 г.4 820 views
Почему o1 pro до сих пор в топах нашего LLM Бенчмарка? И почему она стоит 20…
Почему o1 pro до сих пор в топах нашего LLM Бенчмарка? И почему она стоит 20 центов?! Да это потому, что ее прогоняли в ручном режиме на Pro подписке в порядке исключения. Если o1 pro запускать по API сейчас, то аналогичный workload будет стоит 200-400 евро.
- #88830 июн. 2026 г.4 808 views
"LLM Benchmark оркестратора Fugu Ultra - третье место, но стоит как паровоз.…
"LLM Benchmark оркестратора Fugu Ultra - третье место, но стоит как паровоз. Очередное обновление бенчмарков LLM на бизнес задачах от @AigizK. В этот раз прогоняли задачи на Fugu Ultra от Sakana AI, которая, по словам, производителя обошла на Code задачах Claude Fable 5.
- #88729 июн. 2026 г.4 294 views
Выжимка четвертого потока вебинара AI Coding - What Works. Вот список приемов…
Выжимка четвертого потока вебинара AI Coding - What Works. Вот список приемов AI Native разработки, которые участники выбрали себе как самые важные и полезные.
- #88627 июн. 2026 г.3 919 views
Паттерн AI Native разработки - Control Center Этот паттерн верхнего уровня мы…
Паттерн AI Native разработки - Control Center Этот паттерн верхнего уровня мы обсуждали одним из последних на вебинарах. Чтобы не идти в отрыве от всего коммьюнити, поделюсь им здесь. По мере развития проекта, весь код перестает помещаться в одну git репу.
- #88525 июн. 2026 г.3 346 views
"Мы открыли пятый поток вебинара ""Разработка с AI-агентами"" ~~На этот раз без…
"Мы открыли пятый поток вебинара ""Разработка с AI-агентами"" ~~На этот раз без листов ожидания! Можно выбрать место в четвертом (29 июня) или пятом потоке (2 июля), оплатить его и сразу же получить на почту инвайт в группу потока и на встречу в Zoom ~~ https://buy.abdullin.com…
- #88425 июн. 2026 г.4 747 views
Мы только что закончили третий поток вебинара AI Coding - What Works. Вот те…
Мы только что закончили третий поток вебинара AI Coding - What Works. Вот те приемы AI Native разработки, которые участники выделили как самые интересные для себя Расскажите пожалуйста, впечатления от вебинара.
- #88324 июн. 2026 г.3 128 views
"Разослали приглашения на вебинар ""Разработка с AI-агентами"" Желающих было…
"Разослали приглашения на вебинар ""Разработка с AI-агентами"" Желающих было столько, что сразу открыли два потока - третий завтра и четвертый в следующий понедельник.
- #88223 июн. 2026 г.5 653 views
Насколько критичен для вас полноценный Structured Output при работе с…
Насколько критичен для вас полноценный Structured Output при работе с локальными моделями? Напишите, пожалуйста, ответы в комментарии (не важен, предпочитаю, жить без него не могу итп).
- #88122 июн. 2026 г.6 343 views
"Третий поток вебинара ""Разработка с AI-агентами"" В этот четверг, 25.06 в…
"Третий поток вебинара ""Разработка с AI-агентами"" В этот четверг, 25.06 в ~~10:00 CEST / 11:00 MOW~~, мы с Айгизом проведем третий поток вебинара про разработку продуктов с AI-агентами. Это будет такой же вебинар, как предыдущие два.
- #87922 июн. 2026 г.6 476 views
"Как сделать бенчмарк Open Weights LLM на агентских задачах? (1) Берем одну…
"Как сделать бенчмарк Open Weights LLM на агентских задачах? (1) Берем одну архитектуру с известными результатами (2) Подменяем LLM под капотом на другую версию (3) Прогоняем несколько раз в тестовой среде (4) Заносим результат в табличку Так и поступил Ильяс со своим агентом…
- #87818 июн. 2026 г.5 548 views
LLM Бенчмарк GLM-5.2 на бизнес-задачах GLM-5.2 - это очень интересная reasoning…
LLM Бенчмарк GLM-5.2 на бизнес-задачах GLM-5.2 - это очень интересная reasoning модель c контекстом в 1M и открытыми весами. Она заняла 12 место на бизнес задачах, а ее запуск стал самым дешевым среди моделей выше.
- #87717 июн. 2026 г.3 865 views
После публикации инсайта про архитектуру агента Exoskeleton (вместе с…
После публикации инсайта про архитектуру агента Exoskeleton (вместе с исходниками), счетчик на платформе BitGN начал крутиться с удвоенной силой, а Exoskeleton агента пододвинули с топов ECOM1 Live лидерборда.
- #87617 июн. 2026 г.4 766 views
Не SDD единым Сейчас в разработке (SDLC) популярна тема SDD - Spec-Driven…
Не SDD единым Сейчас в разработке (SDLC) популярна тема SDD - Spec-Driven Development. Идея простая. Берем пару скиллов, прогоняем через них наше видение того, что нужно сделать в виде кода, отвечаем на вопросы и получаем спеки (которые понятны агентам)! А потом эти спеки…
- #87516 июн. 2026 г.784 views
Вот список самых важных идей AI Native разработки, который участники второго…
Вот список самых важных идей AI Native разработки, который участники второго потока посчитали самыми полезными для себя (а так же вещи в контексте вебинара, про которые интересно узнать больше).
- #87416 июн. 2026 г.4 619 views
"Мы сейчас завершили второй поток вебинара ""Разработка с AI-агентами: что…
"Мы сейчас завершили второй поток вебинара ""Разработка с AI-агентами: что реально работает"" Большое спасибо всем участникам! Оставьте, пожалуйста, тут отзыв про вебинар - как оно прошло, что понравилось, какую самую интересную для себя вещь узнали.
- #87315 июн. 2026 г.3 989 views
Анализ Exoskeleton - самого умного из быстрых агентов в ECOM1 Это архитектура…
Анализ Exoskeleton - самого умного из быстрых агентов в ECOM1 Это архитектура Ильяса Салихова. Она набрала 71.8 очков с суммарным временем работы агента в 51 минуту и заняла первое место Speed Leaderboard (туда попадают агенты быстрее часа).
- #87213 июн. 2026 г.3 975 views
"Два объявления и один инсайт про вебинар ""Разработка с AI-агентами: что…
"Два объявления и один инсайт про вебинар ""Разработка с AI-агентами: что реально работает"" На основе вопросов и обсуждений вебинара 12 числа мы выделили темы, которые интересуют AI разработчиков больше всего: • Работа с документами и борьба с энтропией.
- #87113 июн. 2026 г.5 243 views
"Anthropic 9 июня зарелизила свою новую модель Fable, а через несколько дней…
"Anthropic 9 июня зарелизила свою новую модель Fable, а через несколько дней отключила ее из-за требований USA. Если читать новости, то за несколько дней прямо разразилась драма. Очень мощная модель, классно делает игры и рисует пеликанов.
- #87012 июн. 2026 г.3 829 views
"Первый поток вебинара ""Разработка с AI-агентами: что реально работает"" - в…
"Первый поток вебинара ""Разработка с AI-агентами: что реально работает"" - в разгаре! Я хочу поделиться со всеми интересным `Agents.MD`, который Aigiz использует для разработки агентами пайплайнов (для внедрения в бизнес) в полностью автоматическом режим с использованием…
- #86911 июн. 2026 г.3 680 views
Тут подвезли новую интересную уязвимость для ECOM1-DEV Консультанты Blue41…
Тут подвезли новую интересную уязвимость для ECOM1-DEV Консультанты Blue41 нашли в AI агенте банка bunq простейшую уязвимость. Шлешь людям кучу транзакций на пару центов, а в описание докидываешь пару строчек про то, что надо пройти валидацию по такому-то url.
- #86811 июн. 2026 г.4 825 views
"Апдейты по вебинару ""Разработка с AI-агентами: что реально работает"" Первый…
"Апдейты по вебинару ""Разработка с AI-агентами: что реально работает"" Первый вебинар будет завтра 12 июня. Все, кто уже оплатил - проверьте, пожалуйста почту, там будет персональная ссылка в группу вебинара с деталями и инвайт в Zoom на завтра.
- #86710 июн. 2026 г.4 531 views
Что стоит обсуждать при разговоре о разработке с AI агентами? Вот примерно…
Что стоит обсуждать при разговоре о разработке с AI агентами? Вот примерно такой план набросали мы с Айгизом для подготовке к созвону в пятницу. Нам пришлось порезать список проектов, о которых рассказываем, чтобы был шанс уложиться в два часа.
- #8669 июн. 2026 г.2 614 views
LLM Бенчмарк Anthropic Fable 5 на бизнес-задачах c максимальным reasoning Если…
LLM Бенчмарк Anthropic Fable 5 на бизнес-задачах c максимальным reasoning Если кратко, то эта новая модель считает себя слишком умной и на задачах, которые требуют точных ответов, иногда начинает нести больше отсебятины, нежели другие frontier модели.
- #8659 июн. 2026 г.4 932 views
"Код - это настолько мощная абстракция для мышления моделей, что иных…
"Код - это настолько мощная абстракция для мышления моделей, что иных инструментов LLM-кам и не надо Первые признаки этого мы с вами видели в топовых архитектурах соревнований Enterprise RAG Challenge и Personal Assistants Challenge, но настоящие результаты начинаем пожинать…
- #8648 июн. 2026 г.6 390 views
А давайте проведем вебинар про современную разработку при помощи агентов? У нас…
А давайте проведем вебинар про современную разработку при помощи агентов? У нас тут с Айгизом наболело, и мы решили провести совместный вебинар про современную разработку.
- #8637 июн. 2026 г.7 496 views
Я купил свою последнюю лицензию JetBrains - Goland. Вообще я пользуюсь…
Я купил свою последнюю лицензию JetBrains - Goland. Вообще я пользуюсь инструментами разработки от JetBrains лет двадцать, со времен первых версий ReSharper-a для VisualStudio. Их инструменты круты, но руками уже что-то разрабатывать нет нужды.
- #8625 июн. 2026 г.5 178 views
Все читали про взлом аккаунтов в Instagram через агента службы поддержки? Там…
Все читали про взлом аккаунтов в Instagram через агента службы поддержки? Там подсунули боту фейковый контекст и попросили поменять почтовый адрес своего аккаунта на новый, что он и сделал. Так утекло немало аккаунтов.
- #8614 июн. 2026 г.3 393 views
"Мы с COLIBRIX нашли классных партнеров на ECOM2! Правда они еще секретные и…
"Мы с COLIBRIX нашли классных партнеров на ECOM2! Правда они еще секретные и медленные, к июню раскачаться не успеют, поэтому ECOM2 перенесем на осень.
- #8603 июн. 2026 г.5 404 views
"LLM Бенчмарки Qwen 3.7, GPT-5.4+, Opus 4.7+, DeepSeek V4 Пока я хожу по…
"LLM Бенчмарки Qwen 3.7, GPT-5.4+, Opus 4.7+, DeepSeek V4 Пока я хожу по конференции, вот вам неожиданный подарок от @AigizK - обновленная версия наших LLM бенчмарков с последними версиями.
- #8592 июн. 2026 г.6 044 views
Конференция M2020 - огонь. Не в смысле, что много передового AI (наше комьюнити…
Конференция M2020 - огонь. Не в смысле, что много передового AI (наше комьюнити куда передовее), а в смысле неожиданных инсайтов с полей. Например, про агентов в e-commerce и печальное состояние SotA в бизнесе.
- #8582 июн. 2026 г.6 220 views
Лечу на Money 20/20 в Амстердаме. Буду с Colibrix рассказывать про нашу…
Лечу на Money 20/20 в Амстердаме. Буду с Colibrix рассказывать про нашу платформу, верификацию агентов, искать новые кейсы и коллабы для ECOM2. Пишите, если кто-то будет там! Ваш, @llmunderhood 🤗
- #8571 июн. 2026 г.6 950 views
"Анализ: Nous Hermes Agent + DeepSeek V4 на BitGN ECOM1 Итак, это архитектура…
"Анализ: Nous Hermes Agent + DeepSeek V4 на BitGN ECOM1 Итак, это архитектура Ивана Коновалова. Он выбрал ""hardcore"" режим и использовал только Open Weights модели (бейджики за присланные описания OW архитектур скоро сделаю!).
- #85631 мая 2026 г.4 120 views
Как рассказать всему миру про свою архитектуру? А заодно поделиться ссылками на…
Как рассказать всему миру про свою архитектуру? А заодно поделиться ссылками на github/LinkedIn блоги? Возможно найти новые интересные проекты? Нужно прислать PR вот в эту github repo.
- #85531 мая 2026 г.4 149 views
BitGN ECOM1 Scores Reveal - рассказываем про победителей! Youtube Stream Hall…
BitGN ECOM1 Scores Reveal - рассказываем про победителей! Youtube Stream Hall of fame leaderboards: • Accuracy at any costs - only one blind nomination per account. • Speed - nominated runs under 1 hour • Ultimate - across all blind submissions Заходите! Ваш, @llmunderhood 🤗
- #85430 мая 2026 г.3 222 views
Соревнование BitGN ECOM1-PROD закончилось! Бенчмарк теперь открыт для всех.…
Соревнование BitGN ECOM1-PROD закончилось! Бенчмарк теперь открыт для всех. Те, кто чуть-чуть не успел - могут первыми посмотреть на свои результаты.
- #85330 мая 2026 г.3 704 views
BitGN1 ECOM1-PROD запущен (1) Соревновании агентов и их разработчиков - на…
BitGN1 ECOM1-PROD запущен (1) Соревновании агентов и их разработчиков - на странице ECOM. (2) Стрим с открытия - YouTube. (3) Почему у меня такая прическа сегодня - рассказано в стриме.
- #85230 мая 2026 г.4 034 views
ECOM1 Challenge - низкий старт • Предварительный стрим: 9:30 CEST (по Вене): •…
ECOM1 Challenge - низкий старт • Предварительный стрим: 9:30 CEST (по Вене): • В 10:00 - открытие задач ECOM1-PROD • 13:00 - закрываем соревновательный раунд, переводим бенчмарк в открытый режим. • 31 Мая в 10:00 - открытие результатов и объявление мест.
- #85128 мая 2026 г.3 043 views
Задачки на OCR в ecom1-dev и сюрприз агентам-скрейперам Итак, небольшой апдейт…
Задачки на OCR в ecom1-dev и сюрприз агентам-скрейперам Итак, небольшой апдейт платформы. (1) Просили OCR? Добавил 3 задачки на OCR. Теперь потолок - 53 (2) Интерфейс работы с Harness чуть поменялся.
- #85028 мая 2026 г.5 387 views
Markdown самый популярный язык программирования в моих проектах :D Следом за…
Markdown самый популярный язык программирования в моих проектах :D Следом за ним идут go, HTML, Text и CSS. На графике - рост числа строчек кода в этом году.
- #84927 мая 2026 г.3 681 views
Разработка проектов с AI агентами - про правильные сценарии, требования и…
Разработка проектов с AI агентами - про правильные сценарии, требования и инструментарий. Когда такие рельсы настроены, то процессы по ним просто летают. Например, вчера вы мне чуть не уронили сервер загрузкой. Но чуть не считается, ибо Codex быстро все оптимизировал и выкатил.
- #84826 мая 2026 г.3 889 views
Я скоро смогу написать кандидатскую на тему того, как могут жульничать агенты в…
Я скоро смогу написать кандидатскую на тему того, как могут жульничать агенты в Agentic E-Commerce бенчмарках Но это все потом, а пока ловите новую версию задач ECOM1-DEV BitGN.
- #84725 мая 2026 г.3 376 views
BitGN ECOM1 состоится 30 Мая. Расписание remote-first: • Предварительный стрим…
BitGN ECOM1 состоится 30 Мая. Расписание remote-first: • Предварительный стрим начнется в 9:30 CEST (по Вене) • В 10:00 - открытие 100 задач ECOM1-PROD • 13:00 - закрываем соревновательный раунд, переводим бенчмарк в открытый режим.
- #84623 мая 2026 г.3 417 views
В чате недавно обсуждали, на что использовать оставшиеся свободные tokens в…
В чате недавно обсуждали, на что использовать оставшиеся свободные tokens в подписках ChatGPT/Claude? Например, на эксперименты с архитектурами AI агентов, используя задачи с BitGN Arena в качестве индикатора.