Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки возникновения ошибок. А самые уязвимые места самых сильных архитектур (когда они путаются, пропускают нарушения границ, забывают про политики итп) собрали в бенчмарк. И получается, что модели GPT-5.6 с дефолтным ризонингом настолько хороши, что двигают Парето-фронтир как по комбинации качество-скорость, так и по комбинации качество-цена. Смотрите сами на графики справа. Это делает их дефолтным выбором в новых проектах. Отчет на сайте выложим попозже, а пока картинка с хорошим качеством - в комментариях. Ваш, @llm_under_hood 🤗
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI…
Из этого канала
- #907Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши.…
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши. Но при этом защита от уязвимостей у него на самом высшем уровне - ни одна не…
- #908Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом.…
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет.
- #909100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это…
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это примерно по 50 tool calls на решение одной задачи.
- #905Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы…
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN.
- #904Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу…
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу (5 минут объяснения про платформу для выгрузки видео про AI Coding,…