GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах. Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля. Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями. А вот GPT-6 фронтир пододвинули сильно. GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк. Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством! GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно) Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает отказы). Но при этом два прокола безопасности через эту модель протащить удалось. В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них. Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги. Ваш, @llm_under_hood 🤗
GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6…
Из этого канала
- #945"Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого…
"Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky, как на YouTube выложили видео с моим выступлением с этой…
- #944LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в…
LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону.
- #943Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш,…
Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш, @llmunderhood 🤗