GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах. Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля. Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями. А вот GPT-6 фронтир пододвинули сильно. GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк. Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством! GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно) Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает отказы). Но при этом два прокола безопасности через эту модель протащить удалось. В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них. Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги. Ваш, @llm_under_hood 🤗