"Аномалии Opus 5 и оптимальный reasoning effort Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне. И там видно, что в Opus 5 medium effort часто оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК). Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем. Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво. И любопытный факт - новенький FrontierBench v0.1 (уже третий ""фронтир"" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high. @ai_driven"
"Аномалии Opus 5 и оптимальный reasoning effort Если вы используете агентов так…
Источник
https://t.me/ai_driven/259Канал AI-Driven Development. Родион Мостовой · опубликовано 24 июл. 2026 г.
Из этого канала
- #257Opus 5 Похоже, все-таки придется снова брать Claude 200$... Для гурманов: Opus…
Opus 5 Похоже, все-таки придется снова брать Claude 200$... Для гурманов: Opus 5 System Card. (193 страницы paper!)
- #255Все лимиты и ресеты для Codex 200$ закончились. Рекорд - расход 2 недельных…
Все лимиты и ресеты для Codex 200$ закончились. Рекорд - расход 2 недельных подписки за сутки (работа над RepoContextBench v2 ведется полным ходом).
- #254Вырубал комментарии временно, защищаясь от наплыва ботов. Сейчас вернул -…
Вырубал комментарии временно, защищаясь от наплыва ботов. Сейчас вернул - пишите!