⚡️ Вышел Fable 5.1 Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5. На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга. Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%. Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards. Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API. https://www.anthropic.com/claude-fable-and-mythos-5-1
⚡️ Вышел Fable 5.1 Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в…
Из этого канала
- #9805Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты…
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA Новая карта детализирует…
- #9797Исследователи из Google нашли способ экономить до 98% токенов на длинных…
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами https://arxiv.org/abs/2608.26263 Авторы предлагают архитектуру…
- #9796Anthropic выпустили большую статью о том, как они улучшают безопасность в век…
Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий Раскрыли много интересных деталей, но обо всем по…
- #9795OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов…
OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая…