Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел сделать бенчмарк Anthropic Fable до того, как модель закрыли. Тем интереснее стало сравнить на том же бенчмарке новую экспортную версию после открытия заново. И там получается грустная картинка. Новый Anthropic Fable урезали настолько, что модель упала с 12 места на 39ое в нашем бенчмарке. Основная причина - 15 пустых ответов с `stop_reason=“refusal”` там, где раньше были ответы. Просели тщательно подобранные, но совершенно безопасные задачи на code + engineering и интеграцию. В общем, с такими результатами и стоимостью, особого смысла использовать Anthropic Fable в бизнес задачах - нет. GPT-5.5 сильно лучше и куда дешевле. Ваш, @llm_under_hood 🤗
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел…
Из этого канала
- #904Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу…
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу (5 минут объяснения про платформу для выгрузки видео про AI Coding,…
- #905Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы…
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN.
- #906Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI…
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке.
- #896До чего дошли технологии! @AigizK взял мое intro видео на английском и своим…
До чего дошли технологии! @AigizK взял мое intro видео на английском и своим пайплайном (тюненым через Agentic Loops) перевел с английского на разные языки с…
- #893Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не…
Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не планировали.