Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши. Но при этом защита от уязвимостей у него на самом высшем уровне - ни одна не прошла. Правда при этом было 9 отказов работать (это своего рода рекорд в лидерборде). При малейшей опасности - Fable уходит в отказ. Если вернут старую версию модели, то, возможно, она потягается и за первые места. А пока - почетное 11 место. Но не фронтир. Ваш, @llm_under_hood 🤗
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши.…
Из этого канала
- #908Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом.…
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет.
- #909100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это…
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это примерно по 50 tool calls на решение одной задачи.
- #910Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных…
Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных задач в бизнесе - подсвечены в таблице и на Pareto графиках.
- #906Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI…
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке.
- #905Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы…
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN.