Тем временем на ARC-AGI-2 ИИ-системе впервые удалось превзойти уровень человека В лаборатории Poetiq придумали, как можно соединять разные LLM так, чтобы в разы бустить их производительность (кому интересно, внизу оставим ссылку на код). И вот 20 ноября они заявили, что их подход – микс Gemini 3 и GPT-5.1 – впервые дал на бенчмарке результат, превосходящий человека. Правда, это только на публичном evaluation-сете. При переносе на semi-private результат, скорее всего, ухудшится. Но учитывая, что по отдельности модели даже близко не дотягивают до 60% (у Gemini 3 45%, у GPT-5 около 20%), все равно новость занятная. Еще пол года назад ARC-AGI-2 казался для ИИ вообще нерешаемым, а самые топовые модели выбивали на нем 1-2%. Блогпост | Код
Тем временем на ARC-AGI-2 ИИ-системе впервые удалось превзойти уровень человека…
Из этого канала
- #8369В честь пятилетия AlphaFold Google впервые выложили в бесплатный доступ фильм…
В честь пятилетия AlphaFold Google впервые выложили в бесплатный доступ фильм про DeepMind Картина называется The Thinking Game, наверняка кто-то из вас ее уже…
- #8370Я на любом рабочем дейлике, когда речь заходит о моих задачах
Я на любом рабочем дейлике, когда речь заходит о моих задачах
- #8371"Статья от команды Qwen взяла награду Best Paper Award на NeurIPS 2025 Работа…
"Статья от команды Qwen взяла награду Best Paper Award на NeurIPS 2025 Работа называется ""Gated Attention for Large Language Models: Non-linearity, Sparsity,…
- #8366Курица не птица, рисерчер с волосами – не авторитет
Курица не птица, рисерчер с волосами – не авторитет
- #8363"Новое исследование от Anthropic: ребята решили посчитать реальный…
"Новое исследование от Anthropic: ребята решили посчитать реальный экономический эффект от Claude Чем работа выделяется, так это тем, что эффект считают уже…