ARC AGI 3 — Skill Issue Скиллы оказались куда лучше системных промптов. В них можно зашить tool use, решая проблему повторяемости и консистентности ответов. Это дико полезная фича, когда нужна строгая форма вывода, скажем, для заполнения таблиц. Парни с помощью кастомный скилла для Claude Opus 5 зарешали ARC AGI 3 на 100%. Скилл буквально заставляет модель лишний раз подумать перед предсказанием на бенчмарке. В итоге, модель улетела с 30% до чистых 100%, что уже лучше кожаных, при этом используя ~вдвое меньшее количество шагов. Никакого читерства в виде правил датасета внутри скилла нет. В тул-колл тупо зашит жесткий логический блок. Если модель не рассуждает перед ответом и не пытается предугадать следующий шаг, заполняя соответствующие ячейки, предсказание отправляется на доработку. Ну, а в остальном базовые инструкции. С одной стороны RL вроде как убил классический промпт-инжиниринг, а теперь на его месте уже плотно закрепился скилл-инжиниринг. Также это показывает насколько беплолезным бенчем оказался ARC AGI на нашей траектории к AGI (не в обиду, Франсуа). ARC Skill @ai_newz