«Вторая половина» — мини-эссе Shunyu Yao, исследователя OpenAI, первого автора ReAct и Tree-of-Thoughts, который уже несколько лет занимается AI-агентами. Вкратце: мы находимся в перерыве между таймами в условной игре развития ИИ. Что ознаменовало окончание первой половины? Методы Reinforcement Learning наконец-то обобщаются. После нескольких открытий мы пришли к рабочему рецепту для решения широкого спектра задач с использованием языка и вербализованных рассуждений. Даже год назад, если бы вы сказали большинству AI-исследователей, что один рецепт обучения может справиться с разработкой программного обеспечения, творческим письмом, математикой олимпиадного уровня, манипуляцией мышью и клавиатурой для управления компьютером и ответами на длинные вопросы — они бы посмеялись над вашими галлюцинациями. Каждая из этих задач невероятно сложна, и многие исследователи тратят все своё время, сосредоточившись только на одном узком срезе из этих задач. Вторая половина — которая уже начинается — перенесет фокус с решения проблем на их определение и формализацию. В эту новую эпоху оценка результатов становится важнее обучения. Вместо того чтобы просто спрашивать: «Можем ли мы обучить модель решению задачи X?», мы спрашиваем: «Чему мы должны обучать ИИ и как мы можем измерить реальный прогресс?» Это означает, что нам следует фундаментально переосмыслить методы оценки прогресса. Не просто создание новых и более жестких критериев, но и фундаментальное переосмысление существующих установок и создание новых. Мы должны пытаться изобретать новые оценки за пределами уже хорошо изученных территорий. Раньше как было, вот есть школьные математические задачки. Проходит 2-3 года, модель учится их решать, и мы берём задачи сложнее, с первого тура олимпиады. Потом со второго. Каждый раз мы приподнимаем планку, но не меняем сути тестирования. Как следствие — ИИ уже победил чемпионов мира в шахматы и го, превзошел большинство людей на экзаменах, призванных оценить «реальные навыки» специалистов, достиг уровня золотых медалей на международных олимпиадах. Но ... мир не сильно изменился, по крайней мере, если судить по экономике и ВВП. Yao называет это проблемой полезности и считает ее самой важной. Почти все способы оценки моделей отличаются от того, что мы хотим в реальной жизни, даже в очень базовых вещах: — прогон модели на бенчмарке «должен» быть атоматическим и не включать участие человека. Но ведь большинство задач реального мира требуют взаимодействия и итераций! — прогон модели на бенчмарке «должен» быть независимым между примерами. Если есть 500 задач, то задача 1 не связана с задачей 2, все их можно посчитать в параллель и усреднить результаты. Но в реальном мире зачастую успех — это выполнение нескольких задач подряд. Почти никакие способы оценки сейчас это не учитывают, и предлагают лишь набор разрозненных задачек. === Игроки первой половины решали видеоигры и экзамены, игроки во второй половине будут создавать компании стоимостью в миллиарды или триллионы долларов, и будут оптимизировать модели напрямую на доллары, на экономический эффект, а не удовлетворённость пользователя. OpenAI уже сделали первые шаги к этому — один из последних бенчмарков, SWE-Lancer, оценивает успех модели в долларах («какую долю банка сможет заработать модель, выполняя задачи?»).