Но, продолжая тему, не все потеряно для людей Прочитал результаты огроменной работы, которую проделали Berkley и еще три десятка организаций. Они собрали новый бенч, назвали его Agent's Last Exam, в который включили долгосрочные и максимально практические в экономике задачи. Тут тебе и перенести композицию на нотные листы для каждого участника оркеста, и разработка игр, и настройка станков в химическом производстве, медицинские описания, 3D анимация и даже скоринг выступления акробатов на чемпионате. Модели уровня Opus 4.7 и GPT 5.5 набрали около 1%, поэтому прямо сегодня все еще можно сказать, что люди незаменимы в экономике, особенно за пределами проверяемых областей типа IT, юристов, финансистов. Будет очень интересно смотреть как этот бенч постепенно заполняется :)