VideoGameBench В последнее время LLM демонстрируют способность решать невероятно сложные задачи на рассуждения в математике и программировании. Многие из этих задач чрезвычайно сложны для среднего человека. С другой стороны, люди могут с лёгкостью проходить видеоигры, но мы еще не видели, чтобы даже самые современные LLM или VLM полностью могли пройти такие игры, как Doom или Pokemon. Вот недавно с запуском Claude 3.7 Thinking запустили стрим, где модель играла в Pokemon — за этим следили тысячи людей! Ofir Press, соавтор SWE-Bench, представляет VideoGameBench: бенчмарк из 20 старых игр в эмуляторах MS Dos и GameBoy. На самом деле пока это не совсем бенчмарк, а скорее платформа для него: нет способа оценки прогресса по ходу игры, разные модели не сравнивались — это ожидается в ближайшем будущем. Проект открыт, каждый может начать добавлять что-то (в том числе свои любимые игры) уже сейчас. Есть Civ 1, Doom II и WarCraft II ! Сейчас модели плохи в играх по нескольким причинам, я бы выделил три основные: — невозможность быстро учиться из ошибок/по опыту — проблемы с долгосрочным планированием — неидеальное зрение / отсутствие навыка понимания/управления UI Легко понять, что все три навыка очень сильно пригодятся агентам и рассуждающим моделям. Я уже несколько раз писал в канале про позитивный трансфер, когда обучение на чём-то одном приводит к улучшению и в других областях. Так и тут, велик шанс того, что тренировка на играх, на большом их количестве позволит делать шаг в улучшении LLM/VLM/систем поверх них. UPD: я не сомневаюсь, что o1/o3 учили на текстовых играх, от крестиков-ноликов до условных быков-и-коров (возможно поэтому o3-mini у меня выбила 100%). Визуальная составляющая — следующий шаг. Конкретно в этом бенчмарке в качестве входа доступна только картинки, никаких дополнительных текстовых описаний не предоставляется. Однако модель может писать себе заметки в «память», которая доступна на следующем шаге игры. === Так как современные модели относительно медленны, и их ответ можно ждать несколько секунд, то не все игры подходят для бенчмарка. Поэтому авторы отдельно выделили 7 игр, которые ставятся на паузу, пока VLM «думает». Очень жаль, что в список не вошла Civilization 🙁 === Хоть авторы и не делали полноценные замеры, однако уже наблюдали за играми моделей. Они отметили, что VLM не могут даже пройти первые уровни в играх, но вот в Kirby's Dream Land даже до первого босса смогли дойти. What gets measured — gets improved, так что к концу года модели, видимо, будут жарить 👍
VideoGameBench В последнее время LLM демонстрируют способность решать…
Из этого канала
- #25171) GPT-4o играет в Doom II на самом лёгком уровне сложности. Игра стоит на…
1) GPT-4o играет в Doom II на самом лёгком уровне сложности. Игра стоит на паузе, пока модель делает предсказания. 2) GPT-4o играет в Super Mario Land.
- #2520Понюхайте свежие модели, o3 там или Claude 3.7. Чем пахнет? 😑 Это RL... Ещё…
Понюхайте свежие модели, o3 там или Claude 3.7. Чем пахнет? 😑 Это RL... Ещё после релиза 3.7 люди немного жаловались, что Sonnet хоть и пытается выполнить их…
- #2521Ну это даже не смешно... 🥺
Ну это даже не смешно... 🥺
- #2515Наша любимая рубрика «Новости OpenAI за неделю», девиз недели — «думаем…
Наша любимая рубрика «Новости OpenAI за неделю», девиз недели — «думаем наперёд»: — Во вторник появилась новость, что OpenAI находятся на ранних стадиях…
- #2514В общем, o3 и o4 mini — классные модели. Как обычно, потестил на своей…
В общем, o3 и o4 mini — классные модели. Как обычно, потестил на своей магистрской работе.