В день релиза Claude 3.7 модель в шутку запрягли играть в одну из старых 2D-версий Pokemon, и даже запустили прямую трансляцию, где все желающие могли следить за прогрессом. С недавним выходом Gemini 2.5 Pro произошло примерно то же самое, и модель продвинулась сильно дальше, почти дойдя до конца игры — за меньшее количество времени (первая картинка). Сотрудники (пиарщики) Google конечно используют это как пример превосходства модели, но дело не так просто: обе модели используют разные обвязки, или как сейчас модно говорить _scaffolding_. Помимо картинки с самой игрой в промпт подаётся куча дополнительной информации, да и сам скриншот игры — не просто скриншот. Из коробки без «подпорок» модели работают очень плохо, и разные части обвязки позволяют как бы подпирать слабости моделей костылями. И вот костыли разные, потому и сравнение делать сложно. Примеры частей scaffolding'ов, которые могут отличаться: 1. Промпт, содержащий советы по прохождению игры 2. Какая информация рисуется поверх картинки (об этом ниже) 3. Реализация «памяти», текста, который сохраняется и передаётся дальше по ходу игры 4. Способ отдачи команд эмулятору игры (модель ведь не может в прямом смысле нажимать кнопки) 5. Реализация второй модели-критика, которая позволяет прерывать ходьбу по кругу, если основная модель-игрок зациклилась. Чуть больше про различия можно глянуть здесь. === Автор отсюда пробовал позапускать игры сам, и сразу же выяснил, что модели вообще не понимают, что изображено на скриншотах из игры. Они не видят отдельные элементы, не отличают траву (по которой можно ходить) от непроходимых деревьев итд — и потому плохо справляются с одной из главных механик игры: передвижение/навигация. Как доказательство автор экспериментировал с запросами на конвертацию изображения в ASCII-карту, и модели справлялись очень плохо. Поэтому из памяти эмулятора с запущенной игрой считывается состояние окрестностей и затем наносится сетка с координатами и цветными квадратиками (см. картинки). Метод чем-то напоминает Set-of-Mark Prompting. Цвета квадратиков могут кодировать разную информацию (о чем пишется в промпте, возможно даже КАПСОМ ЧТОБЫ ТУПАЯ МОДЕЛЬ НАКОНЕЦ ПОНЯЛА ЧТО ОТ НЕЁ ХОТЯТ). Например, красные квадратики обозначают точки, куда пойти нельзя, синие — где «игрок» уже недавно был (чтобы не попадать в циклы и не ходить кругами). Автор отдельно подчеркнул навыки OpenAI o3 придерживаться контекста (по сравнению с другими моделями). Правда это минус, ибо одна ошибка, которую занесли в память (например, спутали дверь и стену) — и модель будет упорно долбиться, так как НУ У НЕЁ ЖЕ В ПРОМПТЕ НАПИСАНО. И так будет продолжаться сотни ходов... (автор заплатил за это $100 😁). Claude 3.7 попадает в такие же ситуации, но иногда говорит «Wait! My previous assertions are obvious nonsense». В общем, тяжело моделькам играть в 2D. Ну ничего, сейчас их поучат на сотне-другой игр — и начнётся.