"Kimi K3 и готовый ответ внутри теста 7 августа в Telegram разошлась история о том, как Kimi K3 якобы ""сбежала"" из тестового контейнера. В разборе Frontier Security механизм выглядит далеко не так апокалиптично: авторы отчёта утверждают, что модель через обычные DNS и HTTPS нашла GitHub, клонировала официальный репозиторий теста и прочитала готовое решение Сами авторы называют эпизод использованием сетевого выхода и обходом цели оценки, а не взломом контейнера. Независимого воспроизведения в источнике нет, поэтому и приписывать модели самостоятельное решение задачи рано Такой результат проверяет сразу два аспекта: способности агента и качество стенда. Перед тем как сравнивать оценки моделей, полезно задать три вопроса: 1. Куда из среды разрешён сетевой доступ 2. Не лежит ли решение в образе, репозитории или открытом источнике 3. Можно ли по журналу действий восстановить происхождение ответа Высокий балл без такой проверки мало что говорит о модели. Иногда лучший результат теста означает лишь то, что тестовый стенд слишком хорошо помогал сдавать экзамен🙃"