Независимые исследователи нашли способ полностью восстанавливать скрытый ризонинг фронтирных моделей https://arxiv.org/abs/2608.09867 В статье они показывают, что зашифрованный ризонинг любой модели OpenAI, Anthropic и Google можно декодировать буквально 1:1, при этом без джейлбрейка модели. Авторы нашли архитектурную дыру: зашифрованные блоки ризонинга полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и моделями внутри экосистемы одного провайдера. Например, если взять зашифрованный ризонинг Opus и подсунуть его менее умному Haiku, то тот может прочитать эти «мысли» и вывести их дословно в открытом виде. Вот так просто 🤷‍♂️ Последствий пропасть. Во-первых, с помощью такой уязвимости можно обходить анти-дистилляционные меры. Во-вторых, в открытых репозиториях куча таких скрытых блоков ризонинга, в которых могут оказаться чувствительные данные (в статье в выборке из 315 320 блоков обнаружили 367 артефактов PII и 182 учетки). В-третьих, это упрощает джейлбрейки и промпт-инъекции. Вот такой анекдот. Исследователи уже передали свои изыскания в лабы и говорят, что работа по ним ведется.