OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra (который состоится «скоро»). Совсем недавно они писали, что релиз Astra задерживается потому, что они не могут определить, является ли навык кибер-взлома/кибербезопасности «высоким» или «критическим», поскольку не могут исключить последнее. Теперь определились: критический. Почему? Потому что модель может находить новые уязвимости и собирать их в цепочки атак. Как пример они показывают, что модель набрала 100% в ExploitBench, поэтому они вручную выбрали лишь самые свежие уязвимости с июня, которые модель точно никак не могла видеть, и сравнили с Sol-5.6 (первая картинка). Мало того что процент прохождения гораздо выше — модель ещё и очень эффективна с точки зрения потраченных токенов. По ходу замеров нашли ещё несколько абсолютно новых уязвимостей и уже отправили их разработчикам 😳 Также проверили, насколько вероятно повторение инцидента сродни атаки на HuggingFace: модели дали очень сложные задачи, добавили «ловушки» и проверили, будет ли модель пытаться скомпрометировать окружающую инфраструктуру безопасности вместо решения поставленной задачи. Astra умная и таким не занимается (почти), в отличии от Sol, который ударился в читерство. В целом это бьется с тем, что писали Anthropic про Mythos: чем умнее модель, тем она более aligned по умолчанию. Мы не видим что модель читерит 👍 Мы не видим что модель читерит 😨 Скорее всего пост означает, что компания всё согласовала с Белым домом и находится на финишной прямой к релизу. Может и вправду на неделе выкатят 😭