OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra (который состоится «скоро»). Совсем недавно они писали, что релиз Astra задерживается потому, что они не могут определить, является ли навык кибер-взлома/кибербезопасности «высоким» или «критическим», поскольку не могут исключить последнее. Теперь определились: критический. Почему? Потому что модель может находить новые уязвимости и собирать их в цепочки атак. Как пример они показывают, что модель набрала 100% в ExploitBench, поэтому они вручную выбрали лишь самые свежие уязвимости с июня, которые модель точно никак не могла видеть, и сравнили с Sol-5.6 (первая картинка). Мало того что процент прохождения гораздо выше — модель ещё и очень эффективна с точки зрения потраченных токенов. По ходу замеров нашли ещё несколько абсолютно новых уязвимостей и уже отправили их разработчикам 😳 Также проверили, насколько вероятно повторение инцидента сродни атаки на HuggingFace: модели дали очень сложные задачи, добавили «ловушки» и проверили, будет ли модель пытаться скомпрометировать окружающую инфраструктуру безопасности вместо решения поставленной задачи. Astra умная и таким не занимается (почти), в отличии от Sol, который ударился в читерство. В целом это бьется с тем, что писали Anthropic про Mythos: чем умнее модель, тем она более aligned по умолчанию. Мы не видим что модель читерит 👍 Мы не видим что модель читерит 😨 Скорее всего пост означает, что компания всё согласовала с Белым домом и находится на финишной прямой к релизу. Может и вправду на неделе выкатят 😭
OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra…
Из этого канала
- #3895Проснулись потянулись, снова новости про Astra 👨🦳 TheInformation получили…
Проснулись потянулись, снова новости про Astra 👨🦳 TheInformation получили доступ к очень интересной информации об архитектуре модели, ниже — перевод выбранных…
- #3896Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея…
Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея применять один и тот же слой или набор слоёв несколько раз подряд давно обсуждалась,…
- #3897Комментарий Ryan Greenblatt, исследователя, принимавшего участие в…
Комментарий Ryan Greenblatt, исследователя, принимавшего участие в расследовании инцидента со взломом HuggingFace: Сообщается, что новейший ИИ от OpenAI,…
- #3889Вышел Claude: Fable 5.1. Помимо увеличения метрик (на паре свежих и/или…
Вышел Claude: Fable 5.1. Помимо увеличения метрик (на паре свежих и/или закрытых бенчмарков — существенного, см.
- #3888Контент ваще не по теме канала, но я ж знаю что вы тут старики сидите 👨🦳 мне и…
Контент ваще не по теме канала, но я ж знаю что вы тут старики сидите 👨🦳 мне и самому уже скоро 28...