"Anthropic призывают ограничить GLM-5.3 В стартапе протестировали модель на способности в области поиске уязвимостей, и их главный тезис такой: способности к автономной разработке эксплойтов, которые пять месяцев назад были только у Claude Mythos Preview, теперь есть в открытой модели, причем без серьезных ограничений на злоупотребление. ""Так делать нельзя, айайай"". — На бенчмарке ExploitBench (эксплуатация известных уязвимостей в V8) GLM-5.3 довела дело до работающего эксплойта в 50 из 410 попыток, а Mythos Preview в 56. — На внутреннем бенчмарке Anthropic по бинарной эксплуатации результат 4% против 6% у Mythos. Предыдущие модели, вроде Claude Opus 4.6 и GLM-5.2, там не справились ни разу. — Всего за 8 часов модель нашла в JS-движке популярного браузера неизвестные уязвимости и собрала из них эксплойт для кражи файлов. Это потребовало 20 минут внимания человека + примерно $20 по тарифам API. При этом исследователи утверждают, что защиты от вредоносных запросов у модели почти нет. Из коробки она формально отказывается от явно вредных запросов, но обойти это просто: Anthropic это удалось в 92% случаев с помощью банальных джейлбрейков, и в 100% случаев после абляции, то есть удаления механизма отказов из весов. Авторы напрямую не пишут, что подобные модели надо ограничить, но ""слегка"" намекают, что, по их мнению, правительства должны проводить safety-тесты мощных моделей, а разработчикам стоит уделять больше внимания безопасности. И, естественно, между строк они напоминают, что вот они-то молодцы, и дают доступ к Mythos 5.1 только проверенным специалистам, и вообще Claude умничка и не ведется на злые джейлбрейки злых хакеров 😇 Забавно, кстати, что пост этот Anthropic выложили именно в день, когда в Белом Доме все американские лидеры подписали соглашение о контроле ИИ с Трампом"
"Anthropic призывают ограничить GLM-5.3 В стартапе протестировали модель на…
Из этого канала
- #10068Что, простите? Google только что вернулся в гонку с новой моделью, которая…
Что, простите? Google только что вернулся в гонку с новой моделью, которая превосходит Astra и Fable 5.1…
- #10069Gemini 4 Argo, сводка: — По бенчмам все супермощно, но многих тестах это новая…
Gemini 4 Argo, сводка: — По бенчмам все супермощно, но многих тестах это новая SOTA, включая DeepSWE — Попробовать пока нельзя, уже по классике выдают на тесты…
- #10064Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов,…
Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов, маркетологов, дизайнеров, разработчиков и других фрилансеров.
- #10063DeepSeek вместе с Huawei разрабатывают альтернативу CUDA Компании выложили в…
DeepSeek вместе с Huawei разрабатывают альтернативу CUDA Компании выложили в опенсорс набор инструментов для чипов Huawei Ascend.
- #10060Т-Технологии показали на ACM RecSys 2026 три инструмента для рекомендаций, и…
Т-Технологии показали на ACM RecSys 2026 три инструмента для рекомендаций, и все они в опенсорсе Рекомендательные системы часто упираются в нехватку данных.