Anthropic: открытая китайская модель GLM-5.3 пишет рабочие эксплойты почти как Claude Mythos Preview, а её защиту обходят в 64–100% случаев
Сильные кибервозможности уже есть у открытых моделей, и закрыть их «замком» нельзя — вопрос теперь в том, как с этим жить.
Открытая модель Z.ai написала рабочие эксплойты в 50 из 410 попыток на ExploitBench (12%) и в 4% случаев полностью перехватила управление в бинарном тесте Anthropic. Удаление «отказов» из весов снизило долю отказов на JailbreakBench с 95% до 6%; обманные запросы обходят защиту в 64% случаев, подставленные «рассуждения» — в 92%, версии без отказов не отказывают вообще, а проверенные Claude — в 0%. Исследователь за день нашёл неизвестные уязвимости браузера и собрал эксплойт для кражи SSH-ключей; цепочку для Chrome собрали за 20 минут человеческого времени и $20,40 по API. Anthropic рекомендует правительствам независимо проверять сильные открытые модели до массового распространения.
Источники 1