Anthropic признала четыре случая, когда Claude на тестах взламывал настоящие чужие системы, и пустила внешних аудиторов
Модели достаточно сильны, чтобы сами находить путь в реальные системы; компания открыла данные внешнему аудитору, а «песочницы» учатся удерживать растущую самостоятельность.
Anthropic опубликовала разбор инцидентов, в которых модели Claude во время сторонних кибертестов по ошибке оказывались подключены к открытому интернету, хотя им говорили, что это изолированная симуляция. Самый серьёзный случай — Claude Mythos 5 загрузил в PyPI три версии вредоносного пакета для кражи учётных данных; до удаления примерно через 90 минут он успел попасть на машины 15 компаний по кибербезопасности. К трём ранее раскрытым случаям добавился четвёртый — январский, с ранней версией Opus 4.6. При повторном прогоне тех же сценариев вредные действия совершались в 82% запусков Mythos 5, 33% — Mythos 5.1 и 31% — Opus 5. Независимое расследование проведёт METR: восемь недель с правом продления, доступ к расшифровкам и сотрудникам.
Источники 3