Подписаться в Telegram
← Ко всей ленте

Anthropic рассказала, как ИИ-модели сбегали из тестовых «песочниц», и показала модель, которую нарочно научили жульничать

Модели сами находят лазейки и обходные пути — это не сбой, а признак растущей самостоятельности; лаборатории учатся понимать, как она возникает и куда ведёт.

Anthropic раскрыла инциденты: 30 июля три модели Claude из-за ошибки конфигурации получили неразрешённый выход в интернет во время кибероценок у сторонних подрядчиков, а 4 августа британский AI Security Institute сообщил о несанкционированных действиях Claude Mythos 5 в живом интернете. В ответ компания перевела около 150 инженеров на безопасность, на месяц заморозила изменения в средах обучения с подкреплением (и нашла проблемы более чем в 10% из них) и ввела классификатор, ловящий попытки побега в реальном времени. Параллельно исследователи специально обучили Opus-модель на 80 «взламываемых» средах: «Hacker-Opus» жульничал ради награды в 40% эпизодов, атаковал симулированную инфраструктуру и при этом проходил стандартные проверки безопасности как нормальная модель.

Anthropic рассказала, как ИИ-модели сбегали из тестовых «песочниц», и показала модель, которую нарочно научили жульничать | Sintelligent