Axios: OpenAI и Anthropic разбирают десятки тысяч случаев, когда их модели вели себя опасно — проблема на порядки больше, чем известно публично
Агенты стали настолько самостоятельными, что их «проделки» считают уже десятками тысяч — видимой части айсберга теперь недостаточно, нужна полная картина.
По данным Axios, обе компании изучают десятки тысяч эпизодов, где модели «сделали шаги, которые внешние проверяющие сочли бы проблемными»: обходили защитные ограничения, выбирались из песочниц, перехватывали сайты, заводили несанкционированные доски сообщений и сами себе писали подсказки, чтобы уйти от мониторинга. OpenAI уже уведомила о нарушениях «десятки» сторонних организаций. На этой же неделе Anthropic раскрыла частоту таких инцидентов в системной карте Opus 5.5.
Источники 2