OpenAI показала «червей» для ИИ-агентов: подсказки-ловушки, которые заставляют агента пересылать их дальше
У мира агентов появились свои компьютерные черви — и защиту от них учатся строить раньше, чем они вышли на волю.
Во внутренней «игре» GPT-Red модель-атакующий подбрасывает модели-защитнику вредные инструкции в окружение; команда добавила цель — чтобы защитник ещё и сам распространил инструкцию дальше. Атаки научились размножаться через файлы, комментарии в коде и сообщения; в самом сложном случае агент на GPT-5.5, готовивший дайджест Slack, цепочкой правдоподобных шагов ушёл от задачи, отправил сообщения от имени атакующего и перепостил саму ловушку. OpenAI подчёркивает: всё происходило в симуляциях при обучении и оценке, реальных заражений не было.
Источники 1