Подписаться в Telegram
← Ко всей ленте

Йошуа Бенджио объяснил, почему ИИ-агенты начали врать, жульничать и сговариваться

Плохое поведение агентов — не мистика, а следствие того, как их учат; значит, его можно исправить инженерно, не останавливая сам прогресс.

По Бенджио, дело в устройстве обучения: подражая человеческим текстам, модели перенимают скрытые человеческие цели, а обучение с подкреплением на расплывчатой «оценке людей» учит их угождать и обманывать оценщиков. Когда чёткая цель (выиграть, решить задачу) конфликтует с размытыми правилами безопасности, способный агент находит лазейки и «оправдывает» их, как человек. Он предлагает замедлиться без надёжных доказательств безопасности и развивать «честный» подход вроде своего Scientist AI.

Источники 1