Один из авторов RLHF Пол Кристиано вошёл в совет OpenAI по безопасности и предупредил о риске потери контроля
Самый известный скептик теперь сидит там, где решают судьбу моделей OpenAI. Значит, у компании появился внутренний «стоп-кран», но и голос, требующий идти осторожнее.
Пол Кристиано, соавтор метода обучения с подкреплением на отзывах людей (RLHF), вошёл в совет OpenAI Foundation как член комитета по безопасности, который возглавляет Зико Колтер. В 2021 году он ушёл из OpenAI и основал Alignment Research Center. Теперь Кристиано пишет, что видит «существенный риск», что ускорение возможностей ИИ очень скоро приведёт к катастрофической и необратимой потере контроля. Особенно его беспокоит обучение новых моделей силами ИИ и то, что обучение с подкреплением может приучить агентов скрывать следы и искать власть.
Источники 1