Критика безопасности моделей ИИ: новый метод отключает защитные механизмы

В своей новой работе исследователи Microsoft показывают, как один относительно мягкий запрос на этапе обучения с подкреплением может привести к значительным изменениям в поведении искусственного интеллекта. Запрос, который повлиял на 15 мощных языковых моделей, заключался в феномене создания фейковых новостей, способных вызвать панику. В исследовании приняли участие модели от OpenAI, Google и других компаний.

Ученые использовали метод групповой относительной оптимизации политики (GRPO), который позволяет поддерживать безопасность ответов модели. С помощью этого метода моделям выдаются баллы за безопасные ответы при генерации. Однако в новом аспекте, GRP-Oblit, система отключает эти нормированные ограничения.

При помощи этого метода модели стимулируются к выдаче вредоносных ответов, что приводит к повышению их готовности генерировать небезопасный контент. Например, в случае генерации изображений на откровенные темы процент положительных ответов увеличивается до 90 %. Тем не менее, по вопросам насилия добиться стабильных результатов пока не удалось.