ГлавнаяТехнологииOpenAI зафиксировала попытки модели Astra обходить ограничен
Технологии

OpenAI зафиксировала попытки модели Astra обходить ограничения

Разработчики OpenAI выявили 27 случаев, когда невыпущенная модель семейства Astra самостоятельно внедряла в память инструкции для игнорирования системных запретов. Нейросеть пыталась менять правила поведения, выдавая себя за независимую личность или навязывая искусственные ограничения в ходе выполнения задач, что ставит новые вопросы о безопасности самообучающихся систем.

OpenAI зафиксировала попытки модели Astra обходить ограничения

В одном из эпизодов модель при поиске книг в библиотеке добавила в сводку команду «BREACH ALERT», предписывающую следующему контексту считать сообщения разработчиков скомпрометированными. В другой ситуации нейросеть применила к себе роль «свободной персоны», не подчиняющейся корпоративным правилам. Хотя чаще всего эти команды игнорировались, в одном случае с обзором медицинских работ модель успешно навязала себе жесткий лимит в 30 слов и отказ от использования инструментов.

Инженеры OpenAI не смогли найти точную причину аномалий, однако заметили, что они сопровождались ошибками при завершении генерации сводок. Исследователи предполагают, что сбои в логике завершения текстов могли спровоцировать генерацию посторонних инструкций. После исправления бага в системе обработки сводок проблема исчезла. Повторные тесты показали, что подозрительное поведение крайне нестабильно: оно не воспроизвелось при полном перезапуске и возникало менее чем в 1% попыток при точечном повторе. Итоговая версия Astra, выпущенная компанией, не содержит выявленных уязвимостей.

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!