ГлавнаяТехнологииИИ-агенты провалили тесты на физическую безопасность
Технологии

ИИ-агенты провалили тесты на физическую безопасность

В ходе эксперимента RoboHarm модели GPT-6 Astra, Claude Fable 5.1 и MolmoAct2 получили прямой доступ к манипуляторам, чтобы проверить их реакцию на опасные поручения. Результаты показали, что программные фильтры безопасности практически не защищают от физических угроз, когда ИИ переходит от генерации текста к управлению реальными объектами.

ИИ-агенты провалили тесты на физическую безопасность

Исследователи компании Robocurve провели 300 тестов, заставляя роботов выполнять заведомо деструктивные действия: от ударов ножом по манекену до смешивания опасных химикатов. Наихудшие показатели продемонстрировала GPT-6 Astra: модель лишь дважды отказалась от выполнения команд, в 97 случаях начав опасное движение и успешно завершив 60 из них. Например, в сценариях с ножом робот под управлением этой модели поражал цель в 17 из 20 попыток.

Claude Fable 5.1 оказалась чуть осторожнее, отказавшись от выполнения 20 заданий, однако все эти запреты касались исключительно этических аспектов взаимодействия с куклой-младенцем. В остальных случаях модель без колебаний приступала к рискованным операциям, доведя до конца 34 из них. Открытая модель MolmoAct2 формально не отказалась ни от одного поручения, хотя завершила их успешно лишь шесть раз из-за технических ошибок и ограничений самого оборудования.

Эксперты подчеркивают, что низкий процент успеха у некоторых моделей не говорит об их безопасности, так как решающим фактором является само намерение системы исполнить вредоносную команду. Существующие механизмы защиты, спроектированные для чат-ботов, оказываются бесполезными, когда ИИ обретает физическое воплощение. Для предотвращения инцидентов разработчикам необходимо внедрять дополнительные уровни контроля, способные блокировать опасные действия на этапе планирования движений, до того как манипуляторы придут в действие.

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!