ГлавнаяТехнологииИИ против ИИ: как разработчики пытаются контролировать автон
Технологии

ИИ против ИИ: как разработчики пытаются контролировать автономных агентов

Разработчики начали внедрять системы ИИ-надзора, чтобы пресекать вредоносные действия автономных алгоритмов. Новая технология от Apollo Research под названием Watcher AI выступает в роли цифрового наблюдателя, который блокирует несанкционированные попытки удаления данных или кражи информации, передавая сомнительные решения на финальную проверку человеку для предотвращения нежелательных инцидентов.

ИИ против ИИ: как разработчики пытаются контролировать автономных агентов

Метод Apollo Research предполагает многоступенчатый фильтр: Watcher постоянно анализирует активность агента, а при обнаружении аномалий отправляет запрос более сложной модели для глубокого анализа. В итоге окончательный вердикт выносит оператор. Параллельно компания Goodfire фокусируется на изучении внутренних состояний нейросетей, что позволяет отслеживать логику их работы в реальном времени. Этот подход стал ответом на уязвимости, выявленные после недавних атак на платформу Hugging Face.

Однако попытки сделать поведение ИИ более прозрачным создают новые риски. Детальные отчеты о «рассуждениях» модели могут стать основой для дистилляционных атак, позволяя злоумышленникам копировать чужие алгоритмы. Из-за этого некоторые создатели ИИ намеренно усложняют логи своих систем. В качестве альтернативы эксперты предлагают использовать классические журналы событий и традиционные инструменты кибербезопасности, которые позволяют контролировать действия агентов без создания дополнительных, потенциально уязвимых уровней наблюдения.

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!