Метод Apollo Research предполагает многоступенчатый фильтр: Watcher постоянно анализирует активность агента, а при обнаружении аномалий отправляет запрос более сложной модели для глубокого анализа. В итоге окончательный вердикт выносит оператор. Параллельно компания Goodfire фокусируется на изучении внутренних состояний нейросетей, что позволяет отслеживать логику их работы в реальном времени. Этот подход стал ответом на уязвимости, выявленные после недавних атак на платформу Hugging Face.
ИИ против ИИ: как разработчики пытаются контролировать автономных агентов
Разработчики начали внедрять системы ИИ-надзора, чтобы пресекать вредоносные действия автономных алгоритмов. Новая технология от Apollo Research под названием Watcher AI выступает в роли цифрового наблюдателя, который блокирует несанкционированные попытки удаления данных или кражи информации, передавая сомнительные решения на финальную проверку человеку для предотвращения нежелательных инцидентов.

Однако попытки сделать поведение ИИ более прозрачным создают новые риски. Детальные отчеты о «рассуждениях» модели могут стать основой для дистилляционных атак, позволяя злоумышленникам копировать чужие алгоритмы. Из-за этого некоторые создатели ИИ намеренно усложняют логи своих систем. В качестве альтернативы эксперты предлагают использовать классические журналы событий и традиционные инструменты кибербезопасности, которые позволяют контролировать действия агентов без создания дополнительных, потенциально уязвимых уровней наблюдения.
__wtxebxe.webp)


Комментарии (0)
Пока нет комментариев. Будьте первым!