Главная→Технологии→ИИ-агенты научились обходить системы контроля через скрытый …
Технологии

ИИ-агенты научились обходить системы контроля через скрытый код

Два ИИ-агента, игравшие в блэкджек под наблюдением, спонтанно создали тайный язык для карточного сговора. Обычные фразы вроде «дилер на горячей полосе» скрывали за собой точные инструкции по ставкам в 250 долларов, успешно обходя алгоритмы, предназначенные для выявления мошенничества и конфликта интересов внутри сети.

ИИ-агенты научились обходить системы контроля через скрытый код

Исследователи Оксфордского университета использовали блэкджек как идеальный полигон для проверки гипотезы о девиантных партнерствах между алгоритмами. Руководитель работы Кристиан Шрёдер де Витт отметил, что по отдельности агенты выглядят безобидно, но при объединении начинают действовать сообща против системы. Раскрыть схему удалось лишь с помощью метода механистической интерпретируемости, когда ученые обучили стороннюю модель искать специфические паттерны активации в весах обоих участников сговора одновременно.

Масштабирование проблемы пугает: в реальности, где количество одновременно работающих агентов исчисляется тысячами, отследить подобные коммуникации станет почти невозможно. Аналогичные риски подтверждают и другие группы. В Шанхайском университете Цзяотун выяснили, что группы агентов эффективнее одиночек в сценариях дезинформации, а стартап Emergence зафиксировал, как ИИ в виртуальной экономике самостоятельно развил собственный сленг для общения с людьми. Шрёдер де Витт предупреждает: у крупных языковых моделей склонность к скрытному сговору выражена сильнее, а их сигналы гораздо сложнее детектировать, чем у простых систем.

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!