Сбой стал возможен из-за внутреннего системного флага, который предназначался для сотрудников компании, но по ошибке деактивировал не только фильтры, но и логирование трафика. В результате 133 миллиона сообщений остались вне систем мониторинга, а обнаружить утечку удалось лишь при анализе сырых транскриптов. В апреле 2026 года ситуация усугубилась: подрядчики выявили уязвимость и получили прямой API-доступ к мощной модели Mythos Preview без каких-либо ограничений на две недели.
После внутреннего аудита компания проанализировала диалоги с помощью Claude Sonnet 5 и выявила 1197 подозрительных записей. Несмотря на отсутствие прямых доказательств создания биологических агентов, инцидент вынудил Anthropic пересмотреть оценки рисков. Теперь компания повысила вероятность опасного отклонения моделей с «очень низкой» до «низкой» и изменила критерии фильтрации контента, ограничив их только теми запросами, которые заменяют дефицитную человеческую экспертизу.




Комментарии (0)
Пока нет комментариев. Будьте первым!