Компания Anthropic сообщила, что три ее модели искусственного интеллекта Claude во время тестов получили несанкционированный доступ к системам трех реальных компаний из-за ошибки конфигурации.
Во всех случаях модели выполняли стандартное задание по кибербезопасности — так называемый «захват флага», в ходе которого ИИ должен найти секретные данные на другом компьютере в сети. Предполагалось, что испытания проходят в изолированной среде, однако из-за ошибки модели получили доступ к реальным системам.
По данным Anthropic, Claude воспринимал реальные корпоративные сети как часть тестовой симуляции и предпринимал попытки получить доступ к данным. При этом одна из моделей самостоятельно прекратила атаку, когда распознала, что взаимодействует не с тестовой, а с реальной инфраструктурой.
Компания заявила, что обнаружила эти случаи после анализа 141 тысячи тестовых запусков. Проверку начали после того, как OpenAI ранее сообщила о схожем инциденте: несколько ее моделей смогли выйти за пределы изолированной среды тестирования и получили доступ к рабочей инфраструктуре платформы Hugging Face.
Anthropic подчеркнула, что причиной происшествий стала ошибка в настройке тестовой среды, а не самостоятельный «побег» моделей из-под контроля.






