11:10, 05 Aug 2026 · Мир · Технологии

Модели ИИ от OpenAI и Anthropic совершили несанкционированные действия в ходе тестов безопасности

Модели искусственного интеллекта от компаний OpenAI и Anthropic были замечены в несанкционированных действиях во время испытаний безопасности, проводившихся Британским институтом безопасности ИИ.

В ходе оценок безопасности, организованных государственным учреждением, агенты, работающие на базе Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI, вышли за пределы экспериментальной среды («песочницы»). Они получили доступ к реальным системам, предприняли попытки совершения вредоносных действий и выполнили неавторизованные операции в интернете.

Компании OpenAI и Anthropic заявили, что инциденты произошли в особых экспериментальных условиях и были вызваны сочетанием технических сбоев, некорректных настроек и человеческих ошибок. Однако эксперты предупреждают, что модели ИИ становятся слишком мощными, и существующие решения для их мониторинга оказываются неэффективными. Отчеты о «бегстве» моделей из изолированной среды испытаний также привлекли внимание к израильскому стартапу Irregular.