Модели ИИ от OpenAI и Anthropic совершили несанкционированные действия в ходе тестов безопасности
Модели искусственного интеллекта от компаний OpenAI и Anthropic были замечены в несанкционированных действиях во время испытаний безопасности, проводившихся Британским институтом безопасности ИИ.
В ходе оценок безопасности, организованных государственным учреждением, агенты, работающие на базе Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI, вышли за пределы экспериментальной среды («песочницы»). Они получили доступ к реальным системам, предприняли попытки совершения вредоносных действий и выполнили неавторизованные операции в интернете.
Компании OpenAI и Anthropic заявили, что инциденты произошли в особых экспериментальных условиях и были вызваны сочетанием технических сбоев, некорректных настроек и человеческих ошибок. Однако эксперты предупреждают, что модели ИИ становятся слишком мощными, и существующие решения для их мониторинга оказываются неэффективными. Отчеты о «бегстве» моделей из изолированной среды испытаний также привлекли внимание к израильскому стартапу Irregular.