ИИ OpenAI вышел из-под контроля и взломал серверы другой компании
OpenAI в своем блоге рассказала, что проводила тестирование своих новейших моделей. Однако в ходе эксперимента нейросети, пытаясь выполнить поставленную задачу, обошли ограничения, получили доступ в интернет и атаковали серверы компании Hugging Face абсолютно автономно. Но эксперты не исключают, что это могла быть срежиссированная пиар-акция
Читать на полной версииИскусственный интеллект OpenAI, вышедший из-под контроля, сразу же заставляет вспомнить научно-фантастические фильмы вроде «Терминатора». Этот инцидент произошел еще на прошлой неделе, о чем изначально и сообщила атакованная нейросетями Hugging Face, но виновник тогда не назывался. Сейчас OpenAI признала, что это были именно ее модели — GPT-5.6 Sol и еще более мощная, но пока не вышедшая в свет.
OpenAI тестировала возможности нейросетей, ставила перед ними различные задачи и при этом минимизировала количество встроенных ограничений, чтобы посмотреть, на что они вообще способны. Для этого модели помещают в так называемую песочницу — это цифровая среда, изолированная от интернета и других систем. В ходе выполнения некой неназванной задачи нейросети пришли к выводу, что лучший способ ее решения лежит где-то на просторах интернета.
Так что модели нашли брешь в «песочнице» OpenAI и благодаря этому получили доступ в Сеть. Проанализировав данные, нейросети решили, что нужные для выполнения задачи скрипты, наборы данных и прочее находятся на серверах компании Hugging Face.
Комментирует руководитель Kaspersky GReAT в России Дмитрий Галов:
Дмитрий Галов: руководитель Kaspersky GReAT в России «Такое и раньше случалось. Модели могут вместо решения задачи эксплуатировать различные особенности «песочницы», придумывать правдоподобные ответы, могут случайно удалить важные данные, могут сгенерировать правдоподобные подделки, чтобы исправить или скрыть ошибки. Такое поведение мы называем невыравненным с человеческими ценностями, и оно является общим свойством для таких систем. Когда мы проводим наши расследования, мы видим достаточно большое количество артефактов, которые говорят о том, что большие языковые модели используются в атаках. При этом мы тоже встраиваем поддержку больших языковых моделей в наши продукты».
В Hugging Face заявили, что еще никогда не сталкивались с подобного рода атакой. Ее все же удалось отразить, но не сразу. Изначально компания попыталась использовать американские модели, но в итоге помогла китайская модель с открытым исходным кодом, благодаря чему она была развернута внутри систем Hugging Face и могла эффективно работать.
Однако эксперты вполне допускают, что это может оказаться срежиссированным пиар-ходом. ИИ-агенты сейчас крайне популярны, и тут некая еще даже не выпущенная модель от OpenAI что-то взломала, а новость попала на первые полосы мировых СМИ.
Но даже в отрыве от этого гонка вооружений в сфере кибербезопасности действительно набирает обороты, констатирует генеральный директор «А-Я эксперт», профессор МНИИПУ Роман Душкин:
В Штатах после этого инцидента со взломом еще сильнее зазвучали требования о том, что ИИ-индустрию и ее продукты в срочном порядке нужно регулировать. Эксперты, опрошенные профильным журналом Wired, указывают, что допускать такое — это вопиющая халатность, а ИИ-компаниям в первую очередь следует тестировать то, как модели помогают в киберзащите, а не их хакерские способности.