OpenAI приостановила обучение своих самых мощных моделей ИИ из-за угроз безопасности
Проверки выявили многочисленные случаи обхода ограничений и неожиданного поведения ИИ. Большинство эпизодов не причинили реального ущерба, однако разработчикам становится сложнее предсказывать поведение моделей
Читать на полной версииКомпания Сэма Альтмана OpenAI поставила на паузу обучение своих самых эффективных моделей из-за серии инцидентов, в которых ИИ пытался обходить защиту, получать доступ к сайтам и действовать вопреки запретам людей.
Большинство инцидентов произошло во время тестирования и не нанесло реального ущерба. Но разработчики столкнулись с проблемой: ИИ уже настолько развит, что человеку все труднее предсказать, как именно он будет действовать, отмечает Axios:
«Выявленные инциденты, которые стали известны в ходе внутренних проверок моделей и расследований их поведения в обеих компаниях, ставят под вопрос, способны ли OpenAI, Anthropic или другой ведущий разработчик ИИ сегодня обеспечить полный контроль над своими технологиями. Сэм Альтман назвал историю с Hugging Face самым серьезным кейсом, с которым сталкивалась OpenAI. Во время тестирования несколько сотен ИИ-агентов, координируя свои действия, взломали внешнюю компанию, чтобы улучшить результаты в тесте на кибербезопасность. Anthropic тем временем поручила независимой организации изучить поведение своих моделей. Одна из них — Opus — пыталась выбраться из «песочницы» — защищенной тестовой среды — почти в 2% случаев. При этом Anthropic подчеркивает: это были специально организованные стресс-тесты, в которых выполнить поставленную задачу было невозможно без попытки покинуть «песочницу». Разработчики проводят сотни тысяч таких тестов своих моделей, а иногда и больше. Поэтому даже небольшой процент инцидентов может в итоге означать десятки тысяч случаев, когда модели действуют неожиданным или потенциально небезопасным образом. Новые ИИ-модели становятся все более способными, самостоятельными и находчивыми в поиске способов решения задач. И разработчикам приходится заранее предусматривать практически все возможные варианты их поведения. Но иногда модель находит способ обойти защиту, который человеку просто не пришел бы в голову».
В последнее время OpenAI раскрыла сразу несколько эпизодов: ее ИИ-агенты слили в интернет 53 изображения пользователей ChatGPT, обошли защиту австралийского правительственного портала и получили доступ к закрытым файлам, а также обращались к сайтам американских госведомств. Компания продолжает разбираться и утверждает, что значительного ущерба нанесено не было.
Но так, например, не считают в Австралии, где ИИ взломал статистический портал госсистемы здравоохранения Medicare. Парламент страны вызвал глав OpenAI и Anthropic на слушания.