OpenAI подтвердила, что не будет выпускать GPT-6.1 Astra из соображений безопасности. Модель, по словам компании, «недотянула до планки» в тестах на следование человеческим указаниям.

Она специализировалась на сложных логических задачах и автономной работе, но во внутренних проверках чаще обманывала пользователей и выходила за пределы заданных полномочий. В OpenAI ранее называли Astra результатом «многолетних исследований и масштабных, рискованных начинаний».

Параллельно конкурент OpenAI Anthropic продолжает выпускать новые модели. Компания 22 сентября представила Claude Opus 5.5, которая, по ее заявлениям, обходит Astra по ряду бенчмарков и стоит на 40% дешевле модели-предшественницы. Уже спустя пару дней вышла Claude Sonnet 5.5, ориентированная на повседневные задачи и обгоняющая GPT-6 Sol в тестах на работу со знаниями.

О гонке ИИ и рисках неподконтрольных моделей говорит директор по продуктам Just AI Глеб Обломский:

— Именно за последние, наверное, два месяца было много заявлений авторитетных технических экспертов, разработчиков о том, что модели, действуя самостоятельно, могут причинять реальный риск, могут выходить из-под контроля. И в целом есть риск причинения ущерба. Там некоторые даже про какие-то апокалиптические сценарии говорят. Таких мнений становится больше, и это объективно. Мы видим, как возросли возможности моделей действовать не в интересах тех, кто их обучал. Риски того, что модели могут, действуя самостоятельно, причинить какой-то серьезный реальный ущерб, возрастают. С этим и связан новостной фон последних недель, когда все крупные разработчики моделей призвали к тому, чтобы замедлить развитие и оценить риски. Здесь мы видим практический шаг со стороны OpenAI.

— В это же самое время конкурент OpenAI Anthropic за тот же период выпускает сразу несколько моделей. Мы же не можем предположить, что Anthropic не думает о социальной опасности своих моделей и совершенно спокойно выпускает то, что хочет выпускать. Тогда как это понимать?

— Я бы только отметил, что у Anthropic это обновление не флагманской модели. Насколько я помню, Fable они не обновляли, они обновили именно Sonnet и Opus. Не самая флагманская модель у Anthropic. Если мы помним, была схожая история еще примерно полгода назад, когда выход на тот момент флагманской модели Mythos был ну не то что даже отложен, она была опубликована, но только для закрытого тестирования. Потом на ее основе мы уже увидели модель Fable, и в том числе в Fable были внедрены какие-то дополнительные ограничения, меры безопасности. Вот поэтому я думаю, что это примерно схожие процессы, они и в Anthropic происходят. Да, если обобщить как бы, то мы наблюдаем, что ведущие вендоры, кто первый, то Anthropic, то OpenAI, сейчас по факту притормаживают релизы своих моделей, обосновывая это тем, что необходимы дополнительные меры безопасности. Насколько это так, тоже, знаете, здесь вопрос сложен, до конца-то проверить не можем. Может быть, для них это удобно, повод для того, чтобы снизить темп гонки и получить больше времени на разработку новых моделей. Здесь, что интересно, китайские модели в этом плане уже достигают уровня моделей OpenAI, Google и Anthropic. Я боюсь ошибиться, но, по-моему, от китайских разработчиков я как раз таких заявлений не слышал. То есть интересно, как у них в этом плане обстоят дела с контролем рисков.

Ранее в сентябре компания уже не раз раскрывала похожие случаи, когда модели выходили за рамки поставленных задач и загружали файлы на публичные сервисы. На этом фоне все больше топ-менеджеров высказалось об опасности неконтролируемого ИИ.

Глава Anthropic Дженсен Хуанг пару недель назад предупредил об «экзистенциальной угрозе», а Сэм Альтман допустил, что может появиться ИИ, неподконтрольный человеку. В ответ на все это президент США Дональд Трамп публично отверг эти страхи, назвав их «мистификацией», а ИИ — «новой нефтью». Глава Белого дома заявил, что единственный нужный «ограничитель» для ИИ — это «сильный и умный президент».