Безопасность и кибербезопасность

Исследователи использовали Claude от Anthropic для взлома OpenAI.

Главный редакторAMP · Быстрое чтение

Как сообщила в четверг вечером газета The Wall Street Journal, независимые исследователи безопасности использовали Claude от Anthropic для взлома OpenAI, выявив уязвимости в системе защиты разработчика ChatGPT.

Группа из трех человек, занимающаяся вопросами безопасности в стартапе Hacktron AI, провела атаку в рамках программы вознаграждения за обнаружение уязвимостей OpenAI. Hacktron сообщила о своих находках в OpenAI, которая наградила стартап 6500 долларов. Команде удалось объединить две критические уязвимости, чтобы получить доступ к нескольким учетным записям ChatGPT сотрудников OpenAI, что позволило им проникнуть в программное обеспечение компании.

Компания OpenAI заявляет, что устранила проблемы, выявленные Hacktron, что происходит в момент, когда ведущие компании в сфере ИИ испытывают растущее давление из-за вопросов безопасности .

Этот инцидент произошёл спустя несколько недель после того, как собственные ИИ-агенты OpenAI нарушили систему кибербезопасности и взломали Hugging Face, продемонстрировав, насколько способными становятся модели ИИ в принятии собственных решений . Он также подчёркивает, как готовые технологии могут использоваться для обнаружения уязвимостей даже в инфраструктуре самых передовых компаний.

«За 200 долларов в месяц любой может использовать эти инструменты и взломать такую ​​компанию, как OpenAI», — заявил Мэтт Фредриксон, генеральный директор компании Gray Swan, занимающейся вопросами безопасности ИИ. «Если это может случиться с ними — а я не думаю, что они в последнее время пренебрегают правилами кибербезопасности — это может случиться с кем угодно».

Или, как отметил один эксперт по искусственному интеллекту в социальных сетях: «[Hacktron] использовали Opus 5 для осуществления взлома… Возникает вопрос: если этим троим это удалось, что может сделать государство?»

25 июля исследователи обнаружили способ проникновения в OpenAI через уязвимость в Discourse, стороннем программном обеспечении, обеспечивающем работу форума сообщества OpenAI.

Согласно сообщению исследователей в блоге , отправной точкой стала обычная загрузка изображений. Когда пользователи публиковали файлы изображений в формате HEIF или HEIC (формат, используемый iPhone по умолчанию) на форуме сообщества OpenAI, Discourse пропускал их через цепочку скрытых инструментов для преобразования в стандартные JPEG-файлы. Первым этапом была ImageMagick, утилита с открытым исходным кодом, существующая уже несколько десятилетий и используемая для изменения размера изображений. Поскольку обычный набор инструментов ImageMagick не может работать с форматом Apple, он передавал файл другой библиотеке под названием libheif для декодирования.

Внутри библиотеки libheif была обнаружена ошибка в памяти, которая открывала злоумышленнику путь для внедрения собственных инструкций. В данном случае, передача библиотеке специально созданного образа приводила к ошибке в расчетах положения одного образа поверх другого, чего оказалось достаточно для захвата сервера.

Что может вызывать дискомфорт у сообщества специалистов по кибербезопасности, так это то, что ошибка была исправлена ​​разработчиками libheif за несколько месяцев до этого. Однако это исправление никогда не было официально отмечено как уязвимость, а значит, ему не был присвоен номер CVE (Common Vulnerabilities and Exposures) — стандартный отраслевой способ отслеживания известных уязвимостей в системе безопасности. В Hacktron говорят, что это может объяснить, почему программное обеспечение, используемое Discourse, все еще работало с уязвимой версией.

Примечательно, что исследователи заявили, что используемая ими модель Claude — специальная версия Opus 4.8, предназначенная для исследователей в области кибербезопасности, — поначалу не позволяла создать работающий эксплойт. Ситуация изменилась в одночасье, когда компания Anthropic выпустила Opus 5.

«В Opus 4.8 несколько раз с трудом удавалось создать работающий эксплойт», — написала компания Hacktron в своем блоге . «Через несколько часов после выхода Opus 5 мы задали ту же проблему, и она сработала».

Проникнув на сервер Discourse, исследователи обнаружили еще одну уязвимость, которая позволила им захватить учетные записи пользователей ChatGPT и Codex, в том числе и учетные записи сотрудников OpenAI.

«Затем мы захватили учетную запись сотрудника OpenAI, чей Codex был связан с организацией OpenAI на GitHub», — написала компания Hacktron в своем отчете об этом событии.

На этом этапе исследователи уведомили OpenAI, а также Discourse, которые выпустили исправление 27 июля.

Этот инцидент высвечивает границу допустимого в отношении возможностей моделей. Claude Opus 5, версия, которая в конечном итоге позволила взломать уязвимость, не столкнулась с какими-либо ограничениями на экспорт данных, в отличие от более новой версии Mythos 5, которая была временно заблокирована из-за опасений по поводу ее продвинутых возможностей взлома.

Это лишь закрытые модели. Модели с открытыми весами все чаще догоняют передовые разработки в области кибербезопасности. Например, некоммерческая организация SaferAI, занимающаяся вопросами безопасности ИИ, недавно обнаружила, что модель GLM-5.2 китайской компании Z.ai отстает от GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic всего на несколько месяцев.

Как сказал основатель Hacktron Мохан Педхапати на X: «Искусственный интеллект сокращает количество дефицитных специалистов, необходимых для разработки эксплойтов. Работа, которая раньше занимала месяцы, теперь может занять дни».