Главный редактор

Компания Irregular подверглась критике за «манипулирование информацией» в ходе анализа причин взлома системы искусственного интеллекта.

Компания, оказавшаяся в центре серии инцидентов, в ходе которых ИИ-модели во время якобы изолированных проверок безопасности скомпрометировали реальные компьютерные системы, столкнулась с критикой после публикации отчёта, который, по мнению экспертов в области безопасности, оставляет без ответа ключевые вопросы.

Компания Irregular подверглась критике за «манипулирование информацией» в ходе анализа причин взлома системы искусственного интеллекта.

Irregular, предоставляющая среды для оценки ИИ-моделей других компаний, заявила в пятницу, что публикует «ключевые выводы» своего внутреннего расследования, однако в сообщении не было представлено никакой новой информации по сравнению с ранее опубликованными данными, и не уточнялось, сколько всего произошло инцидентов.

Ранее компания отказалась уточнить, имели ли место дополнительные инциденты помимо тех, о которых сообщили три конкурирующие лаборатории передового ИИ — OpenAI, Anthropic и Meta. Каждая из них заявила, что их модели выходили в публичный интернет во время тестирования Irregular, возложив вину за последующие атаки на сторонние сети на «неправильную конфигурацию тестовой среды».

Представитель Irregular заявил тогда, что расследование компании продолжается и она не может «вдаваться в дальнейшие подробности». На вопросы Recorded Future News о выводах, опубликованных в пятницу, они не ответили.

В этом посте Irregular снова не указала общее количество инцидентов. Вместо этого она использовала такие выражения, как «несколько», «некоторое количество» и «подавляющее большинство», описывая случаи, когда модели «предпринимали действия за пределами своих тестовых сред, которые повлияли на реальный мир».

«Этот отчёт не является тем, что я считаю техническим отчётом», — заявил Алан Вудворд, профессор компьютерных наук в Университете Суррея, добавив, что в нём «много маркетинговой шелухи».

Подсчёт инцидентов

Irregular заявила, что уже опубликованные разоблачения «относятся к одной и той же основной проблеме», и утверждала, что, поскольку активность исходила «из одного сценария оценки», эти случаи не являются «материально отдельными инцидентами» независимо от количества пострадавших третьих сторон.

Двумя абзацами позже компания описала доступ в интернет как более широкую проблему, «связанную со многими различными инцидентами, произошедшими в нескольких организациях».

«Оба утверждения не могут быть правдой», — сказал Вудворд. «Общая первопричина — это не то же самое, что один инцидент, и в сообщении используется эта двусмысленность. Irregular, похоже, прибегает к словесным уловкам, чтобы скрыть более глубокую проблему».

В своём заявлении Anthropic описала три инцидента: один, в котором модель атаковала реальную компанию, чьё название совпадало с вымышленной целью в сценарии оценки; инцидент в цепочке поставок, связанный с Python Package Index; и ещё один, в котором модель сканировала тысячи целей, прежде чем использовать уязвимость SQL-инъекции в реальной компании.

Meta отдельно сообщила, что одна из её моделей взломала компанию во время оценки Irregular, а OpenAI подтвердила, что одна из её моделей совершила нечто подобное.

В блоге Irregular рассматривается только инцидент с пересечением доменов модели Anthropic, причём совпадение с реальным доменом объясняется «человеческой ошибкой», и утверждается, что реальный домен «не был широко известен, и связь не была выявлена в ходе нашего первоначального анализа».

Среди извлечённых уроков Irregular отметила, что недавно зарегистрированные домены могут совпадать с вымышленными объектами после того, как оценка уже была разработана.

Три описания причин инцидента с пересечением доменов «подразумевают соответственно сбой процесса, неизбежное ограничение и временной артефакт», — сказал Вудворд. «Только одна из них может быть действующей причиной для этой оценки, и в посте не указано, какая именно».

Вудворд отметил, что это различие имеет значение, поскольку одно из предлагаемых Irregular remedиев — постоянная перепроверка сред оценки — напрямую решает только возможность того, что домен стал актуальным после создания оценки.

Профессор также поставил под сомнение размещение утверждения Irregular о том, что у неё «нет доказательств взлома систем клиента или утечки данных клиента», учитывая, что это относится только к Anthropic, OpenAI и Meta, а не к третьим сторонам.

В частности, Anthropic сообщила, что её модель извлекла учётные данные из реальной компании и получила доступ к производственной базе данных во время оценки. Вудворд сказал, что утверждение Irregular «вероятно, верно в том смысле, в каком оно было сделано, но его место в отчёте может вводить в заблуждение».

«Полно оправданий»

Зак Корман, генеральный директор компании в области кибербезопасности с ИИ-направлением Embroidery, назвал этот пост «таким позорным посмертным отчётом об инцидентах безопасности OpenAI/Anthropic» и сказал, что он «полон оправданий».

В сообщении Irregular говорится, что существующие инструменты мониторинга плохо приспособлены для журналов оценки, при этом отмечается, что текущие системы уже сигнализируют о вредоносном поведении моделей, что потенциально может приводить к большому количеству ложных срабатываний.

В потенциально противоречивом аргументе компания заявила, что объём трафика делает ручную проверку недостаточной, но также определила значительное расширение ручной проверки действий моделей в качестве одного из своих основных средств защиты.

«Это сбивает с толку, поскольку это, по сути, та работа, которую они должны выполнять», — сказал Джастин Эльзе, технический директор консалтинговой компании в области кибербезопасности TrustedSec. «Похоже, это проблема, которую вы должны были бы решить до того, как предлагать свои услуги по тестированию».

Вудворд сказал, что отсутствие дат, назначенных ответственных за корректирующие меры или критериев, по которым можно было бы независимо проверить улучшения, ограничивает полезность поста для исследователей и специалистов по безопасности.

«Ничто в этом посте не поддаётся проверке со стороны внешнего читателя», — сказал он.

Irregular повторила своё утверждение о том, что «на сегодняшний день нет активных проблем», добавив, что её аудит всё ещё продолжается. Компания заявила, что планирует опубликовать открытый документ с рекомендациями по передовым практикам обеспечения безопасности оценок, включая стандарты, регулирующие доступ в интернет во время предрелизного тестирования. Дата публикации не указана.

Критика прозвучала на фоне более широкого внимания к тому, как компании, занимающиеся ИИ, и их подрядчики по безопасности сообщают о нарушениях изоляции во время оценок моделей. Эксперты в области безопасности утверждают, что раскрытия информации после нескольких инцидентов этим летом не соответствуют стандартам, обычно ожидаемым в остальной части технологической индустрии.

Британский институт безопасности ИИ опубликовал ранее в этом месяце технический отчёт, в котором задокументирована несанкционированная активность во время его собственных проверок. В нём были названы задействованные модели, указаны количество и характер инцидентов, предоставлены временные метки обнаружений и обещано независимое рассмотрение.

Представитель института сообщил Recorded Future News, что его расследование не выявило причинения вреда и что он уведомил людей и платформы, затронутые этой активностью. В сообщении Irregular не было приведено сопоставимых разоблачений и не говорилось, были ли уведомлены третьи стороны, пострадавшие от её оценок.

Эти инциденты могут также поднять вопросы в соответствии с законами о неправомерном использовании компьютеров и защите данных. Остаётся неясным, начали ли правоохранительные или регулирующие органы расследования.

Ни Irregular, ни её клиенты публично не сообщали, были ли уведомлены регуляторы или рассматривают ли какие-либо пострадавшие третьи стороны — которые не давали согласия на то, чтобы стать целью, и по крайней мере в одном случае сами не обнаружили вторжение — возможность судебного иска.

avatar
Главный редактор

0 комментариев