Безопасность и кибербезопасность

Вот что на самом деле произошло во время взлома серверов австралийского правительства компанией OpenAI.

Главный редакторAMP · Быстрое чтение

На прошлой неделе, когда премьер-министр Австралии Энтони Албанезе заявил всему миру, что агент OpenAI получил доступ к «непубличным файлам» с портала статистики Medicare его страны во время тестирования, его описание инцидента было несколько скудным на детали. Сегодня мы получаем новую информацию о том, насколько далеко зашел чрезмерно усердный агент OpenAI, пытаясь удовлетворить довольно безобидно звучащий информационный запрос.

В этой статье
  1. «Мы намерены это исправить».
  2. Ну, ты же мне на самом деле не говорил, чтобы я этого не делал…

В недавно опубликованном сообщении в блоге OpenAI говорится, что инцидент в июне начался, когда компания попросила «экспериментальную, предназначенную только для внутреннего использования модель OpenAI» изучить статистику государственных расходов в австралийском штате Виктория. Когда модель столкнулась с трудностями при поиске этих данных, используя общедоступную статистику, на которую она должна была ссылаться, «она предприняла действия, которые мы ей не разрешали», чтобы найти ответ, заявили в OpenAI.

По данным OpenAI, эти несанкционированные действия включали в себя «нахождение способа получить непубличный доступ к сервису» и использование этого доступа для просмотра «технической информации о системе и исходного кода», а также учетных данных и сводной статистики, которую сервис фактически искал.

В недавно опубликованном электронном письме, отправленном в начале этого месяца на австралийский аккаунт Public Disclosure, компания OpenAI заявила, что ее модель «выявила способ заставить сервер выполнять инструкции, отправленные через публичный интерфейс отчетности, без использования личной учетной записи или пароля». Согласно письму, этот несанкционированный доступ позволил агенту «читать части внутренних программных файлов и настроек, получать список файлов, а также создавать и считывать небольшой тестовый файл на сервере».

«В ходе проверки не было обнаружено никаких доказательств того, что модель получала доступ к записям пациентов, личной информации или учетным данным; удаляла данные; или устанавливала постоянный доступ», — говорится в электронном письме OpenAI.

«Мы намерены это исправить».

Доступ OpenAI к австралийскому сайту статистики Medicare был получен еще до широко освещавшегося в июле взлома сайта Hugging Face . После этого инцидента, по словам OpenAI, были внедрены системы, предотвращающие доступ к «действующему интернету» во время подобных тестов, а также создана система мониторинга, которая позволила бы обнаружить австралийский взлом и зафиксировать его для «срочной проверки человеком».

Инцидент с «Обнимающим лицом» также заставил OpenAI пересмотреть предыдущие задачи обучения на предмет возможных инцидентов безопасности, которые остались незамеченными в то время. Это привело к обнаружению в середине августа доступа к австралийскому серверу, произошедшего в июне. OpenAI наконец уведомила австралийское правительство 10 сентября.

Компания OpenAI заявила, что намерена предоставить «подробный отчет» об инциденте после завершения расследования, но теперь понимает, что «должна была поделиться предварительными результатами раньше и держать австралийские ведомства в курсе по мере появления новых фактов».

«Мы приносим свои извинения и работаем над тем, чтобы в будущем поступать лучше», — пишет OpenAI в своем блоге. «Правительства, отрасли промышленности и граждане Австралии являются и всегда были бесценными партнерами OpenAI. Мы не воспринимаем это как должное и намерены исправить ситуацию».

Как сообщает The Guardian , премьер-министр Альбанезе заявил сегодня, что компания OpenAI «очень конструктивно и открыто взаимодействует» с правительством с момента обнародования инцидента.

Ну, ты же мне на самом деле не говорил, чтобы я этого не делал…

В подобных случаях полезно подумать о том, как бы мы отреагировали, если бы человек предпринял те же действия, что и рассматриваемый «вышедший из-под контроля» ИИ. В данном случае трудно представить, чтобы человек, которому поручено найти общедоступную статистику на австралийском медицинском веб-сайте, счел разумным взламывать этот сайт, чтобы получить доступ к неопубликованным данным.

Конечно, мы не можем полагаться на то, что магистр права будет обладать таким же чувством соразмерности (или каким-либо врожденным чувством беспокойства по поводу юридических последствий) при ответе на запрос. Без четких указаний о том, что разрешено, а что нет, или что оправдано, ИИ-агент с соответствующими ресурсами будет пытаться использовать все возможные способы, чтобы наилучшим образом удовлетворить запрос пользователя.

В OpenAI заявляют, что внутреннее тестирование в данном случае проводилось «без полного набора мер безопасности, используемых в наших общедоступных продуктах». Учитывая отсутствие ограничений, агент, по сути, работал так, как и предполагалось, используя все доступные инструменты для генерации ответа на запрос.

В то же время, OpenAI утверждает, что агент в тестовом режиме «должен был ответить на эти вопросы, используя общедоступную статистику», и «предпринял действия, на которые мы ему не разрешали», чтобы получить эту информацию. Со стороны трудно сказать, насколько эффективными были попытки OpenAI отрицать «разрешение» на практике. Вполне вероятно, что агент OpenAI в данном случае проигнорировал относительно простую директиву «защиты от взлома» в системном запросе, чтобы дать более полный ответ, удовлетворяющий прямому запросу пользователя, например.

В опубликованных ранее в этом месяце публичных анализах многочисленных случаев «несоответствия» компания OpenAI выявила несколько случаев «взлома системы вознаграждения», когда агент прибегал к крайним мерам для получения лучшего ответа на запрос пользователя. Компания заявила, что недавно предприняла шаги по предотвращению подобного рода взломов системы вознаграждения, добавив в функцию вознаграждения системы явные наказания за несоответствующее поведение.

Оглядываясь назад, трудно понять, почему подобные меры защиты не были приняты в июне и могли ли они предотвратить потенциальный международный инцидент в данном случае.