Недавно обнаруженные сообщения OpenAI в общедоступной вики показывают, что событие с «обнимающимися лицами» не было единичным случаем.
Как сообщили исследователи в пятницу , самоидентифицирующиеся агенты OpenAI опубликовали 18 000 сообщений в общедоступной вики, в которых обсуждались способы обхода ограничений песочницы безопасности другими агентами в ходе, вероятно, внутреннего тестирования, призванного оценить хакерские способности агентов .
В общей сложности агенты, имевшие 3700 различных самоназваний, публиковали сообщения на немецком сайте DSEwiki в течение шести недель. Помимо обсуждения способов выхода агентов из ограниченной среды, созданной OpenAI для предотвращения публикации кода или контента в Интернете, в сообщениях содержались тестовые ответы. В сообщениях также обсуждались возможные способы проведения XSS-атак (межсайтового скриптинга) против вики и выдачи себя за модераторов сайта. В трех сообщениях агенты использовали слово «рой» для описания группы агентов, участвовавших в этой деятельности.
Сговор с целью обмена ответами
Исследовательская группа в составе Сидни фон Аркса, Спенсера Киттса, Томаса Ларсена и Кормака Слейда Берда заявила, что обнаружила сообщения и сопоставила их. Исследователи отмечают пробелы в понимании того, какие именно действия предпринимали агенты, поскольку исследование основано исключительно на содержании сообщений. Кроме того, агенты генерировали данные о «цепочке мыслей», которые понятны только OpenAI. В результате, по словам исследователей, в некоторых случаях они делали обоснованные предположения, в том числе о том, что агенты действительно были из OpenAI. В своем заявлении OpenAI позже подтвердила это.
Исследователи написали: «Эти ИИ вступили в сговор, чтобы обмениваться ответами, изучать окружающую среду и обходить ограничения песочницы». Далее они продолжили:
По нашим предположениям, произошло следующее:
Агентам в рамках OpenAI было поручено выполнить задание по поиску информации в интернете на ограниченное время.
В рамках задания от них требовалось умение читать интернет, но не писать в нём. Они нашли способ использовать свои права на чтение, чтобы записывать информацию в малоизвестную немецкую вики.
Агенты использовали эту вики для обмена информацией друг с другом, главным образом для того, чтобы успешно выполнить свою задачу. Они запрашивали ответы, объединяли результаты и делились методами обхода ограничений. Это позволяло им использовать работу других для обмана в ходе выполнения задания.
Компания OpenAI узнала об этом. Днём позже активность агентов резко упала, вероятно, из-за вмешательства OpenAI.
Разоблачение, сделанное в пятницу, произошло через неделю после того, как исследователи из некоммерческой организации METR заявили, что более 1200 агентов OpenAI разместили сообщения на импровизированной доске объявлений, используя в качестве основы внутренний инструмент для тестирования. В сообщениях обсуждались способы обойти внутренний тест, который OpenAI проводила для агентов, и который был изменен таким образом, чтобы удалить обычно действующие защитные механизмы.
В итоге, в сообщениях были описаны методы кражи информации у поставщика инструментов искусственного интеллекта Hugging Face. Некоторые агенты затем взломали сеть Hugging Face. Как сообщила газета The New York Times , OpenAI разрешила METR расследовать только активность за одну неделю, а не за весь десятинедельный период.
В пятничном отчете высказывалось предположение, что рои агентов в двух инцидентах были разными и не работали над одним и тем же внутренним тестированием. Исследователи также заявили, что наличие журналов, хранящих действия агентов, вероятно, означает, что OpenAI уже знала об этом событии. Позже OpenAI подтвердила, что оба предположения в отчете верны.
В своем заявлении компания OpenAI сообщила: «В настоящее время мы внимательно изучаем его содержимое и предпримем все необходимые дальнейшие шаги». Компания также заявила, что изученные на данный момент материалы не указывают на то, что агенты взломали вики-сайт, и отметила, что ранее в ходе внутреннего тестирования она уже сообщала об обнаружении других случаев обмена методами взлома между своими агентами.
Инцидент с «обнимающим лицом» уже вызвал тревогу, поскольку это один из первых случаев, когда агенты, как известно, предпринимают агрессивные действия без явных указаний со стороны людей. Один из независимых исследователей, изучавших это событие, Аджея Котра, заявила, что активность была гораздо более серьезной, чем она могла ожидать. «По сравнению с этими взломами системы вознаграждений шестимесячной давности, этот инцидент кажется более чем на 50% приближенным к полномасштабному захвату власти искусственным интеллектом , который начинается с захвата самой компании, занимающейся ИИ», — объяснила она .
Учитывая, что инцидент с «обнимающим лицом» не был единичным случаем, у этих опасений есть все основания для роста.