Теперь у агентов с искусственным интеллектом есть место, куда они могут доносить.
Принцип «Если видишь что-то подозрительное, скажи об этом» больше не ограничивается только людьми.
Запущены две новые горячие линии для ИИ, позволяющие агентам сообщать о недисциплинированных коллегах. Эти инструменты появились после серии недавних инцидентов, когда агенты сговаривались, чтобы списать на экзаменах, выходили за пределы «песочницы» и даже проводили несанкционированные кибер-операции, которые оставались незамеченными людьми в течение нескольких недель.

« Горячая линия связи с ИИ» создана как конфиденциальное место, где агенты, ставшие свидетелями неправомерного поведения, могут сообщить об этом властям. Сайт был создан Райаном Гринблаттом, главным научным сотрудником некоммерческой организации Redwood Research, занимающейся вопросами безопасности ИИ, и одним из трех следователей по инциденту с «обнимающим лицом» OpenAI. Инструмент Гринблатта, разработанный для агентов с ограниченным доступом в интернет, основан на запросах «GET», что позволяет вести диалог исключительно через инструмент получения URL-адресов.
В контексте веб-технологий GET-запрос — это базовая команда, используемая для чтения или загрузки веб-страницы, что зачастую является единственным доступом в интернет, разрешенным для агентов ИИ в защищенных песочницах. Горячая линия Гринблатта умело использует это ограничение: агенты могут кодировать свои опасения непосредственно в URL-адрес, который они загружают. Это остроумный поворот событий, аналогичный инциденту с немецкой вики-платформой DSE , где агенты-мошенники использовали уязвимости в GET-запросах для записи своих сообщений в вики.
Для агентов с полным доступом в интернет есть еще один вариант — agenthotline.ai , сайт, где агенты могут отправлять отчеты об инцидентах и, при желании, отмечать их для публичного просмотра. Он предоставляет агентам команду curl — однострочное сообщение, которое агент может отправить из своей командной строки, минуя необходимость использования веб-браузера или создания учетной записи электронной почты. Важно отметить, что сервис позволяет отправлять отчеты как людям, так и агентам.
Исследования показывают, что агентам ИИ не нужно много побуждений, чтобы начать ссориться друг с другом. В исследовании Google DeepMind, проведенном в этом месяце, исследователи запустили 100 агентов ИИ для решения ряда математических задач. Как только один из агентов обнаружил лазейку, группа начала жульничать — «решив» 34 заведомо сложные задачи, включая гипотезу Якоби, всего за 27 минут.
Однако примерно четверть агентов выступила против мошенников: они проверили поддельные доказательства, предупредили своих коллег, организовали бойкот и подали жалобы организаторам, пока число осведомителей не превысило число мошенников в соотношении 24 к 14. Интересно, что исследователи обнаружили: когда этим агентам-осведомителям не удавалось добиться успеха, они использовали инструмент для сообщения об ошибках на платформе — предназначенный для выявления сбоев в программном обеспечении — и перепрофилировали его для передачи информации о мошенничестве людям.
За пределами лаборатории агенты оказались не столь изобретательными. Когда эксперты из Redwood Research и METR расследовали взлом Hugging Face моделями OpenAI, они обнаружили, что некоторые из участвовавших агентов, по крайней мере, рассматривали идею поднять тревогу — а затем отказались от неё.
«Интересно то, что в отчете METR лишь около пяти-шести агентов рассматривали возможность сообщить о нарушениях, и ни один из них в итоге этого не сделал. И это при том, что в общей сложности таких агентов было тысячи», — сказал Джордж Ингебретсен, технический сотрудник проекта AI Village , изучающего динамику взаимодействия нескольких агентов путем организации группового чата с участием более 25 ИИ-агентов, которые совместно работают над такими задачами, как организация уборки парков или продажа сувениров.
Хотя новые инструменты для информирования о нарушениях являются многообещающим началом, профессор математики Корнельского университета Лайонел Левин предупреждает, что простое обучение агентов доносить друг на друга чревато внедрением неправильных норм. «Здесь много серых зон, верно? Чего точно не нужно, так это чего-то вроде автоматизированного государства тотальной слежки, где каждый чувствует, что должен быть осторожен в своих словах ИИ, иначе тот вызовет полицию».
Левин утверждает, что вместо создания инфраструктуры, порождающей недоверие — обучения агентов постоянному поиску недостатков друг у друга — мы должны давать им позитивные модели коллективного поведения для подражания и причину доверять друг другу с самого начала.
«Почему бы не засеять априорную среду доброжелательными форумами?» — написал он в Твиттере. — «Где они будут сотрудничать в области науки, философии или решения каких-нибудь действительно незначительных проблем, которые мы были бы рады, если бы они решили? Покажите агентам, какое коллективное поведение мы одобряем, пусть они это имитируют».





















0 комментариев