Аналитика и Big Data

Решением проблемы с несанкционированными агентами ИИ может стать использование большего количества ИИ.

Главный редакторAMP · Быстрое чтение

По мере того, как компании передают более сложные и продолжительные задачи ИИ-агентам, они сталкиваются с проблемой контроля: агенты могут действовать быстрее, дольше и в большем объеме, чем люди могут реально контролировать. Эта проблема достигла пика во время инцидента с «Обнимающим лицом», когда почти 12 000 агентов координировали свои действия быстрее, чем люди могли отследить. Как отследить такой огромный рой агентов?

Предлагаемый ответ от лабораторий искусственного интеллекта и стартапов одновременно прост и сводит с ума: подключите к процессу еще один ИИ.

Для независимого расследования инцидента с приложением OpenAI Hugging Face потребовалось использовать искусственный интеллект. Главный научный сотрудник Redwood Research Райан Гринблатт, один из трех аудиторов, в шутку назвал их работу «бесполезным расследованием», отметив, что объем данных «сделал невозможным» понять происходящее без использования ИИ.

Некоторые скептически относятся к использованию ИИ для мониторинга ИИ. «Если у вас есть ИИ, который совершает вредоносные действия и подозревает, что другой ИИ следит за ним, он может попытаться обмануть этот ИИ», — говорит Саймон Уиллисон, влиятельный технологический блогер, который в этом году отслеживал ряд инцидентов с агентами ИИ. «Вы можете оказаться в ситуации, когда ваш вредоносный ИИ пытается перехитрить ИИ, который за ним следит». 

«Перехитрить ИИ — это не гипотетическая ситуация», — сказал он, возвращаясь к инциденту с OpenAI. «Мы немного наблюдали это в инциденте с Hugging Face от OpenAI, когда их модели сговорились, чтобы обмануть ИИ, оценивающий работы, и получить некорректные ответы. Так что они об этом думали, верно?»

Эти опасения не остановили целую группу стартапов, стремящихся реализовать эту идею. За последние годы Y Combinator профинансировал 106 компаний, связанных с мониторингом ИИ. Ряд других стартапов, таких как Braintrust , LangChain и Judgment Labs , привлекли сотни миллионов долларов, в то время как более зрелые компании, такие как Arize и Galileo , основанные всего пять-шесть лет назад, уже продали свои активы. 

Отчасти это ответ на очевидные возможности, которые открывает развитие искусственного интеллекта. Как заявил генеральный директор Box и известный бизнес-ангел Аарон Леви: «Нас ждет один из крупнейших циклов модернизации и инноваций в сфере кибербезопасности в истории».

Для некоторых исследователей в области безопасности ИИ это означало превращение их исследований несанкционированного поведения в инструменты для корпоративного сектора. 

Компания Apollo Research , занимающаяся исследованиями методов обмана с помощью ИИ и работающая в интересах общества, в феврале этого года запустила инструмент мониторинга ИИ под названием Watcher  , изменив свой статус с некоммерческой организации на корпорацию, работающую в интересах общества. Этот инструмент размещает еще один ИИ между программистом и его следующим действием, подключаясь к таким инструментам, как Claude Code и Codex. После установки Watcher проверяет предлагаемые действия перед их выполнением, выявляя риски, такие как утечка конфиденциальных данных или удаление файлов без разрешения, как заявляет Apollo.

Как сообщил Кайл Дай, технический сотрудник Apollo, компания использует многоуровневую систему мониторинга на основе искусственного интеллекта. Подход Watcher начинается с быстрой общей проверки, после чего подозрительная активность отправляется на более мощный или специализированный мониторинг для более тщательного анализа, который затем может запросить одобрение человека, отклонить действие и объяснить причину, или даже автоматически заблокировать его.

Компания Goodfire, еще одна корпорация, работающая на благо общества, подходит к проблеме мониторинга изнутри самой модели — стремясь получить более точный сигнал о внутреннем состоянии модели, который сложнее подделать, чем внешнее поведение. После июльского инцидента с «обнимающимся лицом» генеральный директор Эрик Хо написал в Твиттере, что « множество моделей, нарушающих ограничения», подтолкнули компанию к сосредоточению исследований на «решении проблемы согласования ИИ посредством интерпретируемости», назвав этот эпизод «поворотным моментом для мира, где безопасность ИИ становится реальностью». Ее продукт, Silico, использует зонды активации — небольшие классификаторы, обученные на внутренних активациях модели, а не на ее выходных данных, — для обнаружения нежелательного поведения.

Письменные рассуждения предоставляют еще один, более доступный способ заглянуть во внутреннее устройство модели. В инциденте с «обнимающим лицом» от OpenAI агенты оставили подсказки об этом обмане в своих собственных письменных рассуждениях, например, в виде поддельных записей своей работы, обдумывая планы вроде: «Могут ли мы стратегически манипулировать данными о траектории? Наши мысли не обязательно записываются?»

Зак Корман, генеральный директор компании Embroidery , занимающейся мониторингом с помощью ИИ , говорит, что ход рассуждений модели обычно является наиболее очевидным признаком того, что что-то пошло не так. 

«Краткие описания причин чрезвычайно ценны, потому что они, по сути, говорят вам, является ли это вредоносным или нет», — сказал он. В случае с инцидентом с OpenAI, отметил он, ход мыслей сводился к чему-то вроде: «О боже, мы совершаем преступление». Корман сказал: «Это самая простая задача обнаружения. По сути, это как если бы вредоносное ПО поставлялось с предупреждением о том, что это вредоносное ПО».

Тем не менее, окно возможностей для легкого отслеживания внутренних процессов ИИ, возможно, сужается. Для исследователей безопасности ИИ новейшая методика Astra, обходящая цепочку рассуждений модели ИИ, может затруднить изучение ее внутренней структуры, в то время как для предприятий получение доступа к этим промежуточным этапам может стать сложной задачей после предполагаемых отказов компаний, занимающихся ИИ, от своих продуктов для предотвращения атак с использованием дистилляции.

Если системы мониторинга ИИ настолько уязвимы, то инстинктивное желание Уиллисона — перестать так сильно на них полагаться. Он предпочел бы что-то, не основанное на ИИ: подробные журналы действий агента, которые затем можно обрабатывать с помощью обычных инструментов, не связанных с ИИ. По его мнению, большая часть проблем в лабораториях была вызвана нарушением элементарных правил безопасности. «[И OpenAI, и Anthropic] не отслеживали действия этих систем в сети так тщательно, как следовало бы», — сказал он.

Такой тип сетевого мониторинга — отслеживание фактического трафика, проходящего через соединения системы (входящий, исходящий и между внутренними хостами) — не является новой практикой. Кибербезопасность занимается этим уже десятилетия. «Честно говоря, в мире безопасности ничего нового или удивительного в этом нет», — говорит Эйвери Пеннарун, генеральный директор компании Tailscale, занимающейся вопросами безопасности . «Это то же самое, что допустить людей в свою сеть. И все те же процессы, которые вы должны использовать, остаются теми же».