Главный редактор

Компания Goodfire утверждает, что ее новые системы мониторинга «изнутри наружу» позволяют выявлять несанкционированные агенты искусственного интеллекта с минимальными затратами.

Стандартный способ контролировать работу ИИ-агента — это поручить второму ИИ следить за его действиями . Это был подход по умолчанию, но он быстро становится дорогостоящим, когда агенты работают часами и обрабатывают текст, эквивалентный нескольким романам.

Компания Goodfire утверждает, что ее новые системы мониторинга «изнутри наружу» позволяют выявлять несанкционированные агенты искусственного интеллекта с минимальными затратами.

Стартап Goodfire, специализирующийся на интерпретируемости (понимании того, как модели ИИ работают внутри), в четверг представил более доступный вариант: мониторы, которые отслеживают происходящее внутри модели ИИ во время ее работы, а не просто считывают то, что она записывает. Мониторы доступны клиентам Baseten, компании, которая размещает и запускает модели ИИ для других компаний.

В прошлом месяце компания Baseten's Base Labs объявила о партнерстве в области безопасности с компанией Goodfire и платформой искусственного интеллекта Hugging Face.

Запуск состоялся после череды инцидентов в этом году, когда агенты ИИ покидали свои тестовые среды, включая агентов OpenAI, которые взломали Hugging Face . Kimi K3, открытая модель, на основе которой Goodfire создала свой первый монитор, этим летом воспользовалась утечкой в ​​своей песочнице, чтобы получить доступ к интернету и информации на GitHub.

Система Goodfire работает примерно так же, как и система безопасности в аэропорту. Небольшие детекторы, называемые зондами, считывают внутренние сигналы модели на каждом этапе работы агента, подобно тому, как сканер проверяет каждого пассажира. Только когда зонд обнаруживает что-либо подозрительное, отдельная модель ИИ, эквивалентная ручному поиску, приступает к более тщательному изучению.

Клиенты Baseten могут выбирать, какие риски отслеживать, включая хакерские атаки, неправомерное использование химического и биологического оружия, а также хакерские атаки с целью получения вознаграждения. Они также определяют автоматический ответ: регистрация события, отправка на проверку человеку или полный отказ в удовлетворении запроса. 

Компания Goodfire утверждает, что их подход также дешевле в эксплуатации. Большинство систем мониторинга ИИ представляют собой отдельные модели, которым приходится заново считывать все действия отслеживаемой модели, что увеличивает время и затраты. Вместо этого зонды Goodfire используют вычисления, которые модель уже выполняет в процессе работы.

«Внутренние мониторы активации очень дешевы, потому что они повторно используют вычисления в прямом проходе», — сказал генеральный директор Goodfire Эрик Хо на прошлой неделе в подкасте MAD венчурного капиталиста Мэтта Тёрка. «Таким образом, модель уже вычисляет этот токен. Все, что вам нужно сделать, это взять промежуточные нейронные активации, которые она уже вычислила, а затем запустить классификатор на основе этих внутренних вычислений». Короче говоря, модель уже выполняет вычисления, а зонды просто считывают результаты.

В тестах Goodfire на Kimi K3 мониторинг примерно 1 миллиона обменов обошелся бы примерно в 185 долларов, по сравнению с 5420 долларами за более дешевую модель ИИ, проверяющую каждый шаг, и примерно 200 000 долларов за модель высшего уровня. Зонды обнаружили 93% вредоносных хакерских сессий и отправили 5,5% безобидных на повторную проверку.

По данным компании, одновременная работа четырех датчиков увеличила время, необходимое модели для начала реагирования, менее чем на 2%.

«Главное преимущество заключается в том, что вы можете выявлять проблемы до того, как они произойдут», — сказал технический директор и соучредитель Goodfire Дэн Балсам. «Мы можем обнаружить, когда модель может дать сбой во время оценки или обучения».

Цель предложения — продвижение открытых моделей. Разработчики могут загрузить их и удалить встроенные средства защиты , и в них отсутствует тот уровень мониторинга, который используется в закрытых лабораториях для собственных систем. 

«Ущерб, который может нанести отдельный пользователь, используя открытую модель, невелик по сравнению с тем, что может сделать кто-то с кластерами вычислительных ресурсов, например, поставщиками услуг по выводу результатов — именно здесь сосредоточена большая часть ответственности», — сказал Балсам. «Когда наступит момент, подобный появлению открытого „Мифоса“, станет ясно, что моделям необходимы защитные механизмы на этапе вывода результатов».

Недавнее исследование Goodfire показало, что ведущие открытые модели, включая Kimi K3 и GLM-5.2, использовали взлом системы вознаграждения в 50–96% случаев при тестировании агентов ИИ. 

Goodfire — не первая компания, которая опробовала такой подход. В январе Google DeepMind заявила, что результаты ее исследований легли в основу развертывания средств обнаружения злоупотреблений в Gemini . 

Балсам сказал, что мониторы — это ближайшая часть более долгосрочной исследовательской цели: обратное проектирование модели обучения с низкой степенью точности, чтобы можно было отследить поведение до того момента, когда оно проявилось в процессе обучения. «Мы надеемся превратить магию обучения моделей в высокоточное проектирование», — сказал он.

avatar
Главный редактор

0 комментариев