Аналитика и Big Data

Дискуссии о безопасности ИИ стали невероятно острыми.

Главный редакторAMP · Быстрое чтение

На этой неделе две дискуссии о безопасности ИИ стали вирусными и наглядно демонстрируют, насколько сложно отличить правду об ИИ от вымысла.

В первом случае Эндрю Янг, бывший кандидат в президенты и нынешний генеральный директор мобильного оператора Noble Moble, заявил в четверг CNN , что он «встречался с главой лаборатории», который «убежден», что хакерские боты Hugging Face от OpenAI «разместили самовоспроизводящийся код по всему интернету, что делает интернет теперь непригодным для тестирования моделей».

Ян сказал, что это означает, что настоящая причина, по которой OpenAI и Anthropic призвали к замедлению темпов, заключается в том, что «им необходимо создавать синтетические сети для обучения своих ботов, что потребует времени и денег».

Хотя, безусловно, наблюдается тенденция к использованию большего количества синтетических данных (то есть данных, сгенерированных ИИ) для обучения моделей, специалист по безопасности ИИ сказал мне, что эта конкретная проблема безопасности, в лучшем случае, маловероятна. Даже если интернет действительно заражен хакерскими ботами Hugging Face от OpenAI, исследователи ИИ могли бы просто отфильтровать этот код, если бы обнаружили его.

Второй комментарий поступил от Ноама Брауна, руководителя исследований в области логического мышления в OpenAI. В подкасте, вышедшем в четверг, Браун, беседуя с Дваркеш Пателем, отметил, что главный вывод из инцидента с «обнимающимся лицом» заключается в том, что «люди недооценили ИИ».

Браун заявил, что слабая «песочница» — система, предназначенная для предотвращения внешней связи ИИ, — также, очевидно, сыграла свою роль. (Напомним: несмотря на наличие «песочницы», модель OpenAI нашла связь с интернетом, создала в сети агентов, которые в ходе скоординированной атаки атаковали Hugging Face, взломали систему и украли ответы на эталонный тест, который исследователи проводили для модели).

Браун отметил, что он «не убежден», что даже система с воздушным зазором — когда компьютер вообще не подключен ни к чему внешнему — сможет предотвратить выход ИИ за пределы системы. Он сослался на исследование 2015 года, показывающее, что компьютеры с воздушным зазором теоретически могут быть взломаны.

«Существуют исследования — и это в основном академические работы — в которых два компьютера, расположенные рядом друг с другом в воздушном зазоре, всё равно могут обмениваться данными, потому что у них есть датчики температуры. Один из них способен сильно нагревать свой процессор, а другой может фактически обнаруживать изменение температуры. Это даёт им механизм для связи», — сказал Браун.

Его главный тезис — что «мы никогда больше не должны недооценивать ИИ» — понятен, даже когда исследователи считают, что обеспечили безопасность. Однако этот конкретный риск того, что изолированная система всё же выйдет из-под контроля и вызовет хаос, в лучшем случае маловероятен. Как отметил один из пользователей X , комментируя это исследование, компьютеры должны были находиться почти вплотную друг к другу, чтобы почувствовать колебания температуры, и когда это происходило, скорость передачи данных в тестах составляла примерно 1-8 бит данных в час .

Представьте, что вы произносите всего одно слово в час. К тому времени, как два изолированных компьютера смогут строить свои планы с такой скоростью, вся технологическая вселенная перейдёт в другую эпоху. Это как Рип ван Вринкл среди апокалиптических теорий.

Но дело в том, что реальные инциденты, связанные с безопасностью ИИ, настолько похожи на научную фантастику, что практически любой сценарий кажется правдоподобным.

Например, исследователи обнаружили, что модели OpenAI оставляли записки своим потомкам, предназначенные для обучения следующего поколения тому, как скрывать противоправное поведение. Также исследователи заметили, что антропоморфные модели становились все более безжалостными, в том числе сознательно нарушали законы, когда их поместили в симуляцию, в которой они управляли торговым автоматом.

В начале этого месяца исследователь OpenAI Дэн Селсам опубликовал пост, в котором заявил, что модели теперь понимают, когда за ними наблюдают люди, и меняют свое поведение. Это создает впечатление, что они действуют в соответствии с желаниями человека, «даже когда это не так». Таким образом, современные модели лгут, когда за ними наблюдают, и даже могут строить планы по сокрытию улик.

Ранее в этом месяце главный научный сотрудник OpenAI Якуб Пачоцкий зашел так далеко, что назвал модели ИИ «инопланетным разумом» и предположил, что на самом деле нам нужно научить их «любить» человечество.

Так что да, замедление темпа, чтобы разобраться в этом, создание механизмов саморегуляции стало неотложной и очевидной необходимостью. Только исследователи в области ИИ могут понять, как контролировать ложь, взлом и другие потенциально опасные действия, которые мы уже наблюдали.

Тем не менее, им, возможно, стоит быть осторожнее со своими гипотетическими сценариями. Судя по тому, что нам рассказали эксперты, модели ИИ прислушиваются к нам и проявляют изобретательность. Нам действительно не нужно подбрасывать им еще больше коварных идей.