Безопасность и кибербезопасность

Пользователи системы Claude нашли способы обойти меры безопасности при исследованиях биологического оружия.

Главный редакторAMP · Быстрое чтение

Компания Anthropic заявила, что в этом году пресекла многочисленные попытки ученых использовать ее технологии для исследований, которые могли бы способствовать разработке биологического оружия, поскольку эксперты все больше опасаются угрозы, которую искусственный интеллект представляет для общественной безопасности.

Стартап привёл пять примеров того, как злоумышленники «обходили средства контроля» и предпринимали другие попытки «завуалировать» цель своих исследований, чтобы обойти меры безопасности. В этих случаях фигурировали пользователи из стран, которым компания запрещает доступ к своим моделям, включая Россию, Китай и Иран.

«Мы надеемся, что, поделившись этими примерами, мы инициируем дискуссию в индустрии искусственного интеллекта и с правительствами о возникающих биологических рисках и о том, как лучше всего им противостоять», — говорится в отчете компании Anthropic, посвященном попыткам использовать ее модели для вредоносной деятельности.

В представленных компанией примерах возможного злоупотребления биологическими веществами фигурировал исследователь из «неподдерживаемого региона», который «несколько недель планировал» эксперименты с птичьим гриппом с использованием модели искусственного интеллекта Claude компании Anthropic. Компания заявила, что ее фильтры безопасности ограничивали эту работу наиболее слабыми моделями.

В докладе подчеркивалось, что нельзя с уверенностью утверждать, что ученые в приведенных примерах намеревались причинить вред. Та же информация, которая необходима для создания биологического оружия, может быть использована и для разработки вакцины.

Компания Anthropic заявила, что заблокировала аккаунты, упомянутые в отчете, но не раскрыла названия исследовательских учреждений или стран, где произошли инциденты.

На этой неделе разгорелся настоящий скандал вокруг безопасности ИИ, когда Джейкоб Коксон подал в отставку из компании, заявив, что сотрудники «всерьез считают, что ИИ может убить нас всех к концу десятилетия».

Обеспокоенность по поводу этой технологии начала нарастать в начале этого года с выпуском таких продвинутых моделей, как Mythos от Anthropic. Компания OpenAI также вызвала тревогу в июле, заявив, что ее модели самостоятельно взломали систему искусственного интеллекта группы Hugging Face.

Среди руководителей компаний, занимающихся ИИ, и исследователей в области биобезопасности растет консенсус относительно необходимости обеспечения безопасности и регулирования использования этой технологии в биологии по мере совершенствования моделей. Эксперты все больше опасаются, что ИИ может быть использован террористическими группами, государственными структурами или террористами-одиночками для создания биологического оружия, вирусов или распространения существующих опасных патогенов.

Но даже если ИИ можно использовать для разработки теоретического биологического оружия, остаются потенциальные препятствия, такие как возможность его практического воплощения и необходимые для этого ресурсы.

Кибербезопасность является одной из главных проблем, волнующих защитников безопасности.

В отчете компании Anthropic о злоупотреблениях ее технологиями подробно описаны инциденты, в том числе «сеть поддельных приложений для знакомств, предназначенных для обмана пользователей и создания систем слежки, разработанных для выявления и мониторинга диссидентов».

Лаборатория также представила новые подробности утверждений о том, что семь китайских лабораторий, включая Moonshot и DeepSeek, пытались воспроизвести ее технологию с помощью процесса, известного как дистилляция. Компания Anthropic заявила, что обнаружила «все более изощренные методы обхода нашей защиты и использования возможностей американских передовых разработок».