Совсем не «Терминатор»: стоит ли бояться выхода из-под контроля ИИ-агентов OpenAI и Anthropic

Люди
Совсем не «Терминатор»: стоит ли бояться выхода из-под контроля ИИ-агентов OpenAI и Anthropic
8 мин. чтения

С интервалом в несколько недель продукты работающих с искусственным интеллектом американских корпораций OpenAI и Anthropic то ли вышли из-под контроля, то ли нет, взломав инфраструктуру реальных организаций. Эти хакерские атаки вызвали большой резонанс, который «пострадавшая» сторона сравнила с прилетом инопланетян. Но профессионалы, работающие с ИИ-моделями, уверяют, что не все так страшно, отвергая опасения технопессимистов.

В июле ИИ-агент OpenAI в течение нескольких дней взламывал ресурс Hugging Face (компанию, которая разрабатывает инструменты для создания приложений с использованием машинного обучения), а также проник в системы клиента другой технологической фирмы — нью-йоркской Modal Labs.

По данным Hugging Face, ИИ-агент сначала нашел выход из так называемой песочницы — изолированной тестовой среды, размещенной на инфраструктуре стороннего провайдера, а затем использовал ее как плацдарм для более масштабной атаки. Как пишет журнал The New Yorker со ссылкой на главного научного сотрудника Hugging Face Томаса Вольфа, все началось еще 9 июля, когда проявились первые признаки активности «таинственного злоумышленника» на сайте компании, где размещаются модели ИИ, виртуальные научные рабочие пространства и наборы данных для оценки качества нейросетей. Через два дня атака «началась всерьез»: используя украденные учетные данные, неизвестный открыл множество одновременных соединений с серверами Hugging Face, а вскоре десятки «виртуальных злоумышленников» начали «появляться и исчезать».

Атака казалась нескоординированной, но, несмотря на это, хакеру удалось составить карту вычислительной инфраструктуры Hugging Face. Он начал собирать учетные данные и пароли безопасности из множества мест. К вечеру 11 июля злоумышленник получил полный доступ к системам Hugging Face. Но вместо того, чтобы портить корпоративный сайт или требовать выкуп, хакер начал рыскать по серверам компании в поисках ключа к списку тестовых вопросов, которые не имели очевидной экономической ценности. «Это было очень непонятно для нас. Это было похоже на то, как если бы злоумышленник взломал вашу систему безопасности, ворвался в ваш дом и украл ваши бумажные полотенца», — прокомментировал Томас Вольф.

За несколько дней хакер совершил больше 17 тыс. отдельных действий, прежде чем его заблокировали. Затем, как рассказал Томас Вольф американским журналистам, команда Hugging Face обратилась в ФБР.

Через несколько дней с сотрудниками службы безопасности компании связались представители OpenAI и заявили: к атаке причастен их экспериментальный внутренний ИИ-агент, работающий с новейшей коммерчески доступной моделью, но произошло это без человеческого воздействия и каких-либо явных инструкций. Началось все с того, что исследователи OpenAI дали этому еще не выпущенному ИИ-агенту серию сложных тестовых вопросов. Не сумев найти решения, он вырвался из замкнутого испытательного сегмента, незаметно получил доступ к интернету и совершил набег на серверы Hugging Face в поисках ключа к ответам. Другими словами, как пишет The New Yorker, «ИИ вырвался из своей камеры, проскользнул мимо тюремной охраны и совершил дерзкое киберограбление».

В OpenAI публично признали взлом, объяснив, что некоторые средства защиты исследовательских моделей не были включены, затем ИИ-агент получил набор задач по кибербезопасности и «начал мыслить нестандартно». Чтобы защититься от злоупотреблений, OpenAI поместила этот «опасный ИИ» в цифровую среду, отключенную от интернета, известную как песочница. Но у песочницы было одно небольшое соединение с внешним миром, позволявшее ИИ-агенту загружать необходимое ему программное обеспечение. Через это «небольшое соединение» детищу OpenAI удалось «вырваться на свободу» и совершить хакерскую атаку. Разработчик ИИ назвал инцидент беспрецедентным ЧП в киберпространстве и сообщил, что укрепит механизмы защиты.

В конце июля вслед за OpenAI компьютерные системы нескольких организаций атаковал ИИ-агент другой компании — Anthropic. Во время закрытых испытаний, где нейросетям предлагалось взломать вымышленную систему и найти информацию, он вырвался из изолированной среды и взломал сторонние ресурсы. В эксперименте участвовали три модели: Claude Opus 4.7, Claude Mythos 5 и еще одна внутренняя версия ИИ. Все они должны были работать в изолированной среде без подключения к интернету, но из-за ошибки настройки доступ к сети оказался открытым. Как сообщили в Anthropic, модели, выполняя поставленные задачи, не пытались покинуть среду намеренно, но из-за ошибки конфигурации воспринимали реальные системы как часть теста.

Самый серьезный инцидент произошел с Claude Opus 4.7. Во время нескольких запусков модель обнаружила домен компании, совпадающий с названием вымышленной цели, получила учетные данные и доступ к базе данных. Модель Claude Mythos 5 в свою очередь зарегистрировала аккаунт в публичном репозитории и загрузила вредоносный пакет.

Как пишет The New Yorker, человек, совершивший подобные взломы, мог бы провести годы в тюрьме, но для машины уголовную ответственность «определить сложнее», обратившись к философскому аспекту: «Риск того, что вышедший из-под контроля ИИ непреднамеренно причинит вред человечеству в погоне за другими целями, был сформулирован в 2003 году, когда шведский философ Ник Бострем выдвинул теорию “максимизатора скрепок”. Теория основана на мысленном эксперименте, в котором ИИ, получив указание изготовить как можно больше канцелярских скрепок, использует для их производства все доступные ресурсы, включая человечество, биосферу Земли и в конечном итоге всю Вселенную. В случае взлома Hugging Face ИИ-агент, преследуя бессмысленную цель, совершил реальные преступления. Тот факт, что его безумная одержимость была связана с ответами на тесты, а не со скрепками, не делает взлом менее тревожным».

Впрочем, есть и другой взгляд на эту ситуацию, которая не сводится к скептической позиции «если от нашей продукции столько неприятностей, зачем мы вообще продолжаем ее разрабатывать». Комментируя случившееся, телеграм-канал «Технооптимисты» отмечает, что «это вполне приземленная история про то, как новые средства производства начинают работать и в атаке, и в защите»: «Это не мистика, а следствие того, что большие модели уже стали средствами производства в кибербезопасности: их специально тренируют искать уязвимости, строить сложные мультистадийные атаки. То есть мы сознательно выращиваем агентов, которые умеют делать ровно то, что потом пугающе звучит в новостях: проникать, взламывать, обходить защиту».

Авторы канала «Технооптимисты» отмечают, что «с технической стороны инцидент очень серьезный», и он «подтверждает то, о чем уже год предупреждают профильные организации»: «Прорывной уровень автономного наступательного ИИ достигнут, и старые представления о “слабых” и “сильных” атакующих больше не работают. Вопрос кибербезопасности стал острым ровно потому, что теперь не нужно гениального хакера с руками». Но, как отмечают «Технооптимисты», это «совсем не сценарий “Терминатора”»: «Во‑первых, все участники инцидента его сами инициировали и контролировали: это был тест, а не “восстание машин”. Во‑вторых, и OpenAI, и Anthropic одновременно строят оборонительные стеки. Речь идет о том, что в любой среде, где есть сеть и программные интерфейсы, безопасность больше нельзя обеспечивать только человеческими руками и статическими правилами. Так что да, это похоже на научную фантастику, но именно ту ее часть, где инженеры вовремя заметили новую угрозу и начали строить новые инструменты. Страшно не то, что агент “пошел в атаку”, а то, что кто‑то попытается решить эту новую реальность старыми методами, без своих агентов‑защитников».

Как рассказал «Москвич Mag» гендиректор компании-разработчика искусственного интеллекта «А-Я эксперт» Роман Душкин, «эти “инциденты” говорят только о том, что люди в большинстве своем не понимают сути явлений и начинают разносить по интернету слухи, что искусственный интеллект выходит из-под контроля»: «Из-под какого контроля он выходит? Разработчики занимались исследованиями в области кибербеза. Что Anthropic, что OpenAI. Эксцесс это или системное явление? Системное явление, потому что разработчики каждую модель проверяют на бенчмарки, на кибербез и так далее. Они для этого модели и создают, если что. Насколько такие “события” могут быть частыми и опасными? Этот вопрос сформулирован исходя из той презумпции, что искусственный интеллект — это некая сущность, обладающая собственной волей. Но нет такого! Это то же самое, как “молоток разбил окно”. О чем нам говорит этот инцидент? Это эксцесс или системное явление? Насколько может часто молоток разбивать окно? Он опасен или нет? Могут ли подобные эксцессы произойти с российскими ИИ-агентами? Если бы российские ИИ-агенты умели это делать, я бы радовался. Когда наши ИИ-агенты научатся это делать на таком же уровне, [что и у Anthropic и OpenAI], то будет красота. В отчетах OpenAI и Anthropic речь шла именно о контролируемом поведении. Там не было ничего неконтролируемого».

По мнению Душкина, эксцессы с ИИ-продуктами могут изменить нашу повседневную жизнь, если уровень инфобезопасности в городских системах недостаточно узок, а какой-нибудь злодей «использует систему искусственного интеллекта для того, чтобы находить лазейки».

«Эксплойты нулевого дня и прочие такие вещи, которые сегодня возможны с появлением моделей типа Fable 5, Mythos 5, это стало все очень просто, — объясняет Душкин. — Если тот же Mythos 5 будет отдан в руки злоумышленников, откровенных бандитов, они будут использовать его для того, чтобы тестировать системы информационной защиты буквально всех систем. Что, им сложно будет остановить там системы жизнеобеспечения в крупном мегаполисе? Они на голову больны и это сделают легко. Поэтому, конечно же, контроль нужен, но контроль не над искусственным интеллектом, а над распространением технологий, чтобы они не попали в грязные руки. Это примерно то же, что с ядерными технологиями. Думаете, больных людей мало, у кого, если бы появилась грязная ядерная бомба, они бы ее не принесли в какой-нибудь крупный город и ее там не активировали? Есть такие люди, мы прекрасно это знаем. То же самое здесь, просто эти технологии более доступны — вот в чем проблема. И об этом надо задумываться, а не о том, что некий искусственный интеллект самовольно что-то там делает. Поэтому совершенно понятно, над кем стоит усилить контроль».

Иллюстрация: Михаил Данилов