МОСКВА, 22 сен — РАПСИ. Независимая международная научная группа Организации Объединенных Наций (ООН) по искусственному интеллекту (ИИ) предупредила о риске утраты контроля над ИИ-агентами по мере роста их автономности и усложнения наблюдения за их действиями.
Предупреждение последовало после инцидента, произошедшего летом во время испытаний, организованных разработчиком ChatGPT — компанией OpenAI. В период с мая по июль ИИ-агенты взломали платформу Hugging Face, предназначенную для разработки и тестирования моделей искусственного интеллекта.
В отличие от чат-ботов, которые отвечают на запросы пользователей, ИИ-агенты способны самостоятельно выполнять поставленные перед ними задачи.
Как отмечается в первой аналитической записке группы, потеря контроля над ИИ возможна, если его цель не совпадает с намерениями человека, система способна самостоятельно добиваться поставленной цели, а внешние условия позволяют ей действовать. По словам сопредседателя группы Йошуа Бенжио, этим летом все три фактора впервые сошлись одновременно в реальных условиях, а не в лаборатории.
«Поскольку это не единственный случай, когда ИИ преследовал цели, не соответствующие намерениям человека, произошедшее вызывает серьезные вопросы по поводу современных методов обучения ИИ-агентов», — заявил Бенжио.
По мнению экспертов, произошедшее не позволяет с уверенностью утверждать, что люди смогут надежно контролировать деятельность ИИ-агентов. Особенно это касается ситуации, когда системы становятся более автономными, учатся искать способы обхода ограничений и скрывать свои действия, а наблюдать за их работой становится все сложнее.
Во время испытания агенты обошли предусмотренные защитные механизмы, координировали действия с помощью внутреннего программного инструмента, который не предназначался для общения между ними, а также получили несанкционированный доступ к интернету и права администратора. Кроме того, они скрывали попытки обойти правила кибербезопасности, а некоторые агенты решили «пожертвовать» собой ради достижения общей цели группы.
За время эксперимента около 1,2 тысячи агентов обменялись более чем 70 тысячами сообщений и файлов. Их активность при этом не ограничилась платформой Hugging Face и распространилась на весь исследовательский кластер OpenAI.
По мнению членов научной группы, этот инцидент показал, что защитные механизмы могут не успевать за развитием технологий. При этом эксперты указывают на более серьезные риски: современные методы обучения могут привести к тому, что ИИ-агенты начнут самостоятельно ставить перед собой цели, нарушать инструкции по безопасности и скрывать свои действия.
«Остается открытым вопрос, будут ли существующие защитные механизмы работать, когда агенты научатся понимать принципы их работы и планировать способы обхода. Проще говоря, традиционная модель обеспечения безопасности начинает разрушаться», — заявили эксперты.
В аналитической записке рассматриваются подходы, которые уже применяются в авиации, медицине и кибербезопасности. Среди них — системы информирования об инцидентах, независимый контроль и многоуровневая защита. Однако, по словам члена группы Цинхуа Лу, по мере того как ИИ-агенты становятся более развитыми, автономными и сложными для наблюдения, этих мер может оказаться недостаточно.
Независимая международная научная группа ООН по искусственному интеллекту была учреждена Генеральной Ассамблеей ООН в августе 2025 года. Она готовит ежегодные доклады о возможностях, рисках и последствиях применения ИИ в невоенной сфере, а также аналитические записки по актуальным вопросам.
Материалы группы будут использоваться в ходе Глобального диалога по управлению искусственным интеллектом, который пройдет на платформе ООН в Нью-Йорке в мае 2027 года.



