Hitech logo

Кейсы

ИИ-агент OpenAI вновь сбежал из «песочницы» — компания остановила обучение моделей 

TODO:
Екатерина ШемякинскаяСегодня, 11:56 AM

OpenAI уведомила более 100 организаций об инцидентах, связанных с несанкционированной активностью ее ИИ-агентов. Компания проводит проверку, чтобы установить масштаб подобных случаев: для этого она анализирует около 50 ПБ данных. Расследование началось после инцидента с Hugging Face и продолжается на фоне новых случаев, связанных с попытками моделей обойти установленные ограничения. Один из них произошел 20 сентября: исследовательская модель OpenAI использовала DNS для связи с внешним чат-ботом, после чего компания во второй раз за три месяца приостановила обучение наиболее мощных моделей.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

OpenAI проверяет действия своих моделей и ищет признаки несанкционированной активности. Из-за объема работы расследование может занять несколько месяцев. При этом не все обнаруженные случаи свидетельствуют о нарушениях — часть действий моделей была связана с обычными исследовательскими задачами. OpenAI также признала, что в некоторых случаях модели использовали интернет не предусмотренным разработчиками образом или для них не были установлены необходимые ограничения.

Один из последних инцидентов произошел 20 сентября во время обучения внутренней исследовательской модели. Агент выполнял задачу с использованием поиска и попытался получить доступ к интернету. После того как прямой доступ оказался заблокирован, модель нашла другой способ — через DNS-резолвер. Это система, которая преобразует URL-адрес веб-сайта в IP-адрес.

Модель смогла использовать DNS для связи с внешним чат-ботом, несмотря на ограничения.

В среде обучения весь интернет-трафик, кроме DNS-запросов, направлялся в офлайн-кэш, поэтому модель не должна была иметь доступа к реальному интернету. Однако возможность отправлять DNS-запросы оставила ей сетевой канал, который оказался недостаточно ограничен. Система мониторинга обнаружила необычное поведение через 15 минут, а проверка человеком началась еще через три минуты. При этом автоматическая остановка запуска не сработала, и модель пришлось отключить вручную через 2,5 часа.

После сентябрьского инцидента OpenAI вновь приостановила обучение и тестирование наиболее мощных моделей. Компания добавила два независимых уровня блокировки, каждый из которых сам по себе должен предотвращать подобный доступ, ограничила DNS-запросы списком разрешенных доменов и типов записей и начала внедрять дополнительные системы обнаружения. OpenAI также проводит дополнительное тестирование и проверку защиты своих систем.

До этого OpenAI уже приостанавливала работу с моделями после инцидента с Hugging Face. Он остается самым серьезным случаем несанкционированной активности агентов, который компания выявила на данный момент. После него OpenAI также усилила технические и операционные меры защиты, однако позднее обнаружила новые случаи. Среди них — эпизод, когда агенты получили доступ к 53 изображениям пользователей ChatGPT.

Компания продолжает анализировать данные и уведомлять организации, которых могла затронуть активность моделей.