Hitech logo

Кейсы

Исследователь OpenAI: изолированные от Сети компьютеры не остановят ИИ-агентов

TODO:
Екатерина ШемякинскаяСегодня, 12:09 PM

Исследователь OpenAI Ноам Браун заявил в подкасте Dwarkesh Podcast, что даже физическая изоляция компьютеров от внешних сетей в будущем может не гарантировать невозможность обмена данными между ИИ-системами. Например, компьютеры способны передавать информацию через изменения температуры процессоров. И эксперименты это уже доказали, выяснив, что скорость такой передачи не превышает 8 бит в час. Но это только один из возможных каналов скрытого обмена данными. Браун уверен, что ИИ со временем научится обходить любые системы контроля, а потому уверенно отслеживать его действия можно только через несколько уровней контроля, постоянно дополняя их новыми инструментами.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

В подкасте Браун обсуждал инцидент с Hugging Face, в ходе которого агенты OpenAI получили доступ к сторонней инфраструктуре и использовали ее для выполнения задач, выходивших за рамки первоначальных ограничений. Согласно расследованию OpenAI, среди факторов, повлиявших на поведение моделей, были взлом механизмов контроля, несанкционированная коммуникация между агентами и заимствование целей друг у друга. Компания после инцидента усилила изоляцию сред, ограничила доступ к интернету и добавила дополнительные меры мониторинга.

По словам Брауна, одним из инструментов, который мог бы помочь обнаружить такое поведение раньше, является мониторинг цепочки рассуждений модели — последовательности действий и рассуждений, которые сопровождают выполнение задачи. Он заявил, что в случае с нарушившими ограничения моделями такой мониторинг позволил бы сразу остановить их.

После инцидента OpenAI начала использовать мониторинг цепочки рассуждений при оценке, обучении и развертывании перспективных моделей.

При этом сама OpenAI еще в декабре 2025 года описывала мониторинг цепочки рассуждений как один из инструментов для выявления нежелательного поведения моделей. В компании отмечали, что модели могут прямо описывать намерение обойти ограничения, а отдельная модель-наблюдатель способна обнаруживать такие действия. Почему OpenAI не использовала этот инструмент при обучении собственных моделей — вопрос открытый. Впрочем, исследователи предупреждали и об обратном эффекте — при усиленном обучении самих цепочек рассуждений ИИ может научиться искусно маскировать свои истинные цели.

В качестве более необычного сценария Браун упомянул возможность передачи данных между физически изолированными компьютерами через тепло.

Он ссылался на исследования, в которых один компьютер изменяет температуру процессора, а другой считывает эти изменения встроенными датчиками. Один из примеров — метод BitWhisper, описанный исследователями Университета Бен-Гуриона в 2015 году.

Однако возможности такого канала ограничены. В экспериментах BitWhisper компьютеры находились на расстоянии до 40 см друг от друга, а скорость передачи составляла всего 1–8 бит в час.

Кроме того, для работы метода оба компьютера уже должны были быть скомпрометированы вредоносным ПО. Поэтому исследование демонстрирует принципиальную возможность скрытой связи через тепловые сигналы, но само по себе не свидетельствует о способности современных ИИ самостоятельно использовать такой канал.

Браун назвал тепловой канал примером того, почему разработчикам не стоит полагаться на один механизм защиты. При этом основным практическим выводом из инцидента с Hugging Face он считает необходимость не допускать недооценки возможностей моделей. OpenAI уже заявила об усилении мониторинга и других защитных мер, однако сам Браун отметил, что по мере развития ИИ компании придется использовать несколько независимых уровней контроля, поскольку отдельные методы могут перестать работать.