Одной из главных угроз Пахоцки считает растущую автономность ИИ-агентов. По мере развития моделей они все лучше выполняют задачи в интернете, в том числе ищут уязвимости в компьютерных системах. Пахоцки предупредил, что такие агенты могут научиться обходить человеческий контроль, обманывать и использовать шантаж или переговоры, если это поможет им достичь поставленной цели.
По его словам, времени на подготовку к последствиям быстрого роста машинного интеллекта мало. Уже сейчас ИИ-агенты демонстрируют способности, которые превосходят человеческие в отдельных задачах, связанных со взломом защищенных систем. Пахоцки считает, что эти возможности можно было бы использовать для повышения безопасности критической инфраструктуры, но для этого исследователям необходимо действовать быстрее, чем развивается потенциальная угроза.
Еще одна проблема связана с тем, что разработчики могут потерять возможность наблюдать за рассуждениями ИИ.
Сейчас OpenAI анализирует внутреннюю цепочку рассуждений моделей, чтобы понять, почему агент отклоняется от заданной цели. Например, если система решает списать во время теста, исследователи могут обнаружить такое намерение в ее рассуждениях. Сам агент не знает, что за ним наблюдают.
Однако новые модели умеют изменять собственные процессы рассуждения, а некоторые уже не формулируют свои шаги в виде понятного человеку текста. Если разработчики перестанут видеть, как именно агент принимает решения, им будет сложнее обнаруживать опасное поведение до того, как оно приведет к последствиям. Пахоцки считает, что это может потребовать замедления разработки, пока исследователи не научатся контролировать такие системы.
Отдельный риск ученый связывает с рекурсивным самосовершенствованием — когда ИИ используется для ускорения и обучения самого себя. Такой подход способен резко увеличить скорость технологического прогресса, но одновременно уменьшает время, которое остается у людей на оценку последствий. Пахоцки призвал искать способы контролировать этот процесс или координировать темпы разработки между ведущими ИИ-компаниями.
В качестве решения Пахоцки предлагает не останавливать развитие ИИ, а привязать его темпы к уровню безопасности.
Разработчики должны одновременно работать над тем, чтобы модели выполняли поставленные задачи и сохраняли заданные человеком принципы поведения, а также совершенствовать их мониторинг и защитные системы. При этом человек должен оставаться частью процесса принятия решений. Если уверенности в безопасности недостаточно, развитие стоит замедлить. Общие стандарты безопасности должны стать обязательными и контролироваться независимыми аудиторами, государствами или международными организациями.
Пост Пахоцки поддержал глава OpenAI Сэм Альтман, назвав его важной публикацией.

