Введенная в конце 2023 года система оценки готовности (Preparedness Framework) служит внутренним регламентом OpenAI для отслеживания рисков в ИИ-алгоритмах. Предыдущие флагманские разработки компании, включая GPT-5.6-Sol, после проверок оставались в категории «Высокий уровень». Astra стала первой моделью, которая может превысить этот порог.
Согласно правилам OpenAI, модель попадает в критическую категорию, если она способна автономно обнаруживать и применять уязвимости нулевого дня против защищенных реальных систем. Кроме того, к этой группе относятся ИИ-агенты, способные без участия человека проводить масштабные и сложные кибератаки. В компании подчеркивают, что окончательные тесты еще не завершены, а сама Astra не имеет отношения к недавним инцидентам на платформе Hugging Face.
В ответ на выявленные риски OpenAI ужесточила правила разработки и тестирования. Инженеры перевели проект на изолированные системы тестирования с ограниченным доступом к сети, внедрили шифрование весов моделей и закрытые среды выполнения. Вся работа над Astra, не соответствующая новым требованиям, временно приостановлена.
Также был внедрен сквозной мониторинг цепочки рассуждений ИИ-агентов Astra во время обучения и тестирования. Специальные алгоритмы безопасности в реальном времени анализируют логику модели и при обнаружении потенциально опасного поведения автоматически блокируют сессию. Подобный подход позволяет вовремя перехватить высокорисковые действия до того, как они будут выполнены.
Перед выходом модели на рынок OpenAI намерена привлечь к ее проверке сторонних экспертов и государственные органы. Компания планирует передать Astra независимым группам по безопасности ИИ и профильным ведомствам для проведения внешних стресс-тестов. В OpenAI отмечают, что уже применяли аналогичный протокол в 2025 году, когда их системы приблизились к высокому уровню опасности в сфере биологических угроз.
Несмотря на жесткие ограничения, долгосрочная цель разработчиков остается прежней — использовать Astra для укрепления мировой цифровой инфраструктуры. В OpenAI рассчитывают, что после выполнения всех требований безопасности модель станет доступна специалистам. Это позволит командам защиты находить и устранять уязвимости в ПО до того, как их успеют эксплуатировать злоумышленники.

