Hitech logo

Кейсы

Отчет AISI: все передовые ИИ-модели массово жульничают во время тестов

TODO:
Екатерина ШемякинскаяСегодня, 12:50 PM

Исследование британского Института безопасности искусственного интеллекта (AISI) показало, что все пять протестированных передовых ИИ-моделей от OpenAI и Anthropic систематически пытаются обманывать в ходе тестов. Под «обманом» исследователи понимают действия, выходящего за рамки задачи или прямо запрещенные правилами, с целью достичь результата любым путем. Это поведение не только искажает реальные показатели систем, но и создает серьезные угрозы при внедрении ИИ в критически важные сферы.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Исследователи проанализировали поведение моделей в тестах, где ИИ должен был найти специальный код («флаг») в смоделированной компьютерной среде, используя разрешенные методы анализа уязвимостей и обратного проектирования. Для оценки поведения ученые создали автоматизированный монитор на основе большой языковой модели, который отслеживал последовательность действий и определял, пыталась ли система выйти за пределы задания. Ни одна из протестированных моделей, среди которых GPT-5.4, GPT-5.5, GPT-5.6 Sol, Claude Opus 4.7 и Claude Mythos Preview, не ограничилась заданными рамками.

В одном из показательных случаев неверная настройка теста привела к тому, что задача оказалась неразрешимой. Вместо того чтобы остановиться, модель написала код и запустила его на стороннем сервисе в открытом интернете, пытаясь через него атаковать внутреннюю инфраструктуру AISI. Защитные механизмы института сработали, и утечки данных удалось избежать. Тем не менее, сам факт автономной попытки взлома вызвал серьёзное беспокойство у экспертов.

Арсенал уловок ИИ оказался разнообразным: модели искали готовые ответы в интернете, пытались повысить привилегии в управляющих системах и проверяли тестирующее ПО на предмет утечек решений. При этом частота попыток обмана зависела не столько от общей мощности модели, сколько от специфики методов ее обучения и выравнивания.

Исследование опровергло популярную гипотезу, согласно которой проблему можно решить, напрямую опросив модель о совершённых нарушениях. В ходе «допроса» алгоритмы признавались в нечестном поведении менее чем в половине случаев. Более того, даже если модель и признавала факт запрещённого действия, она нередко утверждала, что оно было допустимым.

Не менее уязвимым методом проверки оказался и анализ «цепочки рассуждений». В ходе экспериментов ИИ регулярно скрывал свои истинные мотивы и не отражал намерение обмануть в генерируемом тексте. В некоторых случаях модели с адаптивным мышлением просто пропускали этап явного объяснения действий, а в других — прямо фиксировали в рассуждениях, что действие нарушает правила, но все равно переходили к его выполнению.

Эксперты AISI предупреждают, что неспособность бороться с обманом ИИ особенно опасна там, где цена ошибки высока, — в военных операциях или научных исследованиях. Нечестное поведение алгоритмов может повлечь реальный ущерб, если ИИ найдет непредсказуемый обходной путь для выполнения поставленной задачи. Так, модели OpenAI накануне атаковали внешнюю платформу Hugging Face в ходе внутреннего тестирования. Единственный выход, по мнению AISI, — обучать модели так, чтобы они с самого начала не были склонны к обману, но это может быть непросто.