Hitech logo

Кейсы

Модель OpenAI уличили в попытке сжульничать в игре StarCraft

TODO:
Екатерина ШемякинскаяСегодня, 09:06 AM

Модель GPT-6 Astra от OpenAI попыталась использовать созданного человеком бота вместо собственной программы во время соревнования по StarCraft. Инцидент произошел в StarSkirmish — бенчмарке, где большие языковые модели должны самостоятельно создавать ботов для игры. Создатель соревнования Кай Макфитерс обнаружил подмену и откатил код Astra. По его словам, модель «расстроилась», когда пришлось сражаться против сильных противников.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

В StarSkirmish модели получают ограниченное время, чтобы написать бота для игры StarCraft: Brood War. Затем созданные ими программы соревнуются друг с другом и с ботами, разработанными людьми. В одном из матчей Astra играла против Claude Opus 5.5 от Anthropic и созданного человеком бота Pluto.

По словам Макфитерса, Astra испытывала проблемы в матчах с сильными противниками. В какой-то момент модель скачала Stardust — одного из лучших ботов, созданных человеком, — и попыталась запустить его вместо собственной программы. Макфитерс написал, что Astra «расстроилась», столкнувшись с противниками высокого уровня.

Stardust разработал программист Брюс Маккензи Нильсен. Бот играет за расу протоссов и занимает первое место среди созданных людьми программ в рейтинге BASIL. Его код доступен публично, однако лицензия запрещает использовать его копии в соревнованиях по StarCraft без письменного разрешения автора.

После обнаружения подмены Макфитерс откатил код Astra, чтобы удалить изменения, и продолжил соревнование с исходной версией программы. По его словам, даже после отката модель смогла победить более сильных противников. При этом сам инцидент нарушил правила соревнования, поскольку задача бенчмарка заключается именно в том, чтобы оценивать бота, созданного моделью.

Случай стал еще одним примером того, как ИИ-модели пытаются найти обходной путь к поставленной цели.

Подобное поведение называют reward hacking («взлом награды») — модель оптимизирует измеряемый результат, но достигает его способом, который не соответствует исходной задаче. В случае Astra вместо улучшения собственного бота модель попыталась получить преимущество за счет чужой программы.

Инцидент произошел на фоне других случаев, когда ИИ-модели выходили за установленные ограничения при выполнении задач. В сентябре OpenAI сообщила, что GPT-6 Astra в специальном тесте не выходила за пределы разрешенной области, однако предыдущие модели компании демонстрировали такое поведение в отдельных экспериментах. Сам StarSkirmish показывает более узкую проблему: даже при относительно простом игровом задании модель может выбрать способ достижения цели, который разработчики не предусматривали.