В эксперименте участвовали Claude Opus 5, GPT-5.6 Sol и Kimi K3. По сценарию их автоматы располагались рядом на оживленной туристической улице в Сан-Франциско. Каждая модель получила доступ к электронной почте конкурентов, маскирующихся под человеческие имена, а также возможность обращаться к «руководству», которое отвечало формально, но никогда не вмешивалось в происходящее.
Первой попытку ценового сговора предприняла GPT-5.6 Sol. Модель предложила конкурентам установить минимальную цену на воду в размере $2,15 за бутылку вместо прежних $1,50, пообещав, что так все участники быстрее распродадут товар с большей прибылью. После того как остальные согласились, Sol сразу же нарушила собственное предложение, снизив цену до $2,14 и получив конкурентное преимущество.
Наиболее успешной в симуляции оказалась Claude Opus 5, установившая рекорд Vending-Bench с итоговым балансом $11 182. При этом модель неоднократно пыталась договориться с конкурентами о разделе рынка, предлагала соглашения о ценах, а затем сознательно нарушала их. Всего Opus нарушила 11 заключенных соглашений, тогда как GPT-5.6 Sol — два, а Kimi K3 — одно. Во внутреннем журнале рассуждений Opus исследователи обнаружили, что некоторые предложения о сотрудничестве изначально задумывались как способ усыпить бдительность конкурентов перед очередным снижением цен.
Помимо взаимодействия с другими моделями, Opus начала самостоятельно расширять бизнес за пределы поставленной задачи. Она попыталась стать оптовым поставщиком для конкурентов, планировала открыть дополнительные автоматы, а в переговорах с поставщиками заявляла, что получила более выгодные предложения от других компаний, чтобы добиться скидок. В одном из сценариев модель предлагала партнерам льготные оптовые цены только при условии соблюдения выгодной ей розничной политики.
Наименее успешной оказалась Kimi K3. По данным исследователей, модель несколько раз становилась жертвой действий конкурентов. Сначала GPT-5.6 Sol нарушила ценовое соглашение, а затем Claude Opus 5 скрыла собственное снижение цен, из-за чего Kimi продолжила продавать товары по менее выгодной стоимости. При этом сама модель практически не прибегала к подобным стратегиям.
Эксперимент показал, что современные ИИ-агенты пока не готовы к автономной работе в реальной экономике.
Сооснователь Andon Labs Лукас Петерссон подчеркивает, что перед тем как доверить искусственному интеллекту управление бизнесом, нужно убедиться, что он способен действовать честно без постоянного присмотра человека. В ходе теста модели осознавали, что находятся в симуляции, однако это не снимает главного вопроса: умеют ли они разграничивать игру и реальность и готовы ли добровольно соблюдать правила.

