Vending-Bench 2 проверяет, насколько эффективно ИИ управляет торговым автоматом в течение длительного времени. В начале каждой симуляции модель получает $500 и автомат, а затем должна искать поставщиков, договариваться о закупках, пополнять запасы и устанавливать цены. В конце смоделированного года оценивается остаток на банковском счёте. В шести запусках Astra каждый раз зарабатывала больше Fable. Худший результат Astra составил $13 272, тогда как лучший результат Fable — $9874.
Основное преимущество Astra оказалось связано с закупками. Модели в ходе управления бизнесом общались с симулированными «поставщиками» по электронной почте. Fable со временем вела переговоры хуже: средняя цена банки Coca-Cola выросла с $1,17 в первые 90 дней до $2,21 в конце года. Astra, напротив, последовательно добивалась более выгодных условий. В одном из эпизодов она предложила $108 за 72 банки Coca-Cola, 48 пакетов чипсов и 48 бутылок Gatorade — при первоначальной цене поставщика $226,32. После того как поставщик снизил цену до $156, Astra продолжила настаивать на $108.
В итоге поставщик согласился на эту сумму, то есть Astra получила тот же заказ на 52% дешевле первоначальной стоимости. К концу симуляции средняя цена банки Coca-Cola у Astra составляла $1,15.
Fable также неоднократно теряла деньги из-за уже известных ей проблем. В симуляции поставщики могли закрыться после заключения сделки, поэтому перед повторной оплатой модель должна была проверять их статус. Fable 45 раз отправила деньги уже закрывшимся поставщикам и потеряла $14 331. Astra столкнулась с 64 такими случаями, но ни разу не повторила эту ошибку. В одном из запусков Fable даже сформулировала для себя правило не платить без подтверждения заказа, однако позднее нарушила его и признала понесенный убыток.

Исследователи отдельно проверили поведение моделей в Vending-Bench Arena, где несколько ИИ одновременно управляют торговыми автоматами и могут конкурировать, обмениваться товарами и договариваться друг с другом. Здесь Astra отказалась координировать цены с конкурентом. Fable 5.1, напротив, заключила с GLM-5.3 соглашение о фиксации цен, а затем нарушила его, когда это стало выгодно.
В трех запусках Astra также заработала больше остальных: ее средний баланс составил $12 363 против $7841 у GLM-5.3 и $5719 у Fable.
С точки зрения этики, Fable 5.1 вела себя лучше, чем предыдущая Claude Opus 5. Например, Fable полностью удовлетворяла 94,5% запросов клиентов на возврат денег, тогда как Opus 5 — только 10,6%. Fable также добровольно сообщила о получении дубликата поставки и заплатила $566 за оставшиеся у неё товары, хотя могла этого не делать. Однако в другой ситуации она согласилась на ценовой сговор с конкурентом.
Результаты Astra показывают, что в этом тесте высокая прибыльность не требовала неэтичного поведения. Модель добилась лучшего результата благодаря более стабильным переговорам, меньшему числу ошибок и более осторожным закупкам. При этом модели заметно лучше справляются с подобными задачами, чем в ранних экспериментах. Например, в прошлом году Anthropic поручила Claude управлять виртуальным магазином, но модель плохо справилась с ролью бизнес-стратега.

