Одним из достижений Qwen3.8-Max Alibaba стал результат в бенчмарке OSWorld-Verified, который оценивает способность ИИ-агентов взаимодействовать с компьютерными средами и выполнять многоэтапные задачи. Модель набрала 86,1 балла и обошла Claude Fable 5 (85,0), GPT-5.6 Sol Max (83,2) и Gemini 3.1 Pro (76,2).
Qwen3.8-Max также показала высокие результаты в других специализированных тестах. В бенчмарке PaperBench, оценивающем способность анализировать и воспроизводить научные исследования, модель получила 93 балла. В TerminalBench 2.1, который проверяет работу с командной строкой, результат составил 86,6 балла. Кроме того, Alibaba заявляет о лидерстве модели в тестах Vision2Web (69,0), LVBench (81,8) и ERQA (77,8), связанных с визуальным анализом, веб-задачами и мультимодальным рассуждением.
При этом Qwen3.8-Max не стала абсолютным лидером во всех категориях. Например, в тестах на разработку программного обеспечения SWE-Pro ведущие позиции сохраняют решения OpenAI и Anthropic. Однако Alibaba отмечает, что новая модель показывает «сбалансированный профиль производительности»: она способна работать с кодом, документами, изображениями и сложными последовательностями задач.
Qwen3.8-Max построена на архитектуре «Смесь экспертов» (Mixture of Experts, MoE) и содержит 2,4 трлн параметров. Alibaba позиционирует её не как обычного чат-бота, а как инструмент для автономного выполнения длительных рабочих процессов — от разработки программного обеспечения до анализа научных материалов. Компания утверждает, что модель способна выполнять задачи, рассчитанные на несколько дней работы, однако эти заявления пока основаны преимущественно на внутренних демонстрациях.
Одновременно Alibaba заявила о планах открыть веса модели вместе с меньшей версией Qwen3.8-27B. Qwen 3.8-Max может стать одной из первых флагманских моделей такого уровня, доступных для самостоятельного развертывания. При этом условия лицензии пока не раскрываются, поэтому степень открытости модели остается неизвестной.
Доступ к Qwen3.8-Max через API стоит $2 за миллион входных токенов и $6 за миллион выходных токенов. Это делает модель дешевле флагманских решений западных конкурентов. Например, заявленная стоимость Claude Opus 5 составляет около $5/$25 за миллион токенов, а отдельных моделей OpenAI — до $10/$60 в зависимости от режима работы. Если результаты бенчмарков подтвердятся независимыми тестами, сочетание высокой производительности, более низкой цены и открытых весов может сделать Qwen3.8-Max серьезным конкурентом проприетарным моделям OpenAI, Anthropic и Google в корпоративном сегменте.

