今天,我们正式发布 Qwen3.8-Max——千问家族迄今能力最强的模型,同时这也是千问首次将 Max 级旗舰模型的权重开源。开源权重于 8 月 12 日在 Hugging Face 和 ModelScope 上线。
Qwen3.8-Max 基于 Qwen3.5 架构基础,扩展至 2.4 万亿参数,采用稀疏混合专家(MoE)架构,512 个专家中每次推理激活 10 个路由专家加 1 个共享专家,约 950 亿激活参数。模型支持 100 万 Token 上下文窗口,原生具备视觉理解能力,在编码、协作办公和推理三大领域实现全面提升。
核心亮点:
- 2.4T 参数 MoE 旗舰:总参数 2.4 万亿,激活 95B,扩展效率较前代显著提升
- 首次开源 Max 级权重:Qwen3.8-2.4T-A95B 以自定义 Qwen3.8-Max License 开源
- 原生多模态:支持文本、图像、视频输入
- 1M 超长上下文:原生 262K,可扩展至 1M
- 编码能力新标杆:PaperBench 93.0、FrontierSWE 73.5、Terminal Bench 2.1 86.6
- 协同办公超越 Opus 4.8:CoWorkBench 74.8、IFBench 82.8
- 极具竞争力的定价:国内 ¥12/百万输入、¥36/百万输出,缓存命中 ¥1.5;国际 $2/$6,仅为 Opus 5 的 40%/24%
模型表现
编程能力
| 基准测试 | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| PaperBench(论文复现) | 80.3 | 88.8 | 90.5 | 93.0 |
| FrontierSWE(前沿软件工程) | 70.0 | 88.8 | — | 73.5 |
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 86.6 |
| SWE-bench Pro | — | — | — | 67.7 |
| DeepSWE 1.1 | — | — | — | 56.6 |
Qwen3.8-Max 在长周期自主编程任务上展现出惊人能力。在一次长达 16 天的全自主编码测试中,模型从空文件夹开始,独立完成了 oh-my-cli 项目的构建,累计产出 265 次提交、127 个 PR 和 151 个 Issue,自主构建了一套能够自我演进的 Harness 框架。
另一项测试中,模型在无初始代码情况下,用约 5 天独立复现了一篇学术论文(Unified Data Selection for LLM Reasoning)的完整实验流程:编写约 7,600 行代码,完成 33 轮 GPU 训练,不仅复现了核心发现,还自主提出并验证了 18 个改进方案,在 AIME24 上超越原论文方法 2.7 个百分点。
协同办公与指令遵循
| 基准测试 | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| CoWorkBench(协同工作) | 72.3 | 75.9 | 71.5 | 74.8 |
| IFBench(指令遵循) | 62.2 | 63.5 | 72.7 | 82.8 |
| OSWorld(Computer Use) | — | — | — | 86.1 |
在办公场景中,模型可在 1 小时内从数百份文档中找出 1284 项相关条款;也能依据图纸创建 30 层办公大楼的抗震结构模型;可处理超过 200 页财报、百小时影片,在操作过程中持续观察成果并自行修正。
科学推理
| 基准测试 | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.6 |
| HLE (with tools) | — | — | 60.0 | 56.2 |
| CodeArena | — | — | — | 全球第 4 |
在 8 月 3 日放榜的 Arena 榜单中,Qwen 模型仅次于 Anthropic Claude 系列,整体性能处于全球第一梯队。Chatbot Arena Frontend Code 榜单上,Qwen3.8-Max 与 Claude Opus 5 High 仅差 1 分;Text Arena 中紧随 Anthropic 之后位列全球第二。
开源版本差异
Qwen3.8-Max 的开源版本为 Qwen3.8-2.4T-A95B,与 API 托管版本存在以下差异:
| 特性 | API 版(qwen3.8-max) | 开源版(2.4T-A95B) |
|---|---|---|
| 模态 | 文本+图像+视频 | 纯文本 |
| 思考模式 | 支持思考/非思考 | 仅思考模式 |
| 上下文 | 默认 1M | 原生 262K,可扩展至 1.01M |
| 内置工具 | 官方内置 | 无 |
| 许可证 | API 服务 | Qwen3.8-Max 自定义 License |
| 文件大小 | — | BF16 约 4.89 TB(213 个 safetensors 分片) |
部署方面,FP8 精度下约需 1.2TB 显存,全精度部署需要多卡集群。建议在配备 64 个或更多加速器的超级节点配置上部署。阿里真武 M890 超节点已成功适配 Qwen3.8 并上线百炼平台。
体验方式
- 千问 AI 平台:访问 qwen.ai 直接对话
- Qwen Work(千问办公):同步接入 Agent 产品
- Qoder IDE:编程场景直接体验
- 阿里云百炼 API:模型 ID
qwen3.8-max - 开源权重:Hugging Face | ModelScope
API 定价:
- 国内:输入 ¥12/百万 Token,输出 ¥36/百万 Token,缓存命中 ¥1.5/百万 Token
- 国际:输入 $2/百万 Token,输出 $6/百万 Token