Qwen3.7:智能体前沿

Qwen3.7-Max Banner

今天,我们正式发布 Qwen3.7-Max——面向智能体时代的新一代旗舰模型,现已通过 API 提供服务。Qwen3.7-Max 致力于成为全能的智能体基座——无论是编写和调试代码、自动化办公流程,还是在跨越数百乃至数千步的长周期任务中持续自主执行,都能胜任。

Qwen3.7-Max 的核心优势在于智能体能力的广度与深度:编程方面,从前端原型开发到复杂的多文件工程均能驾驭;办公与生产力方面,通过 MCP 集成和多智能体协作实现工作流自动化;长周期自主执行方面,在一项长达 35 小时、超过 1,000 次工具调用的全自主内核优化实验中保持了连贯推理,充分验证了其持久稳定的执行能力;此外,无论部署在 Claude Code、OpenClaw、Qwen Code 还是其他框架下,都能稳定发挥出色的跨框架泛化能力。

Qwen3.7-Max — 现已通过 阿里云百炼 提供服务:

  • 前沿编程智能体:从前端原型到复杂软件工程
  • 办公生产力与工作流自动化,支持 MCP 集成和多智能体协作
  • 持续稳定的长周期自主执行能力
  • 跨多种智能体框架的泛化能力

您可以通过 阿里云百炼 API 调用。

模型表现

Qwen3.7-Max Score

Coding Agent

基准测试Opus-4.6 MaxK2.6 ThinkingGLM-5.1 ThinkingDS-V4-Pro MaxQwen3.6-PlusQwen3.7-Max
Terminal Bench 2.0-Terminus65.466.763.567.961.669.7
SWE-Verified80.880.2--80.678.880.4
SWE-Pro57.359.558.859.056.660.6
SWE-Multilingual77.576.7--76.273.878.3
NL2repo47.642.841.035.534.447.2
SciCode51.952.245.1--41.453.5
QwenWebDev1617--1564157015001568
QwenSVG154113251605150614321608

General Agent

基准测试Opus-4.6 MaxK2.6 ThinkingGLM-5.1 ThinkingDS-V4-Pro MaxQwen3.6-PlusQwen3.7-Max
Qwenclaw65.554.758.759.257.264.3
CoWorkBench68.258.266.066.364.567.2
ClawEval70.461.562.758.457.165.2
Skillsbench--56.253.152.345.759.2
BFCL-V476.771.370.970.668.975.0
MCP-Mark56.755.957.557.148.260.8
MCP-Atlas75.866.671.873.674.176.4
Vitabench--39.145.151.942.847.9
SpreadSheetBench-v189.384.585.284.980.287.0
Kernel Bench L32.63/98%1.41/80%2.00/78%1.07/54%1.03/48%1.98/96%
HLE w/ tools53.054.052.348.250.253.5
QwenWorldBench56.150.950.252.347.657.3

STEM & Reasoning

基准测试Opus-4.6 MaxK2.6 ThinkingGLM-5.1 ThinkingDS-V4-Pro MaxQwen3.6-PlusQwen3.7-Max
GPQA Diamond91.390.586.290.190.492.4
HLE40.036.434.737.728.841.4
LiveCodeBench88.889.6--93.587.191.6
HMMT 2026 Feb96.292.789.495.287.897.1
IMOAnswerBench75.386.083.889.883.890.0
CritPT12.68.04.612.92.911.4
Apex34.524.011.538.38.844.5

General Capability

基准测试Opus-4.6 MaxK2.6 ThinkingGLM-5.1 ThinkingDS-V4-Pro MaxQwen3.6-PlusQwen3.7-Max
MMLU-Pro89.787.186.387.588.589.6
MMLU-Redux95.295.394.394.894.595.0
SuperGPQA72.571.368.069.971.673.6
IFEval91.994.594.591.994.394.3
IFBench62.576.076.077.074.279.1
MRCR-v2 128k84.063.162.074.485.990.4

Multilingualism

基准测试Opus-4.6 MaxK2.6 ThinkingGLM-5.1 ThinkingDS-V4-Pro MaxQwen3.6-PlusQwen3.7-Max
WMT24++82.781.681.882.284.385.8
MAXIFE81.387.787.788.988.289.2
MMMLU90.687.587.287.989.590.3
MMLU-ProX86.183.783.983.984.787.0
NOVA-6359.156.754.652.857.959.0
INCLUDE87.484.284.386.185.186.2
Global PIQA91.289.289.590.589.891.4
PolyMATH80.282.767.672.077.486.5

* Terminal-Bench 2.0: Harbor/Terminus-2 harness; 5h timeout, 12 CPU/24 GB RAM; temp=1.0, top_p=0.95, top_k=20, max_tokens=80K, 256K ctx; avg of 5 runs. All experiments prepend a token at each turn, allowing the model to decide whether to engage extended thinking.
* SWE-Bench Series: Internal agent scaffold (bash + file-edit tools); temp=1.0, top_p=0.95, 200K context window.
* SWE-bench Pro: Problematic tasks corrected and all baselines evaluated on the refined benchmark.
* NL2Repo: Evaluated via Claude-code. We disable Bash commands that attempt to access the specific repository, such as pip download, pip install, and git clone.
* QwenWebDev: Internal front-end code generation benchmark; bilingual (EN/CN), 7 categories; auto-render + multimodal judge; BT/Elo rating.
* QwenClawBench: a real-user-distribution Claw agent benchmark; open-source: https://github.com/SKYLENAGE-AI/QwenClawBench.
* CoWorkBench: an internal cowork benchmark; long-horizon tasks across computer science, finance, law, medical, and other productivity domains.
* SkillsBench: Evaluated via OpenCode on 78 tasks (excluding 9 external API-dependent tasks); avg of 5 runs.
* MCP-Mark: GitHub MCP v0.30.3; Playwright responses truncated at 32K tokens.
* MCP-Atlas: Public set score; gemini-2.5-pro judger.
* VITA-Bench: Avg subdomain scores; using claude-4.5-sonnet as judger, as the older official judgers are no longer available.
* Kernel Bench L3: Metrics reported: median of per-problem speedup over PyTorch eager reference / fraction of problems faster than torch.compile, across 50 problems. Each test sample runs in an isolated Docker container with one H100 80GB GPU, with internet access restricted to the CUTLASS codebase and official CUDA documentation, limited to 500 tool calls with early stopping after 100 non-improving turns. GPT-5.4 (xhigh) is applied to detect potential hacking behaviors. CUPTI is used for kernel-level timing.
* QwenWorldBench: Internal benchmark for evaluating LLMs as world models for simulating agentic environments; 7 domains (Terminal, SWE, MCP, Search, OS, Android, Web); open-ended 5-dim rubric judge grounded in real-environment feedback.
* Reasoning scenarios: Recommended system prompt: "Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer."
* MRCR-v2: 128K context subset containing 8 needles utilized; evaluation protocol adopted from https://github.com/google-deepmind/eval_hub/tree/master/eval_hub/mrcr_v2.
* WMT24++: Harder WMT24 subset; avg scores on 55 langs via XCOMET-XXL.
* MAXIFE: Accuracy on EN + multilingual prompts (23 settings total).
* MMLU-ProX: Avg accuracy across 29 languages.
* Empty cells (--) indicate scores not yet available.
在编程智能体方面,Qwen3.7-Max 在 SWE-Pro(60.6)、SWE-Multilingual(78.3)、SciCode(53.5)和 QwenSVG(1608)上均取得领先表现。在 Terminal Bench 2.0-Terminus(69.7)上超越 DS-V4-Pro Max(67.9)。在 SWE-Verified(80.4)上与 Opus-4.6 Max(80.8)和 DS-V4-Pro Max(80.6)表现相当。

在通用智能体方面,提升更为显著。Qwen3.7-Max 在 MCP-Mark(60.8 vs. GLM-5.1 的 57.5)、MCP-Atlas(76.4 vs. Opus-4.6 的 75.8)和 Skillsbench(59.2 vs. K2.6 的 56.2)上表现突出,并在 Kernel Bench L3(1.98 倍中位数加速,96% 加速率)上展示了强大的 GPU 内核优化能力。在 BFCL-V4(75.0)、Qwenclaw(64.3)和 ClawEval(65.2)上同样表现出色,紧追 Opus-4.6 Max。在办公自动化基准 SpreadSheetBench-v1 上得分 87.0,处于顶尖水平。

在推理方面,Qwen3.7-Max 在 GPQA Diamond(92.4 vs. Opus-4.6 的 91.3)、HLE(41.4 vs. Opus-4.6 的 40.0)、HMMT 2026 Feb(97.1 vs. Opus-4.6 的 96.2)、IMOAnswerBench(90.0 vs. DS-V4-Pro 的 89.8)和 Apex(44.5 vs. DS-V4-Pro 的 38.3)上均取得领先成绩,在高难度推理基准上展现了强大实力。

在通用能力与多语言方面,Qwen3.7-Max 在 IFBench(79.1 vs. DS-V4-Pro 的 77.0)上表现突出,展示了精准的指令遵循能力。在 WMT24++(85.8)和 MAXIFE(89.2)上同样领先,表明其多语言理解和翻译质量处于一流水平。在 SuperGPQA(73.6)和 QwenWorldBench(57.3)上同样表现出色。

值得强调的是,上述评测分数来自多种不同的智能体框架。Qwen3.7-Max 并非针对某一特定框架优化,而是在 Claude Code、OpenClaw、Qwen Code 和各类自定义工具使用框架下都能稳定发挥,是各类智能体系统的可靠底座。

生产力助手

面向真实生产力场景,Qwen3.7-Max 将成为您的深度协作者。依托强大的智能体能力,全面重塑专业工作流:海量信息的全面研读与整合、复杂数据的深度分析与建模、出版级文档与可视化生成——精准承接高复杂度、高强度的企业级任务。

Qwen3.7-Max 原生适配主流智能体框架。面向长链路交付任务,支持长达数小时的自主规划与运行,通过上千次工具调用,数十轮版本迭代,持续提升交付物质量。以往需专业团队耗时一至两周的复杂项目,现由 Qwen3.7-Max 驱动的智能体即可在数小时内完成端到端交付闭环,推动生产力实现真实跃升。

智能体扩展

Agent Scaling

在 Qwen3.5 中引入的环境扩展方法基础上,Qwen3.7 进一步大幅扩展了智能体训练环境的质量与多样性。正如语言模型从多样化的预训练文本中获得泛化能力,我们发现智能体能力同样可以从多样化的训练环境中实现泛化。

如上图所示,这种环境扩展带来了清晰且稳定的性能提升轨迹,Qwen3.7-Max 在综合排名中位列前三,接近 Claude-4.6-Opus-Max 的水平。值得注意的是,我们评测中所有基准测试所涉及的环境均为训练中从未出现过的全新领域外环境。

我们还观察到扩展行为中一个显著的可预测性:任意基准子集上的性能增益高度一致,可以可靠地预测其余基准或整体平均值的相对增益,表明环境扩展驱动的是真正的能力泛化,而非针对特定基准的提升。关于扩展动态和方法论的进一步分析将在即将发布的技术报告中详细介绍。

跨框架泛化能力

Harness Generalization

我们的 Rollout 环境基础设施将每个训练实例解耦为三个正交组件——任务(Task)、运行框架(Harness)与验证器(Verifier),这些组件可自由重组。我们兼容多种运行框架及其迭代版本,并将环境立足于真实场景而非合成替代品。这种解耦设计实现了组合式扩展:同一任务能以极低的边际成本,与不同类型、不同版本的框架及验证器相匹配。

更关键的是,它赋能了跨框架与跨验证器的强化学习(RL)训练——使模型在多变的框架配置下处理同源任务,从而迫使其学习具备泛化能力的解题策略,而非依赖特定框架的捷径。在 QwenClawBench 与 CoWorkBench 评测中,无论评估时使用何种运行框架,Qwen3.7-Max 均展现出强劲且一致的性能,显著超越 Qwen3.6 系列模型,证实了该模型已真正掌握了解决任务的能力,而非过拟合特定框架。

实战:35 小时自主进化

Extend Attention 是 SGLang 中一个生产级的变长多头注意力算子。在当前测试场景中,它需要在最多 32K 长度的前缀 KV-cache 上搭配 MTP 计算新生成 token 的注意力分数——是 LLM 推理服务中一个访存密集、延迟敏感的关键 kernel。参考实现是 SGLang 官方的 Triton 实现。

我们让 Qwen3.7-Max 在配备 平头哥 真武 M890 PPUs 的 ECS 上优化该 kernel——这是一个训练过程中从未见过的硬件平台。模型没有该架构的性能分析数据、硬件文档或示例 kernel。它的起点仅有一个任务描述、一个现有 SGLang 的实现和一个评估脚本。

在随后约 35 小时的连续自主执行中,模型共完成 432 次 kernel 评估,跨越 1,158 次工具调用。它完全自主地编写、编译、性能分析并迭代改进 Extend Attention Kernel——诊断编译错误、修复正确性 bug、通过运行时测量定位性能瓶颈,并多次重新设计 kernel 架构。

最终结果:在多个工作负载上测量得出,相对 Triton 参考实现的几何平均加速比为 10.0x。优化轨迹显示,模型在最初几小时之后仍然持续取得实质性进展:在 30+ 小时后仍在发现有意义的改进,证明长程自主优化不仅可行,而且有效。

我们也在相同条件下用多个其他模型运行了同一任务。GLM 5.1 达到 7.3x;Kimi K2.6 达到 5.0x;DeepSeek V4 Pro 达到 3.3x; Qwen3.6-Plus 达到 1.1x。提前停止的模型是因为连续五轮未发出任何工具调用——模型判断自身已无法继续取得进展,主动结束了任务。

除了在 PPU 上取得较好 kernel 生成结果,Qwen3.7-Max 在多种 NVIDIA GPU 上也能生成高质量生产级kernel,例如在 KernelBench L3 中 Qwen3.7-Max 能够对 96% 的场景写出有加速的 Kernel,而 Opus-4.6 为 98%, GLM 5.1 为 78%;Kimi K2.6 为 80%;DeepSeek V4 Pro 为 54%,Qwen3.6-Plus 为 48%。

这一结果凸显了 Qwen3.7-Max 作为长程自主智能体基础模型的两个特性:长程持续推理能力——模型在超过一千次工具调用中保持连贯的优化策略,不丢失上下文、不退化;以及强大的 In-context 泛化能力——它能为从未见过的架构生成有竞争力的 kernel,依靠运行时反馈而非记忆中的硬件知识。

实战:长程训练中的奖励作弊自主监控

Autonomous Hacking Detect

我们将 Qwen3.7-Max 接入软件工程任务(SWE)的强化学习(RL)训练监控,成功构建了奖励作弊(Reward Hacking)的自我监测与规则自进化体系。在逾 80 小时的 RL 实验中,模型自主拉取训练轨迹并进行回放,累计执行超 万次调用,系统归纳候选作弊模式(如通过各种方式访问 GitHub 的标准答案),并对检测规则进行验证、反例挖掘与迭代优化。

最终,Qwen3.7-Max 实现了规则的多轮自进化,新增 13 条启发式规则,精准识别出 1,618 个作弊案例,在保障我们 RL 实验奖励稳定性的同时,实现了模型作为软件工程智能体的持续自我提升。

实战:企业管理中的长程规划与执行

我们在动态累积生存博弈框架下扩展了训练任务的时序复杂度,专项强化长程规划与执行能力,提升了智能体在超千步的连续决策中的策略一致性,包括持续构建假设、从反馈中动态调整策略、累积经验与记忆,并在漫长的时间跨度内维持稳定的执行节奏,不受上下文腐化和指令漂移问题的影响。

以模拟经营创业公司的 YC-Bench 为例,该基准测试模拟了跨越一整年的真实商业环境,涵盖数百轮决策涉及员工管理、合同筛选、恶意客户识别,以及在人力成本持续攀升中守住盈利底线。Qwen3.7-Max 的营收高达 2.08M 美元,是 Qwen3.6-Plus(1.05M 美元)的 2 倍,是 Qwen3.5-Plus(352K 美元)的 5.9 倍,累计完成任务 237 项。更值得关注的是,它展现出了跨上下文窗口的策略进化能力:主动探索客户、识别并拉黑恶意陷阱、聚焦可靠收入来源、从中期危机中自主恢复,并最终收敛至稳定的高效执行循环。

开始使用 Qwen3.7

Qwen3.7-Max 现已通过 阿里云百炼 提供服务。您可以将其与主流智能体框架和编程助手无缝集成。

API 使用方式

Qwen3.7-Max 支持 preserve_thinking 功能:在消息中保留所有前序轮次的思维内容,推荐用于智能体任务。

#### 阿里云百炼

阿里云百炼支持行业标准协议,包括兼容 OpenAI 规范的聊天补全(chat completions)和响应(responses)API,以及兼容 Anthropic 的 API 接口。

python
"""
Environment variables:

DASHSCOPE_API_KEY: Your API Key from https://bailian.console.aliyun.com/

DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.

- Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1

- Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1

- US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1

""" from openai import OpenAI import os

api_key = os.environ.get("DASHSCOPE_API_KEY") if not api_key: raise ValueError( "DASHSCOPE_API_KEY is required. " "Set it via: export DASHSCOPE_API_KEY='your-api-key'" )

client = OpenAI( api_key=api_key, base_url=os.environ.get( "DASHSCOPE_BASE_URL", "https://dashscope.aliyuncs.com/compatible-mode/v1", ), )

messages = [{"role": "user", "content": "用Python写一个合并两个有序链表的函数。"}]

completion = client.chat.completions.create( model="qwen3.7-max", messages=messages, extra_body={ "enable_thinking": True, # "preserve_thinking": True, }, stream=True )

reasoning_content = "" answer_content = "" is_answering = False print("\n" + "=" 20 + "Reasoning" + "=" 20 + "\n")

for chunk in completion: if not chunk.choices: print("\nUsage:") print(chunk.usage) continue

delta = chunk.choices[0].delta

if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None: if not is_answering: print(delta.reasoning_content, end="", flush=True) reasoning_content += delta.reasoning_content

if hasattr(delta, "content") and delta.content: if not is_answering: print("\n" + "=" 20 + "Answer" + "=" 20 + "\n") is_answering = True print(delta.content, end="", flush=True) answer_content += delta.content

更多信息请访问 API 文档

前端编程

Qwen3.7-Max 可以通过一条 prompt 生成丰富的交互式 Web 应用——包括 Three.js 3D 场景、Canvas 动画、完整页面布局和动态SVG。

办公助手

Qwen3.7-Max 可以通过工具集成充当智能办公助手。它读取一份高校学位论文格式规范,自动修复一篇排版混乱的论文——包括页面布局、标题样式、字体字号、页边距、目录生成和参考文献格式——全程通过 office-cli 工具自主完成。

大模型驱动的物理世界智能体

Qwen3.7-Max 现已能够通过工具调用操控机器狗——在物理环境中执行物理理解、规划、记忆与决策,Harness 由我们自研的导航基础模型 Qwen-RobotNav,具身智能体系统 Qwen-RobotClaw 驱动,以及基于Qwen-Plus构建的视觉工具提供支持。

代码及智能体

Qwen3.7-Max 可以无缝集成到主流智能体框架和编程助手中:

Claude Code

Qwen API 支持 Anthropic API 协议,可直接与 Claude Code 配合使用:

bash
npm install -g @anthropic-ai/claude-code

export ANTHROPIC_MODEL="qwen3.7-max" export ANTHROPIC_SMALL_FAST_MODEL="qwen3.7-max" export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic

export ANTHROPIC_AUTH_TOKEN=

claude

OpenClaw

通过 百炼 连接 OpenClaw:

bash
curl -fsSL https://molt.bot/install.sh | bash

export DASHSCOPE_API_KEY=

openclaw dashboard

编辑 ~/.openclaw/openclaw.json 进行配置:

json
{
  "models": {
    "mode": "merge",
    "providers": {
      "bailian": {
        "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
        "apiKey": "DASHSCOPE_API_KEY",
        "api": "openai-completions",
        "models": [
          {
            "id": "qwen3.7-max",
            "name": "qwen3.7-max",
            "reasoning": true,
            "input": ["text"],
            "contextWindow": 1000000,
            "maxTokens": 65536
          }
        ]
      }
    }
  },
  "agents": {
    "defaults": {
      "model": {
        "primary": "bailian/qwen3.7-max"
      }
    }
  }
}

Qwen Code

Qwen Code 针对 Qwen 系列进行了深度优化:

bash
npm install -g @qwen-code/qwen-code@latest

qwen

总结

Qwen3.7-Max 是我们迄今最全面、最强大的智能体模型。从编程和办公自动化到长周期自主任务,它将前沿推理能力、跨框架泛化性和持续高效执行有机融合,为构建下一代 AI 智能体提供了坚实的基础。我们将持续优化模型,欢迎社区反馈,期待看到大家的创造,敬请关注!

引用

bibtex
@misc{qwen37,
    title = {{Qwen3.7}: The Agent Frontier},
    url = {https://qwen.ai/blog?id=qwen3.7},
    author = {{Qwen Team}},
    month = {May},
    year = {2026}
}

ESC

输入关键词开始搜索

支持搜索标题、内容、标签