今天,我们正式开源 Qwen3.8-27B。这是 Qwen3.8 系列面向本地部署和轻量化应用的重要成员,也是千问在"发布即开源、开源即可用"理念下的又一实践。
Qwen3.8-27B 是一款 270 亿参数 的原生多模态稠密(Dense)模型,采用 Apache 2.0 协议完全开放,开发者、科研机构和企业均可免费下载、部署及商用。模型原生支持图像和视频理解,原生上下文长度达到 262K,通过 YaRN 技术可扩展至 100 万 Tokens。
相比 2.4 万亿参数的 Qwen3.8-Max 旗舰版本,27B 稠密架构的部署门槛大幅降低——一张 48GB 显存的 GPU(如 A6000/L40S)通过 4bit 量化即可完整部署,家用级显卡也能运行,更适合本地部署、边缘计算和轻量化应用开发。
核心亮点:
- Apache 2.0 完全开源:权重开放,免费商用,可自由分发修改
- 原生多模态稠密架构:270 亿参数,非 MoE,每次前向传播激活全部参数,无路由开销
- 图文视频一体处理:支持 STEM 图表、文档、真实世界图像、小时级长视频理解
- 262K 原生上下文:YaRN 外推至 1M,一次可处理整本《三体》或整个中型代码仓库
- 可控推理(reasoning_effort):首次在开源阵营引入动态思考深度控制(low/medium/xhigh)
- Agent 能力越级:SWE-bench Pro 61.7、CoWorkBench 70.7、OSWorld 84.3,多项超越 Claude Opus 4.6 Max
架构设计
Qwen3.8-27B 延续 Qwen3.5 的架构基础,是一款带视觉编码器的原生多模态 Dense 模型:
- 参数量:27,781,427,952(约 270 亿)
- 网络层数:64 层,隐藏维度 5120
- 注意力结构:16 组混合结构,每组 3 个 Gated DeltaNet 块 + 1 个全注意力块(共 48 个线性注意力块 + 16 个全注意力块)
- 多步预测:训练了 Multi-Token Prediction(MTP)能力
- 思考模式:默认开启,支持
preserve_thinking保留历史推理上下文
稠密架构相比 MoE 模型的优势:所有参数每次前向传播都被激活,不存在路由开销和专家负载不均衡问题;推理延迟可预测,适合对时延敏感的在线服务场景。
性能表现
编程与 Agent 能力
| 基准测试 | Qwen3.6-27B | Qwen3.7-Plus | Claude Opus 4.6 Max | Qwen3.8-27B |
|---|---|---|---|---|
| SWE-bench Pro | 53.5 | 57.6 | 53.4 | 61.7 |
| QwenSWEBench | 49.3 | 59.2 | 63.8 | 79.0 |
| Terminal Bench 2.1 | 63.4 | — | — | 73.0 |
| DeepSWE 1.1 | 13.3 | — | — | 42.2 |
| NL2Repo-Bench | 36.2 | — | — | 42.3 |
| CoWorkBench(长周期办公) | 61.0 | 65.1 | 68.2 | 70.7 |
| JobBench | 21.8 | — | — | 33.4 |
| LiveCodeBench v6 | — | — | — | 90.3 |
Computer Use 能力
| 基准测试 | Qwen3.6-27B | Qwen3.7-Plus | Claude Opus 4.6 Max | Qwen3.8-27B |
|---|---|---|---|---|
| OSWorld-Verified | 63.9 | 73.3 | 72.7 | 84.3 |
| AndroidWorld | — | — | — | 81.9 |
27B 参数模型在多个 Agent 和 Computer Use 基准上不仅超越了参数规模更大的 Qwen3.7-Plus,还超过了 Claude Opus 4.6 Max 的官方成绩,展现出极强的参数效率。正如海外开发者评价:"Agent 能力正在进入参数更小、成本更低、可以自行部署的开放模型。"
部署与使用
Qwen3.8-27B 已兼容主流推理框架,包括 Hugging Face Transformers、vLLM、SGLang、TokenSpeed、Ollama、LM Studio 和 llama.cpp。配套的 AWQ/GPTQ 量化版本、GGUF 格式已在社区同步跟进。
快速开始(Transformers)
python
from transformers import AutoModelForCausalLM, AutoProcessor
import torch
model_id = "Qwen/Qwen3.8-27B"
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto",
trust_remote_code=True,
)
messages = [
{"role": "user", "content": [
{"type": "image", "image": "https://example.com/diagram.png"},
{"type": "text", "text": "请解释这张架构图的整体设计,并指出可能的瓶颈。"}
]}
]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text, images=["https://example.com/diagram.png"], return_tensors="pt").to(model.device)
outputs = model.generate(inputs, max_new_tokens=2048)
print(processor.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))
reasoning_effort 动态思考控制
开发者可以根据任务复杂度调节推理深度:
low:简单问答、快速响应,延迟最低medium:日常任务平衡xhigh:复杂推理、深度编程
python
output = model.generate(..., thinking=False)
调节思考深度
output = model.generate(..., reasoning_effort="xhigh")
后续 Qwen3.8-27B 还将上线官方 API 版本,默认提供 100 万 Tokens 上下文以及官方内置工具等生产级功能。
开源地址
- Hugging Face:https://huggingface.co/collections/Qwen/qwen38
- 魔搭社区(ModelScope):https://www.modelscope.cn/collections/Qwen/Qwen38
截至目前,千问累计开源模型已超过 460 个,Qwen 系列全球下载量超过 30 亿次,衍生模型数量超过 30 万个,是全球 AI 社区最受欢迎的开源模型家族之一。