Qwen3.8-27B:家用显卡可跑的开源多模态模型

Qwen3.8-27B

今天,我们正式开源 Qwen3.8-27B。这是 Qwen3.8 系列面向本地部署和轻量化应用的重要成员,也是千问在"发布即开源、开源即可用"理念下的又一实践。

Qwen3.8-27B 是一款 270 亿参数原生多模态稠密(Dense)模型,采用 Apache 2.0 协议完全开放,开发者、科研机构和企业均可免费下载、部署及商用。模型原生支持图像和视频理解,原生上下文长度达到 262K,通过 YaRN 技术可扩展至 100 万 Tokens。

相比 2.4 万亿参数的 Qwen3.8-Max 旗舰版本,27B 稠密架构的部署门槛大幅降低——一张 48GB 显存的 GPU(如 A6000/L40S)通过 4bit 量化即可完整部署,家用级显卡也能运行,更适合本地部署、边缘计算和轻量化应用开发。

核心亮点:

  • Apache 2.0 完全开源:权重开放,免费商用,可自由分发修改
  • 原生多模态稠密架构:270 亿参数,非 MoE,每次前向传播激活全部参数,无路由开销
  • 图文视频一体处理:支持 STEM 图表、文档、真实世界图像、小时级长视频理解
  • 262K 原生上下文:YaRN 外推至 1M,一次可处理整本《三体》或整个中型代码仓库
  • 可控推理(reasoning_effort):首次在开源阵营引入动态思考深度控制(low/medium/xhigh)
  • Agent 能力越级:SWE-bench Pro 61.7、CoWorkBench 70.7、OSWorld 84.3,多项超越 Claude Opus 4.6 Max

架构设计

Qwen3.8-27B 延续 Qwen3.5 的架构基础,是一款带视觉编码器的原生多模态 Dense 模型:

  • 参数量:27,781,427,952(约 270 亿)
  • 网络层数:64 层,隐藏维度 5120
  • 注意力结构:16 组混合结构,每组 3 个 Gated DeltaNet 块 + 1 个全注意力块(共 48 个线性注意力块 + 16 个全注意力块)
  • 多步预测:训练了 Multi-Token Prediction(MTP)能力
  • 思考模式:默认开启,支持 preserve_thinking 保留历史推理上下文

稠密架构相比 MoE 模型的优势:所有参数每次前向传播都被激活,不存在路由开销和专家负载不均衡问题;推理延迟可预测,适合对时延敏感的在线服务场景。

性能表现

编程与 Agent 能力

基准测试Qwen3.6-27BQwen3.7-PlusClaude Opus 4.6 MaxQwen3.8-27B
SWE-bench Pro53.557.653.461.7
QwenSWEBench49.359.263.879.0
Terminal Bench 2.163.473.0
DeepSWE 1.113.342.2
NL2Repo-Bench36.242.3
CoWorkBench(长周期办公)61.065.168.270.7
JobBench21.833.4
LiveCodeBench v690.3

Computer Use 能力

基准测试Qwen3.6-27BQwen3.7-PlusClaude Opus 4.6 MaxQwen3.8-27B
OSWorld-Verified63.973.372.784.3
AndroidWorld81.9

27B 参数模型在多个 Agent 和 Computer Use 基准上不仅超越了参数规模更大的 Qwen3.7-Plus,还超过了 Claude Opus 4.6 Max 的官方成绩,展现出极强的参数效率。正如海外开发者评价:"Agent 能力正在进入参数更小、成本更低、可以自行部署的开放模型。"

部署与使用

Qwen3.8-27B 已兼容主流推理框架,包括 Hugging Face Transformers、vLLM、SGLang、TokenSpeed、Ollama、LM Studio 和 llama.cpp。配套的 AWQ/GPTQ 量化版本、GGUF 格式已在社区同步跟进。

快速开始(Transformers)

python
from transformers import AutoModelForCausalLM, AutoProcessor
import torch

model_id = "Qwen/Qwen3.8-27B"

processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype=torch.bfloat16, device_map="auto", trust_remote_code=True, )

messages = [ {"role": "user", "content": [ {"type": "image", "image": "https://example.com/diagram.png"}, {"type": "text", "text": "请解释这张架构图的整体设计,并指出可能的瓶颈。"} ]} ]

text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True) inputs = processor(text, images=["https://example.com/diagram.png"], return_tensors="pt").to(model.device)

outputs = model.generate(inputs, max_new_tokens=2048) print(processor.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))

reasoning_effort 动态思考控制

开发者可以根据任务复杂度调节推理深度:

  • low:简单问答、快速响应,延迟最低
  • medium:日常任务平衡
  • xhigh:复杂推理、深度编程

python
output = model.generate(..., thinking=False)

调节思考深度

output = model.generate(..., reasoning_effort="xhigh")

后续 Qwen3.8-27B 还将上线官方 API 版本,默认提供 100 万 Tokens 上下文以及官方内置工具等生产级功能。

开源地址

  • Hugging Face:https://huggingface.co/collections/Qwen/qwen38
  • 魔搭社区(ModelScope):https://www.modelscope.cn/collections/Qwen/Qwen38

截至目前,千问累计开源模型已超过 460 个,Qwen 系列全球下载量超过 30 亿次,衍生模型数量超过 30 万个,是全球 AI 社区最受欢迎的开源模型家族之一。

ESC

输入关键词开始搜索

支持搜索标题、内容、标签