DeepSeek V4 与 Qwen3.8-27B 对比:开源大模型的两条效率路线
2026 年 8 月中旬,Qwen3.8-27B 正式开源(8 月 14 日,Apache-2.0),而 DeepSeek V4 的 Flash 与 Pro 两个模型也已经通过 API 和开放权重运行了几个月(最新版本分别是 0731 与 0813)。一个是 27B 的稠密小钢炮,一个是 284B/1.6T 的稀疏巨兽,两款模型代表了当下开源模型效率之争的两条典型路线。这篇文章用公开资料把它们的规格、架构、能力、部署与成本放在一起对比。 一句话定位 DeepSeek V4:面向“百万级上下文智能”的 MoE 家族。Flash 是 284B 总参数 / 13B 激活参数的稀疏模型,Pro 是 1.6T / 49B 激活参数的旗舰。两者都原生支持 1M 上下文与 384K 输出,主打超长上下文 + 可控深度推理。 Qwen3.8-27B:Qwen 开源家族最新一代的紧凑稠密模型,27B 全参数激活,原生图文视频理解,262K 原生上下文(可扩展至 1M),内置 MTP 多头预测加速。官方称它把“Qwen-Max 级”的能力第一次带到了开源。 两者都是开源权重(V4 为 MIT,Qwen3.8-27B 为 Apache-2.0),都可以本地部署,但部署门槛和适用场景截然不同。 规格对比 项目 DeepSeek V4 Flash DeepSeek V4 Pro Qwen3.8-27B 总参数 284B(MoE) 1.6T(MoE) 27B(稠密) 激活参数 13B 49B 27B 专家配置 256 专家/层,43 个路由层 MoE(同系架构) — 注意力架构 CSA 压缩稀疏注意力 + HCA 重度压缩注意力(128 token 滑窗 + 4x/128x 压缩 KV 行) 同 Flash 架构 Gated DeltaNet 线性注意力 + 每 4 层插入一层全注意力 KV 缓存 MLA 式潜变量注意力,NVFP4 量化 同左 线性注意力状态 + 全注意力 KV 上下文长度 1M 原生 1M 原生 262K 原生,可扩展至 1M 最大输出 384K 384K — 多模态 纯文本 纯文本 原生图像 + 视频理解 思考模式 默认思考,off/low/high/max 四档 同左 默认思考,reasoning_effort 可调,preserve_thinking 保留思考上下文 工具调用 DSML 工具协议,DeepSeek Harness 生态 同左 标准工具调用 + 官方托管版内置工具 许可证 MIT MIT Apache-2.0 发布节点 2026 年 4 月预览,0731 为最新 Flash 0813 为最新 2026-08-14 两组数字最能说明差异:激活参数上,Qwen3.8-27B 的 27B 全部参与计算,而 V4 Flash 只有 13B 被激活;但权重体积上,V4 Flash 的 284B 需要 128GB 以上内存才能完整放下(量化后另说),Qwen3.8-27B 在 Q4 量化下只要约 17GB 权重、22.2GB 显存就能跑满 262K 窗口——一张 RTX 3090 就够。 ...