
阿里巴巴最新开源的Qwen3.6-27B模型正在改写参数规模与性能的关系。这个仅有27B参数的密集模型,在Terminal-Bench 2.0、SWE-bench Pro等主要编码基准测试中,全面超越了其前代397B参数的混合专家模型(Qwen3.5-397B-A17B)。

27B密集模型之所以能超越大得多的MoE模型,关键在于其注意力机制的高效设计。不同于MoE模型每次只激活部分专家,Qwen3.6-27B的每个token都能利用全部参数,保证了推理的一致性,在同规模下比MoE模型更“智能”,但计算速度较慢。
在编码任务中,这种一致性尤为重要——DeltaNet层处理局部上下文(如当前语法、变量定义),而全注意力层则能捕捉跨文件的函数签名等远距离依赖。

通过Unsloth提供的Dynamic GGUFs量化方案,开发者现在可以在消费级硬件上运行这一前沿模型:
# 下载4-bit量化模型
hf download unsloth/Qwen3.6-27B-GGUF \
--local-dir unsloth/Qwen3.6-27B-GGUF \
--include "*UD-Q4_K_XL*"
量化精度 | 内存需求 |
|---|---|
3-bit | 15GB |
4-bit | 18GB |
8-bit | 30GB |
BF16 | 55GB |
开发者实测
社区讨论集中在模型大小选择的合理性上。有观点认为27B参数正好卡在16GB显存的边缘,需要Q3量化才能流畅运行,而Q3量化对27B-32B模型的性能影响较大。
有开发者反馈,在Nuxt+Go-zero技术栈的实际项目中,Qwen3.6-27B的表现比基准测试更突出。其262K原生上下文窗口(可扩展至1M)在处理大型代码库时优势明显,而MoE模型在长上下文多轮交互中会出现性能断崖。
技术博客:https://qwen.ai/blog?id=qwen3.6-27b
模型下载:https://huggingface.co/unsloth/Qwen3.6-27B-GGUF)
运行指南:https://unsloth.ai/docs/models/qwen3.6
MacOS MLX版本:https://huggingface.co/unsloth/Qwen3.6-27B-UD-MLX-4bit
注:建议禁用CUDA 13.2以避免输出异常,NVIDIA正在修复该问题。