MacBook本地运行Qwen3.8-27B
上周我在旅行,远离通常为我思考的GPU机架。8月14日,阿里巴巴开源了Qwen 3.8–27B——Apache 2.0许可证,4位量化约17GB,包含视觉功能。
我只有我的MacBook Pro,搭载M4 Max芯片。所以我下载了它,将llama.cpp指向它,然后运行了它。
老实说?它让我大开眼界。
不是"对于它的尺寸来说令人印象深刻"——这是你在每篇评论中看到的礼貌版本。这个模型比我本地运行过的任何东西思考时间更长,捕捉到了我之前日常驱动器错过的问题边缘案例,并交回了我通常需要付费前沿API才能获得的工作。
这篇文章是我所知道的关于它的一切。它与Opus 4.6、DeepSeek V4 Flash 0731和GLM 5.2的比较。社区在两周实际使用后的评价。以及没有基准表会告诉你的硬件真相。
1、你实际得到的是什么
Qwen 3.8–27B是一个密集的270亿参数模型——所有27B在每个令牌上都活跃,不是假装小的稀疏MoE。聪明的部分是注意力:大多数层使用廉价的线性注意力机制(Gated DeltaNet),只有四分之一的层使用完全注意力。这个3比1的比率是它如何在不消耗所有内存的情况下提供原生262K令牌上下文——Qwen说如果你想,可以将其扩展到100万令牌。
它还能看到图像和视频,不仅仅是文本。而最重要的部分是:它默认思考。 最高推理努力("xhigh")是开箱即用的,这意味着每个提示在你看到答案之前都会进行长时间的内部辩论。
这个思考模式是这个模型生死攸关的地方。我会谈到这一点。
2、它如何比较
2.1 对比Opus 4.6:赢得工作,输掉考试
Opus 4.6是我在2026年初为自己设定的标准——这个模型让我震惊到开始构建自己的代理。所以这是记分卡,直接来自每个供应商的卡片:
| 基准测试 | Qwen3.8-27B | Opus 4.6 Max | GLM-5.2 |
|--------------------|-------------|--------------|-----------|
| SWE-bench Pro | 61.7 | 53.4 | 62.1 |
| Terminal-Bench 2.1 | 73.0* | 78.2 | 81.0* |
| GPQA Diamond | 89.2 | 91.3 | 91.2 |
| HLE | 30.8 | 40.0 | 40.5 |
*每个供应商不同的工具——将其视为方向性,而非绝对真理。
用简单的英语说:Qwen在代理实际工作的地方获胜。 SWE-bench Pro是在真实仓库中修复真实错误,Qwen在那里以超过8分的优势击败Opus。它还在指令遵循(IFBench 79.5对62.5)和所有与视觉相关的内容中获胜——OSWorld计算机使用从旧Qwen的63.9跃升至84.3,超过了Opus的72.7。
Opus仍然占据主导地位的是最难的推理:GPQA(研究生级别的科学问题)和HLE("人类最后的考试")。那是前沿数学领域,17GB文件还没有达到那里。没有人应该假装不是。
在你引用那个表格之前的一个警告:每个数字都来自每个供应商自己的卡片和他们自己的工具。阿里巴巴使用Claude Code工具进行SWE-bench Pro,并用GPT-4o判断HLE。它是天花板,不是地板——但它仍然是我们拥有的最佳地图。
2.2 对比DeepSeek V4 Flash 0731:相同智力分数,五分之一硬件
DeepSeek V4 Flash是我之前的"聪明本地模型"——这个比较对我个人很重要(稍后详述)。在Artificial Analysis的独立指数上,每个模型都通过相同的九个评估,Qwen 3.8–27B得分正好52——与DeepSeek V4 Flash 0731相同,这是一个284亿参数的MoE,每个令牌只有13B活跃。
相同的智力分数。其中一个在单个24GB卡上运行并能看到图像;另一个需要我的五个RTX 3090,与之相比,其预填充速度是冰川级的。
2.3 对比GLM 5.2:旗鼓相当,附带脚注
智谱的GLM-5.2——MIT许可,扎实的100万上下文——是纸上最接近的对手:SWE-bench Pro 62.1对Qwen的61.7,Terminal-Bench 81对73(在他们的工具上)。我会选择Qwen有两个原因:它有视觉功能,而且它适合你已经拥有的一张卡。
而脚注很重要:智谱在8月18日发布了GLM-5.3——比Qwen的发布晚两天。它在相同的Artificial Analysis指数上得分60(Qwen是52),所以这场战斗在你阅读时已经在重新进行。
3、社区怎么说
两周后,r/LocalLLaMA有数百个帖子,Hacker News有一个375分的讨论。共识清晰地分为三个阵营:
阵营一:"家庭前沿智能。" 这是Hacker News上的实际评论,它捕捉了情绪。一位使用5090的用户在发布主帖中告诉发布主帖,他不再需要Claude来处理80%以上的工作。一篇长篇社区评论说得最好:"Sonnet级别的性能,具有达到Opus级别结果的潜力。" Simon Willison,以审查LLM为生的人,称其优秀并用它来驱动他自己的编码代理——"17GB文件能做所有这些是一个奇迹,"正如他所说。
还有一个值得重复的独立结果:在Harvey的法律代理基准上——一个从超过1亿令牌跨约1万份文档构建的合成律师事务所——一个适应的Qwen3.8–27B以大约0.13美元每查询对1.32美元的价格击败了Claude Opus 4.8。诚实的警告:该模型首先研究了律师事务所自己的语料库,所以这是领域适应可以对27B做的事情的演示——不是股票权重的中性分数。但这是该能力在阿里巴巴自己的工具之外幸存的第一个迹象。
阵营二:过度思考税。 默认情况下,在xhigh模式下,这个模型会在任务上思考21分钟,而关闭思考只需要两分半。Willison著名的鹈鹕测试:他要求一个简单的鹈鹕SVG。模型花了超过22,000个推理令牌来产生3,200个令牌的输出——鹈鹕很棒,但它花费了他21分钟。它每个任务产生的令牌大约是Qwen 3.6–27B的两倍,在消费硬件上这意味着等待。
阵营三:"它在代码之外会产生幻觉。" 这一点很痛,因为它是真的:它的世界知识准确性(AA-Omniscience)实际上略低于Qwen 3.6。它用回忆换取了能力。用户报告在一般知识上有自信的错误答案,有一个人让它在一个CLI任务上循环了一个多小时,而这个任务它本应该只是谷歌搜索——"世界知识是垃圾和过时的,"正如帖子所说。
而最重要的阵营:让它变快的人。 几天内社区破解了NVFP4量化加MTP推测解码:在单个RTX 5090上以完整262K上下文加载时达到200+令牌每秒。 速度是可调的。模型不慢——你的设置可能慢。
4、我的第一印象:它思考更久,这很明显
经过一周的日常使用,与Qwen 3.6–27B相比,一个突出的区别是:它在问题上停留更久。
Qwen 3.6快速、能干、有点懒——它会给你一个适用于快乐路径的答案然后停止。Qwen 3.8考虑了我没有提到的边缘案例:如果输入为空怎么办,如果API在第二次调用返回500怎么办,如果文件在我们到达第四步时不存在怎么办。工作回来更完整,"足够好"的答案基本消失了。
社区发现了同样的事情,甚至量化了如何引导它:一个用户将像"你每轮有12K令牌的思考预算"这样的行直接注入模型的推理中,并在50%和75%时提醒。这将xhigh从税变成了旋钮。如果你在代理工具中运行这个的实用建议:管理努力级别或给它一个预算。模型足够聪明,可以在被告知停止思考时保持简洁——它只是不会主动提出。
5、你应该在哪里实际运行它?
我的MacBook发现首先,因为它让我惊讶:在Apple Silicon上使用llama.cpp,启用MTP没有加速推理——它减慢了。 (Willison测量了MTP推测解码约72%的加速,但那是CUDA路径;我的M4 Max经验则相反。)所以在Mac上,运行它并接受速度。
Qwen 3.8没有改变数学的奇异新架构——它仍然是一个27B密集模型,所以我过去一年运行这类模型学到的一切直接适用。这是我诚实的映射:
- RTX 3090 / 4090 (24GB): Q4到Q8(2个GPU)舒适地适合。这是日常使用开始感觉真实的地方——社区报告在CUDA设备上使用MTP时40-70 tok/s,与我期望的这类卡一致。
- RTX 5090 (32GB): 现在的甜蜜点。NVFP4加MTP在单流中超过200 tok/s,包含完整上下文。如果你在2026年为本地AI购买一张卡,就是这张。
- DGX Spark / MacBook Pro: 它能运行,而且看起来令人印象深刻——我正是因为在旅行中遇到了这个模型。但对于日常使用来说它仍然太慢。将其视为旅行模型。
这里没有虚假的解决方案:如果你唯一的机器是笔记本电脑,你需要前沿级思考,今天的诚实答案是租用GPU或等待一代芯片。智慧在你口袋里;耐心不在。
6、我是如何到达这里的
2026年初,我第一次使用Opus 4.6,我会说实话:我很震惊。不是"令人印象深刻"——震惊。那个模型驱使我构建自己的代理AZPal,因为如果订阅能做到那样,我希望我的一个在自己的硬件上运行。
Qwen 3.5–27B是实际让这个代理在本地工作的模型。然后Qwen 3.6–27B接管了——它今天仍然处理我大约90%的日常工作。但边缘案例不断溜走:问题在于更快、更浅的模型只是放弃或猜测。
这个差距是我上个月转向DeepSeek V4 Flash 0731的原因。它极大地提高了代理智能——第一个感觉像是在思考我的代码库而不是模式匹配它的本地模型。但它需要我所有的五个RTX 3090来运行,而且它的预填充速度太慢,长时间会话就像在跑步机上看着油漆变干。
然后Qwen 3.8–27B出来了,数学终于奏效了:DeepSeek V4 Flash级别的智能,一张卡,带视觉。 这个列表中的每个模型都为我做了一项特定工作——Opus教我什么是可能的,DeepSeek向我展示了代理可以思考得更好,而Qwen 3.8是第一个我可以放在桌面上而没有电费的。
7、接下来会发生什么
方向现在很清楚:本地AI不再是玩具或补充品。 它是主要事件,并且同时在两条战线上发生。
首先,小模型变得比我们预期的更快更聪明——这个发布从"27B"到"代理工具中的Sonnet级别"只用了一代,社区在发布几天内在单张卡上找到了200 tok/s。其次,硬件正在赶上:AMD在第一天就在Ryzen AI Max+笔记本芯片上测量了这个确切模型,达到24.5令牌每秒——RTX 3090级硅芯片正在进入移动设备形态。
将这两种力量结合在一起,预测并不疯狂:DeepSeek V4 Flash级别的智能在你口袋中运行,在适合手机的芯片上。 我在旅行中遇到了这个模型,我的GPU留在家里。下一代不需要旅行的借口。
原文链接:I Ran Qwen 3.8–27B on a MacBook While Traveling — and It Blew My Mind
汇智网翻译整理,转载请标明出处