Qwen 3.8 27B:3090比4090快
阿里巴巴的27B模型在4位量化下可以装入24GB显卡。推理努力程度、上下文窗口和推理运行时决定了你得到的结果,而不是显卡。
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
一位英国程序员让Qwen 3.8 27B绘制一只骑自行车的鸟的SVG图。在128GB M5 Max MacBook Pro上运行LM Studio和17GB的Q4_K_M量化版本,它花了22,000个token思考,然后生成了3,223个token的答案,当被要求绘制一个普通圆圈时,它推理了几分钟。他写道这是一个有趣的默认设置,"绝对不是运行模型的好方法,尤其是在消费级硬件上"。
没有什么损坏。Qwen 3.8将reasoning_effort设置为其最深级别,因此每个请求都会获得最大 deliberation,直到你另行告知,包括"重命名此变量"。
速度数字遵循完全相同的模式。在当前的llama.cpp构建上,4位GGUF在4090上以每秒49个token的速度解码。在较旧的RTX 3090上,使用W4A16权重和推测解码的修补vLLM堆栈每秒可推送约114个token。相同内存,更差的GPU,吞吐量超过两倍。
文件是常量,配置是变量,两个运行相同17GB构建的人之间的差距不是显卡。
1、8月14日发布的内容
Qwen于2026年8月14日在Hugging Face上发布了27.78B dense模型,采用Apache 2.0许可证。它接受文本、图像和视频输入以生成文本输出,支持262,144个token的原生上下文窗口。你可以通过YaRN将该上下文扩展到1M,这是一种缩放技巧,可以将窗口扩展到模型训练时所用的范围之外,尽管静态YaRN可能会损害较短的提示。发布时的官方格式包括55.58GB BF16 safetensors构建和30.88GB的分块FP8构建。虽然第一天没有官方GGUF,但来自ggml-org、lmstudio-community和unsloth的第三方构建现已广泛可用。
阿里巴巴在两天前发布了2.4T Qwen3.8-Max的开放权重,这是一个具有95B活跃参数的混合专家(MoE)模型,采用其自己的许可证开放权重,但27B仍然是3.8系列中唯一的27B dense开放模型。
64个解码器层中有48个是Gated DeltaNet,只有16个执行完全注意力。Gated DeltaNet是一种线性注意力层类型,它保持固定大小的运行状态,而不是随每个token增长的缓存。标准注意力机制呈二次方扩展,因为模型必须将每个新token与序列中的每个先前token进行比较,这在长上下文时消耗更多内存。线性注意力通过将历史压缩为递归状态来避免这种情况。这种48比16的分割是27B模型能够在消费级内存上保持262K上下文的原因,为适应本地显卡所需的KV计算奠定了基础。这种形状的传统64层dense模型将承担大得多的缓存负担。
由于它是dense模型而不是MoE,每个参数都会在每个token上触发,没有专家路由,这意味着你的硬件必须为每个生成步骤加载和计算整个权重矩阵。

2、花费数分钟的设置
该模型附带三个文档化的推理级别:low、medium和xhigh,思考可以完全关闭,默认为xhigh。官方仓库在发布后立即充满了用户报告,标题如"这个模型无法停止思考"和"一个疯狂的思考模型"。
你通过传递标志来更改此行为,一份报告指出,将推理努力程度降低到medium可以将等待时间减少约三分之一,而没有可测量的质量下降,为开发者节省了数分钟的挂钟时间。在llama.cpp中,你在llama-server运行命令中附加--chat-template-kwargs '{"reasoning_effort":"medium"}'。API路径需要在chat_template_kwargs中设置enable_thinking为false,同时设置reasoning_effort="low"。Ollama默认开启思考,但提供"无思考"设置。
给定固定的768个token思考预算,它在190个token中位数下完成了120个推理运行中的117个,而Qwen3.6只完成了28个并且一直达到768上限,所以deliberation不是模型慢,而是被告知要彻底。

3、内存开销
要在消费级显卡上装入模型,你必须计算KV缓存,即对话的运行内存,它随每个token增长。该模型有16个完全注意力层,每个层有4个KV头和256维头,需要两个张量用于键和值,每个张量两个字节。这计算出每个token 64KB。你可以通过使用FP8或Q8缓存立即将64KB的负担减半,用少量精度换取双倍的上下文长度。
在标准16位精度下,缓存在8K上下文时占用0.5 GiB,32K时占用2 GiB,128K时占用8 GiB,完整262K时占用16 GiB。你将其添加到视觉投影仪,即将图像转换为模型可读token的部分,成本约为0.93 GiB。量化将权重缩减为更少的位数,4位变体范围从15.932 GiB到19 GiB,具体取决于你使用的是哪个构建。

在纯文本评估运行中,4090上的峰值VRAM在64K时运行21 GB。该占用空间在24 GB显卡上留下3 GB的余量。
如果你在不固定上下文的情况下将相同文件加载到llama.cpp中,其默认设置会保留超过65,000个token的窗口,进程占用超过31GB。根据非正式测试,Ollama的默认保留超过35GB。相同文件在不同配置上,21GB调优对比31GB默认设置,这就是10GB的去向。
4、你已经安装的运行时
你运行的软件决定了你获得的速度,从Ollama和LM Studio提供最简单的路径开始,但开箱即带未优化的内存保留。升级一步是llama.cpp,它需要当前构建,但提供内存控制以在预填充时达到每秒3,001个token(读取你的提示),在解码时达到每秒49.09个token(写入答案)。
修补的vLLM 0.27.1堆栈将上限更改为在较旧的RTX 3090上单个用户约每秒114个token,并在64个并发流时扩展到约每秒1,035个token(github.com/syv-ai/qwen38–27b-rtx3090)。成本是工程时间和维护责任。它需要9个优化,作为13个vLLM补丁发布,W4A16权重,以及轻微的质量下降。
W4A16意味着权重被量化为4位整数以节省内存带宽,但激活保持在16位浮点数以保持计算精度。这种混合方法让GPU从VRAM流式传输模型参数非常快,同时仍然准确执行繁重的矩阵乘法数学。如果你运行一个小工程团队,每秒1,035个token意味着一个24GB显卡可以服务整个团队,让你用配置时间换取硬件预算。
Qwen 3.8携带一个MTP头,一个多token预测层,它猜测接下来的几个token,以便大模型可以在一次通过中验证多个。根据contextstudios.ai指南,这种推测解码在5090上报告了81%的增益,在DGX Spark上72%,在AMD Strix Halo上183%。
当前llama.cpp构建上的4090比相同构建上的3090更快,得分为46对比40基线。调优vLLM堆栈上的3090击败了两者。显卡设置上限,堆栈决定你有多接近。

5、是否比你正在运行的更好
一张卡,一个量化,一个llama.cpp构建,这是此比较有意义的唯一方式。一位仔细的测试者在相同的RTX 4090上运行Qwen3.8–27B、Qwen3.6–27B和Gemma 4 31B,使用相同的Q4_K_M量化和相同的种子集。

数字揭示了升级的实际成本。Qwen 3.8和Qwen 3.6具有相同的内存曲线,在64K上下文时达到20,266 MiB的峰值,并且它们以完全相同的速度解码。因为硬件占用空间不变,从12个编码任务中的8个跳到完美的12/12 pass@1完全免费。在日常驾驶中,12/12的通过率意味着你可以信任模型进行零次重构而无需监督输出,将玩具助手转变为可靠工具。
Gemma 4保留特定优势,在视觉任务上19比18,多步工具调用30比28,而Qwen3.6在机械约束方面更好,11比12对比新模型的8。Gemma在此级别中的主要弱点是内存消耗,在64K上下文的F16 K/V上遇到CUDA内存不足错误,需要量化缓存才能通过,而Qwen3.8完成测试时剩余4.20 GiB。
Artificial Analysis排行榜在xhigh推理努力程度上对该模型评分为52,比Qwen3.6-27B高出14分。

6、运行什么,根据你拥有的

你首先更改推理努力程度,因为它不花费任何东西,其次更改上下文窗口,因为它回收浪费的内存,最后更改运行时,因为它需要实际工程。一个启动Ollama并接受xhigh思考默认值和35GB上下文保留的开发者会立即宣布模型臃肿和缓慢,而一个传递单个JSON标志并将上下文固定到64K的开发者将获得一个响应迅速的助手,编写完美的代码。硬件是相同的,堆栈的知识将他们分开。
7、结束语
每个开发者下载的文件都是相同的,他们在24GB级硬件上从中提取的性能从每秒49个token到114个token不等。使用Qwen3.8–27B的第一个小时值得花在设置上,而不是购买5090,因为正如硬件指南所指出的,"硬件很少是瓶颈,推理堆栈才是"。此系列中较小的官方模型尚未发布,当9B出现时,相同的三个杠杆将决定它是否可在16GB笔记本电脑上使用。
原文链接: Qwen 3.8 27B Runs Faster on a 3090 Than a 4090. The GPU Isn’t Why.
汇智网翻译整理,转载请标明出处