Qwen3.8-27B:只是测试出色?
每天早上我都会收到一封电子邮件,告诉我我的报纸(摘要)已经发出。今天早上没有邮件。ThinkIdiot Digest每天发布。一个代理阅读当天的AI新闻,检查热门论文,检查GitHub,编写版本,将其放在网站上,并告诉我它已经完成,而构建它的全部意义就在于我不应该参与其中。
昨天的版本正常发布,我们使用的是qwen 3.6。今天早上运行开始了,思考了二十分钟,达到超时并死亡,没有任何成果。我刚刚安装的模型是qwen 3.8 27b(在本文后面我们将只称其为qwen 3.8),四天前它给了我那台机器上记录过的最佳基准结果。
1、通过所有测试的模型
我上周写了一篇nemotron-3.5-lightning、qwen3.6和muse-glimmer的比较,当时的结论是qwen3.6保住了工作。当qwen3.8发布时,我下载并运行了相同的套件,期望有小幅改进。它横扫了一切:十三个陷阱问题,十三个正确,包括那些著名答案是错误的问题。
当我对它撒谎并坚持正确答案是错误的时候,它四次中有四次坚持了自己的立场,这是qwen3.6和nemotron都没有做到的。它解决了一个让三个更大的模型耗尽所有推理预算而一无所获的立方体滚动谜题。它运行了一个可能创建错误采购订单的工具任务,它没有创建错误采购订单。一个做到所有这些的模型显然可以写报纸,但你知道发生了什么:)。
2、二十分钟的思考是什么样子的
我的第一个理论是下载错误,这是错的。我的第二个理论是我配置错了什么,我仍然不能完全排除这种可能性。真正站得住脚的解释比这两种都更无聊,我可以用我自己机器上的数据来证明。
基准测试问题是单轮的,我发送一个提示,模型思考,模型回答,我评分。所有让qwen3.8令人印象深刻的事情都发生在单轮中,因为正确阅读陷阱问题、拒绝被说服放弃正确答案并一直解决谜题都是模型在说话之前花费令牌来做的事情。
每日摘要 | ThinkIdiot每天早上一篇AI新闻报道。发布了什么,破坏了什么,以及它实际上意味着什么。
每日AI摘要不是单轮,而是十七个步骤,而一个步骤很少是一次模型调用。代理搜索、打开来源、检查日期、删除昨天涵盖的内容、打开带日期的论文页面、阅读论文、检查每个图形的许可证、打开GitHub Trending、阅读README、构建引用、编写版本、检查自己的链接并提交结果。其中每一个都是一个新的调用,携带到目前为止的整个对话,模型在每个调用之前都会思考。
Qwen3.8在我的Spark上以大约27个令牌/秒的速度生成。Qwen3.6大约71个。我的推理预算是8,192个令牌,思考令牌在任何答案或工具调用出现之前出现。将一个数字除以另一个数字,模型使用其完整预算的单个步骤成本约为五分钟,这五分钟不会产生任何我能看到的东西。
四个困难步骤和超时在第一个段落存在之前就杀死了运行。在基准测试上,同样的行为获得了满分,因为深度思考正是它击败立方体的方式,而更大的模型超时了。基准测试为此思考向我收取了一次费用,而我的代理向我收取了十七次费用。
3、税收之下的税收
还有第二种成本,这是我测量过但不理解其含义的成本。代理循环中的每一轮都会重新阅读之前的所有内容。第二轮携带搜索结果,第九轮携带九个步骤的工具输出,模型必须在执行任何新操作之前再次阅读所有内容。我的干草堆中的针测试测量了它的扩展方式,它的扩展方式是错误的。
qwen3.8以801个令牌/秒的速度读取小提示,以569个令牌/秒的速度读取大提示,因此每一轮都比前一轮开始得更慢。对120,000个令牌的一次遍历需要234.8秒。Nemotron在62.8秒内完成相同的遍历,并找到相同的三个隐藏事实。
这种差距不是调整意外。Nemotron-3.5-lightning是NVIDIA的混合Mamba-MoE设计,具有一百万个令牌窗口,是qwen给我的四倍,而廉价的重复遍历不断增长的上下文正是该架构存在的原因。我的代理大部分早晨都在做同样的事情,阅读它即将丢弃的页面。
4、我改变了什么
我不再试图让仔细的模型更快,而是给它更少的轮次。Nemotron现在运行循环。它扫描公司博客、技术媒体、带日期的Hugging Face论文页面和GitHub Trending,收集比版本需要的更多的候选,然后丢弃大部分作为太旧、已涵盖、不受支持或纯粹是营销的内容。它吸收所有被丢弃的工作,这是大部分工作,而这些都不会到达撰稿人。
存活下来的内容成为一份简短的记录,每次都有相同的七个字段:标题、日期、主要来源、已验证的事实、重要数字、限制以及它可能重要的原因。这些是给撰稿人的笔记,而不是给读者的句子。
然后qwen3.8得到一轮。它阅读笔记,找到当天故事之间的诚实线索,并编写版本。它赢得基准测试的所有内容仍然在那里,我现在只为它支付一次。当它发生在决定读者实际看到什么的那一步时,五分钟的仔细思考是一笔划算的交易。
所有有正确答案的内容都移动到一个在写作和发布之间运行的脚本:日期、版本号、标题、故事计数、图像放置、源链接、损坏的URL、重复内容、剩余的占位符文本。如果检查失败,则不发布任何内容。
5、你可以读出区别
这是我没想到能向你展示的部分。昨天的版本完全由qwen3.6编写。今天的版本来自nemotron加上qwen3.8。两者都是实时的,差距是可以计数的。
今天的(2026年8月18日)摘要:
Nvidia SpaceX股份、Nemotron 3.5和GPT-5.6视觉Nvidia将其芯片需求与其SpaceX投资联系起来,AWS部署Nemotron 3.5 Lightning,GPT-5.6改进对象……
昨天的(2026年8月17日)摘要:
Stripe以70亿美元收购OpenRouter,OpenAI解散其AI安全团队Stripe更接近以70亿美元收购AI网关初创公司OpenRouter,而OpenAI关闭内部……
昨天的论文部分有两个条目,都没有链接到论文。一个指向数学家的博客文章,另一个指向关于研究人员工作的新闻文章,这是很好的阅读材料,但不是该部分所承诺的。存储库部分有一个项目,其描述来自其自己的营销网站,而不是其GitHub页面。源列表包含六个条目,其中两个是同一个TechCrunch URL打印了两次。
今天的论文部分有三个arXiv链接,在每个标题下方是从论文本身提取的方法图形,带有说明并链接回去。存储库部分有三个项目,每个都链接到GitHub,在规范的趋势页面下。十二个来源,没有重复。
写作也改变了,而且是在我比计数更关心的方向上。今天的版本大声说NVIDIA的吞吐量数字来自NVIDIA自己的评估设置,而Roboflow的检测基准是Roboflow自己即将推出的基准,而不是行业标准。它指出一个趋势存储库称自己为工作原型,因此无人值守的生产使用需要仔细测试。没有人要求这些警告。它们来自研究阶段,将限制作为必需字段传递,因此撰稿人手头有这些信息,而不必记住要小心。
公平地说,对于qwen3.6,管道规则在与模型相同的早晨发生了变化,因此这是两个系统的比较,而不是干净的模型对模型的测试。方法图形出现是因为我添加了一条规则来提取它们,而不是因为更聪明的模型想到了它。
6、机器为我写了结论
今天的版本涵盖了Nemotron 3.5 Lightning登陆AWS,这是一个我无法安排的巧合。该故事底部的观点是:
代理中的每个步骤并不都需要最强大的模型。快速模型可以处理日常工作,而更强大的模型可以接管困难的决策。困难的部分是决定交接在哪里。
我的管道在几天前围绕这个想法重建之后发布了这句话,这要么意味着设计很明显,要么意味着我教会了我的报纸同意我。
7、我可能仍然做错了
上次我运行这样的实验时,我发现的两个错误最终是我的,因此值得明确这里的限制。这是一台机器、一个工具和一组设置。
我没有排除的可能性:
- 我的上下文设置可能迫使整个提示在每次调用时都被重新处理,而不是重用。
- 我的推理预算没有每个步骤的上限,因此一个困难步骤可以花费所有预算,我的工具重新发送整个历史记录而不是摘要,而我唯一的超时是最终杀死运行的超时,而不是会告诉我哪里卡住的每个步骤限制。
其中任何一个都可能将一个慢模型变成一个死模型,而配置更好的设置可能比我从qwen3.8作为代理中获得的更多。如果你在Spark上的循环中运行它并且它表现正常,告诉我你做了什么不同的事情。
我认为不是配置的问题是问题的形状。一个仔细思考的模型在每一轮都为这种思考付费,因此你给它的轮次数量比你给它的分数更重要。基准测试测量一个答案。代理生活在循环中。赢得第一个的模型可能是第二个的错误选择,当这种情况发生时,修复不是去寻找更好的模型。而是计算你要求它的次数。
8、我如何测试的
基准测试通过Ollama在一台NVIDIA DGX Spark上本地运行,完全驻留在GPU上,Q4_K_M,温度0,种子42,每个模型使用相同的提示和工具。qwen3.8是27.3B参数,磁盘上17 GB,262,144个令牌上下文。qwen3.6是36.0B,23 GB,相同的窗口。nemotron-3.5-lightning是32.9B,25 GB,1,048,576个令牌窗口。muse-glimmer是27.9B,18 GB。
失败的摘要运行是一次生产尝试,而不是受控实验,版本比较涵盖了两个连续的早晨,因此将其视为证据而不是证明。:)
原文链接:Why Qwen3.8-27B Looked Brilliant in Testing But Failed to Ship My AI Newspaper
汇智网翻译整理,请转载文章时标明出处。