如何运行无审查版Qwen 3.8 27B
LM Studio、Ollama、适合您RAM的正确GGUF量化、Valyu搜索以及修复"它仍然拒绝"的模型文件设置……
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
社区发布的模型JonathanColetti/Qwen3.8–27B-Uncensored-GGUF是Qwen官方Qwen3.8–27B检查点的消融(减少拒绝)构建的GGUF转换。基础模型是一个270亿参数的密集视觉语言模型,具有262,144个令牌的原生上下文窗口、工具使用支持和Apache 2.0许可证。您可以从Hugging Face下载GGUF量化,在任何具有足够统一内存的Apple Silicon Mac上的LM Studio、Ollama中加载它,并添加Valyu LM Studio插件进行实时网络搜索。
1、模型的准确身份是什么?
Hugging Face上的JonathanColetti/Qwen3.8–27B-Uncensored-GGUF存储库是您将在LM Studio中运行的GGUF文件的主要来源。两者都是由JonathanColetti社区发布的。
基础检查点是Qwen/Qwen3.8–27B,由阿里巴巴的Qwen团队在Hugging Face上发布。根据官方模型卡,Qwen3.8–27B是Hugging Face Transformers格式的后训练模型,兼容vLLM、SGLang和类似的推理引擎。
Qwen团队还指出,任何托管的Qwen Cloud版本都将提供1M上下文长度和内置工具,尽管该服务与开放权重版本是分开的。
"无审查"修改是使用Heretic方法执行的,该方法在不进行额外微调或训练数据的情况下,共同最小化对基础模型KL散度的拒绝计数。根据JonathanColetti构建,在100个有害提示的保留集上,拒绝从98/100下降到12/100,减少了88%。模型卡本身指出拒绝行为已"大幅减少,而非消除"。
2、参数计数和"无审查"标签在实践中意味着什么?
Qwen3.8–27B是一个270亿参数的密集模型,而不是混合专家架构。每个参数对于每个令牌都是活跃的,这意味着完整的模型占用必须在推理时适合内存。Hugging Face上的官方Qwen模型卡和Qwen3.8的LM Studio模型页面都证实了这一点。
Qwen3.8–27B的LM Studio模型页面将其描述为"一个密集的27B视觉语言模型,用于编码、专业工作、研究和长期代理任务,具有可配置的推理和原生262K令牌上下文窗口。"来自主要来源的已确认功能包括:
- 视觉输入:模型接受文本、图像和视频作为输入。LM Studio模型页面和官方Hugging Face描述都证实了多模态支持。
- 上下文窗口:原生262,144个令牌(262K)。Qwen团队指出,托管的Qwen Cloud版本将扩展到1M个令牌,但开放权重版本具有262K限制。
- 工具使用:LM Studio模型页面证实了工具使用支持。unsloth GGUF存储库还指出嵌套对象解析的工具调用改进。
- 可配置推理:模型支持可以切换的思考模式,正如LM Studio模型页面和unsloth存储库所确认的那样。
"无审查"标签特别意味着模型在有害提示上的拒绝行为已通过Heretic消融方法减少。这并不意味着模型没有偏见、事实准确、在每种情况下都安全,或者在您运行它的操作系统、应用程序或平台上没有系统级审核。
JonathanColetti模型卡明确指出:功能、训练数据和架构与基础模型相比没有变化。该修改仅针对激活空间中的拒绝方向。
3、哪些GGUF量化适用LM Studio,要多少内存?
LM Studio在运行macOS 14.0或更新版本的Apple Silicon Mac(M1/M2/M3/M4)上运行。官方LM Studio系统要求页面建议16GB或更多RAM,并指出8GB Mac可以运行具有适度上下文大小的较小模型。不支持基于Intel的Mac。
Qwen3.8–27B的LM Studio模型页面列出了最小可用量化的下载大小为16.10 GB,并指出16 GB RAM是运行它的最低要求。这是一个关键细节:16 GB Mac在技术上可以加载最小的量化,但为上下文、操作系统和其他应用程序留下的空间非常有限。更高的量化(Q5、Q6、Q8)会产生更大的文件,并且需要相应更多的内存。
每个量化的文件大小应在下载前在Hugging Face文件列表中确认。Q4_K_M层级是本地使用的常见选择,如果您的Mac有足够的统一内存来容纳它,这是一个合理的起点。
4、如何在LM Studio中下载、配置和测试模型
步骤1:安装LM Studio
从官方网站下载LM Studio。该应用程序在运行macOS 14.0或更新版本的Apple Silicon Mac上运行。启动应用程序并检查GPU加速选项的设置,这可以帮助模型更有效地使用统一内存。
步骤2:下载GGUF文件
转到Hugging Face上的GGUF存储库。浏览文件部分并选择与您的Mac内存匹配的单个GGUF文件。选择适合您的可用统一内存的量化,为KV缓存和操作系统留出空间。
您可以通过LM Studio的内置模型浏览器直接下载文件。

步骤3:加载模型
下载完成后,转到LM Studio中的聊天选项卡。从顶部的模型选择器中选择下载的模型。LM Studio会将模型加载到统一内存中。观察加载栏,如果模型无法加载或系统开始交换到磁盘(由持续的磁盘活动和非常慢的令牌生成指示),则您的量化对于可用内存来说太大了。切换到更小的量化并重试。
**注意:**根据我在16GB RAM M5 Macbook上尝试多个版本的Qwen消融模型的经验,快速、愉快且不令人沮丧的体验是当您使用Qwen 3.5–9B消融Q4_K_M GGUF模型时。知道这一点非常重要。Qwen 3.8 27B仍然可以加载和工作,但它很慢,几乎无法使用,因为它占用所有内存,可能只是让您的macbook持续挂起。对于64GB M5 Macbook,这不会是个问题!
步骤4:配置上下文和GPU卸载
对于Mac上的27B模型,两个设置最重要:
- **GPU卸载:**将其设置为最大层数。在Apple Silicon上,Metal后端自动处理GPU卸载。LM Studio默认应将所有层卸载到GPU。如果没有,请手动将卸载滑块设置为最大值。
- **上下文长度:**模型原生支持262,144个令牌,但您不应在内存受限的Mac上将上下文设置为最大值。长上下文的KV缓存会消耗大量统一内存。从适度的上下文长度开始,仅在内存余量允许且您的用例需要时才增加。
步骤5:测试模型
从一个简单的提示开始,确认模型正在生成文本。然后使用安全对齐模型通常会拒绝的提示进行测试,例如,虚构的安全漏洞或政治敏感话题的请求。模型应该在基础Qwen3.8–27B会拒绝的地方做出响应,但响应质量取决于量化和具体提示。
通过将图像附加到提示并要求模型描述它来检查视觉输入是否有效。Qwen3.8–27B架构支持图像和视频输入。orcarouter Ollama页面确认其相同消融模型的变体具有"完整mmproj视觉"。
通过在LM Studio中启用工具使用格式并提供简单的函数定义来测试工具调用。unsloth Qwen3.8–27B存储库指出嵌套对象解析的工具调用改进,这表明该架构是为代理工作流设计的。
5、运行无审查Qwen模型的其他三种方式
如果您的Mac缺乏运行27B密集模型的统一内存,或者您更喜欢不同的部署风格,三种替代方案涵盖了从本地CLI到托管API的范围。
选项1:Ollama用于更简单的本地CLI
Ollama是用于运行GGUF模型的命令行推理引擎。Ollama上的orcarouter/Qwen3.8–27B-Uncensored页面列出了具有Q4_K_M量化标签的模型,并报告了16.9K下载量。Ollama页面确认消融变体的完整mmproj视觉支持、工具调用、思考模式和262K上下文。
要运行它:
ollama run orcarouter/Qwen3.8-27B-Uncensored
Ollama可以帮助选择量化和内存管理。相同的统一内存约束适用:模型权重和KV缓存仍然必须适合您的Mac RAM。
Ollama默认不提供图形聊天界面,但它提供本地API,其他工具和脚本可以调用。如果您已经使用LM Studio,Ollama以更轻的占用空间和无GUI开销覆盖相同的硬件领域。
选项2:Hetzner云GPU服务器用于远程推理
如果您的本地硬件无法容纳27B模型,您可以租用配备GPU的云服务器并在那里运行模型。
Hetzner云提供适合LLM推理的GPU服务器。根据2026年设置指南,Hetzner的GPU产品范围从预算仅限CPU的实例到专用RTX 4000 Ada GPU服务器,每月约184欧元,2026年6月后的定价在指南中有记录。
这种方法将推理工作负载完全从您的Mac上移开。您的提示和模型的响应通过SSH隧道传输到远程GPU并返回。模型本身在服务器的VRAM上运行,因此您的Mac统一内存不是限制。您负责服务器的安全配置、防火墙规则和成本管理。
您可以从实验页面直接运行许多开放模型。
选项3:Featherless用于无基础设施的托管API
Featherless将Qwen3.8–27B-Uncensored模型作为具有固定费率的API端点托管,这意味着您可以调用模型而无需下载权重、配置服务器或管理GPU驱动程序。
它还提供与OpenAI聊天完成格式兼容的API,因此您可以将兼容的客户端指向Featherless端点。这包括接受自定义基础URL的Python脚本、编码助手和代理框架。您不控制量化、上下文窗口上限或底层硬件,这些由托管提供商决定。
权衡是隐私和控制。您发送到托管API的每个提示都会离开您的机器,并在您不拥有的基础设施上处理。对于研究和实验,这可能是可以接受的。对于敏感或机密工作负载,Mac上的本地推理或像Hetzner选项这样的自管理服务器为您提供了更强的隐私边界。
6、三种替代方案的比较

7、模型支持哪些用例,还有哪些限制?
- 研究和实验:减少的拒绝行为让研究人员可以研究模型在对齐模型拒绝的提示上的行为。消融技术本身是一个持续学术研究的主题,arXiv论文检查了该方法及其防御。
- 编码辅助:Qwen3.8–27B是为编码任务设计的,无审查构建保留了此功能。模型卡指出架构和训练数据与基础模型相比没有变化。
- 起草和长文本生成:具有262K上下文窗口,模型可以处理长文档。这对于总结冗长的论文、起草技术文档的部分内容或生成结构化输出很有用。
- 本地数据分析:因为推理在您的Mac上运行,您可以将敏感文档提供给模型,而无需将它们发送到云API。除非您添加外部检索步骤,否则推理保留在您的机器上。
8、需要理解的限制
- 幻觉:减少的拒绝行为不会提高事实准确性。模型仍然会生成不正确的信息,并且在对齐模型会拒绝或犹豫的主题上,它可能会更自由地这样做。来自模型的每个事实声明都需要人工验证。
- 安全:消融移除了安全机制。模型可能产生有害、误导性或不适合上下文的输出。这是一个研究工具,而不是生产助手。orcarouter博客将其变体标记为"仅限研究",相同的原则适用于JonathanColetti构建。
- 高风险领域:对于医疗、法律、金融或网络安全用例,减少的拒绝行为不能替代专业判断、安全控制或人工审查。
- 许可:Apache 2.0允许商业用途,但您负责合规。许可证包含特定条款和条件,您应在模型卡上完整阅读。开放可用性不会自动赋予所有商业权利而没有义务。
- 隐私边界:本地推理将您的提示和模型的响应保留在您的机器上。如果您添加网络搜索插件,这些查询会离开您的Mac并传输到外部API。本地推理本身保持私密;检索步骤则不然。
9、如何添加网络搜索和检索
LM Studio支持扩展本地模型与外部工具的插件。Valyu插件可在LM Studio Hub上获得。它使LM Studio中的本地LLM能够搜索网络并实时获取网页内容。
- 安装插件。单击"添加到LM Studio"直接安装。
- 从platform.valyu.ai获取API密钥。新账户获得10美元免费积分,无需信用卡。
- 在LM Studio内的插件设置中添加您的API密钥。打开插件配置,粘贴密钥并保存。
配置后,插件使您的本地模型能够在对话期间调用网络搜索工具。当模型确定需要当前信息时,它会将搜索查询发送到Valyu API,该API返回模型可以合并到其响应中的网页内容。
10、这改变了什么和没有改变什么
它使模型能够访问来自网络的当前信息。网络搜索步骤是一个工具,而不是事实基础的保证。
Valyu的索引涵盖学术文献、同行评审研究、监管文件、技术标准、PDF、专业来源和更广泛的网络。这意味着搜索查询可以从主要文档中提取,而不是依赖第三方摘要,这对于源出处很重要的研究工作流很有用。
原文链接:How to Run an Uncensored Qwen 3.8 27B on your Macbook
汇智网翻译整理,请转载文章时标明出处。