Qwen3.8-Flash-Next 快速指南
大型语言模型正在成为强大的软件开发工具,但许多开发者仍然依赖云API来访问它们。
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
在本实验中,我想尝试一种不同的方法:在本地运行Qwen3.8-Flash-Next,并使用llama.cpp和OpenCode将其转变为编码代理。
最终架构如下:
Qwen3.8-Flash-Next
↓
UD-Q4_K_XL GGUF
↓
llama.cpp
↓
OpenAI兼容API
↓
OpenCode
↓
本地编码代理
结果是一个令人惊讶的强大本地开发环境。

1、什么是Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next是一个开源权重的**混合专家(MoE)**模型,于2026年8月26日发布。
它具有:
- 125B总主参数
- 每个token约6B活跃参数
- 51B额外的n-gram嵌入参数
- 262K原生上下文
- 理论上支持最多1M tokens(使用YaRN)
该架构包括Gated DeltaNet、Qwen稀疏注意力(QSA)、Gated残差连接和n-gram嵌入。这些技术旨在提高效率、信息流和长上下文处理能力。
在编码方面,Qwen在DeepSWE、SWE-bench Pro、SWE-bench Multilingual和Toolathlon Verified等基准测试中报告了强劲的结果,尽管这些是供应商报告的结果。

2、硬件要求
我使用**NVIDIA RTX PRO 6000(96GB显存)**测试了该模型。
然而,你不一定需要96GB显存,因为llama.cpp可以将模型组件卸载到系统内存中。
UD-Q4_K_XL GGUF版本大约111GB,分为四个文件。
对于实际部署,我建议大约拥有:
140GB+可用RAM和显存
这为运行时提供了额外的空间来容纳模型权重、上下文、KV缓存和开销。

3、 检查你的NVIDIA GPU
在安装了NVIDIA驱动程序的Linux机器上:
nvidia-smi
验证是否显示了你的GPU、驱动程序、CUDA版本和可用显存。
如果你没有NVIDIA GPU,则需要调整此特定CUDA配置;此处测试的设置专门使用CUDA加速。

4、安装构建依赖项
更新Ubuntu并安装所需工具:
sudo apt update
sudo apt install -y \
git \
cmake \
build-essential \
curl \
libcurl4-openssl-dev \
python3-pip
这些工具是获取和编译llama.cpp所必需的。

5、构建llama.cpp
Qwen3.8-Flash-Next使用新的qwen4_exp架构,因此本实验使用的源代码是专门支持Qwen3.8-Flash-Next的Unsloth分支。
创建你的工作空间:
cd /workspace
克隆正确的分支:
git clone \
--branch qwen4exp/qwen3.8-flash-next \
https://github.com/unslothai/llama.cpp.git
进入目录:
cd llama.cpp
使用CUDA构建:
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_BUILD_TYPE=Release
cmake --build build \
--config Release \
-j"$(nproc)"
验证服务器:
./build/bin/llama-server --version
测试的构建报告版本为0.3.0-dev。

6、下载GGUF模型
安装Hugging Face CLI:
pip install -U huggingface_hub
在此设置中,禁用Xet提高了下载可靠性:
export HF_HUB_DISABLE_XET=1
unset HF_XET_HIGH_PERFORMANCE
unset HF_XET_NUM_CONCURRENT_RANGE_GETS
unset HF_HUB_ENABLE_HF_TRANSFER
创建模型目录:
cd /workspace
mkdir -p Qwen3.8-Flash-Next-GGUF
并行下载四个GGUF分片:
for i in 1 2 3 4; do
shard=$(printf "%05d" "$i")
hf download unsloth/Qwen3.8-Flash-Next-GGUF \
"UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-${shard}-of-00004.gguf" \
--local-dir Qwen3.8-Flash-Next-GGUF &
done
wait
完整的量化模型大约需要111GB存储空间。

7、启动本地模型服务器
返回llama.cpp:
cd /workspace/llama.cpp
启动服务器:
./build/bin/llama-server \
-m /workspace/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
--alias qwen3.8-flash-next \
--host 0.0.0.0 \
--port 8080 \
--ctx-size 131072 \
--parallel 1 \
--flash-attn on \
--fit on \
--fit-target 4096 \
--jinja \
--batch-size 1024 \
--ubatch-size 512 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0
该配置使用131K上下文窗口,而不是完整的262K原生上下文。
重要选项包括:
--fit on— 自动将模型层适配到可用GPU内存中。--fit-target 4096— 保留约4GB GPU内存可用。--flash-attn on— 启用Flash Attention。--ctx-size 131072— 提供大型编码上下文。--temp 1.0 --top-p 0.95 --top-k 20— 测试使用的采样配置。

8、测试API
llama.cpp提供OpenAI兼容API。
检查模型:
curl http://127.0.0.1:8080/v1/models
你应该看到:
qwen3.8-flash-next
现在发送编码请求:
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next",
"messages": [
{
"role": "user",
"content": "Write a Python function that checks whether a number is prime."
}
]
}'
有效的响应确认本地推理服务器正在工作。

9、使用llama.cpp WebUI
你也可以通过浏览器与模型交互。
打开:
http://localhost:8080
这提供了一个简单的本地界面来测试提示。
我的第一个测试要求Qwen使用HTML、CSS和JavaScript创建一个完整的政府IT部门网站。
该模型生成了一个令人惊讶的完整应用程序,包含响应式样式、图表、动画、选项卡、JavaScript交互和多个部分。
生成大约花费了13分钟,但结果证明该模型可以做出超出明确要求的实现决策。

10、安装OpenCode
下一个目标是将该模型转变为代理编码助手。
安装OpenCode:
curl -fsSL https://opencode.ai/install | bash
重启终端并验证:
opencode --version
测试的安装报告版本为1.18.23。

11、将OpenCode连接到llama.cpp
创建OpenCode配置目录:
mkdir -p ~/.config/opencode
创建配置:
printf '%s\n' '{"$schema":"https://opencode.ai/config.json","model":"llama.cpp/qwen3.8-flash-next","provider":{"llama.cpp":{"npm":"@ai-sdk/openai-compatible","name":"Qwen3.8 Flash Next Local","options":{"baseURL":"http://127.0.0.1:8080/v1"},"models":{"qwen3.8-flash-next":{"name":"Qwen3.8 Flash Next","limit":{"context":65536,"output":32768}}}}}}' > ~/.config/opencode/opencode.json
关键设置是:
http://127.0.0.1:8080/v1
这告诉OpenCode通过其OpenAI兼容API与本地llama.cpp服务器通信。
我将OpenCode配置为65K工作上下文,在131K llama.cpp上下文中留出额外空间。

12、启动你的本地编码代理
进入你的项目:
cd /workspace/my-project
启动OpenCode:
opencode
你现在拥有:
你的项目
↓
OpenCode
↓
llama.cpp API
↓
Qwen3.8-Flash-Next
↓
本地AI编码代理
此时,你可以给模型正常的软件开发任务。
例如:
构建一个现代的系统分析和任务管理仪表板。
监控CPU、RAM、VRAM、GPU使用情况、温度、磁盘使用情况、
运行进程和临时文件。
在测试中,Qwen首先创建了任务计划,构建了应用程序,收到UI反馈后,然后将其重新设计为更紧凑的系统命令中心。
它还经常在没有明确要求框架时首选原生HTML、CSS和JavaScript,避免不必要的依赖。

13、性能
在RTX PRO 6000设置上,初始推理速度达到约:
80 tokens/秒
随着上下文增加,性能接近:
64 tokens/秒
考虑到这是一个125B参数模型,部分工作负载可能驻留在系统内存中,性能令人惊讶地可用。

14、我学到了什么
最大的收获是本地LLM部署不再局限于简单的聊天机器人实验。
有了正确的硬件和软件栈,你可以构建一个完整的本地AI开发环境:
量化模型 → 本地推理 → API → 代理 → 软件项目
Qwen3.8-Flash-Next在代理编码方面特别令我印象深刻,因为它专注于规划、结构、实现细节和迭代改进,而不仅仅是生成孤立的代码片段。
最大的限制是硬件:UD-Q4_K_XL模型大约111GB,复杂的推理任务可能消耗大量时间和内存。
但如果你的机器有足够的RAM和显存,这是一种在本地运行强大编码模型的引人注目的方法。

15、最终架构
┌──────────────────────────┐
│ Qwen3.8-Flash-Next │
│ 125B MoE / ~6B active │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ UD-Q4_K_XL GGUF │
│ ~111GB │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ llama.cpp │
│ CUDA + 131K Context │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ OpenAI兼容API │
│ localhost:8080/v1 │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ OpenCode │
│ 代理编码 │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ 完全本地AI开发环境 │
└──────────────────────────┘
16、结束语
Qwen3.8-Flash-Next展示了现代开源权重模型正在实现的可能性。
你可以获取一个125B MoE模型,将其量化为可管理的GGUF格式,通过llama.cpp运行,通过OpenAI兼容API公开,并将其连接到OpenCode等代理开发环境。
结果不仅仅是一个本地聊天机器人。
它是一个本地编码基础设施栈,能够规划、生成、调试和迭代软件项目。
对于对本地AI、LLM基础设施、编码代理、GPU推理和私有AI开发感兴趣的开发者来说,这是一个值得尝试的设置。🚀
原文链接:Run Qwen3.8-Flash-Next Locally: A Complete Guide to Building a Local Coding Agent
汇智网翻译整理,转载请标明出处