Qwen3.8-Flash-Next 快速指南

大型语言模型正在成为强大的软件开发工具,但许多开发者仍然依赖云API来访问它们。

Qwen3.8-Flash-Next 快速指南
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

在本实验中,我想尝试一种不同的方法:在本地运行Qwen3.8-Flash-Next,并使用llama.cpp和OpenCode将其转变为编码代理。

最终架构如下:

Qwen3.8-Flash-Next
        ↓
UD-Q4_K_XL GGUF
        ↓
llama.cpp
        ↓
OpenAI兼容API
        ↓
OpenCode
        ↓
本地编码代理

结果是一个令人惊讶的强大本地开发环境。

None

1、什么是Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next是一个开源权重的**混合专家(MoE)**模型,于2026年8月26日发布。

它具有:

  • 125B总主参数
  • 每个token约6B活跃参数
  • 51B额外的n-gram嵌入参数
  • 262K原生上下文
  • 理论上支持最多1M tokens(使用YaRN)

该架构包括Gated DeltaNet、Qwen稀疏注意力(QSA)、Gated残差连接和n-gram嵌入。这些技术旨在提高效率、信息流和长上下文处理能力。

在编码方面,Qwen在DeepSWE、SWE-bench Pro、SWE-bench Multilingual和Toolathlon Verified等基准测试中报告了强劲的结果,尽管这些是供应商报告的结果。

None

2、硬件要求

我使用**NVIDIA RTX PRO 6000(96GB显存)**测试了该模型。

然而,你不一定需要96GB显存,因为llama.cpp可以将模型组件卸载到系统内存中。

UD-Q4_K_XL GGUF版本大约111GB,分为四个文件。

对于实际部署,我建议大约拥有:

140GB+可用RAM和显存

这为运行时提供了额外的空间来容纳模型权重、上下文、KV缓存和开销。

None

3、 检查你的NVIDIA GPU

在安装了NVIDIA驱动程序的Linux机器上:

nvidia-smi

验证是否显示了你的GPU、驱动程序、CUDA版本和可用显存。

如果你没有NVIDIA GPU,则需要调整此特定CUDA配置;此处测试的设置专门使用CUDA加速。

None

4、安装构建依赖项

更新Ubuntu并安装所需工具:

sudo apt update
sudo apt install -y \
  git \
  cmake \
  build-essential \
  curl \
  libcurl4-openssl-dev \
  python3-pip

这些工具是获取和编译llama.cpp所必需的。

None

5、构建llama.cpp

Qwen3.8-Flash-Next使用新的qwen4_exp架构,因此本实验使用的源代码是专门支持Qwen3.8-Flash-Next的Unsloth分支。

创建你的工作空间:

cd /workspace

克隆正确的分支:

git clone \
  --branch qwen4exp/qwen3.8-flash-next \
  https://github.com/unslothai/llama.cpp.git

进入目录:

cd llama.cpp

使用CUDA构建:

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_BUILD_TYPE=Release
cmake --build build \
  --config Release \
  -j"$(nproc)"

验证服务器:

./build/bin/llama-server --version

测试的构建报告版本为0.3.0-dev

None

6、下载GGUF模型

安装Hugging Face CLI:

pip install -U huggingface_hub

在此设置中,禁用Xet提高了下载可靠性:

export HF_HUB_DISABLE_XET=1
unset HF_XET_HIGH_PERFORMANCE
unset HF_XET_NUM_CONCURRENT_RANGE_GETS
unset HF_HUB_ENABLE_HF_TRANSFER

创建模型目录:

cd /workspace
mkdir -p Qwen3.8-Flash-Next-GGUF

并行下载四个GGUF分片:

for i in 1 2 3 4; do
  shard=$(printf "%05d" "$i")
  hf download unsloth/Qwen3.8-Flash-Next-GGUF \
    "UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-${shard}-of-00004.gguf" \
    --local-dir Qwen3.8-Flash-Next-GGUF &
done
wait

完整的量化模型大约需要111GB存储空间

None

7、启动本地模型服务器

返回llama.cpp:

cd /workspace/llama.cpp

启动服务器:

./build/bin/llama-server \
  -m /workspace/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
  --alias qwen3.8-flash-next \
  --host 0.0.0.0 \
  --port 8080 \
  --ctx-size 131072 \
  --parallel 1 \
  --flash-attn on \
  --fit on \
  --fit-target 4096 \
  --jinja \
  --batch-size 1024 \
  --ubatch-size 512 \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0

该配置使用131K上下文窗口,而不是完整的262K原生上下文。

重要选项包括:

  • --fit on — 自动将模型层适配到可用GPU内存中。
  • --fit-target 4096 — 保留约4GB GPU内存可用。
  • --flash-attn on — 启用Flash Attention。
  • --ctx-size 131072 — 提供大型编码上下文。
  • --temp 1.0 --top-p 0.95 --top-k 20 — 测试使用的采样配置。
None

8、测试API

llama.cpp提供OpenAI兼容API

检查模型:

curl http://127.0.0.1:8080/v1/models

你应该看到:

qwen3.8-flash-next

现在发送编码请求:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next",
    "messages": [
      {
        "role": "user",
        "content": "Write a Python function that checks whether a number is prime."
      }
    ]
  }'

有效的响应确认本地推理服务器正在工作。

None

9、使用llama.cpp WebUI

你也可以通过浏览器与模型交互。

打开:

http://localhost:8080

这提供了一个简单的本地界面来测试提示。

我的第一个测试要求Qwen使用HTML、CSS和JavaScript创建一个完整的政府IT部门网站。

该模型生成了一个令人惊讶的完整应用程序,包含响应式样式、图表、动画、选项卡、JavaScript交互和多个部分。

生成大约花费了13分钟,但结果证明该模型可以做出超出明确要求的实现决策。

None

10、安装OpenCode

下一个目标是将该模型转变为代理编码助手

安装OpenCode:

curl -fsSL https://opencode.ai/install | bash

重启终端并验证:

opencode --version

测试的安装报告版本为1.18.23

None

11、将OpenCode连接到llama.cpp

创建OpenCode配置目录:

mkdir -p ~/.config/opencode

创建配置:

printf '%s\n' '{"$schema":"https://opencode.ai/config.json","model":"llama.cpp/qwen3.8-flash-next","provider":{"llama.cpp":{"npm":"@ai-sdk/openai-compatible","name":"Qwen3.8 Flash Next Local","options":{"baseURL":"http://127.0.0.1:8080/v1"},"models":{"qwen3.8-flash-next":{"name":"Qwen3.8 Flash Next","limit":{"context":65536,"output":32768}}}}}}' > ~/.config/opencode/opencode.json

关键设置是:

http://127.0.0.1:8080/v1

这告诉OpenCode通过其OpenAI兼容API与本地llama.cpp服务器通信。

我将OpenCode配置为65K工作上下文,在131K llama.cpp上下文中留出额外空间。

None

12、启动你的本地编码代理

进入你的项目:

cd /workspace/my-project

启动OpenCode:

opencode

你现在拥有:

你的项目
     ↓
OpenCode
     ↓
llama.cpp API
     ↓
Qwen3.8-Flash-Next
     ↓
本地AI编码代理

此时,你可以给模型正常的软件开发任务。

例如:

构建一个现代的系统分析和任务管理仪表板。
监控CPU、RAM、VRAM、GPU使用情况、温度、磁盘使用情况、
运行进程和临时文件。

在测试中,Qwen首先创建了任务计划,构建了应用程序,收到UI反馈后,然后将其重新设计为更紧凑的系统命令中心。

它还经常在没有明确要求框架时首选原生HTML、CSS和JavaScript,避免不必要的依赖。

None

13、性能

在RTX PRO 6000设置上,初始推理速度达到约:

80 tokens/秒

随着上下文增加,性能接近:

64 tokens/秒

考虑到这是一个125B参数模型,部分工作负载可能驻留在系统内存中,性能令人惊讶地可用。

None

14、我学到了什么

最大的收获是本地LLM部署不再局限于简单的聊天机器人实验。

有了正确的硬件和软件栈,你可以构建一个完整的本地AI开发环境:

量化模型 → 本地推理 → API → 代理 → 软件项目

Qwen3.8-Flash-Next在代理编码方面特别令我印象深刻,因为它专注于规划、结构、实现细节和迭代改进,而不仅仅是生成孤立的代码片段。

最大的限制是硬件:UD-Q4_K_XL模型大约111GB,复杂的推理任务可能消耗大量时间和内存。

但如果你的机器有足够的RAM和显存,这是一种在本地运行强大编码模型的引人注目的方法。

None

15、最终架构

┌──────────────────────────┐
│ Qwen3.8-Flash-Next       │
│ 125B MoE / ~6B active   │
└────────────┬─────────────┘
             │
             ▼
┌──────────────────────────┐
│ UD-Q4_K_XL GGUF          │
│ ~111GB                   │
└────────────┬─────────────┘
             │
             ▼
┌──────────────────────────┐
│ llama.cpp                │
│ CUDA + 131K Context      │
└────────────┬─────────────┘
             │
             ▼
┌──────────────────────────┐
│ OpenAI兼容API            │
│ localhost:8080/v1        │
└────────────┬─────────────┘
             │
             ▼
┌──────────────────────────┐
│ OpenCode                 │
│ 代理编码                 │
└────────────┬─────────────┘
             │
             ▼
┌──────────────────────────┐
│ 完全本地AI开发环境       │
└──────────────────────────┘

16、结束语

Qwen3.8-Flash-Next展示了现代开源权重模型正在实现的可能性。

你可以获取一个125B MoE模型,将其量化为可管理的GGUF格式,通过llama.cpp运行,通过OpenAI兼容API公开,并将其连接到OpenCode等代理开发环境。

结果不仅仅是一个本地聊天机器人。

它是一个本地编码基础设施栈,能够规划、生成、调试和迭代软件项目。

对于对本地AI、LLM基础设施、编码代理、GPU推理和私有AI开发感兴趣的开发者来说,这是一个值得尝试的设置。🚀


原文链接:Run Qwen3.8-Flash-Next Locally: A Complete Guide to Building a Local Coding Agent

汇智网翻译整理,转载请标明出处