LlamaStash = llama.cpp+Ollama
如果你已经读过关于 llama.cpp 无限制、无网络、零成本、运行飞快的内容,你也会知道为这种速度付出的代价:手动配置。构建标志、硬件检测、逐个下载 GGUF 文件、自己管理端口。另一方面,Ollama 的出现是为了消除所有这些麻烦——但它带来了另一种权衡:在你和底层真正运行的 llama.cpp 之间,隔了一层额外的抽象。
那么为什么要二选一呢?为什么没有一个工具能像 llama.cpp 一样快,又像 Ollama 一样简单?
这正是 LlamaStash 想要回答的问题:一个 Rust 二进制文件,同时是 TUI、CLI、守护进程和 OpenAI 兼容代理——直接以 llama.cpp 作为其后端,没有额外的层拖慢速度,也不需要你从零开始配置一切。
让我们来看看这个工具为什么存在、如何使用它,以及如果你已经习惯使用 Ollama 或原生的 llama-server,它会有什么样的表现。
1、为什么会有 LlamaStash
如果你读过更新日志或作者的发布文章,动机就很清楚了:他仍然会在某些任务上使用托管模型,但本地优先的工具不仅关乎隐私或成本——更关乎所有权。你可以随时更换模型、上下文、构建标志和服务器参数,并且可以运行那些你永远不会考虑在付费 API 上做的实验。
LlamaStash 正是出于这种需求而构建的:它对 llama.cpp 保持透明——不像 Ollama 那样把它藏在自己的模型注册表后面——同时仍然去除那些前期需要处理的繁琐部分:硬件检测、安装正确的二进制文件、下载入门模型,以及冒烟测试,让你知道一切真的能正常工作。
2、安装
LlamaStash 根据你的操作系统支持多种安装方式:
# macOS + Linux (one-shot)
curl -fsSL https://llamastash.dev/install.sh | sh
# Windows 11 (PowerShell, no admin elevation)
irm https://llamastash.dev/install.ps1 | iex
# Homebrew (macOS + Linuxbrew)
brew install llamastash/llamastash/llamastash
# Arch Linux (AUR)
yay -S llamastash
# From crates.io (any platform with a Rust toolchain)
cargo install llamastash
# Windows via Scoop
scoop bucket add llamastash https://github.com/llamastash/scoop-llamastash
scoop install llamastash
具体到 Windows,你需要 64 位 Windows 10 1809+ 或 Windows 11、PowerShell 5.1+,以及 VC++ 2015–2022 运行库(x64),因为内置的 llama-server 依赖它。
安装完成后,你应该运行的第一条命令是:
llamastash init
这个向导会替你处理烦人的首次运行工作——它检测你的硬件、安装正确的 llama-server 构建版本、下载入门 GGUF、写入调优后的配置,并进行冒烟启动以确认一切正常。如果你想在流水线或智能体工作流中自动化这一步,还有一个非交互式版本:
llamastash init --recommended --json
3、不同之处:端口、代理和兼容性
如果你已经习惯使用原生 llama-server 或 Ollama,这部分是我觉得最有趣的地方。
- LlamaStash 默认在
http://127.0.0.1:11435/v1暴露一个 OpenAI 兼容端点(如果 11435 被占用,则使用下一个空闲端口,最高到11440) - 默认端口
11435是经过深思熟虑的选择——比 Ollama 众所周知的11434大一号——这样 LlamaStash 守护进程和 Ollama 安装可以共存,不会争抢端口 - 每个发现的模型都通过同一个 URL 路由,因此 OpenCode、Cline、
llm-cli或任何 OpenAI SDK 等工具无需修改即可直接使用 - 如果你请求的模型尚未运行,守护进程会自动启动它;如果启动失败,它会回退到已经 Ready 的对等实例,并附加审计头(
x-llamastash-served-by、x-llamastash-fallback-reason),让你确切知道幕后发生了什么
如果你使用 Claude Code 或 Anthropic SDK,有一个在类似工具中不常见的细节:同一个代理也会转发 Anthropic Messages API。/v1/messages 和 /v1/messages/count_tokens 端点会被直接转发到 llama-server 的原生端点,因此你只需设置 ANTHROPIC_BASE_URL 就可以把 Claude Code 或 Anthropic SDK 指向它(密钥通过 x-api-key 头发送)。llamastash init 甚至还会生成一个可 source 的 claude-code.sh 文件:
source claude-code.sh && claude
这样你就可以按终端会话选择启用,而不是劫持你的全局环境。
如果你喜欢捣鼓,还有几个值得一提的技术细节:
- 可复现的拉取 — 使用
--revision <SHA>将模型固定到特定修订版本,在需要跨团队保持一致环境时非常有用 - 智能上下文自动适配 — 如果你不手动设置
ctx,LlamaStash 会自动选择仍然适合你硬件的最大上下文 - CLI 上稳定的
--json输出,专为脚本化或被其他智能体驱动而设计
4、简单使用示例
运行 llamastash init 之后,你可以这样使用它:
# Open the interactive TUI
llamastash
# List available models via CLI, JSON output for scripting
llamastash list --json
# Get a model recommendation based on your hardware
llamastash recommend
# Pull a specific model pinned to a revision
llamastash pull <model-name> --revision <SHA>
要集成任何已经支持 OpenAI 兼容端点的工具,只需把基础 URL 指向它:
export OPENAI_BASE_URL="http://127.0.0.1:11435/v1"
对于 Claude Code:
source claude-code.sh && claude
不需要额外的"转换"步骤——它会被直接转发到 llama.cpp 的原生端点。
5、LlamaStash vs Ollama vs 原生 llama-server
如果你正在比较选项,这里是快速对比:
- 原生
llama-server— 最零开销的选择,你直接与 llama.cpp 对话,但一切都是手动的:构建、硬件检测、下载模型、自己管理端口 - Ollama — 最方便,但它带有自己的模型注册表和格式,这意味着你和底层真正运行的 llama.cpp 之间隔了一层额外的抽象
- LlamaStash — 后端直接是 llama.cpp(没有重新实现或笨重的包装),但你仍然可以在一个二进制文件中获得向导、TUI、守护进程和多协议代理(OpenAI + Anthropic Messages API)。架构上还有一个"可插拔后端接缝",所以将来可以插入的不只是 llama.cpp
如果你一直在"完全掌控但繁琐"和"简单但黑盒"之间纠结,LlamaStash 是一个中间选择,而且它不会强迫你放弃 llama.cpp 作为核心后端。
6、结束语
LlamaStash 并没有重新发明轮子——它对此直言不讳,后端仍然是 llama.cpp。它所做的是剥离围绕 llama.cpp 的摩擦:初始配置、避免与其他工具冲突的端口管理,以及在单个守护进程中的双协议代理兼容性(OpenAI + Anthropic)。
如果你用惯了原生 llama-server 但厌倦了自己处理运维方面的事情,或者你正在用 Ollama 但开始想要更接近 llama.cpp 的精细控制,那么这个工具值得一试。你可以这样开始:
curl -fsSL https://llamastash.dev/install.sh | sh
llamastash init
原文链接: LlamaStash: Run Local AI Faster Without Manual Setup — As Fast as llama.cpp, As Easy as Ollama
汇智网翻译整理,转载请标明出处