我测试了100多个LLM,这9个疯了
大多数都是垃圾——这9个是每个用途的最佳LLM,而且没有一个会偷偷上传数据。
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
上周我做了一件稍微有点疯狂的事。我把所有AI模型从我的基础款M4 Mac mini上清掉了——一共39GB——然后从零开始。
接着我连续几个晚上做了更疯狂的事:在同一台599美元的小盒子上一个接一个地下载和测试模型,只为回答一个问题——
"哪些本地AI真正值得留在苹果最便宜的Mac上?"
大多数都是垃圾。太大放不进16GB,太慢没法用,或者干脆很蠢。但其中有九个?它们让我坐直了身子,心想*"等等,我的mini能做这个?"*
每一个都完全离线运行。没有云端。没有月费。没有账号。没有任何东西离开你的桌面。
我所有数据都是在这台确切的机器上测量的——基础款16GB M4 mini——关闭了后台应用,所以这不是某个评测者64GB Mac Studio的数据冒充mini的。(为什么这很重要,后面会说。)
让我给你介绍这九个。
1、先说实话(不读这个你之后会生我的气)
16GB是紧张的。句号。一次只能运行一个重型模型。
把它想象成单车道厨房,不是自助餐。加载一个聊天模型,用它,关掉,然后加载图像模型。如果你试图同时运行两个大的,整个系统就会开始喘不过气。
另外:你在网上找到的几乎每个"M4 Mac mini AI基准测试"实际上都是M4 Pro或Mac Studio——内存带宽是基础款的2-4倍。
所以那些速度数字在基础款芯片上是幻想。下面的所有数据都是在真正的基础款M4上测量的。这种诚实正是重点。
在基础款16GB M4 mini上测量的真实tokens/sec
好吧?好的。开始。
大脑(文本)
1、你的离线ChatGPT — Qwen3.5–9B
我不喜欢我那些半成品的凌晨2点问题永远存在于某个公司服务器上的想法。所以我首先想要的是一个能关闭Wi-Fi运行的正经聊天机器人。
获胜者是Qwen3.5–9B。它只有6.6GB,留出足够的RAM,在我的mini上能输出18 tokens/sec——比你阅读的速度快得多。
我让它解释,就像一个风趣的合著者,为什么16GB mini能运行90亿参数模型但30亿的就不行——它的回答击中了要点:
Qwen3.5–9B在基础款M4 mini上以18 tok/s回答为什么9B模型能运行但30B不行:"把你的RAM想象成厨师的操作台。只有16GB时,你可以舒适地为九种食材的食谱切菜。但同时处理三十种调料,突然间你的工作空间就溢出了;你只是试图不把所有东西都打翻就掉了工具。更多空间让它能做更大的梦,而不仅仅是更努力地工作。"
震撼吧?这是本地运行的。
最棒的是,如果你想要更大的大脑,gpt-oss:20b(OpenAI的开源模型)也能放进去——这是你能塞进16GB的最聪明的东西,能达到24 tok/s。
但问题是:它在回答前会思考出声(我看到它在一个问题上烧掉了约1300个token的推理),所以即使它很快,感觉也更慢。最大的≠最好的。
日常聊天,Qwen3.5–9B是最佳平衡点;要即时的单句回复,降到Llama 3.2 3B(惊人的48 tok/s)。
运行方式:
- LM Studio — 免费(
brew install --cask lm-studio),基本上是本地模型的ChatGPT窗口。 - 终端用户:Ollama(
brew install ollama)。用我那篇VRAM文章里的有线内存技巧挤进gpt-oss。
2、永不离开Mac的编程伙伴 — qwen2.5-coder-7B
我不会过度吹嘘这个,因为其他人都会。在16GB上你无法运行完整的代理编码模型——好的模型(30B+)根本放不下。任何告诉你相反的人其实都悄悄用着64GB机器。
你能运行且运行良好的是qwen2.5-coder-7B(4.7GB,22.7 tok/s)。
它是一个很棒的代码片段和自动补全伙伴。我让它写一个查找文件夹中最大文件的函数,它返回了干净、可运行的Python——不需要手把手:
qwen2.5-coder-7B在mini上的回复:一个largest_files(folder, n=5)函数,用os.walk递归遍历文件夹,格式化每个文件大小为MB,跳过抛出PermissionError的文件,返回按大小降序排列的前n个最大文件
最棒的是,它在飞机上也能离线完成这个。只是别让它重构你的整个代码库——那是24GB+的工作量,老实说仍然比不上Claude。
3、总结任何东西 — Qwen3.5–9B
和#1是同一个模型,只是换了顶帽子。粘贴一大段文字,它会给你要点。
老实说,问题不在模型——在于内存。那些"256K上下文!"的说法在mini上是理想状态;实际上在RAM用完前你只能用8K–32K token的有效上下文,所以大段转录要分块处理。
我给它一段凌乱的站会记录,让它提取三个待办事项和负责人:
Qwen3.5–9B把凌乱的站会笔记变成三个行动项——1. 续签CI证书(Marco)。2. 撰写入职文案(Sam)。3. 邮件通知beta测试者延期(Priya)。
不性感。但极其有用。
最棒的是——这很有趣——你可以链式调用:先转录会议(见#8),然后把转录稿直接喂给这个。
你的Mac刚刚把一小时的闲聊变成了待办清单,离线完成。(对于需要精确度的密集报告,Gemma 4 12B是稍好但稍慢的替代品。)
你自己的数据
4、只知道你文件的私人ChatGPT — 本地RAG
这是让一个朋友说*"好吧这真的是巫术"*的功能。你把一个应用指向你的PDF和笔记堆,然后你就…提问。关于你的东西。什么都不会上传。
底层是两个模型:一个聊天大脑(又是Qwen3.5–9B)加上一个小型嵌入模型——Qwen3-Embedding-0.6B——负责实际的"找到正确段落"魔法。
在我的快速测试中,相关问题得分0.72相似度,不相关的0.34——正是你想要的差距。
最棒的是,你不需要碰任何管道。下载RecurseChat(一次性19.99美元,App Store),拖入你的PDF,然后提问——答案甚至会带引文回溯到源页面。
RecurseChat回答PDF中的一个问题
或者免费替代品:LM Studio的文档聊天,或AnythingLLM。
诚实的局限:它擅长*"找到并引用这个具体内容"*,在综合多份文档方面较弱。纯图像扫描需要先OCR——方便的是,那就是#7。
5、离线私密翻译 — Gemma 4 12B
对于快速旅行短语,macOS 26内置的Apple Translate已经能离线工作且免费——下载语言包就行。
但当语气重要时,本地LLM的人类感是短语书应用做不到的。我给Gemma 4 12B一段抱怨的英文,让它"像朋友实际发短信那样翻译":
Gemma 4 12B通过ollama在基础款M4 Mac mini上运行,完全离线,13.3 tokens/s,把英文文本"呃,我的笔记本风扇又像喷气发动机了。觉得它终于要挂了,还是只是那47个Chrome标签页?"翻译成地道的法语——"Pfff, mon ordi fait un bruit de moteur d'avion encore une fois… ou c'est juste mes 47 onglets Chrome ?"
那个"Pfff"是厨师之吻。教科书翻译器不会写"Pfff"。最棒的是,它能一次翻译并总结一篇外文文章。
诚实提示:对于稀有语言,专用模型如MADLAD-400覆盖400多种;是的,DeepL在欧洲大语对上仍然略胜一筹。但这些都不能在你厨房里关掉Wi-Fi运行。
感官(图像、视觉、语音)
6、你的免费离线Midjourney — FLUX.2 klein
今天就取消一个订阅。
FLUX.2 klein能本地生成真正好的图像,免费——其许可证甚至允许商业使用。
在我的基础款mini上,4位量化4步运行:512×512约18秒每张,1024×1024约57秒。而且——这连我都惊讶——完整的1024×1024渲染没有内存不足,网上一半人发誓16GB上不可能。(首次启动加载时慢;之后就嗡嗡运行。)
最棒的是,这个应用一键安装:Draw Things,Mac App Store免费,专为Apple Silicon优化。输入提示,点击生成,看你的Mac画画。
这是它给我生成的一张:
FLUX.2 klein在基础款M4 mini上本地生成的图像
确切提示是:极简编辑插画,黄昏时木质书桌上一台发光的Mac mini,温暖的琥珀色光线溢出,深青到海军蓝渐变背景,柔和胶片颗粒,大量留白,电影感。
避开陷阱:FLUX.2 dev需要64GB,"Sana"明确禁止在非Nvidia GPU上运行。klein是那个能放下的。
7、"嘿Mac,读这个截图" — Qwen3-VL-4B
这个感觉像作弊。拖入截图、收据、图表、菜单照片——模型就读出来了。
Qwen3-VL-4B是首选:只有3.3GB,是我测试中最快的,达到31.7 tok/s——而且完美无误。
- 我给它一张收据图片,它提取了每一行项目和正确的总计(21.16)。
Qwen3-VL-4B读取的收据——它得到了每一行和21.16的总计
- 我给它一个柱状图,提示中没有数字,它回答:
"这个柱状图衡量月活跃用户数,单位是千。最高是5月,90千;最低是1月,40千。"
Qwen3-VL-4B读取的图表——它说是5月=90,1月=40
完全正确。它读出了图表。
最棒的是,一个模型同时做普通描述和OCR——从扫描页面、手写笔记、拍摄的标识中提取文字。和#5链式调用,你就有了一个离线的"对着外国菜单拍照→理解它"机器。
运行方式: LM Studio(用MLX构建版本,这样视觉功能才能在Mac上工作)。对于严肃的文档数字化(表格、数学),加上olmOCR 2。
8、转录数小时音频,比实时更快 — Parakeet
如果从这篇文章只记住一件事,记住这个:你的Mac转录音频比大多数付费服务更好更快,离线运行。
冠军是NVIDIA Parakeet TDT 0.6B v3。我在mini上测到16.9倍实时速度——也就是说一小时音频大约三分半钟就能转录完——转录稿近乎完美。(我在短片段上测的;这个速率对长文件同样成立。)
OpenAI的Whisper large-v3-turbo是替代选择(9.4倍实时,对非欧洲语言更好)。
最棒的是:
- 如果你是非技术用户:MacWhisper(联盟链接;或superwhisper)把两个引擎包装在友好的窗口里——拖入文件,或指向文件夹,它会批量处理。设备上,永远。
- 如果你偏好终端,
brew install whisper-cpp是免费路线。
这是每个人都能用的功能——会议、讲座、语音备忘、访谈、那45分钟你想快速浏览的播客。
把转录稿喂给#3,你的Mac还能总结它。酷吧?
Parakeet在约3.5分钟内转录一小时音频,离线运行
9、给你的Mac一个声音 — Kokoro & Chatterbox
最后来个有趣的。你的mini能说话——而且,令人不安地,用别人的声音说话。
朗读文本方面,Kokoro是一个8200万参数的小奇迹(Apache许可证,约0.3GB),听起来惊人地自然。
在我的mini上,它以2.9倍实时速度生成语音——文字出来的速度比你说的还快。最简单的应用:Kokori,基于Kokoro的免费菜单栏应用。
声音克隆方面,Chatterbox(MIT许可证)能从几秒钟的参考音频复制声音——而且它真的有效,这既惊人又令人不安。
不过诚实警告:在16GB mini上它很慢——我的克隆大约两分钟才能渲染六秒钟语音。是需要耐心的爱好,不是一键派对把戏。
最棒的是,把#3 + #9变成链式调用:总结一篇长文章,然后让你的Mac像个人播客一样把总结读给你听——离线,散步时,手机放在口袋里。
10、诚实的结论
91个模型没有入选。这九个入选了——它们一起把苹果卖的最便宜的Mac变成了一台私人AI工作站,能聊天、编码、总结、读取你的文件、翻译、绘画、看见、转录和说话。
全部离线。全部免费。全部属于你。对于一台"本该"只是媒体服务器的599美元盒子来说,不错吧?
原文链接:I Tried 100+ LLMs on M4 Mac mini — These 9 Are INSANE
汇智网翻译整理,转载请标明出处