编程Agent可用的6个免费 AI API
你了解我。我永远不会停止寻找免费 AI 资源。
事实上,在处理敏感和私密文档时,本地 AI 是必需的。但对于其他一切,一个免费且强大的 AI 是最好的选择。
正如我在上一篇文章中提到的,使用 AI 编码 Agent(配合免费层级的 AI)的最佳方式是构建你自己的应用,并牢记一条简单的规则:你的 AI 驱动应用必须能够与一个你可以在本地运行的小型 AI 模型协同工作。
所以今天我将列出 6 个你可以与你的编码 Agent(我习惯用 OpenCode)一起使用的必备免费资源:我还会分享 Python 代码片段,方便你测试它们或在你的演示中使用。
下面列出的资源都不需要任何形式的充值,只需一个普通的注册流程。
⚠️ 注意:我不会按重要性顺序来介绍这 6 个资源,而是从最不为人知的开始!
1. Zenmux 免费 API
base_url="https://zenmux.ai/api/v1"
api_key="<ZENMUX_API_KEY>"
model="stepfun/step-3.7-flash-free"
ZenMux 是一个 AI 服务平台,旨在简化和统一对各种人工智能模型的访问。
根据他们的网站介绍,"ZenMux"这个名字结合了两个概念:
- Zen(禅): 他们的目标是处理 AI 系统的复杂性,让用户可以享受简单、流畅的体验(一个账户、一个 API、一个平台)。
- Mux(多路复用器): 他们聚合来自主要 AI 提供商(如 OpenAI、Anthropic、Google 和 DeepSeek)的授权渠道,并智能地把任务路由到最佳可用模型。
ZenMux 的主要特点包括:
- 可靠性与保障: 他们强调"补偿驱动"模式,即如果某个服务或模型表现不佳,会有内置的补偿机制。
- 面向开发者: 该平台专为开发者打造,提供统一的 SDK、可观测性、可追溯性和透明的定价,帮助管理从开发到生产的 AI 集成。
- 质量控制: 他们专注于路由到最佳模型,不依赖"降级副本",确保 AI 输出的质量可验证、可追溯。
- 愿景: 他们旨在充当 AI 应用的"可信访问和承保层",其"Assured by ZenMux"状态是 AI 构建者安全和可靠的信号。
简而言之……ZenMux 是一个帮助开发者通过单一、可靠的服务更轻松地集成、监控和优化多个 AI 模型使用的工具。而且它通过 API 调用提供了几个免费模型。
注册非常简单。从主网页点击右上角的 Sign In。你有 3 个选项(我选择 GitHub)。
有几个套餐:你需要选择免费(默认)套餐,然后从 Pay As You Go 菜单或直接从模型卡片创建 API 密钥。请看下面的截图。
进入你的个人资料 —— PAYG API —— 创建一个新的 API 密钥
记得把它保存在安全的地方!
或者你也可以浏览模型,从那里创建。
你可以在搜索框中输入 free 来浏览模型,获取所有可用的免费 Endpoint。
然后点击 API Requests,向上查看详细信息和代码片段。
下面是一个简单的 Python 代码片段,用于在你的应用或流水线中使用这些免费模型……
#pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://zenmux.ai/api/v1",
api_key="<ZENMUX_API_KEY>",
)
# Chat Completion
completion = client.chat.completions.create(
model="stepfun/step-3.7-flash-free",
messages=[
{
"role": "user",
"content": "What is the meaning of life?"
}
]
)
print(completion.choices[0].message.content)
# Responses API
responses = client.responses.create(
model="stepfun/step-3.7-flash-free",
input="What is the meaning of life?"
)
print(responses)
2. GROQ 免费 API
base_url="https://api.groq.com/openai/v1"
api_key="GROQ_API_KEY"
model="qwen/qwen3.6-27b"
Groq 是一家专注于超快、低成本推理(运行预训练 AI 模型以生成响应的过程)的专业 AI 基础设施公司。
与在 GPU(如 Nvidia 的 H100)上托管 AI 模型的传统云提供商不同,Groq 开发了自己的定制硅架构,称为语言处理单元(LPU)。
LPU 架构的关键技术特性:
- 确定性执行: LPU 不依赖运行时复杂的动态调度(这会在 GPU 上导致不可预测的延迟尖峰),而是采用软件优先的方法。Groq 的编译器在执行开始之前就把每一次计算预先调度到单个时钟周期。
- 片上 SRAM: LPU 不从较慢的外部高带宽内存(HBM)获取权重,而是把模型权重直接存储在高速度的片上 SRAM 中。这完全消除了内存瓶颈,并把访问速度提高了大约 20 倍。
- 惊人的吞吐量: 由于这种架构,Groq 以前所未有的速度交付开源大语言模型。例如,它可以以每秒 560–840 个 token(TPS)以上的速度运行 Llama 3.1 8B 这样的小型模型,并以280–394 TPS 的速度运行 Llama 3.3 70B 这样的大型模型。
- 即插即用兼容性: Groq 的 API 完全兼容 OpenAI。你只需修改两行代码就能把现有应用切换到 Groq——
base_url(指向[https://api.groq.com/openai/v1](https://api.groq.com/openai/v1))和你的 API 密钥。
注意:Groq 不构建自己的基础模型;他们托管由他人开发的开源权重模型,如 Meta 的 Llama 系列、Qwen、Mistral 以及 OpenAI 的开源权重模型。
关于 GroqCloud 免费 API 层级
Groq 通过 GroqCloud 提供了一个能力很强的免费层级,让开发者无需输入信用卡即可构建、测试和原型化应用。这一层级的主要限制是速率限制,而不是模型访问受限——这意味着你可以访问平台上所有可用的模型。
免费层级限制与能力:
正如你所看到的,免费层级中有相当多出色的 LLM,每天 14,000 次请求,每天最多 500,000 个 token。
你有几种注册选项:如下面这些
注册完成后,创建一个 API 密钥,开始你的冒险吧。
这里有几个可免费使用的模型……
llama-3.1-8b-instant
llama-3.3-70b-versatile
meta-llama/llama-4-scout-17b-16e-instruct
openai/gpt-oss-120b
qwen/qwen3-32b
qwen/qwen3.6-27b
下面是如何用 Python 使用它:
from openai import OpenAI
client = OpenAI(
api_key="GROQ_API_KEY",
base_url="https://api.groq.com/openai/v1",
)
response = client.responses.create(
input="Explain the importance of fast language models",
model="openai/gpt-oss-20b",
)
print(response.output_text)
你也可以使用专门的 groq SDK
#using the groq sdk - pip intall groq
from groq import Groq
client = Groq(api_key="GROQ_API_KEY")
completion = client.chat.completions.create(
model="llama-3.3–70b-versatile",
messages=[
{
"role": "user",
"content": ""
}
],
temperature=1,
max_completion_tokens=1024,
top_p=1,
stream=True,
stop=None
)
for chunk in completion:
print(chunk.choices[0].delta.content or "", end="")
3. Puter.js
puter_token = "your_superLONG_puterJS_token" #API Key
model = "openai/gpt-5.4-nano" #Model
BASE_URL = "https://api.puter.com/puterai/openai/v1"
Puter 不适合 Coding Agent:它是一个完整的 JavaScript 现成框架。无论如何,我将很快向你展示如何在你自己的 Python 应用(或者你用 Opencode 亲手打造的 AI 驱动应用)中使用它!
Puter.js 是一个无服务器、无需密钥的 JavaScript 库,让你完全在前端代码(浏览器端 JavaScript)中构建全栈 Web 应用。它消除了构建后端、配置服务器或管理云服务的需求。
只需在 HTML 中放入一个 <script> 标签,或运行 npm install @heyputer/puter.js,你的应用就能立即获得一整套后端工具包:
- AI 网关: 用一行代码与数百个高级 LLM(如 Claude、GPT、Gemini 和 DeepSeek)交互。
- 云存储与数据库: 直接从浏览器读写文件,并使用快速的 NoSQL 键值存储。
- 内置认证: 无需设置 OAuth 或认证服务器即可实现简单的用户登录系统。
- 托管与网络: 即时托管静态网站或发起请求,无需担心 CORS 限制。
免费 API 层级如何运作("用户付费"模式)
Puter.js 处理"免费层级"的方式与几乎所有其他云平台都不同。它不是给开发者一小桶最终会用完或在流量激增时崩溃的月度积分,而是采用用户付费模式。
以下是它如何让你 100% 免费:
- 无需 API 密钥: 你不需要注册 API 密钥,意味着没有什么可泄露、可窃取或硬编码到前端代码里的。
- 用户买单: 当访问者使用你应用中需要云基础设施或 AI token 的功能(如与模型聊天或保存文件)时,Puter 会通过提示用户使用自己的 Puter 账户登录(通过一个简洁的弹窗)来自动处理。
- 零扩展成本: 因为每个用户都用各自的 Puter 账户进行认证并承担自己的计算/AI 开销,你作为开发者支付的费用正好是 0 美元。
- 无限可扩展性: 无论你的应用有 1 个用户还是 100 万个用户,运行成本都为零。你永远不必担心你的项目爆火后收到一笔巨额意外账单。
如何注册?
你有上面提到的所有选项。进入后,你会看到 Puter 的应用和主界面。
从同一个主菜单中,你可以在左侧面板浏览到 Home 和账户详情。
在 Account 部分,你可以看到分配给你的用户名,以及创建 API Token 的选项(我们需要它来测试 Python 代码)。
Puter.js 不适合 Agent 框架,但对于其他一切来说,它是一个强大的工具。你有 400 多个模型,基本上都是免费的。
你可以用以下参数把它用于你的聊天应用:
puter_token = "your_superLONG_puterJS_token" #API Key
selected_model = "openai/gpt-5.4-nano" #Model
BASE_URL = "https://api.puter.com/puterai/openai/v1"
💡 提示:你可以让 Opencode 为你编写一个兼容 OpenAI 的 API 网关,监听 localhost:11434,把所有 AI Agent 请求路由到 Puter.js
我更喜欢把 TOKEN 放在 Python 代码之外:所以我把它保存在 CLI 应用同目录下名为 config.json 的文件中
{
"token": "your_superLONG_puterJS_token",
"model": "openai/gpt-5.4-nano"
}
例如,我让 Opencode 为我编写了一个多轮、多行的聊天 CLI 应用,就像下面这个:它会读取 config.json 文件,并由 puter.js 模型驱动对话。
import json
import sys
import os
from openai import OpenAI, APIError
# Import Rich and Prompt Toolkit utilities
from rich.console import Console
from rich.markdown import Markdown
from rich.panel import Panel
from rich.text import Text
from prompt_toolkit import prompt
# Initialize the global rich console object
console = Console()
def load_config(config_path="config.json"):
"""Loads configuration data from config.json."""
if not os.path.exists(config_path):
console.print(f"[bold red]Error:[/bold red] Configuration file '{config_path}' not found.")
sys.exit(1)
try:
with open(config_path, "r") as f:
config = json.load(f)
if not config.get("token"):
console.print("[bold red]Error:[/bold red] Puter 'token' missing from config.json")
sys.exit(1)
return config
except json.JSONDecodeError:
console.print("[bold red]Error:[/bold red] Failed to parse config.json.")
sys.exit(1)
def main():
config = load_config()
puter_token = config["token"]
selected_model = config.get("model", "gpt-4o")
console.print("[bold cyan]Connecting to Puter's new OpenAI-compatible API layer...[/bold cyan]")
client = OpenAI(
base_url="https://api.puter.com/puterai/openai/v1",
api_key=puter_token
)
messages = [
{"role": "system", "content": "You are a helpful AI assistant running via Puter platform."}
]
# Display welcome message inside a styled panel with hotkey instructions
welcome_text = Text()
welcome_text.append(f"Active Model: ", style="bold magenta")
welcome_text.append(f"{selected_model}\n\n", style="italic green")
welcome_text.append("Editing Rules:\n", style="bold underline yellow")
welcome_text.append("• Press ", style="dim")
welcome_text.append("Enter", style="bold white")
welcome_text.append(" to create a new line.\n", style="dim")
welcome_text.append("• Press ", style="dim")
welcome_text.append("Alt + Enter", style="bold reverse white")
welcome_text.append(" (or Esc then Enter) to send your message.\n\n", style="dim")
welcome_text.append("Commands: ", style="bold blue")
welcome_text.append("type 'exit' or 'quit' to close. Type 'clear' to reset history.", style="yellow")
console.print(Panel(welcome_text, title="[bold reverse cyan] Multi-Line Conversation Started [/bold reverse cyan]", border_style="cyan"))
while True:
try:
# Print a clean prompt indicator using Rich first
console.print("\n[bold reverse green] You [/bold reverse green] (Alt+Enter to send):")
# Use prompt_toolkit to safely accept multi-line entries
user_input = prompt(" ❯ ", multiline=True).strip()
if not user_input:
continue
if user_input.lower() in ['exit', 'quit']:
console.print("[bold red]Ending session. Goodbye![/bold red]")
break
if user_input.lower() == 'clear':
messages = [{"role": "system", "content": "You are a helpful AI assistant running via Puter platform."}]
console.print("\n[bold yellow]✨ Chat context wiped clean for a fresh start. ✨[/bold yellow]\n")
continue
messages.append({"role": "user", "content": user_input})
with console.status("[bold yellow]Thinking...[/bold yellow]", spinner="dots"):
response = client.chat.completions.create(
model=selected_model,
messages=messages
)
ai_response = response.choices[0].message.content
console.print(f"\n[bold reverse blue] AI ({selected_model}) [/bold reverse blue]")
console.print(Markdown(ai_response))
console.print("[dim]─" * console.width + "[/dim]")
messages.append({"role": "assistant", "content": ai_response})
except APIError as e:
console.print(f"\n[bold red]Puter Platform API Error:[/bold red] {e}\n")
except KeyboardInterrupt:
# Catching Ctrl+C inside prompt_toolkit drops to a clean next line or exits gracefully
console.print("\n[bold red]Session interrupted. Exiting...[/bold red]")
break
except Exception as e:
console.print(f"\n[bold red]An unexpected framework error occurred:[/bold red] {e}\n")
if __name__ == "__main__":
main()
现在让我们转向最普遍、同时也最慷慨的免费 API 层级。
4. Gemini 免费 API
base_url="https://generativelanguage.googleapis.com/v1beta/openai/"
api_key="GEMINI_API_KEY"
model="gemma-4-31b-it"
最常用的电子邮件账户服务可能仍然是 Gmail:也许你还没有意识到,用你基本的电子邮件账户,你就有权访问许多 Gemini 或 Gemma 模型,无需任何订阅费用或信用卡。
你只需前往 https://aistudio.google.com/ 并使用你的电子邮件账户凭据登录。
如果你想先查看定价,点击顶栏的 Pricing 选项,你将被重定向到 https://ai.google.dev/gemini-api/docs/pricing。
进入定价页面后,你就能看到哪些模型包含免费层级。例如,Gemini 3.5 Flash 也有免费层级的 API 调用。
登录后,创建一个 API 密钥和一个项目:这是追踪 API 调用和计算限制的方式。
很酷的一点是,你可以在免费层级中查看每个模型的每日请求数(RPD)。请看下面……
想象一下你可以用这些做什么:
- Gemma 4 26B MoE 每天 1500 次请求
- Gemma 4 31B 每天 1500 次请求
- Gemini 3.1 Flash Lite 每天 500 次请求
现在剩下的问题就是如何在我们的电脑上使用所有这些资源。
5. NVIDIA Nim 免费
base_url="https://integrate.api.nvidia.com/v1"
api_key="NVIDIA_API_KEY"
model="nvidia/nemotron-3-ultra-550b-a55b"
NVIDIA 是 AI 和 GPU 计算时代的领导公司。他们不仅提供免费培训,还为一些最好的可用 LLM 提供免费 API 调用。
具体来说,NVIDIA NIM(NVIDIA Inference Microservices)是一组易于使用的微服务,旨在加速生成式 AI 模型在任何 NVIDIA 加速基础设施上的部署。当你访问 build.nvidia.com 时,作为开发者,你可以访问一个庞大的企业级 AI 模型目录(包括 Llama 3、Mistral 和 NVIDIA 自家的 Nemotron),它们运行在高性能 NVIDIA GPU 上。
免费层级:它是如何运作的
NVIDIA 提供一种"先试后买"的模式,专为原型开发和研究设计。以下是免费访问的结构:
- 初始积分: 注册 NVIDIA 开发者计划后,你通常会获得 1,000 个免费 API 积分。这些积分让你无需自己的 GPU 硬件即可向托管的 NIM Endpoint 发起请求。
- 申请更多: 如果你用完最初的 1,000 个积分,通常可以通过提供企业邮箱申请更多积分(总计可达 5,000)。这个升级通常还包括一份 90 天的 NVIDIA AI Enterprise 许可证,允许更深入地评估该平台。
- 转向速率限制: 2025 年中的近期报告表明,NVIDIA 一直在把一些用户从严格的积分制转向速率限制模式以支持持续开发。只要使用严格限于非生产、开发目的,这就能支持持续的原型开发(大约每分钟 40 次请求)。
免费目录的主要特点
- 兼容 OpenAI 的 API: 目录中的所有模型都遵循标准的 OpenAI API 格式。你只需把
base_url改为 NVIDIA 的 Endpoint 并提供你的 API 密钥,就可以把它们集成到现有应用中。 - 模型多样性: 你不仅限于文本 LLM。目录包括专门模型:
- 推理与聊天: Llama 3.3、Mistral 和 Nemotron。
- 视觉与多模态: 能够处理图像和视频的模型。
- 编码: DeepSeek-Coder 和 Qwen-Coder 等专门模型。
- BioNeMo: 用于药物发现和蛋白质折叠的专门模型。
3. 可移植性: NIM 的一个独特之处在于,一旦你使用免费云 API 完成了原型开发,就可以下载同一个 NIM 容器,在你自己的本地 NVIDIA 硬件(RTX 电脑或工作站)或私有云上运行。
当然……有一些使用限制。
虽然该 API 可以免费用于开发,但 NVIDIA 区分了"开发"和"生产":
- 免费/开发者层级: 非常适合构建概念验证的学生、研究人员和爱好者。你在开发者计划会员期间都可以访问。
- NVIDIA AI Enterprise: 一旦进入生产环境就需要。它为商业应用提供企业级安全、专门支持和更高的稳定性。
获取你的 API 调用
从 https://build.nvidia.com/ 或 https://developer.nvidia.com/nim 注册。确认电子邮件,并验证你的手机号码(你会收到一个验证码)。然后就可以开始了!
在你的个人资料中添加一个 API 密钥(并把它保存在你的电脑上某处!!!)
文档整理得很好,也很清晰。但如果你看不懂,就把链接粘贴到任何 AI 驱动的搜索引擎中并请求澄清。我在少数情况下也这么做过。
6. Mistral 免费 API
base_url="https://api.mistral.ai/v1"
api_key="MISTRAL_API_KEY"
model="ministral-14b-2512"
我记得在 2025 年 2 月就已经谈过 Mistral 的免费层级。现在是时候再次考虑他们慷慨的层级了。
事实上,一旦你开始为个人自动化脚本调用商业云 API,探索前沿 AI 很快就会变成一项昂贵的爱好。幸运的是,欧洲 AI 巨头 Mistral AI 为开发者和爱好者提供了一个非常慷慨的免费层级。
Mistral 通过一个完全兼容 OpenAI 标准格式的 API,完全免费地提供其顶级前沿模型的访问。这意味着,如果你编写一个简单的 Python 自动化脚本,你就可以无缝地使用 Mistral 的基础设施,而无需输入信用卡。
- 探索者的优势: Mistral 明确优先考虑数据隐私,让你可以轻松选择退出模型训练,使你的数据始终属于自己。它为你提供了一个坚如磐石、生产级云沙盒,让你零资金投入测试自主 Agent 或自定义界面。
- 最佳用例: 为你的后台自动化脚本、家庭仪表板提供动力,或者在投入本地托管大规模模型之前测试代码工作流。
你可以在下面了解更多关于 Mistral AI 的信息:
超越 ChatGPT:你今天就可以使用的 4 个隐藏瑰宝级开源 AI 项目
如何在 5 分钟内开始
前往 https://chat.mistral.ai/ 注册:你有 Google、Apple 或 Microsoft 账户等注册选项。
进入后,你会获得与 Anthropic 网页应用相同的体验,包括工作区、vibe coding 和聊天应用。
如果你想在 Opencode、MiMo Code 或你个人创建的应用中使用 Mistral 模型,请前往 http://console.mistral.ai/ 并使用新创建的凭据登录。
点击右上角的个人资料,进入 API Keys 创建一个新的。
如果你前往 https://console.mistral.ai/home,可以获取所有 OPEN 模型并浏览列表。
但要验证你可以免费访问哪些模型,最简单的方式是直接从 Console 点击左侧面板的 Limits 进度条。
注意,这里的模型已经显示了调用 mistral API Endpoint 时要使用的相同模型名称。例如,下面是从定价/限制页面和模型卡片中看到的 Ministral 14b 2512 的模型卡片。
让我们看一个简单的 Python 示例:
from openai import OpenAI
# Initialize the client with Mistral's base URL and your API key
client = OpenAI(
base_url="https://api.mistral.ai/v1",
api_key="YOURMISTRALAPIKEY" # Grabs the key fro Mistral Console
)
# Make the chat completion call
response = client.chat.completions.create(
model="ministral-14b-2512",
messages=[
{
"role": "user",
"content": "How far is the moon from earth?"
}
]
)
# Print the response content
print(response.choices[0].message.content)
就是这样!相应地修改模型名称:这里我按照模型卡片使用了 ministral-14b-2512。
7、结束语
要自由地使用 AI Agent 编码,没有比拥有免费层级选项更好的方式了。这是永远不耗尽 token 的最佳途径。
事实上,请记住编码 Agent 是 token 消耗大户。
我从未见过哪个应用能第一次就成功运行,而且上下文里至少消耗了 50k 个 token。
现在我已经给了你几个选项。是时候把它们全部投入使用了!
原文链接: Six ways to give a free AI model to your Coding Agent
汇智网翻译整理,转载请标明出处