自从把各平台内容接入创作体系后,大模型 token 的消耗确实很大。于是攒了一套免费方案,把四家免费 API 封装成统一入口,随用随调。
说到免费大模型,比较出名的有 OpenRouter 和 Cloudflare 等。免费是真的,但有请求频次限制——短时间内不让你请求太多次。解决方案是:将不同的免费模型封装在一起使用。
一、部署 New API 工具
这是整套方案的核心工具,可以把不同大模型厂商集合到一起,生成一个 token 来统一调用。
开源项目:QuantumNous/new-api(45.8K 星标)。
git clone https://github.com/QuantumNous/new-api.git
cd new-api
# 编辑 docker-compose.yml
docker compose up -d
项目自带 docker-compose.yml 已配置好 PostgreSQL 和 Redis,只需修改端口、密码等参数。
建议部署到有公网 IP 的服务器上,本机部署也可以,但只有本机能使用。
二、申请免费大模型的 API Key
1. 英伟达 NVIDIA
登录官网后点击右上角 API Key 创建。

需要验证手机号,选择 China 并填入国内手机号即可。

创建后及时保存,后续无法查看。
2. Cloudflare
注册登录后找到 Workers & Pages → API Tokens 创建身份验证令牌,同样需要及时保存。

3. OpenRouter
注册登录后直接创建 API Key 即可。

4. 商汤日日新
商汤的 token plan 网站,目前公测中完全免费,速度是这四个中最快的。

三、将所有免费 API Key 配置到 New API 中
1. 添加 OpenRouter 渠道
进入 New API(本地部署地址 http://127.0.0.1:3000),找到"渠道管理"→"添加渠道"。


类型选择 OpenRouter,不需要填 API 地址。

模型可以在输入密钥后点击"获取模型列表"自动填入,或者手动输入包含 free 的模型名称。

2. 添加 Cloudflare 配置
步骤类似,但 Cloudflare 需要填写 Account ID:


Account ID 可以在 Workers & Pages 页面找到:
模型名称需要点进去复制完整名称,如 @cf/qwen/qwen3.8-27b。
3. 添加自定义渠道(英伟达 + 商汤)
这两个没有内置类型,需选择"自定义渠道"并填写 Base URL:
- 英伟达 NVIDIA:
https://integrate.api.nvidia.com/v1/chat/completions - 商汤 sensenova:
https://token.sensenova.cn/v1/chat/completions
商汤模型固定填 sensenova-6.8-flash-lite,英伟达可用模型到 build.nvidia.com 查看。


添加完成后,可以点击测试按钮验证模型是否可用。


四、创建统一 API Key
1. 配置统一的模型名称
为了方便调用,需要统一模型调用名称。
为每个渠道添加虚拟模型名称(如 free-auto),并设置模型映射:左边填虚拟模型名称,右边填真实模型名称。


2. 设置渠道的优先级和权重
免费模型一般都有请求限制,不能频繁请求同一渠道。需要配置优先级和权重来平均分配:

优先级相同的情况下,权重越高被请求的概率越高。例如商汤和 OpenRouter 相对稳定,权重设为 3,另外两个设为 2,实现均衡分配。
3. 创建 API Key
找到"令牌管理",添加令牌即可。

五、在 WorkBuddy 中使用
进入 WorkBuddy → 模型切换 → 配置自定义模型 → 提供商拉到"自定义 Custom":

配置参数:
- 接口地址:
http://localhost:3000/v1/chat/completions - 请求模型名称:
free-auto(必须填前面配置的虚拟模型名称) - API Key:前面创建的令牌


测试通过后即可正常使用。

六、使用经验分享
免费模型质量参差不齐,复杂任务(如编程)建议还是使用付费模型。免费模型适合日常简单任务:数据收集、文章初稿编写等。
把 token 花在刀刃上——简单任务用免费模型,关键环节用付费模型。
另外,还可以把 DeepSeek V4 Flash 也加入到 free-auto 模型映射中,优先级降低一级作为兜底,确保免费模型用完后工具始终可用。