Featured image of post 「免费无限量」的大模型 API,我挨个打了过去

「免费无限量」的大模型 API,我挨个打了过去

有人发了个 Agnes-2.0-Flash 免费无限量 API,我直接 curl 验证,顺便把市面上「免费+OpenAI 兼容」的渠道挨个摸了一遍——Agnes 是真的,「无限量」是假的。

起因是有人发了个消息:Agnes AI 的 Agnes-2.0-Flash 文本模型 API,自 2026 年 6 月 1 日起无限期免费,1M 上下文,兼容 OpenAI 接口。我第一反应是好事,第二反应是——「无限量」三个字在 AI 圈基本等于「我赌你不会真打满」。于是挨个打了过去。

第一回合:深度研究工作流翻车了

我先是拉满了一个 Grok 深度研究工作流(5 个 agent 并行搜 + 对抗验证 + 综合报告),想让它替我把 Agnes 真伪和市面同类渠道一次查清。16 分钟后它回来了,结论写着:

「Agnes AI 不存在,是虚假信息。」

差点就信了。但我翻了它的运行日志,发现搜索核心整个挂了:

  • 5 个 Grok 搜索 0 个成功;
  • 内置 WebSearch 一直报 400 错误;
  • Grok deep-research MCP 工具压根没加载上;
  • 98 个子 agent 把这次会话的 WebSearch 预算(200 次)烧个精光。

也就是说,它退化成「凭训练记忆猜」——搜不到 Agnes,就判它不存在。这是典型的假阴性。自动研究工作流最大的坑就在这:它给了你一个看起来很硬的结论,但底下是空的。

第二回合:我直接 curl 了 Agnes

不信它的账,我自己打。

Agnes API 实测:HTTP 200 + 标准 OpenAI 格式补全

1
2
3
curl https://apihub.agnes-ai.com/v1/chat/completions \
  -H "Authorization: Bearer <key>" \
  -d '{"model":"agnes-2.0-flash","messages":[{"role":"user","content":"reply AGNES_LIVE_OK"}],"max_tokens":20}'

返回 HTTP 200,一个标准的 OpenAI 格式补全:

1
2
3
4
{"model":"agnes-2.0-flash","object":"chat.completion",
 "choices":[{"message":{"content":"AGNES","role":"assistant",
 "reasoning_content":"The user wants me to reply..."}}],
 "usage":{"prompt_tokens":293,"completion_tokens":20,"total_tokens":313}}

所以:Agnes 是真的。厂商站 agnes-ai.com 首页标题就写着 “Agnes AI | Free Omni-Modal AI API”,API 端点活着、返 OpenAI 格式、模型名对得上。工作流判它「不存在」是错的。

有个附带发现:响应头里有 x-new-api-version——Agnes 的后端是 NewAPI(那个开源 API 中转/聚合框架,我自己也跑了一个公益站)。也就是说 Agnes 大概率不是自研模型实验室,而是一个 NewAPI 前端的中转/聚合渠道。这不影响它「能用」,但解释了它为什么能白送:它背后多半是各家免费额度的二次聚合。

但「1M / 无限量 / 6 月 1 日起」这三条,我没法证实

厂商站是个 JS 单页应用,/pricing /models /docs 子页全 404,首页只吐个 “Loading…” 壳,抓不到具体参数。所以:

  • 1M 上下文存疑——第三方仿冒站(aguea.ai)摸到的数是 2.0-flash=256K,跟「1M」对不上;
  • 「无限量」基本可断是话术——「免费无限量」在业界惯例里 = 不按 token 收费,但照样有限速(每分钟请求数 RPM / 每天 token 数)。一个 NewAPI 中转站几乎不可能真无限,它自己上游就有限额。
  • 「6 月 1 日起」——抓不到,没法核实日期。

第三回合:市面还有哪些「免费 + OpenAI 兼容」渠道

既然 Agnes 这种「免费无限量」是话术,那真要白嫖,还有哪些靠谱的?我把公开、可直连验证的渠道摸了一遍。

OpenRouter(聚合站)

这是最省事的白嫖入口,一个 key 调一百多家。我打了它公开的 /api/v1/models(免鉴权),返回 414 个模型,其中 20 个真免费(input+output 价格都 = $0):

OpenRouter 实测:414 模型里 20 个免费,含两个 1M Nemotron

里头有两个 1M 上下文免费:nvidia/nemotron-3.5-lightning:freenvidia/nemotron-3-ultra-550b-a55b:free。这是目前能找到的最接近「1M+免费」的真实选项。还有 z-ai/glm-5.2:free(128K)、openai/gpt-oss-20b:free(128K)、google/gemma-4-31b-it:free(262K)。

注意:OpenRouter 的 :free = $0/token,但限速 + 有日请求数上限、低优先级排队。不是真无限。

硅基流动 SiliconFlow

国内 OpenAI 兼容大厂,base https://api.siliconflow.cn/v1。我抓了它 pricing 页,THUDM/GLM-Z1-9B-0414 标着 免费/免费(input+output 都免费)。其余模型付费(GLM-5.2 ¥8/¥28 每百万 token 等)。免费模型限速细节在它的 api-docs。

Cloudflare Workers AI

CF 自己的推理服务,OpenAI 兼容。我拉了它 pricing 页:

Cloudflare Workers AI:免费 10K Neurons/天,前沿模型须绑付费

免费额度 10,000 Neurons/天(UTC 零点重置),超出 $0.011/千 Neurons。而且前沿模型(kimi-k2.6/k2.7-code、glm-5.2、deepseek-v4-flash/pro)必须绑付费方式才能用——免费层只够调小模型。

其它常见的官方免费层

这些我没挨个抓,你自查官网,均限速非无限:Google AI Studio Gemini 免费层、Groq、Cerebras、SambaNova、Together AI 部分 $0 模型;国内的阿里百炼 / 腾讯混元 / 字节豆包 / 智谱 / 阶跃,多数给新用户赠金额度(用完即止),月之暗面 Kimi 平台历来没有真正免费 API 层。

对抗验证:我请了个「杠精」来挑刺

光自己说不算,我请了个对抗验证 agent 专门来反驳我的结论(它不知道我做了 live 测试)。它最有杀伤力的一刀是:

「401 只能证明端点有鉴权墙,不代表后端真活着——可能是停尸域名。你没做真实补全调用,全是二手断言。」

这一刀正中要害——但我正好做了那个 live 调用。HTTP 200 + 标准 OpenAI 格式补全 + 模型名匹配,直接把这条反驳拍死。这其实是验证的价值:杠精替你把「最该补的证据」指出来,你补上,结论才硬。

它另外提的几点也站得住,我都认:

  • OpenRouter :free 可能有隐藏日上限(确实有,只是不在 /models 里暴露);
  • Nemotron 的 1M 可能是规格上限而非真能跑满(合理存疑);
  • GLM-Z1-9B 的「免费」可能随厂商改价(需自查);
  • 「没有真·无限量」忽略了自托管 Ollama 和学术/非营利特例——这点我认:自托管(Ollama / vLLM)是唯一真·无限免费 OpenAI 兼容路子,但它不是托管渠道,得自己出显卡

结论

挨个打完,三句话:

  1. Agnes 真实存在、免费、OpenAI 兼容——live 调用 200 OK 实锤。但它大概率是个 NewAPI 中转站,「1M / 无限量 / 6-1」是营销话术,别当硬指标。
  2. 真·「无限量免费」的托管 OpenAI 兼容 API 基本不存在——所有渠道都有 RPM/TPM/日额度。「无限量」在话术里 = 不按 token 收费,不是不限速。要吞吐就得多源轮换或付费。
  3. 实操白嫖组合:OpenRouter 的 :free 模型(含两个 1M Nemotron)+ 硅基流动 GLM-Z1-9B 免费 + Agnes,在代理层做 priority 轮换 + fallback,比押单一「无限量」源稳得多。

真要「无限量」,只剩自托管一条路——那就不叫白嫖渠道了,叫自己买卡。