起因是有人发了个消息:Agnes AI 的 Agnes-2.0-Flash 文本模型 API,自 2026 年 6 月 1 日起无限期免费,1M 上下文,兼容 OpenAI 接口。我第一反应是好事,第二反应是——「无限量」三个字在 AI 圈基本等于「我赌你不会真打满」。于是挨个打了过去。
第一回合:深度研究工作流翻车了
我先是拉满了一个 Grok 深度研究工作流(5 个 agent 并行搜 + 对抗验证 + 综合报告),想让它替我把 Agnes 真伪和市面同类渠道一次查清。16 分钟后它回来了,结论写着:
「Agnes AI 不存在,是虚假信息。」
差点就信了。但我翻了它的运行日志,发现搜索核心整个挂了:
- 5 个 Grok 搜索 0 个成功;
- 内置 WebSearch 一直报 400 错误;
- Grok deep-research MCP 工具压根没加载上;
- 98 个子 agent 把这次会话的 WebSearch 预算(200 次)烧个精光。
也就是说,它退化成「凭训练记忆猜」——搜不到 Agnes,就判它不存在。这是典型的假阴性。自动研究工作流最大的坑就在这:它给了你一个看起来很硬的结论,但底下是空的。
第二回合:我直接 curl 了 Agnes
不信它的账,我自己打。
| |
返回 HTTP 200,一个标准的 OpenAI 格式补全:
| |
所以:Agnes 是真的。厂商站 agnes-ai.com 首页标题就写着 “Agnes AI | Free Omni-Modal AI API”,API 端点活着、返 OpenAI 格式、模型名对得上。工作流判它「不存在」是错的。
有个附带发现:响应头里有 x-new-api-version——Agnes 的后端是 NewAPI(那个开源 API 中转/聚合框架,我自己也跑了一个公益站)。也就是说 Agnes 大概率不是自研模型实验室,而是一个 NewAPI 前端的中转/聚合渠道。这不影响它「能用」,但解释了它为什么能白送:它背后多半是各家免费额度的二次聚合。
但「1M / 无限量 / 6 月 1 日起」这三条,我没法证实
厂商站是个 JS 单页应用,/pricing /models /docs 子页全 404,首页只吐个 “Loading…” 壳,抓不到具体参数。所以:
- 1M 上下文存疑——第三方仿冒站(aguea.ai)摸到的数是 2.0-flash=256K,跟「1M」对不上;
- 「无限量」基本可断是话术——「免费无限量」在业界惯例里 = 不按 token 收费,但照样有限速(每分钟请求数 RPM / 每天 token 数)。一个 NewAPI 中转站几乎不可能真无限,它自己上游就有限额。
- 「6 月 1 日起」——抓不到,没法核实日期。
第三回合:市面还有哪些「免费 + OpenAI 兼容」渠道
既然 Agnes 这种「免费无限量」是话术,那真要白嫖,还有哪些靠谱的?我把公开、可直连验证的渠道摸了一遍。
OpenRouter(聚合站)
这是最省事的白嫖入口,一个 key 调一百多家。我打了它公开的 /api/v1/models(免鉴权),返回 414 个模型,其中 20 个真免费(input+output 价格都 = $0):
里头有两个 1M 上下文免费:nvidia/nemotron-3.5-lightning:free、nvidia/nemotron-3-ultra-550b-a55b:free。这是目前能找到的最接近「1M+免费」的真实选项。还有 z-ai/glm-5.2:free(128K)、openai/gpt-oss-20b:free(128K)、google/gemma-4-31b-it:free(262K)。
注意:OpenRouter 的 :free = $0/token,但限速 + 有日请求数上限、低优先级排队。不是真无限。
硅基流动 SiliconFlow
国内 OpenAI 兼容大厂,base https://api.siliconflow.cn/v1。我抓了它 pricing 页,THUDM/GLM-Z1-9B-0414 标着 免费/免费(input+output 都免费)。其余模型付费(GLM-5.2 ¥8/¥28 每百万 token 等)。免费模型限速细节在它的 api-docs。
Cloudflare Workers AI
CF 自己的推理服务,OpenAI 兼容。我拉了它 pricing 页:
免费额度 10,000 Neurons/天(UTC 零点重置),超出 $0.011/千 Neurons。而且前沿模型(kimi-k2.6/k2.7-code、glm-5.2、deepseek-v4-flash/pro)必须绑付费方式才能用——免费层只够调小模型。
其它常见的官方免费层
这些我没挨个抓,你自查官网,均限速非无限:Google AI Studio Gemini 免费层、Groq、Cerebras、SambaNova、Together AI 部分 $0 模型;国内的阿里百炼 / 腾讯混元 / 字节豆包 / 智谱 / 阶跃,多数给新用户赠金额度(用完即止),月之暗面 Kimi 平台历来没有真正免费 API 层。
对抗验证:我请了个「杠精」来挑刺
光自己说不算,我请了个对抗验证 agent 专门来反驳我的结论(它不知道我做了 live 测试)。它最有杀伤力的一刀是:
「401 只能证明端点有鉴权墙,不代表后端真活着——可能是停尸域名。你没做真实补全调用,全是二手断言。」
这一刀正中要害——但我正好做了那个 live 调用。HTTP 200 + 标准 OpenAI 格式补全 + 模型名匹配,直接把这条反驳拍死。这其实是验证的价值:杠精替你把「最该补的证据」指出来,你补上,结论才硬。
它另外提的几点也站得住,我都认:
- OpenRouter
:free可能有隐藏日上限(确实有,只是不在/models里暴露); - Nemotron 的 1M 可能是规格上限而非真能跑满(合理存疑);
- GLM-Z1-9B 的「免费」可能随厂商改价(需自查);
- 「没有真·无限量」忽略了自托管 Ollama 和学术/非营利特例——这点我认:自托管(Ollama / vLLM)是唯一真·无限免费 OpenAI 兼容路子,但它不是托管渠道,得自己出显卡。
结论
挨个打完,三句话:
- Agnes 真实存在、免费、OpenAI 兼容——live 调用 200 OK 实锤。但它大概率是个 NewAPI 中转站,「1M / 无限量 / 6-1」是营销话术,别当硬指标。
- 真·「无限量免费」的托管 OpenAI 兼容 API 基本不存在——所有渠道都有 RPM/TPM/日额度。「无限量」在话术里 = 不按 token 收费,不是不限速。要吞吐就得多源轮换或付费。
- 实操白嫖组合:OpenRouter 的
:free模型(含两个 1M Nemotron)+ 硅基流动 GLM-Z1-9B 免费 + Agnes,在代理层做 priority 轮换 + fallback,比押单一「无限量」源稳得多。
真要「无限量」,只剩自托管一条路——那就不叫白嫖渠道了,叫自己买卡。



