兼容覆盖什么,又不覆盖什么
有详细页面的 25 家服务商中,本页收录 24 家,因为它们各自公开了与 OpenAI API 某部分兼容的端点。实际使用时,标准客户端通常只需替换 Base URL、模型 ID 和 API key 就能发送 chat completions。兼容是协议层结论,不代表 OpenAI 的所有能力都存在;响应结构、工具调用、流式事件、Embedding、图片路由和错误字段都可能不同。
兼容端点与免费访问条款
这 24 家按清单顺序展示,不编造质量总分。Base URL 直接来自服务商数据,限额栏只保留官方文档能够支撑的表述。详情页列出精确模型 ID 与来源。即使协议配置正确,只要客户端发送了服务商不认识的模型别名,请求仍然会失败。
| 服务商 | 免费形式 | 官方公布限额 | 信用卡 | Base URL |
|---|---|---|---|---|
| Google Gemini API | 厂商免费额度 | 按项目层级设定 | 不需要 | https://generativelanguage.googleapis.com/v1beta/openai/ |
| GroqCloud | 厂商免费额度 | 每分钟 30 次请求,每天 1000 次请求 | 不需要 | https://api.groq.com/openai/v1 |
| SambaNova Cloud | 厂商免费额度 | 每分钟 20 次请求,每天 20 次请求 | 不需要 | https://api.sambanova.ai/v1 |
| Cohere | 厂商免费额度 | 每分钟 20 次请求 | 不需要 | https://api.cohere.ai/compatibility/v1 |
| Cloudflare Workers AI | 厂商免费额度 | 以计算单位公布 | 不需要 | https://api.cloudflare.com/client/v4/accounts/ACCOUNT_ID/ai/v1 |
| Hugging Face Inference Providers | 厂商免费额度 | 以额度余额公布 | 不需要 | https://router.huggingface.co/v1 |
| SiliconFlow | 厂商免费额度 | 每分钟 1000 次请求 | 不需要 | https://api.siliconflow.com/v1 |
| Fireworks AI | 厂商免费额度 | 每分钟 10 次请求 | 不需要 | https://api.fireworks.ai/inference/v1 |
| Z.AI Open Platform | 厂商免费额度 | 部分模型标价为零 | 不需要 | https://api.z.ai/api/paas/v4 |
| Novita AI | 厂商免费额度 | 部分模型标价为零 | 不需要 | https://api.novita.ai/openai |
| Mistral La Plateforme | 厂商免费额度 | 有限流但未公布数值 | 不需要 | https://api.mistral.ai/v1 |
| Alibaba Cloud Model Studio | 厂商免费额度 | 按模型公布 | 不需要 | https://dashscope-intl.aliyuncs.com/compatible-mode/v1 |
| Moonshot AI (Kimi) | 厂商免费额度 | 按层级公布 | 不需要 | https://api.moonshot.ai/v1 |
| Pollinations.AI | 厂商免费额度 | 有限流但未公布数值 | 不需要 | https://text.pollinations.ai/openai |
| Ollama Cloud | 厂商免费额度 | 有限流但未公布数值 | 不需要 | https://ollama.com/v1 |
| Cerebras Inference | 注册赠送额度 | 每分钟 5 次请求 | 需要 | https://api.cerebras.ai/v1 |
| Vercel AI Gateway | 注册赠送额度 | 以额度余额公布 | 不需要 | https://ai-gateway.vercel.sh/v1 |
| OpenRouter | 免费模型聚合 | 每分钟 20 次请求,每天 50 次请求 | 不需要 | https://openrouter.ai/api/v1 |
| Together AI | 按量计费 | 动态,无固定数值 | 不需要 | https://api.together.xyz/v1 |
| Nebius Token Factory | 按量计费 | 每分钟 60 次请求 | 不需要 | https://api.tokenfactory.nebius.com/v1 |
| Perplexity API | 按量计费 | 每分钟 50 次请求 | 不需要 | https://api.perplexity.ai |
| DeepInfra | 按量计费 | 有限流但未公布数值 | 不需要 | https://api.deepinfra.com/v1/openai |
| Chutes | 按量计费 | 按付费计划公布 | 不需要 | https://llm.chutes.ai/v1 |
| Scaleway Generative APIs | 按量计费 | 有限流但未公布数值 | 需要 | https://api.scaleway.ai/v1 |
先确认你的客户端实际用到了哪些能力
普通聊天客户端需要的兼容能力,远少于一个持续流式调用工具、并依赖特定错误结构的 Agent。先列出应用真正依赖的路由和字段,再对短名单逐项测试。编码工具要确认能否自定义 Base URL,以及 key 从哪个环境变量读取;批处理任务则更应关注每日限额和并发,而不是交互式控制台里偶尔成功的一次请求。
为什么「直接替换」很少完全字面成立
熟悉的端点形状背后,各家的模型目录、上下文窗口、内容审核、Token 计数与重试响应头都不同。有些会忽略不支持的参数,有些会直接拒绝。免费额度还增加了模型可用性和排队优先级这两个独立变量。把服务商专属模型 ID 留在配置中,诊断时保留原始状态码,也不要假设每个 429 都携带相同的重置时间。
可迁移的接入方式
把 Base URL、模型 ID 和 key 环境变量都放到业务代码之外。先运行一个最小的非流式补全,再逐项启用流式、结构化输出和工具调用;记录是哪项能力失败,而不是笼统判定整个端点不兼容。这样切换服务商只是配置变化,某个免费模型被移除或暂时容量紧张时,也保留了清晰的备用路径。
兼容标签背后的证据
只有服务商自己在文档中声明端点时才会使用这个标签,社区维护的包装器不算;记录核验于 2026-07-25。先读数据方法了解证据规则,再用浏览器 key 检测页或它生成的 curl 命令,把 key 错误、限流和端点错误分开,然后再决定是否改 SDK。