每日请求上限最高
GroqCloud
已公布 1,000 次/天
逐条核验的服务商事实 · 核验于 2026-07-25
比较长期免费额度、无需信用卡的选择、模型与官方公布限额;每项结论都能追溯到官方来源。
由数据生成的捷径
完全依据清单中的公开事实选出,不接受赞助排名。
每日请求上限最高
已公布 1,000 次/天
每分钟请求上限最高
已公布 1,000 RPM
可在浏览器检测
已验证 Key 检测所需的跨域支持
编码 Agent 配置
包含 OpenAI 兼容配置指南
清单
长期免费、聚合器、注册赠送和按量计费保持清晰分层。
26 条匹配
| 服务商 | 免费形式 | 信用卡 | OpenAI | 限额 | 采样探活 | 来源核验 | 获取 |
|---|---|---|---|---|---|---|---|
| Google Gemini API | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 限流按项目(project)而不是按 API key 计算,取决于该项目所处的用量层级;Free 是入门层级,往上走需要开启计费。Google 公布了层级结构,但把具体生效的 RPM、TPM 和 RPD 指向 AI Studio 查看,因此这里给不出单一的免费额度数字。 | 未探活 尚未公布任何带凭据的探活结果。 | Gemini API rate limitsGemini API billingGemini OpenAI compatibility | 去开通 API |
| GroqCloud | 厂商免费额度 | 不需要 | 是 | 30 RPM · 1000 次/天 免费计划的限额按模型区分,并按组织(organization)合并计算。llama-3.3-70b-versatile:30 RPM、1,000 RPD、12K TPM、100K TPD。llama-3.1-8b-instant:30 RPM、14,400 RPD、6K TPM、500K TPD。openai/gpt-oss-120b 与 openai/gpt-oss-20b:30 RPM、1,000 RPD、8K TPM、200K TPD。groq/compound:30 RPM、250 RPD、70K TPM。命中缓存的 token 不计入 token 限额。本页 RPM/RPD 两列取的是 llama-3.3-70b-versatile 的数值。 | 未探活 尚未公布任何带凭据的探活结果。 | GroqCloud rate limitsGroq OpenAI compatibilityGroq billing FAQ | 去开通 API |
| SambaNova Cloud | 厂商免费额度 | 不需要 | 是 | 20 RPM · 20 次/天 只要账号没有绑定支付方式,就处于 Free Tier。DeepSeek-V3.1、Meta-Llama-3.3-70B-Instruct 和 gpt-oss-120b 的免费限额是 20 RPM、每天 20 次请求、每天 20 万 token。绑定支付方式后账号转入 Developer Tier(全模型合计 60–240 RPM、12,000–48,000 RPD、每天 2,000 万 token)。 | 未探活 尚未公布任何带凭据的探活结果。 | SambaNova model rate limitsSambaNova developer guideSambaNova OpenAI compatibility | 去开通 API |
| Cohere | 厂商免费额度 | 不需要 | 是 | 20 RPM 试用 key 免费、有限流,并且按条款不得用于生产。Chat 限 20 次/分钟,Rerank 限 10 次/分钟,Audio Transcriptions 与 EmbedJob 限 5 次/分钟,Tokenize 限 100 次/分钟,Embed 限 2,000 条输入/分钟。此外每个试用 key 在账号维度还有每月 1,000 次 API 调用的封顶。 | 未探活 尚未公布任何带凭据的探活结果。 | Cohere API rate limitsCohere Compatibility APICohere pricing | 去开通 API |
| Cloudflare Workers AI | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 Workers Free 和 Workers Paid 两个计划都包含每天 10,000 Neurons 的免费额度,每天 UTC 00:00 重置。Neuron 是计算单位而不是请求数,所以能换到多少次请求取决于模型和 prompt 大小。Free 计划没有超额继续用这一说:额度花完后请求直接失败,直到下次重置。Workers Paid 的超额按每 1,000 Neurons 0.011 美元计费。 | 未探活 尚未公布任何带凭据的探活结果。 | Workers AI pricingWorkers AI OpenAI compatible endpointsWorkers AI models | 去开通 API |
| Hugging Face Inference Providers | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 登录的免费用户每月获得 0.10 美元的 Inference Provider 额度(Hugging Face 注明这个数额可能调整);PRO 用户 2.00 美元,Team 或 Enterprise 组织按每席位 2.00 美元。额度只作用于经 Hugging Face 路由的请求,用你自己的服务商 key 直连既不消耗也不享受。每月额度花完后需要另行购买才能继续。 | 未探活 尚未公布任何带凭据的探活结果。 | Inference Providers pricing and billingInference Providers OpenAI compatibilityInference Providers settings | 去开通 API |
| SiliconFlow | 厂商免费额度 | 不需要 | 是 | 1000 RPM 免费模型的限流是固定值;付费模型按月消费分层,L0 起步为 1,000 RPM、40,000 TPM。限流按用户账号而不是按 API key 计算,而且每个模型单独计限。deepseek-ai/DeepSeek-R1 与 deepseek-ai/DeepSeek-V3 另有每小时 30 次、每天 100 次的额外封顶。 | 未探活 尚未公布任何带凭据的探活结果。 | SiliconFlow rate limitsSiliconFlow quick startSiliconFlow models | 去开通 API |
| Fireworks AI | 厂商免费额度 | 不需要 | 是 | 10 RPM 既没有绑定支付方式、也没有余额的账号,整个账号合计限 10 次请求/分钟。绑定支付方式并有可用余额后,上限最高能到 6,000 RPM。Fireworks 是预付费模式,所以 10 RPM 这个区间是唯一的零成本路径,官方也没有为它公布每日请求上限。 | 未探活 尚未公布任何带凭据的探活结果。 | Fireworks account quotasFireworks serverless rate limitsFireworks pricing | 去开通 API |
| Z.AI Open Platform | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 官方定价表把 GLM-4.7-Flash 和 GLM-4.5-Flash 的输入、缓存输入与输出都标成 $0,也就是真的免费调用,而不只是打折。Z.AI 没有在定价页上给出这两个模型的 RPM 或 TPM,限流说明在另一个页面上,实际以控制台为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Z.AI pricingZ.AI rate limitsOpenAI Python SDK with Z.AI | 去开通 API |
| Novita AI | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 官方定价表把 inclusionai/Ling-3.0-flash 和 Mind Lab 的 Macaron V1 Venti 的输入与输出都标成 Free,其余列出的模型都按每百万 token 计费。Novita 没有在定价页上给出这些免费模型的 RPM 或 RPD。 | 未探活 尚未公布任何带凭据的探活结果。 | Novita pricingNovita LLM API referenceNovita model library | 去开通 API |
| Mistral La Plateforme | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 Mistral 文档里有一个 Free 模式(也称 Experiment 计划),不付费就能激活工作区并生成 API key,但公开文档目前没有一个打得开的限流页面:核验当天,Mistral 自己文档索引里给出的该层级 URL 返回 404。Experiment 计划的每秒请求数和每分钟 token 数,只能以控制台为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Mistral La Plateforme documentationMistral pricingMistral API documentation index | 去开通 API |
| Alibaba Cloud Model Studio | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 限流在阿里云主账号这一层生效,会把该账号下所有 RAM 用户、工作空间和 API key 的用量合并计算。每个模型有各自的 RPM 和 TPM,公布在按模型的表格里,免费额度也是按模型发放而不是给一份账号级总额,因此没有单一的免费额度数字。 | 未探活 尚未公布任何带凭据的探活结果。 | Model Studio rate limitingModel Studio OpenAI compatibilityModel Studio models | 去开通 API |
| Moonshot AI (Kimi) | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 限额用并发数、RPM、TPM 和 TPD 表示,公布的分层表对应的是累计充值金额,而不是一份常设的免费额度;累计充值达到 5 美元会赠送 5 美元代金券。新账号从最低档起步,所以规划用量之前请以控制台的层级页面为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Kimi rate limitsKimi API overviewKimi pricing | 去开通 API |
| Pollinations.AI | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 Pollinations 提供一个 OpenAI 兼容的文本端点,基础用法不带 key 也能调用,官方 API 文档也没有公布 RPM 或 RPD。文档确实写明自 2025-03-31 起免费层的图片可能带水印,所以免费层的产出和付费层并不完全一样。 | 未探活 尚未公布任何带凭据的探活结果。 | Pollinations API documentationPollinations project repositoryPollinations.AI home | 去开通 API |
| Ollama Cloud | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 云端模型跑在 Ollama 自己的服务器上,本地 CLI 的用法保持不变,只要一个 ollama.com 账号就能开始。Cloud 文档页说明了访问方式和模型下线策略,但没有公布每小时或每天的请求限额,实际生效的额度以账号页面为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Ollama Cloud documentationOllama Cloud API accessOllama model library | 去开通 API |
| Cerebras Inference | 注册赠送额度 | 需要 | 是 | 5 RPM 免费试用的限额是每个模型 5 RPM、30K TPM,并有每小时 100 万 token、每天 100 万 token 的封顶,适用于 gpt-oss-120b、zai-glm-4.7 和 gemma-4-31b。新账号获得 5 美元额度,自发放起 30 天过期。Cerebras 说明:注册时如果跳过绑定支付方式,Playground 和 API 访问会一直是未激活状态,直到补上为止。 | 未探活 尚未公布任何带凭据的探活结果。 | Cerebras rate limitsCerebras pricingCerebras OpenAI compatibility | 去开通 API |
| Vercel AI Gateway | 注册赠送额度 | 不需要 | 是 | 动态 / 未公布 免费层下每个 Vercel 团队账号每月获得 5 美元的 AI Gateway 额度,而且只能用在 Free Tier 那部分模型上,不是整个模型目录。免费层的请求还会按模型单独限流,限额低于付费层,Vercel 没有公布这些按模型的具体数字。额度从你第一次调用 Gateway 起开始计算。 | 未探活 尚未公布任何带凭据的探活结果。 | AI Gateway pricingAI Gateway getting startedAI Gateway models | 去开通 API |
| IBM watsonx.ai | 注册赠送额度 | 不需要 | 否 | 动态 / 未公布 IBM 在付费的 Essentials 和 Standard 计划之外,提供 watsonx.ai 的免费试用,定价页也明确邀请你零成本开始构建。该页面按资源单位列出了各计划的价格,但没有公布试用的请求速率限制,试用的上限以控制台为准。 | 未探活 尚未公布任何带凭据的探活结果。 | watsonx.ai pricingwatsonx.ai API referencewatsonx.ai foundation models | 去开通 API |
| OpenRouter | 免费模型聚合 | 不需要 | 是 | 20 RPM · 50 次/天 model ID 以 :free 结尾的变体一律限 20 次请求/分钟,与账号状态无关。每日上限取决于历史累计购买的额度:不足 10 credits 是每天 50 次请求,达到 10 credits 及以上提升到每天 1,000 次。OpenRouter 在全局层面调度容量,所以多开账号或多建 API key 都不会把这些限额抬高。 | 未探活 尚未公布任何带凭据的探活结果。 | OpenRouter API rate limitsOpenRouter free model variantsOpenRouter quickstart | 去开通 API |
| GitHub Models 2026-07-30 下线 | 即将下线的免费额度 | 不需要 | 是 | 动态 / 未公布 限额随模型和 Copilot 计划而不同。已不再接受新客户,服务将于 2026-07-30 下线。 | 未探活 尚未公布任何带凭据的探活结果。 | GitHub Models retirement announcementGitHub Models catalog APIGitHub Models billing | 已停止新用户注册 |
| Together AI | 按量计费 | 不需要 | 是 | 动态 / 未公布 Together 采用按模型的动态限流:持续成功的流量会把限额抬上去,流量降下来限额也跟着回落,官方明确说明不公布固定的按模型限额。超过动态速率的请求返回 429 并带 x-ratelimit-reset;在限额之内却仍然失败的请求返回 503。限流页面上没有记录任何常设的免费额度。 | 未探活 尚未公布任何带凭据的探活结果。 | Together serverless rate limitsTogether OpenAI compatibilityTogether pricing | 去开通 API |
| Nebius Token Factory | 按量计费 | 不需要 | 是 | 60 RPM 限额是动态的,公布的基线为 60 RPM 和 400,000 TPM。用量按 15 分钟滚动窗口评估:窗口内平均达到或超过当前限额的 80%,下一个窗口上调 20%;平均低于或等于 50% 则除以 1.5;上限是基础配额的 20 倍,再往上要走 Enterprise 计划。该页面没有记录任何常设的免费额度。 | 未探活 尚未公布任何带凭据的探活结果。 | Nebius rate limits and scalingNebius Token Factory quickstartNebius billing and consumption | 去开通 API |
| Perplexity API | 按量计费 | 不需要 | 是 | 50 RPM 用量层级由累计购买的 API 额度决定,而且只升不降。Tier 0(累计购买 0 美元)在 Agent API 上允许 1 QPS、50 次请求/分钟;Tier 1(50 美元以上)是 3 QPS、150 次/分钟,到 Tier 4 提升到 33 QPS、2,000 次/分钟。Search API 在所有层级都单独限为 50 次请求/秒。Tier 0 只是划定了速率上限,并不是一份免费 token 赠额,调用之前仍然要先有余额。 | 未探活 尚未公布任何带凭据的探活结果。 | Perplexity rate limits and usage tiersPerplexity pricingPerplexity OpenAI compatibility | 去开通 API |
| DeepInfra | 按量计费 | 不需要 | 是 | 动态 / 未公布 官方定价页为每个在服模型列出了每百万 token 的输入与输出价格,既没有描述免费额度,也没有公布请求速率限制。请把 DeepInfra 当作按量付费来看待,新账号是否附带推广额度,到控制台确认。 | 未探活 尚未公布任何带凭据的探活结果。 | DeepInfra pricingDeepInfra OpenAI compatibilityDeepInfra models | 去开通 API |
| Chutes | 按量计费 | 不需要 | 是 | 动态 / 未公布 Chutes 按 token 计费,并出售包含每日额度的订阅计划:Plus 每月 10 美元,含一份每日额度,超出部分在按量价上打 94 折;Pro 每月 20 美元,每日额度更大,超出部分打 9 折。定价页没有记录任何零成本层级,各计划的请求速率数字在计划限额页上,而不在定价页上。 | 未探活 尚未公布任何带凭据的探活结果。 | Chutes pricingChutes documentationChutes app | 去开通 API |
| Scaleway Generative APIs | 按量计费 | 需要 | 是 | 动态 / 未公布 通过 Generative APIs - Serverless 提供的每个模型,都同时受每分钟 token 数、每分钟查询数和并发请求数三重限制。Scaleway 说明基础限额只在你登记了有效支付方式之后才适用,若再完成身份验证还会自动提高。具体数字在组织配额页面上,而不在限流文档里。 | 未探活 尚未公布任何带凭据的探活结果。 | Scaleway Generative APIs rate limitsScaleway Generative APIs quickstartScaleway Generative APIs pricing | 去开通 API |
没有服务商符合当前筛选条件。
浏览
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GROQ_API_KEY"],
base_url="https://api.groq.com/openai/v1",
)
response = client.chat.completions.create(
model="llama-3.3-70b-versatile",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)
为什么可以信任这份目录
每条限额和生命周期信息都链接到对应的服务商官方页面。
每条记录都保留最后核验官方来源的日期。
赠送额度和按量计费单独展示;一次采样从不冒充整体可用性。
一起保持清单新鲜
带上官方来源和核验日期提交更正;欢迎使用中文或英文。 阅读贡献指南.
延伸阅读: 编程 Agent 实际花了多少钱、在哪儿出问题的实地记录.
需要一个稳定的托管端点?