每日请求上限最高
GroqCloud
已公布 1,000 次/天
逐条核验的服务商事实 · 核验于 2026-08-22
比较长期免费额度、无需信用卡的选择、模型与官方公布限额;每项结论都能追溯到官方来源。
由数据生成的捷径
完全依据清单中的公开事实选出,不接受赞助排名。
每日请求上限最高
已公布 1,000 次/天
每分钟请求上限最高
已公布 1,000 RPM
可在浏览器检测
已验证 Key 检测所需的跨域支持
编码 Agent 配置
包含 OpenAI 兼容配置指南
2026-08-22 重新核对
发布以来的第一次复核。逐家重读了官方源:GitHub Models 已经关停,Novita 的免费行一条不剩,Groq 把两个 Llama 模型移出了免费表。有两家这次读不到源,核验日期保持原样。
一条免费通道关掉,就变成一笔账单。付费的那几家每百万 token 实际多少钱、每个数字出自哪一句话: 实地记录里的成本表.
清单
长期免费、聚合器、注册赠送和按量计费保持清晰分层。
26 条匹配
| 服务商 | 免费形式 | 信用卡 | OpenAI | 限额 | 采样探活 | 来源核验 | 获取 |
|---|---|---|---|---|---|---|---|
| Google Gemini API | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 限流按项目(project)而不是按 API key 计算,取决于该项目所处的用量层级;Free 是入门层级,往上走需要开启计费。Google 公布了层级结构,但把具体生效的 RPM、TPM 和 RPD 指向 AI Studio 查看,因此这里给不出单一的免费额度数字。 | 未探活 尚未公布任何带凭据的探活结果。 | Gemini API rate limitsGemini API billingGemini OpenAI compatibility | 去开通 API |
| GroqCloud | 厂商免费额度 | 不需要 | 是 | 30 RPM · 1000 次/天 免费计划的限额按模型区分,并按组织(organization)合并计算。openai/gpt-oss-120b、openai/gpt-oss-20b、openai/gpt-oss-safeguard-20b、qwen/qwen3.6-27b:30 RPM、1K RPD、8K TPM、200K TPD。groq/compound 和 groq/compound-mini:30 RPM、250 RPD、70K TPM,没有列每日 token 上限。meta-llama/llama-prompt-guard-2-22m 与 -86m:30 RPM、14.4K RPD、15K TPM、500K TPD。Whisper large-v3 与 turbo 按音频秒数计量:20 RPM、2K RPD、7.2K ASH、28.8K ASD。llama-3.3-70b-versatile 和 llama-3.1-8b-instant 已不在免费表内。本页 RPM/RPD 两列取的是 openai/gpt-oss-120b 的数值。 | 未探活 尚未公布任何带凭据的探活结果。 | GroqCloud rate limitsGroq OpenAI compatibilityGroq billing FAQ | 去开通 API |
| SambaNova Cloud | 厂商免费额度 | 不需要 | 是 | 20 RPM · 20 次/天 只要账号没有绑定支付方式,就适用免费档。免费表里每个模型的数字都一样:20 RPM、20 RPD、每天 200,000 token。生产(production)模型是 DeepSeek-V3.1、Meta-Llama-3.3-70B-Instruct 和 gpt-oss-120b;DeepSeek-V3.2 和 gemma-4-31B-it 标着预览(preview)。SambaNova 没有为免费档公布每分钟 token 数,只有 RPM、RPD 和 TPD 三项。MiniMax-M2.7 只出现在开发者档的表里。绑定支付方式后账号转入开发者档。 | 未探活 尚未公布任何带凭据的探活结果。 | SambaNova model rate limitsSambaNova developer guideSambaNova OpenAI compatibility | 去开通 API |
| Cohere | 厂商免费额度 | 不需要 | 是 | 20 RPM 试用 key 免费、有限流,并且按条款不得用于生产。Chat 限 20 次/分钟,Rerank 限 10 次/分钟,Audio Transcriptions 与 EmbedJob 限 5 次/分钟,Tokenize 限 100 次/分钟,Embed 限 2,000 条输入/分钟。此外每个试用 key 在账号维度还有每月 1,000 次 API 调用的封顶。 | 未探活 尚未公布任何带凭据的探活结果。 | Cohere API rate limitsCohere Compatibility APICohere pricing | 去开通 API |
| Cloudflare Workers AI | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 Workers Free 和 Workers Paid 两种计划都含每天 10,000 Neurons 的免费额度,每天 00:00 UTC 重置。Neuron 是计算单位而不是请求次数,所以能换到多少次请求取决于模型和 prompt 大小。免费计划没有超额选项:额度用完,请求就失败到下次重置为止。Workers Paid 的超额价格是每 1,000 Neurons $0.011。有几个模型完全不在免费额度覆盖范围内,无论如何都要先有付费方式 —— @cf/moonshotai/kimi-k2.6、@cf/zai-org/glm-5.2 和 @cf/deepseek-ai/deepseek-v4-pro-0813 —— 要走 Workers Paid 或预付的 AI Gateway 额度。 | 未探活 尚未公布任何带凭据的探活结果。 | Workers AI pricingWorkers AI OpenAI compatible endpointsWorkers AI models | 去开通 API |
| Hugging Face Inference Providers | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 登录的免费用户每月获得 0.10 美元的 Inference Provider 额度(Hugging Face 注明这个数额可能调整);PRO 用户 2.00 美元,Team 或 Enterprise 组织按每席位 2.00 美元。额度只作用于经 Hugging Face 路由的请求,用你自己的服务商 key 直连既不消耗也不享受。每月额度花完后需要另行购买才能继续。 | 未探活 尚未公布任何带凭据的探活结果。 | Inference Providers pricing and billingInference Providers OpenAI compatibilityInference Providers settings | 去开通 API |
| SiliconFlow | 厂商免费额度 | 不需要 | 是 | 1000 RPM 免费模型的限流是固定值;付费模型按月消费分层,L0 起步为 1,000 RPM、40,000 TPM。限流按用户账号而不是按 API key 计算,而且每个模型单独计限。deepseek-ai/DeepSeek-R1 与 deepseek-ai/DeepSeek-V3 另有每小时 30 次、每天 100 次的额外封顶。 | 未探活 尚未公布任何带凭据的探活结果。 | SiliconFlow rate limitsSiliconFlow quick startSiliconFlow models | 去开通 API |
| Fireworks AI | 厂商免费额度 | 不需要 | 是 | 10 RPM 既没有绑定支付方式、也没有余额的账号,整个账号合计限 10 次请求/分钟。绑定支付方式并有可用余额后,上限最高能到 6,000 RPM。Fireworks 是预付费模式,所以 10 RPM 这个区间是唯一的零成本路径,官方也没有为它公布每日请求上限。 | 未探活 尚未公布任何带凭据的探活结果。 | Fireworks account quotasFireworks serverless rate limitsFireworks pricing | 去开通 API |
| Z.AI Open Platform | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 GLM-4.7-Flash、GLM-4.5-Flash 和视觉模型 GLM-4.6V-Flash 在官方定价表上的输入、缓存输入、缓存输入存储和输出四列都标着 $0,也就是真的免费调用,不是打折。Z.AI 没有在定价页上公布这几个模型的 RPM 或 TPM;限流说明在另一页,最终以控制台为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Z.AI pricingZ.AI rate limitsOpenAI Python SDK with Z.AI | 去开通 API |
| Novita AI | 按量计费 | 不需要 | 是 | 动态 / 未公布 定价表里已经没有任何一个模型标价为零。本清单原先列的两个免费项 — inclusionai/Ling-3.0-flash 和 Mind Lab Macaron V1 Venti — 已从表中消失。现在最便宜的是 Llama 3.1 8B Instruct(每百万 token 输入 $0.02、输出 $0.05)和 BAAI:BGE-M3 向量模型(每百万 $0.01)。页面没有公布注册赠额,也没有公布任何请求速率数字。 | 未探活 尚未公布任何带凭据的探活结果。 | Novita pricingNovita LLM API referenceNovita model library | 去开通 API |
| Mistral La Plateforme | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 Mistral 文档里有一个 Free 模式(也称 Experiment 计划),不付费就能激活工作区并生成 API key,但公开文档目前没有一个打得开的限流页面:核验当天,Mistral 自己文档索引里给出的该层级 URL 返回 404。Experiment 计划的每秒请求数和每分钟 token 数,只能以控制台为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Mistral La Plateforme documentationMistral pricingMistral API documentation index | 去开通 API |
| Alibaba Cloud Model Studio | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 限流在阿里云主账号这一层生效,会把该账号下所有 RAM 用户、工作空间和 API key 的用量合并计算。每个模型有各自的 RPM 和 TPM,公布在按模型的表格里,免费额度也是按模型发放而不是给一份账号级总额,因此没有单一的免费额度数字。 | 未探活 尚未公布任何带凭据的探活结果。 | Model Studio rate limitingModel Studio OpenAI compatibilityModel Studio models | 去开通 API |
| Moonshot AI (Kimi) | 按量计费 | 不需要 | 是 | 动态 / 未公布 分档表挂钩的是累计充值金额,而不是一份长期免费额度:文档写明必须先充值至少 $1 才能开始使用,此后 Tier0 给 1 路并发、3 RPM、500K TPM、1.5M TPD。累计 $10 的 Tier1 给 50 路并发、200 RPM、2M TPM、TPD 不限,一直到 Tier5 的 $3,000。$5 代金券要等累计付款达到 $5 才发放,而代金券本身不计入累计充值。文档已迁到 platform.kimi.ai,原先 platform.moonshot.ai 的路径现在 301 过去;页面另有一条告示:因异常流量,分档与限额规则拟于 8 月修订。 | 未探活 尚未公布任何带凭据的探活结果。 | Kimi rate limitsKimi API overviewKimi pricing | 去开通 API |
| Pollinations.AI | 厂商免费额度 | 不需要 | 是 | 4 RPM API 文档现在按「两次请求的最小间隔」公布了四档:Anonymous,免注册,基础模型,每 15 秒 1 次;Seed,免费注册,标准模型,每 5 秒 1 次;Flower,付费,高级模型,每 3 秒 1 次;Nectar,企业版,全部模型,不限。本页 RPM 一列取的是 Anonymous 档折算成每分钟的值(每 15 秒 1 次 = 每分钟 4 次)。自 2025-03-31 起免费档产出的图片可能带水印,用 nologo 参数去掉水印需要账号。 | 未探活 尚未公布任何带凭据的探活结果。 | Pollinations API documentationPollinations project repositoryPollinations.AI home | 去开通 API |
| Ollama Cloud | 厂商免费额度 | 不需要 | 是 | 动态 / 未公布 云端模型跑在 Ollama 自己的服务器上,本地 CLI 的用法保持不变,只要一个 ollama.com 账号就能开始。Cloud 文档页说明了访问方式和模型下线策略,但没有公布每小时或每天的请求限额,实际生效的额度以账号页面为准。 | 未探活 尚未公布任何带凭据的探活结果。 | Ollama Cloud documentationOllama Cloud API accessOllama model library | 去开通 API |
| Cerebras Inference | 注册赠送额度 | 需要 | 是 | 5 RPM 免费试用的限额是每个模型 5 RPM、30K TPM,并有每小时 100 万 token、每天 100 万 token 的封顶,适用于 gpt-oss-120b 和 gemma-4-31b —— zai-glm-4.7 已不在这张表里。gemma-4-31b 另有图片限制:每次请求 2 张、单次载荷 4 MB。新账号获得 5 美元额度,自发放起 30 天过期;Cerebras 明确说明不提供按模型的长期免费额度。注册时跳过绑定支付方式,Playground 和 API 访问会一直是未激活状态。 | 未探活 尚未公布任何带凭据的探活结果。 | Cerebras rate limitsCerebras pricingCerebras OpenAI compatibility | 去开通 API |
| Vercel AI Gateway | 注册赠送额度 | 不需要 | 是 | 动态 / 未公布 每个 Vercel team 账号都有免费档,但免费档只覆盖模型子集,不是全部目录;免费档的请求还按模型限流,上限低于付费档,而这些按模型的数字并不公布。免费额度从你第一次调用 Gateway 时开始计。定价页已经不再写出每月免费额度的具体金额:本清单原先引用的每月 5 美元已经不在页面上,所以这里不再给出金额。 | 未探活 尚未公布任何带凭据的探活结果。 | AI Gateway pricingAI Gateway getting startedAI Gateway models | 去开通 API |
| IBM watsonx.ai | 注册赠送额度 | 不需要 | 否 | 动态 / 未公布 IBM 在付费的 Essentials 和 Standard 计划之外,提供 watsonx.ai 的免费试用,定价页也明确邀请你零成本开始构建。该页面按资源单位列出了各计划的价格,但没有公布试用的请求速率限制,试用的上限以控制台为准。 | 未探活 尚未公布任何带凭据的探活结果。 | watsonx.ai pricingwatsonx.ai API referencewatsonx.ai foundation models | 去开通 API |
| OpenRouter | 免费模型聚合 | 不需要 | 是 | 20 RPM · 50 次/天 model ID 以 :free 结尾的变体一律限 20 次请求/分钟,与账号状态无关。每日上限取决于历史累计购买的额度:不足 10 credits 是每天 50 次请求,达到 10 credits 及以上提升到每天 1,000 次。OpenRouter 在全局层面调度容量,所以多开账号或多建 API key 都不会把这些限额抬高。 | 未探活 尚未公布任何带凭据的探活结果。 | OpenRouter API rate limitsOpenRouter free model variantsOpenRouter quickstart | 去开通 API |
| GitHub Models 2026-07-30 已下线 | 已下线的免费额度 | 不需要 | 是 | 动态 / 未公布 2026-07-30 已下线。GitHub 关停了 playground、模型目录、推理 API 和 BYOK 端点;当天的更新日志把它标注为已下线(英文原话见下方来源链接)。已经没有免费额度可以引用。GitHub 让原有用户转向 Microsoft Foundry(模型选择面广)或 GitHub Copilot(AI 工作流)。 | 未探活 尚未公布任何带凭据的探活结果。 | GitHub Models is being fully retired on July 30, 2026 | 已停止新用户注册 |
| Together AI | 按量计费 | 不需要 | 是 | 动态 / 未公布 Together 采用按模型的动态限流:持续成功的流量会把限额抬上去,流量降下来限额也跟着回落,官方明确说明不公布固定的按模型限额。超过动态速率的请求返回 429 并带 x-ratelimit-reset;在限额之内却仍然失败的请求返回 503。限流页面上没有记录任何常设的免费额度。 | 未探活 尚未公布任何带凭据的探活结果。 | Together serverless rate limitsTogether OpenAI compatibilityTogether pricing | 去开通 API |
| Nebius Token Factory | 按量计费 | 不需要 | 是 | 动态 / 未公布 限额是动态的,文档不公布账号默认值:它让你去 Token Factory 里的 Rate Limits 页面自己看。本清单原先当作基准值的 60 RPM / 400,000 TPM,在页面上只出现在一张标着「示意」(visual example)的表里,所以这里不再把它当限额引用。真正通用的规则是:按 15 分钟滚动窗口评估用量,窗口内平均达到当前限额的 80% 及以上,下一窗口上调 20%;平均在 50% 及以下,则除以 1.5;上限是基准配额的 20 倍,再往上要走企业版。文档没有记载任何长期免费额度。 | 未探活 尚未公布任何带凭据的探活结果。 | Nebius rate limits and scalingNebius Token Factory quickstartNebius billing and consumption | 去开通 API |
| Perplexity API | 按量计费 | 不需要 | 是 | 50 RPM 用量层级由累计购买的 API 额度决定,而且只升不降。Tier 0(累计购买 0 美元)在 Agent API 上允许 1 QPS、50 次请求/分钟;Tier 1(50 美元以上)是 3 QPS、150 次/分钟,到 Tier 4 提升到 33 QPS、2,000 次/分钟。Search API 在所有层级都单独限为 50 次请求/秒。Tier 0 只是划定了速率上限,并不是一份免费 token 赠额,调用之前仍然要先有余额。 | 未探活 尚未公布任何带凭据的探活结果。 | Perplexity rate limits and usage tiersPerplexity pricingPerplexity OpenAI compatibility | 去开通 API |
| DeepInfra | 按量计费 | 不需要 | 是 | 动态 / 未公布 官方定价页为每个在服模型列出了每百万 token 的输入与输出价格,既没有描述免费额度,也没有公布请求速率限制。请把 DeepInfra 当作按量付费来看待,新账号是否附带推广额度,到控制台确认。 | 未探活 尚未公布任何带凭据的探活结果。 | DeepInfra pricingDeepInfra OpenAI compatibilityDeepInfra models | 去开通 API |
| Chutes | 按量计费 | 不需要 | 是 | 动态 / 未公布 Chutes 按 token 计费,并出售包含每日额度的订阅计划:Plus 每月 10 美元,含一份每日额度,超出部分在按量价上打 94 折;Pro 每月 20 美元,每日额度更大,超出部分打 9 折。定价页没有记录任何零成本层级,各计划的请求速率数字在计划限额页上,而不在定价页上。 | 未探活 尚未公布任何带凭据的探活结果。 | Chutes pricingChutes documentationChutes app | 去开通 API |
| Scaleway Generative APIs | 按量计费 | 需要 | 是 | 动态 / 未公布 通过 Generative APIs - Serverless 提供的每个模型,都同时受每分钟 token 数、每分钟查询数和并发请求数三重限制。Scaleway 说明基础限额只在你登记了有效支付方式之后才适用,若再完成身份验证还会自动提高。具体数字在组织配额页面上,而不在限流文档里。 | 未探活 尚未公布任何带凭据的探活结果。 | Scaleway Generative APIs rate limitsScaleway Generative APIs quickstartScaleway Generative APIs pricing | 去开通 API |
没有服务商符合当前筛选条件。
浏览
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GROQ_API_KEY"],
base_url="https://api.groq.com/openai/v1",
)
response = client.chat.completions.create(
model="llama-3.3-70b-versatile",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)
为什么可以信任这份目录
每条限额和生命周期信息都链接到对应的服务商官方页面。
每条记录都保留最后核验官方来源的日期。
赠送额度和按量计费单独展示;一次采样从不冒充整体可用性。
一起保持清单新鲜
带上官方来源和核验日期提交更正;欢迎使用中文或英文。 阅读贡献指南.
手边没有出处?说一句是哪家变了就行,那页留给别人去找: 一行就够,表单只有一格.
延伸阅读: 编程 Agent 实际花了多少钱、在哪儿出问题的实地记录.
需要一个稳定的托管端点?