逐条核验的服务商事实 · 核验于 2026-08-22

免费大模型 API:直达官方 Key 申请入口

比较长期免费额度、无需信用卡的选择、模型与官方公布限额;每项结论都能追溯到官方来源。

13家长期免费额度
13家无需信用卡
13家免费额度兼容 OpenAI
2026-08-22最近来源核验

由数据生成的捷径

值得优先查看的起点

完全依据清单中的公开事实选出,不接受赞助排名。

2026-08-22 重新核对

上次核对之后有什么变化

发布以来的第一次复核。逐家重读了官方源:GitHub Models 已经关停,Novita 的免费行一条不剩,Groq 把两个 Llama 模型移出了免费表。有两家这次读不到源,核验日期保持原样。

  • 生命周期 GitHub Models 按预告于 2026-07-30 关停:playground、模型目录、推理 API 和 BYOK 端点全部下线。作为墓碑条目保留。
  • 生命周期 Novita AI inclusionai/Ling-3.0-flash 与 Mind Lab Macaron V1 Venti 不再标价为零;定价表上已无任何免费模型。移入按量计费。
  • 限额变化 GroqCloud llama-3.3-70b-versatile 与 llama-3.1-8b-instant 已离开免费计划表;openai/gpt-oss-safeguard-20b、qwen/qwen3.6-27b、groq/compound-mini 在表内。RPM/RPD 两列改取 openai/gpt-oss-120b 的 30 RPM / 1K RPD。
  • 限额变化 Cerebras Inference zai-glm-4.7 已离开免费试用表;只剩 gpt-oss-120b 与 gemma-4-31b,仍为 5 RPM / 30K TPM / 1M TPH / 1M TPD。
  • 新增 Z.AI Open Platform 视觉模型 GLM-4.6V-Flash 现在与 GLM-4.7-Flash、GLM-4.5-Flash 一样,定价各列均为 $0。
  • 新增 SambaNova Cloud DeepSeek-V3.2 与 gemma-4-31B-it 以预览身份进入免费表,数字同为 20 RPM / 20 RPD / 200K TPD。
  • 更正 Pollinations.AI API 文档其实是公布了限额的,形式是每档的最小请求间隔:Anonymous 每 15 秒 1 次、Seed 5 秒、Flower 3 秒、Nectar 不限。此前本条写的是「没有公布数字」。
  • 更正 Nebius Token Factory 本条原先当作基准值的 60 RPM / 400,000 TPM,在源页面上只出现在标着「示意」的表内。官方未公布账号默认值,本条不再引用数字。
  • 更正 Vercel AI Gateway 每月 $5 的免费额度已不在定价页上。免费档仍在,但页面不再给出金额,本条因此也不再引用。
  • 更正 Cloudflare Workers AI 有几个模型不在每天 10,000 Neurons 的额度内,无论如何都要付费方式:@cf/moonshotai/kimi-k2.6、@cf/zai-org/glm-5.2、@cf/deepseek-ai/deepseek-v4-pro-0813。
  • 生命周期 Moonshot AI (Kimi) 文档迁至 platform.kimi.ai。最低一档仍需先充值 $1 才调得通,因此本条从「永久免费额度」移入按量计费。

一条免费通道关掉,就变成一笔账单。付费的那几家每百万 token 实际多少钱、每个数字出自哪一句话: 实地记录里的成本表.

记录在案的每一周,JSON 格式

清单

比较完整目录

长期免费、聚合器、注册赠送和按量计费保持清晰分层。

26 条匹配

服务商免费形式信用卡OpenAI限额采样探活来源核验获取
Google Gemini API https://generativelanguage.googleapis.com/v1beta/openai/ 厂商免费额度 不需要 是 动态 / 未公布 限流按项目(project)而不是按 API key 计算,取决于该项目所处的用量层级;Free 是入门层级,往上走需要开启计费。Google 公布了层级结构,但把具体生效的 RPM、TPM 和 RPD 指向 AI Studio 查看,因此这里给不出单一的免费额度数字。 未探活 尚未公布任何带凭据的探活结果。 Gemini API rate limitsGemini API billingGemini OpenAI compatibility 去开通 API
GroqCloud https://api.groq.com/openai/v1 厂商免费额度 不需要 是 30 RPM · 1000 次/天 免费计划的限额按模型区分,并按组织(organization)合并计算。openai/gpt-oss-120b、openai/gpt-oss-20b、openai/gpt-oss-safeguard-20b、qwen/qwen3.6-27b:30 RPM、1K RPD、8K TPM、200K TPD。groq/compound 和 groq/compound-mini:30 RPM、250 RPD、70K TPM,没有列每日 token 上限。meta-llama/llama-prompt-guard-2-22m 与 -86m:30 RPM、14.4K RPD、15K TPM、500K TPD。Whisper large-v3 与 turbo 按音频秒数计量:20 RPM、2K RPD、7.2K ASH、28.8K ASD。llama-3.3-70b-versatile 和 llama-3.1-8b-instant 已不在免费表内。本页 RPM/RPD 两列取的是 openai/gpt-oss-120b 的数值。 未探活 尚未公布任何带凭据的探活结果。 GroqCloud rate limitsGroq OpenAI compatibilityGroq billing FAQ 去开通 API
SambaNova Cloud https://api.sambanova.ai/v1 厂商免费额度 不需要 是 20 RPM · 20 次/天 只要账号没有绑定支付方式,就适用免费档。免费表里每个模型的数字都一样:20 RPM、20 RPD、每天 200,000 token。生产(production)模型是 DeepSeek-V3.1、Meta-Llama-3.3-70B-Instruct 和 gpt-oss-120b;DeepSeek-V3.2 和 gemma-4-31B-it 标着预览(preview)。SambaNova 没有为免费档公布每分钟 token 数,只有 RPM、RPD 和 TPD 三项。MiniMax-M2.7 只出现在开发者档的表里。绑定支付方式后账号转入开发者档。 未探活 尚未公布任何带凭据的探活结果。 SambaNova model rate limitsSambaNova developer guideSambaNova OpenAI compatibility 去开通 API
Cohere https://api.cohere.ai/compatibility/v1 厂商免费额度 不需要 是 20 RPM 试用 key 免费、有限流,并且按条款不得用于生产。Chat 限 20 次/分钟,Rerank 限 10 次/分钟,Audio Transcriptions 与 EmbedJob 限 5 次/分钟,Tokenize 限 100 次/分钟,Embed 限 2,000 条输入/分钟。此外每个试用 key 在账号维度还有每月 1,000 次 API 调用的封顶。 未探活 尚未公布任何带凭据的探活结果。 Cohere API rate limitsCohere Compatibility APICohere pricing 去开通 API
Cloudflare Workers AI https://api.cloudflare.com/client/v4/accounts/ACCOUNT_ID/ai/v1 厂商免费额度 不需要 是 动态 / 未公布 Workers Free 和 Workers Paid 两种计划都含每天 10,000 Neurons 的免费额度,每天 00:00 UTC 重置。Neuron 是计算单位而不是请求次数,所以能换到多少次请求取决于模型和 prompt 大小。免费计划没有超额选项:额度用完,请求就失败到下次重置为止。Workers Paid 的超额价格是每 1,000 Neurons $0.011。有几个模型完全不在免费额度覆盖范围内,无论如何都要先有付费方式 —— @cf/moonshotai/kimi-k2.6、@cf/zai-org/glm-5.2 和 @cf/deepseek-ai/deepseek-v4-pro-0813 —— 要走 Workers Paid 或预付的 AI Gateway 额度。 未探活 尚未公布任何带凭据的探活结果。 Workers AI pricingWorkers AI OpenAI compatible endpointsWorkers AI models 去开通 API
Hugging Face Inference Providers https://router.huggingface.co/v1 厂商免费额度 不需要 是 动态 / 未公布 登录的免费用户每月获得 0.10 美元的 Inference Provider 额度(Hugging Face 注明这个数额可能调整);PRO 用户 2.00 美元,Team 或 Enterprise 组织按每席位 2.00 美元。额度只作用于经 Hugging Face 路由的请求,用你自己的服务商 key 直连既不消耗也不享受。每月额度花完后需要另行购买才能继续。 未探活 尚未公布任何带凭据的探活结果。 Inference Providers pricing and billingInference Providers OpenAI compatibilityInference Providers settings 去开通 API
SiliconFlow https://api.siliconflow.com/v1 厂商免费额度 不需要 是 1000 RPM 免费模型的限流是固定值;付费模型按月消费分层,L0 起步为 1,000 RPM、40,000 TPM。限流按用户账号而不是按 API key 计算,而且每个模型单独计限。deepseek-ai/DeepSeek-R1 与 deepseek-ai/DeepSeek-V3 另有每小时 30 次、每天 100 次的额外封顶。 未探活 尚未公布任何带凭据的探活结果。 SiliconFlow rate limitsSiliconFlow quick startSiliconFlow models 去开通 API
Fireworks AI https://api.fireworks.ai/inference/v1 厂商免费额度 不需要 是 10 RPM 既没有绑定支付方式、也没有余额的账号,整个账号合计限 10 次请求/分钟。绑定支付方式并有可用余额后,上限最高能到 6,000 RPM。Fireworks 是预付费模式,所以 10 RPM 这个区间是唯一的零成本路径,官方也没有为它公布每日请求上限。 未探活 尚未公布任何带凭据的探活结果。 Fireworks account quotasFireworks serverless rate limitsFireworks pricing 去开通 API
Z.AI Open Platform https://api.z.ai/api/paas/v4 厂商免费额度 不需要 是 动态 / 未公布 GLM-4.7-Flash、GLM-4.5-Flash 和视觉模型 GLM-4.6V-Flash 在官方定价表上的输入、缓存输入、缓存输入存储和输出四列都标着 $0,也就是真的免费调用,不是打折。Z.AI 没有在定价页上公布这几个模型的 RPM 或 TPM;限流说明在另一页,最终以控制台为准。 未探活 尚未公布任何带凭据的探活结果。 Z.AI pricingZ.AI rate limitsOpenAI Python SDK with Z.AI 去开通 API
Novita AI https://api.novita.ai/openai 按量计费 不需要 是 动态 / 未公布 定价表里已经没有任何一个模型标价为零。本清单原先列的两个免费项 — inclusionai/Ling-3.0-flash 和 Mind Lab Macaron V1 Venti — 已从表中消失。现在最便宜的是 Llama 3.1 8B Instruct(每百万 token 输入 $0.02、输出 $0.05)和 BAAI:BGE-M3 向量模型(每百万 $0.01)。页面没有公布注册赠额,也没有公布任何请求速率数字。 未探活 尚未公布任何带凭据的探活结果。 Novita pricingNovita LLM API referenceNovita model library 去开通 API
Mistral La Plateforme https://api.mistral.ai/v1 厂商免费额度 不需要 是 动态 / 未公布 Mistral 文档里有一个 Free 模式(也称 Experiment 计划),不付费就能激活工作区并生成 API key,但公开文档目前没有一个打得开的限流页面:核验当天,Mistral 自己文档索引里给出的该层级 URL 返回 404。Experiment 计划的每秒请求数和每分钟 token 数,只能以控制台为准。 未探活 尚未公布任何带凭据的探活结果。 Mistral La Plateforme documentationMistral pricingMistral API documentation index 去开通 API
Alibaba Cloud Model Studio https://dashscope-intl.aliyuncs.com/compatible-mode/v1 厂商免费额度 不需要 是 动态 / 未公布 限流在阿里云主账号这一层生效,会把该账号下所有 RAM 用户、工作空间和 API key 的用量合并计算。每个模型有各自的 RPM 和 TPM,公布在按模型的表格里,免费额度也是按模型发放而不是给一份账号级总额,因此没有单一的免费额度数字。 未探活 尚未公布任何带凭据的探活结果。 Model Studio rate limitingModel Studio OpenAI compatibilityModel Studio models 去开通 API
Moonshot AI (Kimi) https://api.moonshot.ai/v1 按量计费 不需要 是 动态 / 未公布 分档表挂钩的是累计充值金额,而不是一份长期免费额度:文档写明必须先充值至少 $1 才能开始使用,此后 Tier0 给 1 路并发、3 RPM、500K TPM、1.5M TPD。累计 $10 的 Tier1 给 50 路并发、200 RPM、2M TPM、TPD 不限,一直到 Tier5 的 $3,000。$5 代金券要等累计付款达到 $5 才发放,而代金券本身不计入累计充值。文档已迁到 platform.kimi.ai,原先 platform.moonshot.ai 的路径现在 301 过去;页面另有一条告示:因异常流量,分档与限额规则拟于 8 月修订。 未探活 尚未公布任何带凭据的探活结果。 Kimi rate limitsKimi API overviewKimi pricing 去开通 API
Pollinations.AI https://text.pollinations.ai/openai 厂商免费额度 不需要 是 4 RPM API 文档现在按「两次请求的最小间隔」公布了四档:Anonymous,免注册,基础模型,每 15 秒 1 次;Seed,免费注册,标准模型,每 5 秒 1 次;Flower,付费,高级模型,每 3 秒 1 次;Nectar,企业版,全部模型,不限。本页 RPM 一列取的是 Anonymous 档折算成每分钟的值(每 15 秒 1 次 = 每分钟 4 次)。自 2025-03-31 起免费档产出的图片可能带水印,用 nologo 参数去掉水印需要账号。 未探活 尚未公布任何带凭据的探活结果。 Pollinations API documentationPollinations project repositoryPollinations.AI home 去开通 API
Ollama Cloud https://ollama.com/v1 厂商免费额度 不需要 是 动态 / 未公布 云端模型跑在 Ollama 自己的服务器上,本地 CLI 的用法保持不变,只要一个 ollama.com 账号就能开始。Cloud 文档页说明了访问方式和模型下线策略,但没有公布每小时或每天的请求限额,实际生效的额度以账号页面为准。 未探活 尚未公布任何带凭据的探活结果。 Ollama Cloud documentationOllama Cloud API accessOllama model library 去开通 API
Cerebras Inference https://api.cerebras.ai/v1 注册赠送额度 需要 是 5 RPM 免费试用的限额是每个模型 5 RPM、30K TPM,并有每小时 100 万 token、每天 100 万 token 的封顶,适用于 gpt-oss-120b 和 gemma-4-31b —— zai-glm-4.7 已不在这张表里。gemma-4-31b 另有图片限制:每次请求 2 张、单次载荷 4 MB。新账号获得 5 美元额度,自发放起 30 天过期;Cerebras 明确说明不提供按模型的长期免费额度。注册时跳过绑定支付方式,Playground 和 API 访问会一直是未激活状态。 未探活 尚未公布任何带凭据的探活结果。 Cerebras rate limitsCerebras pricingCerebras OpenAI compatibility 去开通 API
Vercel AI Gateway https://ai-gateway.vercel.sh/v1 注册赠送额度 不需要 是 动态 / 未公布 每个 Vercel team 账号都有免费档,但免费档只覆盖模型子集,不是全部目录;免费档的请求还按模型限流,上限低于付费档,而这些按模型的数字并不公布。免费额度从你第一次调用 Gateway 时开始计。定价页已经不再写出每月免费额度的具体金额:本清单原先引用的每月 5 美元已经不在页面上,所以这里不再给出金额。 未探活 尚未公布任何带凭据的探活结果。 AI Gateway pricingAI Gateway getting startedAI Gateway models 去开通 API
IBM watsonx.ai https://us-south.ml.cloud.ibm.com/ml/v1 注册赠送额度 不需要 否 动态 / 未公布 IBM 在付费的 Essentials 和 Standard 计划之外,提供 watsonx.ai 的免费试用,定价页也明确邀请你零成本开始构建。该页面按资源单位列出了各计划的价格,但没有公布试用的请求速率限制,试用的上限以控制台为准。 未探活 尚未公布任何带凭据的探活结果。 watsonx.ai pricingwatsonx.ai API referencewatsonx.ai foundation models 去开通 API
OpenRouter https://openrouter.ai/api/v1 免费模型聚合 不需要 是 20 RPM · 50 次/天 model ID 以 :free 结尾的变体一律限 20 次请求/分钟,与账号状态无关。每日上限取决于历史累计购买的额度:不足 10 credits 是每天 50 次请求,达到 10 credits 及以上提升到每天 1,000 次。OpenRouter 在全局层面调度容量,所以多开账号或多建 API key 都不会把这些限额抬高。 未探活 尚未公布任何带凭据的探活结果。 OpenRouter API rate limitsOpenRouter free model variantsOpenRouter quickstart 去开通 API
GitHub Models https://models.github.ai/inference 2026-07-30 已下线 已下线的免费额度 不需要 是 动态 / 未公布 2026-07-30 已下线。GitHub 关停了 playground、模型目录、推理 API 和 BYOK 端点;当天的更新日志把它标注为已下线(英文原话见下方来源链接)。已经没有免费额度可以引用。GitHub 让原有用户转向 Microsoft Foundry(模型选择面广)或 GitHub Copilot(AI 工作流)。 未探活 尚未公布任何带凭据的探活结果。 GitHub Models is being fully retired on July 30, 2026 已停止新用户注册
Together AI https://api.together.xyz/v1 按量计费 不需要 是 动态 / 未公布 Together 采用按模型的动态限流:持续成功的流量会把限额抬上去,流量降下来限额也跟着回落,官方明确说明不公布固定的按模型限额。超过动态速率的请求返回 429 并带 x-ratelimit-reset;在限额之内却仍然失败的请求返回 503。限流页面上没有记录任何常设的免费额度。 未探活 尚未公布任何带凭据的探活结果。 Together serverless rate limitsTogether OpenAI compatibilityTogether pricing 去开通 API
Nebius Token Factory https://api.tokenfactory.nebius.com/v1 按量计费 不需要 是 动态 / 未公布 限额是动态的,文档不公布账号默认值:它让你去 Token Factory 里的 Rate Limits 页面自己看。本清单原先当作基准值的 60 RPM / 400,000 TPM,在页面上只出现在一张标着「示意」(visual example)的表里,所以这里不再把它当限额引用。真正通用的规则是:按 15 分钟滚动窗口评估用量,窗口内平均达到当前限额的 80% 及以上,下一窗口上调 20%;平均在 50% 及以下,则除以 1.5;上限是基准配额的 20 倍,再往上要走企业版。文档没有记载任何长期免费额度。 未探活 尚未公布任何带凭据的探活结果。 Nebius rate limits and scalingNebius Token Factory quickstartNebius billing and consumption 去开通 API
Perplexity API https://api.perplexity.ai 按量计费 不需要 是 50 RPM 用量层级由累计购买的 API 额度决定,而且只升不降。Tier 0(累计购买 0 美元)在 Agent API 上允许 1 QPS、50 次请求/分钟;Tier 1(50 美元以上)是 3 QPS、150 次/分钟,到 Tier 4 提升到 33 QPS、2,000 次/分钟。Search API 在所有层级都单独限为 50 次请求/秒。Tier 0 只是划定了速率上限,并不是一份免费 token 赠额,调用之前仍然要先有余额。 未探活 尚未公布任何带凭据的探活结果。 Perplexity rate limits and usage tiersPerplexity pricingPerplexity OpenAI compatibility 去开通 API
DeepInfra https://api.deepinfra.com/v1/openai 按量计费 不需要 是 动态 / 未公布 官方定价页为每个在服模型列出了每百万 token 的输入与输出价格,既没有描述免费额度,也没有公布请求速率限制。请把 DeepInfra 当作按量付费来看待,新账号是否附带推广额度,到控制台确认。 未探活 尚未公布任何带凭据的探活结果。 DeepInfra pricingDeepInfra OpenAI compatibilityDeepInfra models 去开通 API
Chutes https://llm.chutes.ai/v1 按量计费 不需要 是 动态 / 未公布 Chutes 按 token 计费,并出售包含每日额度的订阅计划:Plus 每月 10 美元,含一份每日额度,超出部分在按量价上打 94 折;Pro 每月 20 美元,每日额度更大,超出部分打 9 折。定价页没有记录任何零成本层级,各计划的请求速率数字在计划限额页上,而不在定价页上。 未探活 尚未公布任何带凭据的探活结果。 Chutes pricingChutes documentationChutes app 去开通 API
Scaleway Generative APIs https://api.scaleway.ai/v1 按量计费 需要 是 动态 / 未公布 通过 Generative APIs - Serverless 提供的每个模型,都同时受每分钟 token 数、每分钟查询数和并发请求数三重限制。Scaleway 说明基础限额只在你登记了有效支付方式之后才适用,若再完成身份验证还会自动提高。具体数字在组织配额页面上,而不在限流文档里。 未探活 尚未公布任何带凭据的探活结果。 Scaleway Generative APIs rate limitsScaleway Generative APIs quickstartScaleway Generative APIs pricing 去开通 API

复制、配置、运行

同一个 SDK,只换 Base URL

从环境变量读取你自己的 Groq API Key;目录中其他 OpenAI 兼容服务也遵循同一模式。

生成编码 Agent 配置
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GROQ_API_KEY"],
    base_url="https://api.groq.com/openai/v1",
)

response = client.chat.completions.create(
    model="llama-3.3-70b-versatile",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

为什么可以信任这份目录

事实只有在可追溯时才有用

官方来源

每条限额和生命周期信息都链接到对应的服务商官方页面。

核验日期

每条记录都保留最后核验官方来源的日期。

诚实边界

赠送额度和按量计费单独展示;一次采样从不冒充整体可用性。

一起保持清单新鲜

发现限额过期或漏掉服务商?

带上官方来源和核验日期提交更正;欢迎使用中文或英文。 阅读贡献指南.

手边没有出处?说一句是哪家变了就行,那页留给别人去找: 一行就够,表单只有一格.

延伸阅读: 编程 Agent 实际花了多少钱、在哪儿出问题的实地记录.

需要一个稳定的托管端点?