Meta · 本清单收录 9 家

Llama 免费 API 访问

本清单里所有以免费条款提供 Llama 模型的服务商,以及各自公布的限额。

Llama 系列是什么

Meta 的 Llama 系列是多数推理平台的默认通用选择,同一个模型 ID 常常出现在好几家服务商,但各家的免费额度差别很大。

以免费条款提供 Llama 的服务商

本清单详列的 25 家服务商里,有 9 家至少提供一个 Llama 模型。因为 Meta 公开的是权重而不是服务,所以 model id 在这些家之间可以完全一致,免费额度却不一样。

服务商免费形式官方公布限额信用卡匹配到的模型
SambaNova Cloud 厂商免费额度 每分钟 20 次请求,每天 20 次请求 不需要 Meta-Llama-3.3-70B-Instruct
Cloudflare Workers AI 厂商免费额度 以计算单位公布 不需要 @cf/meta/llama-3.3-70b-instruct-fp8-fast
Fireworks AI 厂商免费额度 每分钟 10 次请求 不需要 accounts/fireworks/models/llama-v3p3-70b-instruct
Novita AI 按量计费 有限流但未公布数值 不需要 Llama 3.1 8B Instruct
IBM watsonx.ai 注册赠送额度 有限流但未公布数值 不需要 meta-llama/llama-3-3-70b-instruct
Together AI 按量计费 动态,无固定数值 不需要 meta-llama/Llama-3.3-70B-Instruct-Turbo
Nebius Token Factory 按量计费 动态,无固定数值 不需要 meta-llama/Llama-3.3-70B-Instruct
DeepInfra 按量计费 有限流但未公布数值 不需要 meta-llama/Llama-4-Scout-17B-16E
Scaleway Generative APIs 按量计费 有限流但未公布数值 需要 llama-3.3-70b-instruct

免费条款到底差在哪

  • SambaNova Cloud — 只要账号没有绑定支付方式,就适用免费档。
  • Cloudflare Workers AI — Workers Free 和 Workers Paid 两种计划都含每天 10,000 Neurons 的免费额度,每天 00:00 UTC 重置。
  • Fireworks AI — 既没有绑定支付方式、也没有余额的账号,整个账号合计限 10 次请求/分钟。
  • Novita AI — 定价表里已经没有任何一个模型标价为零。
  • IBM watsonx.ai — IBM 在付费的 Essentials 和 Standard 计划之外,提供 watsonx.ai 的免费试用,定价页也明确邀请你零成本开始构建。
  • Together AI — Together 采用按模型的动态限流:持续成功的流量会把限额抬上去,流量降下来限额也跟着回落,官方明确说明不公布固定的按模型限额。
  • Nebius Token Factory — 限额是动态的,文档不公布账号默认值:它让你去 Token Factory 里的 Rate Limits 页面自己看。
  • DeepInfra — 官方定价页为每个在服模型列出了每百万 token 的输入与输出价格,既没有描述免费额度,也没有公布请求速率限制。
  • Scaleway Generative APIs — 通过 Generative APIs - Serverless 提供的每个模型,都同时受每分钟 token 数、每分钟查询数和并发请求数三重限制。

怎么挑一家

这 9 家里有 2 家公布了固定的请求次数,其余的只给出层级或额度余额,也就是说「到底免费多少」唯一诚实的答案在它们各自的控制台里。有 8 家不要信用卡。有 6 家会响应跨域浏览器请求,所以这些家的 key 不用装任何东西,直接在浏览器检测页里就能验。

model id 匹配上 Llama,并不等于承诺免费额度里就包含它。服务商会在不改 id 的情况下把某个模型在付费和免费之间挪动,所以每一行都链回对应的服务商页面,那里放着该服务商自己的原话和读取日期。

免费额度用完之后是什么价

上面这些免费额度都有到头的一天,而 Llama 到那时候是什么价,不在本清单的追踪范围内。下面是公开报道过的价钱,连着它出处的整句原话一起引——出自同一维护者整理的那张表,那里每个数都带着自己那句话:

价格它出自的那句原话对应长文
$1.25 / $4.25 per million Meta priced Muse Spark 1.1 at $1.25 per million input and $4.25 per million output, roughly 75% and 83% below Anthropic's Opus, and the tradeoff is visible in the benchmarks, since it leads on MCP Atlas and JobBench while trailing on SWE-Bench Pro and DeepSWE 1.1. 1.6 Billion Free Tokens Is a Compression Ratio, Not a Strategy

要算的那笔账不是 Llama、是别的?一句话说出它的名字——只有一格要填,下一个去查的价钱按谁问了排。