Llama 系列是什么
Meta 的 Llama 系列是多数推理平台的默认通用选择,同一个模型 ID 常常出现在好几家服务商,但各家的免费额度差别很大。
以免费条款提供 Llama 的服务商
本清单详列的 25 家服务商里,有 9 家至少提供一个 Llama 模型。因为 Meta 公开的是权重而不是服务,所以 model id 在这些家之间可以完全一致,免费额度却不一样。
| 服务商 | 免费形式 | 官方公布限额 | 信用卡 | 匹配到的模型 |
|---|---|---|---|---|
| GroqCloud | 厂商免费额度 | 每分钟 30 次请求,每天 1000 次请求 | 不需要 | llama-3.3-70b-versatile、llama-3.1-8b-instant |
| SambaNova Cloud | 厂商免费额度 | 每分钟 20 次请求,每天 20 次请求 | 不需要 | Meta-Llama-3.3-70B-Instruct |
| Cloudflare Workers AI | 厂商免费额度 | 以计算单位公布 | 不需要 | @cf/meta/llama-3.3-70b-instruct-fp8-fast |
| Fireworks AI | 厂商免费额度 | 每分钟 10 次请求 | 不需要 | accounts/fireworks/models/llama-v3p3-70b-instruct |
| IBM watsonx.ai | 注册赠送额度 | 有限流但未公布数值 | 不需要 | meta-llama/llama-3-3-70b-instruct |
| Together AI | 按量计费 | 动态,无固定数值 | 不需要 | meta-llama/Llama-3.3-70B-Instruct-Turbo |
| Nebius Token Factory | 按量计费 | 每分钟 60 次请求 | 不需要 | meta-llama/Llama-3.3-70B-Instruct |
| DeepInfra | 按量计费 | 有限流但未公布数值 | 不需要 | meta-llama/Llama-4-Scout-17B-16E |
| Scaleway Generative APIs | 按量计费 | 有限流但未公布数值 | 需要 | llama-3.3-70b-instruct |
免费条款到底差在哪
- GroqCloud — 免费计划的限额按模型区分,并按组织(organization)合并计算。
- SambaNova Cloud — 只要账号没有绑定支付方式,就处于 Free Tier。
- Cloudflare Workers AI — Workers Free 和 Workers Paid 两个计划都包含每天 10,000 Neurons 的免费额度,每天 UTC 00:00 重置。
- Fireworks AI — 既没有绑定支付方式、也没有余额的账号,整个账号合计限 10 次请求/分钟。
- IBM watsonx.ai — IBM 在付费的 Essentials 和 Standard 计划之外,提供 watsonx.ai 的免费试用,定价页也明确邀请你零成本开始构建。
- Together AI — Together 采用按模型的动态限流:持续成功的流量会把限额抬上去,流量降下来限额也跟着回落,官方明确说明不公布固定的按模型限额。
- Nebius Token Factory — 限额是动态的,公布的基线为 60 RPM 和 400,000 TPM。
- DeepInfra — 官方定价页为每个在服模型列出了每百万 token 的输入与输出价格,既没有描述免费额度,也没有公布请求速率限制。
- Scaleway Generative APIs — 通过 Generative APIs - Serverless 提供的每个模型,都同时受每分钟 token 数、每分钟查询数和并发请求数三重限制。
怎么挑一家
这 9 家里有 4 家公布了固定的请求次数,其余的只给出层级或额度余额,也就是说「到底免费多少」唯一诚实的答案在它们各自的控制台里。有 8 家不要信用卡。有 6 家会响应跨域浏览器请求,所以这些家的 key 不用装任何东西,直接在浏览器检测页里就能验。
model id 匹配上 Llama,并不等于承诺免费额度里就包含它。服务商会在不改 id 的情况下把某个模型在付费和免费之间挪动,所以每一行都链回对应的服务商页面,那里放着该服务商自己的原话和读取日期。