Llama 系列是什么
Meta 的 Llama 系列是多数推理平台的默认通用选择,同一个模型 ID 常常出现在好几家服务商,但各家的免费额度差别很大。
以免费条款提供 Llama 的服务商
本清单详列的 25 家服务商里,有 9 家至少提供一个 Llama 模型。因为 Meta 公开的是权重而不是服务,所以 model id 在这些家之间可以完全一致,免费额度却不一样。
| 服务商 | 免费形式 | 官方公布限额 | 信用卡 | 匹配到的模型 |
|---|---|---|---|---|
| SambaNova Cloud | 厂商免费额度 | 每分钟 20 次请求,每天 20 次请求 | 不需要 | Meta-Llama-3.3-70B-Instruct |
| Cloudflare Workers AI | 厂商免费额度 | 以计算单位公布 | 不需要 | @cf/meta/llama-3.3-70b-instruct-fp8-fast |
| Fireworks AI | 厂商免费额度 | 每分钟 10 次请求 | 不需要 | accounts/fireworks/models/llama-v3p3-70b-instruct |
| Novita AI | 按量计费 | 有限流但未公布数值 | 不需要 | Llama 3.1 8B Instruct |
| IBM watsonx.ai | 注册赠送额度 | 有限流但未公布数值 | 不需要 | meta-llama/llama-3-3-70b-instruct |
| Together AI | 按量计费 | 动态,无固定数值 | 不需要 | meta-llama/Llama-3.3-70B-Instruct-Turbo |
| Nebius Token Factory | 按量计费 | 动态,无固定数值 | 不需要 | meta-llama/Llama-3.3-70B-Instruct |
| DeepInfra | 按量计费 | 有限流但未公布数值 | 不需要 | meta-llama/Llama-4-Scout-17B-16E |
| Scaleway Generative APIs | 按量计费 | 有限流但未公布数值 | 需要 | llama-3.3-70b-instruct |
免费条款到底差在哪
- SambaNova Cloud — 只要账号没有绑定支付方式,就适用免费档。
- Cloudflare Workers AI — Workers Free 和 Workers Paid 两种计划都含每天 10,000 Neurons 的免费额度,每天 00:00 UTC 重置。
- Fireworks AI — 既没有绑定支付方式、也没有余额的账号,整个账号合计限 10 次请求/分钟。
- Novita AI — 定价表里已经没有任何一个模型标价为零。
- IBM watsonx.ai — IBM 在付费的 Essentials 和 Standard 计划之外,提供 watsonx.ai 的免费试用,定价页也明确邀请你零成本开始构建。
- Together AI — Together 采用按模型的动态限流:持续成功的流量会把限额抬上去,流量降下来限额也跟着回落,官方明确说明不公布固定的按模型限额。
- Nebius Token Factory — 限额是动态的,文档不公布账号默认值:它让你去 Token Factory 里的 Rate Limits 页面自己看。
- DeepInfra — 官方定价页为每个在服模型列出了每百万 token 的输入与输出价格,既没有描述免费额度,也没有公布请求速率限制。
- Scaleway Generative APIs — 通过 Generative APIs - Serverless 提供的每个模型,都同时受每分钟 token 数、每分钟查询数和并发请求数三重限制。
怎么挑一家
这 9 家里有 2 家公布了固定的请求次数,其余的只给出层级或额度余额,也就是说「到底免费多少」唯一诚实的答案在它们各自的控制台里。有 8 家不要信用卡。有 6 家会响应跨域浏览器请求,所以这些家的 key 不用装任何东西,直接在浏览器检测页里就能验。
model id 匹配上 Llama,并不等于承诺免费额度里就包含它。服务商会在不改 id 的情况下把某个模型在付费和免费之间挪动,所以每一行都链回对应的服务商页面,那里放着该服务商自己的原话和读取日期。
免费额度用完之后是什么价
上面这些免费额度都有到头的一天,而 Llama 到那时候是什么价,不在本清单的追踪范围内。下面是公开报道过的价钱,连着它出处的整句原话一起引——出自同一维护者整理的那张表,那里每个数都带着自己那句话:
| 价格 | 它出自的那句原话 | 对应长文 |
|---|---|---|
$1.25 / $4.25 per million |
Meta priced Muse Spark 1.1 at $1.25 per million input and $4.25 per million output, roughly 75% and 83% below Anthropic's Opus, and the tradeoff is visible in the benchmarks, since it leads on MCP Atlas and JobBench while trailing on SWE-Bench Pro and DeepSWE 1.1. | 1.6 Billion Free Tokens Is a Compression Ratio, Not a Strategy |
要算的那笔账不是 Llama、是别的?一句话说出它的名字——只有一格要填,下一个去查的价钱按谁问了排。