Fireworks AI
免费额度Fireworks AI更新于 2026-07面向生产的开源模型托管推理平台,主打低延迟与高吞吐。
免费额度与收费
官方价格页写明新用户有 1 美元(USD)免费额度,之后转为按量后付费。Serverless 按 token 计价,单模型价格在模型库与文档中逐个标注(例如页面示例 DeepSeek-V4-Flash 每百万输入 token 0.14 美元),本站不逐条转录以免过时。几项结构性折扣值得记:命中缓存的输入 token 按标准价五折;批量推理(Batch)输入输出均按 Serverless 五折。按需 GPU 部署按 GPU 秒计、页面标注小时价:H100 与 H200 每小时 7.00 美元、B200 每小时 10.00 美元、B300 每小时 12.00 美元。微调按训练 token 计,每百万训练 token 0.50~40 美元,随模型大小与微调方式(LoRA / 全参、SFT / DPO)浮动,300B 以上参数的模型落在 10~40 美元区间。Embedding 按参数量分档,每百万 token 0.008~0.1 美元。
完整入口
- 官网/注册
- fireworks.ai ↗
- 模型库
- fireworks.ai/models ↗可按 LLM、视觉、Embedding、Rerank 筛选
背后的模型
Fireworks 自己不训前沿模型,托管的是 DeepSeek、Qwen、GLM、Kimi、Llama 这类开放权重模型,直接对手是 Together AI 与 Groq。
怎么用
面向生产的开源模型推理云,主打低延迟高吞吐。适合已验证、要上量的应用换更快更稳的推理后端;也支持微调和函数调用。
Fireworks AI 的定位与 Together AI 高度重合:托管开放权重模型、按 token 卖推理,同时提供微调和按需 GPU。它的招牌是创始团队出自 PyTorch,官网强调训练与推理两头都做,模型库覆盖 DeepSeek、GLM、Qwen、Kimi、Llama、Mistral、Gemma 等主流开源系列。
跟 Together 相比,最实际的差别是门槛:Fireworks 官方价格页给新用户 1 美元免费额度、后付费;Together 则明说没有免费试用、最低充值 5 美元。想零成本先试水的,Fireworks 这边省事一些——不过 1 美元额度也就够跑通流程和小规模原型,不是长期免费档。
省钱的两个结构性折扣要记住:命中缓存的输入 token 只收五折,走 Batch 批量推理输入输出都是五折。对于能容忍延迟的离线任务(批量清洗、批量打标),直接走 Batch 就是对半砍。