Fireworks AI
免費額度Fireworks AI更新於 2026-07面向生產的開源模型託管推理平台,主打低延遲與高吞吐。
免費額度與收費
官方價格頁寫明新使用者有 1 美元(USD)免費額度,之後轉為按量後付費。Serverless 按 token 計價,單模型價格在模型庫與文件中逐個標註(例如頁面示例 DeepSeek-V4-Flash 每百萬輸入 token 0.14 美元),本站不逐條轉錄以免過時。幾項結構性折扣值得記:命中快取的輸入 token 按標準價五折;批次推理(Batch)輸入輸出均按 Serverless 五折。按需 GPU 部署按 GPU 秒計、頁面標註小時價:H100 與 H200 每小時 7.00 美元、B200 每小時 10.00 美元、B300 每小時 12.00 美元。微調按訓練 token 計,每百萬訓練 token 0.50~40 美元,隨模型大小與微調方式(LoRA / 全參、SFT / DPO)浮動,300B 以上引數的模型落在 10~40 美元區間。Embedding 按引數量分檔,每百萬 token 0.008~0.1 美元。
完整入口
- 官網/註冊
- fireworks.ai ↗
- 模型庫
- fireworks.ai/models ↗可按 LLM、視覺、Embedding、Rerank 篩選
背後的模型
Fireworks 自己不訓前沿模型,託管的是 DeepSeek、Qwen、GLM、Kimi、Llama 這類開放權重模型,直接對手是 Together AI 與 Groq。
怎麼用
面向生產的開源模型推理雲,主打低延遲高吞吐。適合已驗證、要上量的應用換更快更穩的推理後端;也支援微調和函式呼叫。
Fireworks AI 的定位與 Together AI 高度重合:託管開放權重模型、按 token 賣推理,同時提供微調和按需 GPU。它的招牌是創始團隊出自 PyTorch,官網強調訓練與推理兩頭都做,模型庫覆蓋 DeepSeek、GLM、Qwen、Kimi、Llama、Mistral、Gemma 等主流開源系列。
跟 Together 相比,最實際的差別是門檻:Fireworks 官方價格頁給新使用者 1 美元免費額度、後付費;Together 則明說沒有免費試用、最低充值 5 美元。想零成本先試水的,Fireworks 這邊省事一些——不過 1 美元額度也就夠跑通流程和小規模原型,不是長期免費檔。
省錢的兩個結構性折扣要記住:命中快取的輸入 token 只收五折,走 Batch 批次推理輸入輸出都是五折。對於能容忍延遲的離線任務(批次清洗、批次打標),直接走 Batch 就是對半砍。