模型價格
對外 API 全部按 token 計費。下表是每個可調用模型的對外單價,以美元標示,寫明輸入、命中快取的輸入、輸出三檔,按每 100 萬 token 計;實際扣費按星星結算,1★ = $0.01。
計價單位
單價一律以美元標示;帳戶扣費以星星結算,1 星星的面值固定為 0.01 美元。回應裡給出的星星數就是帳戶實際被扣的數,精確到小數點後 4 位。
1 ★ = $0.01
計費公式
輸入 token 拆成「未命中快取」和「命中快取」兩部分分別按美元單價計價,輸出 token 單獨計價,三項相加即為本次請求的原始費用(美元);除以 1 星星面值 $0.01 就是實際扣掉的星星數。
usd = (input_miss / 1e6) * in_rate_usd
+ (input_cached / 1e6) * cache_rate_usd
+ (output / 1e6) * out_rate_usd
input_miss = max(0, prompt_tokens - cached_tokens)
stars = usd / 0.01
charged = max(1, round(stars, 4)) # 单位 ★每次成功請求最低收費 1 星星。原始費用低於 1 星星時按 1 星星扣,高於 1 星星時按實際值扣。上游返回空結果(0 輸入 0 輸出)時不扣費。
對外單價($ / 100 萬 token)
型號名就是請求裡 model 欄位要傳的字串,與 GET /v1/models 返回的 id 完全一致。單價隨上游調整,以本頁為準。
| 模型 | 官方直連 / 第三方 | 輸入 | 命中快取 | 輸出 | 長上下文 |
|---|---|---|---|---|---|
| 正在讀取即時價目表… | |||||
圖片 / 影片 / 音訊(按次 / 按秒)
按次或按秒計價。最終價 = max(最低收費, 基準價 × 尺寸倍率 × 畫質倍率),各檔位已按公式算好列在右側。
| 模型 | 類型 | 官方直連 / 第三方 | 基準價 | 尺寸 / 解析度檔 | 畫質檔 | 最低收費 |
|---|---|---|---|---|---|---|
| 正在讀取即時價目表… | ||||||
算一筆帳
下面兩個例子的 token 數與扣費數都取自生產環境的真實調用紀錄,不是估算。
一次約 6.4 萬 token 的長上下文請求,絕大部分輸入未命中快取。
model deepseek-v4-flash prompt_tokens 64012 (cached_tokens 2560) completion 1 input_miss 61452 / 1e6 * $0.28 = $0.01720656 input_cached 2560 / 1e6 * $0.056 = $0.00014336 output 1 / 1e6 * $0.56 = $0.00000056 ------------------------------------------------ usd $0.01735 X-Stars-Cost 0.01735 / 0.01 = 1.735 ★
緊接著把完全相同的提示詞再發一次,上游把 6.4 萬輸入 token 全部判為快取命中。
model deepseek-v4-flash (same prompt, resent) prompt_tokens 64012 (cached_tokens 64000) completion 1 input_miss 12 / 1e6 * $0.28 = $0.00000336 input_cached 64000 / 1e6 * $0.056 = $0.00358400 output 1 / 1e6 * $0.56 = $0.00000056 ------------------------------------------------ usd $0.003588 ( = 0.3588 ★ ) X-Stars-Cost max(1, 0.3588) = 1 ★ ( = $0.01 )
快取把原始費用從 1.735 星星壓到 0.3588 星星(省掉約八成),但因為落在 1 星星的最低收費之下,這一次實際扣 1 星星。上下文越長、複用越多,快取省下的錢才會真正反映在帳單上。
怎麼查這次扣了多少
每個成功回應都會帶上 X-Stars-Cost 回應標頭,值就是本次實際扣掉的星星數;X-Request-Id 可用於對帳和工單排查。
X-Stars-Cost: 1.735 X-Request-Id: req_f08c8151fc95438f9c5c524511a16806
走 /v1/messages 和 /anthropic/v1/messages 時,費用還會直接寫進回應內容的 usage 欄位:
"usage": {
"input_tokens": 2203,
"output_tokens": 1,
"cost_stars": 1.5026,
"cost_usd": 0.015
}計費規則
- 只有成功返回的請求才扣費。鑑權失敗、模型不存在、參數非法、限流等錯誤回應一律不扣。
- 串流請求按上游最終上報的 usage 結算,與非串流同價;中途斷開時按已產生的 token 結算。
- 請求發出前會按最壞情況預扣一部分餘額,上游返回真實 usage 後立即多退少補,差額不會被長期佔用。
- 餘額不足時返回 402,不會產生欠費;帳單明細可在控制台的用量頁面按請求 ID 查到。