模型价格
对外 API 全部按 token 计费。下表是每个可调用模型的对外单价,以美元标示,写明输入、命中缓存的输入、输出三档,按每 100 万 token 计;实际扣费按星星结算,1★ = $0.01。
计价单位
单价一律以美元标示;账户扣费以星星结算,1 星星的面值固定为 0.01 美元。响应里给出的星星数就是账户实际被扣的数,精确到小数点后 4 位。
1 ★ = $0.01
计费公式
输入 token 拆成「未命中缓存」和「命中缓存」两部分分别按美元单价计价,输出 token 单独计价,三项相加即为本次请求的原始费用(美元);除以 1 星星面值 $0.01 就是实际扣掉的星星数。
usd = (input_miss / 1e6) * in_rate_usd
+ (input_cached / 1e6) * cache_rate_usd
+ (output / 1e6) * out_rate_usd
input_miss = max(0, prompt_tokens - cached_tokens)
stars = usd / 0.01
charged = max(1, round(stars, 4)) # 单位 ★每次成功请求最低收费 1 星星。原始费用低于 1 星星时按 1 星星扣,高于 1 星星时按实际值扣。上游返回空结果(0 输入 0 输出)时不扣费。
对外单价($ / 100 万 token)
型号名就是请求里 model 字段要传的字符串,与 GET /v1/models 返回的 id 完全一致。单价随上游调整,以本页为准。
| 模型 | 官方直连 / 第三方 | 输入 | 命中缓存 | 输出 | 长上下文 |
|---|---|---|---|---|---|
| 正在读取实时价目表… | |||||
图片 / 视频 / 音频(按次 / 按秒)
按次或按秒计价。最终价 = max(最低收费, 基准价 × 尺寸倍率 × 画质倍率),各档位已按公式算好列在右侧。
| 模型 | 类型 | 官方直连 / 第三方 | 基准价 | 尺寸 / 分辨率档 | 画质档 | 最低收费 |
|---|---|---|---|---|---|---|
| 正在读取实时价目表… | ||||||
算一笔账
下面两个例子的 token 数与扣费数都取自生产环境的真实调用记录,不是估算。
一次约 6.4 万 token 的长上下文请求,绝大部分输入未命中缓存。
model deepseek-v4-flash prompt_tokens 64012 (cached_tokens 2560) completion 1 input_miss 61452 / 1e6 * $0.28 = $0.01720656 input_cached 2560 / 1e6 * $0.056 = $0.00014336 output 1 / 1e6 * $0.56 = $0.00000056 ------------------------------------------------ usd $0.01735 X-Stars-Cost 0.01735 / 0.01 = 1.735 ★
紧接着把完全相同的提示词再发一次,上游把 6.4 万输入 token 全部判为缓存命中。
model deepseek-v4-flash (same prompt, resent) prompt_tokens 64012 (cached_tokens 64000) completion 1 input_miss 12 / 1e6 * $0.28 = $0.00000336 input_cached 64000 / 1e6 * $0.056 = $0.00358400 output 1 / 1e6 * $0.56 = $0.00000056 ------------------------------------------------ usd $0.003588 ( = 0.3588 ★ ) X-Stars-Cost max(1, 0.3588) = 1 ★ ( = $0.01 )
缓存把原始费用从 1.735 星星压到 0.3588 星星(省掉约八成),但因为落在 1 星星的最低收费之下,这一次实际扣 1 星星。上下文越长、复用越多,缓存省下的钱才真正体现在账单上。
怎么查这次扣了多少
每个成功响应都会带上 X-Stars-Cost 响应头,值就是本次实际扣掉的星星数;X-Request-Id 可用于对账和工单排查。
X-Stars-Cost: 1.735 X-Request-Id: req_f08c8151fc95438f9c5c524511a16806
走 /v1/messages 和 /anthropic/v1/messages 时,费用还会直接写进响应体的 usage 字段:
"usage": {
"input_tokens": 2203,
"output_tokens": 1,
"cost_stars": 1.5026,
"cost_usd": 0.015
}计费规则
- 只有成功返回的请求才扣费。鉴权失败、模型不存在、参数非法、限流等错误响应一律不扣。
- 流式请求按上游最终上报的 usage 结算,与非流式同价;中途断开时按已产生的 token 结算。
- 请求发出前会按最坏情况预扣一部分余额,上游返回真实 usage 后立即多退少补,差额不会被长期占用。
- 余额不足时返回 402,不会产生欠费;账单明细可在控制台的用量页按请求 ID 查到。