Bifrost 统计的「400 万 Token 约合 1 USD」是基于其内置的 模型定价元数据表(
governance_model_pricing)结合每次请求的 Token 明细(包含缓存命中) 逐笔精确累加计算出来的。以下是具体的计算依据与量级准确性分析:
一、Bifrost 是根据什么计算的?
查验本机 Bifrost(
:3006,用于 Gemini/Vertex 链路)的配置库与请求日志,计费依据如下:1. 定价基准(以主力模型
gemini-3.8-flash为例)Bifrost 内置的 Vertex 定价标准为:
- 输入(Input / Prompt Tokens):
$0.00000075 / token,即 $0.75 / 100 万 tokens - 输出(Output / Completion Tokens):
$0.00000375 / token,即 $3.75 / 100 万 tokens - 缓存读取(Cached Read Tokens):
$0.000000075 / token,即 $0.075 / 100 万 tokens(基础输入价的 1 折)
2. 为什么 400 万 Token 只有约 1 USD?
若全是冷启动纯输入,
4M × $0.75 = $3.00。
但从 Bifrost 记录的实际日志(如 Coding Agent 会话)来看:- Agent 场景下长对话与 System Prompt 会频繁复用,Context Cache(提示词缓存)命中率极高(通常在 70% ~ 80% 以上)。
- 命中缓存的 Token 单价仅为 $0.075 / 1M。
- 实测综合有效单价约为 $0.24 ~ $0.28 / 100 万 tokens。
- 因此:
400万 tokens × ~$0.25 / 1M ≈ 1.00 USD,完全符合计算逻辑。
3. 单次请求的计算公式
每一笔 API 调用的
cost都是实时落库的,公式为:
$$\text{Cost} = (\text{prompt_tokens} - \text{cached_tokens}) \times 0.75 \times 10^{-6} + \text{cached_tokens} \times 0.075 \times 10^{-6} + \text{completion_tokens} \times 3.75 \times 10^{-6}$$二、大概量级准确吗?
量级非常准确,基本可以作为实际账单的可靠估算。
- 定价基线与官方一致:
- Google Vertex AI 针对新一代 Gemini Flash 系列模型的随用随付(Pay-as-you-go)公开单价正是 $0.75 / 1M(输入)与 $3.75 / 1M(输出),Bifrost 录入的费率模型完全对齐了官方标准。
- 细分维度完整:
- 很多网关只粗暴地按 “总 Token × 均价” 估算,而 Bifrost 正确解析了 Google 上游返回的
cached_content_token_count(或cached_read_tokens),计入了 90% 的缓存折扣,因此估算不会虚高。
- 很多网关只粗暴地按 “总 Token × 均价” 估算,而 Bifrost 正确解析了 Google 上游返回的
- 需要注意的实际账单差异点:
- 输入(Input / Prompt Tokens):
- 收藏支持反对打赏
- 暂无回复
