Bifrost 统计的「400 万 Token 约合 1 USD」是基于其内置的 模型定价元数据表(governance_model_pricing)结合每次请求的 Token 明细(包含缓存命中) 逐笔精确累加计算出来的。

以下是具体的计算依据与量级准确性分析:


一、Bifrost 是根据什么计算的?

查验本机 Bifrost(:3006,用于 Gemini/Vertex 链路)的配置库与请求日志,计费依据如下:

1. 定价基准(以主力模型 gemini-3.8-flash 为例)

Bifrost 内置的 Vertex 定价标准为:

  • 输入(Input / Prompt Tokens)$0.00000075 / token,即 $0.75 / 100 万 tokens
  • 输出(Output / Completion Tokens)$0.00000375 / token,即 $3.75 / 100 万 tokens
  • 缓存读取(Cached Read Tokens)$0.000000075 / token,即 $0.075 / 100 万 tokens(基础输入价的 1 折

2. 为什么 400 万 Token 只有约 1 USD?

若全是冷启动纯输入,4M × $0.75 = $3.00
但从 Bifrost 记录的实际日志(如 Coding Agent 会话)来看:

  • Agent 场景下长对话与 System Prompt 会频繁复用,Context Cache(提示词缓存)命中率极高(通常在 70% ~ 80% 以上)
  • 命中缓存的 Token 单价仅为 $0.075 / 1M
  • 实测综合有效单价约为 $0.24 ~ $0.28 / 100 万 tokens
  • 因此:400万 tokens × ~$0.25 / 1M ≈ 1.00 USD,完全符合计算逻辑。

3. 单次请求的计算公式

每一笔 API 调用的 cost 都是实时落库的,公式为:
$$\text{Cost} = (\text{prompt_tokens} - \text{cached_tokens}) \times 0.75 \times 10^{-6} + \text{cached_tokens} \times 0.075 \times 10^{-6} + \text{completion_tokens} \times 3.75 \times 10^{-6}$$


二、大概量级准确吗?

量级非常准确,基本可以作为实际账单的可靠估算。

  1. 定价基线与官方一致
    • Google Vertex AI 针对新一代 Gemini Flash 系列模型的随用随付(Pay-as-you-go)公开单价正是 $0.75 / 1M(输入)与 $3.75 / 1M(输出),Bifrost 录入的费率模型完全对齐了官方标准。
  2. 细分维度完整
    • 很多网关只粗暴地按 “总 Token × 均价” 估算,而 Bifrost 正确解析了 Google 上游返回的 cached_content_token_count(或 cached_read_tokens),计入了 90% 的缓存折扣,因此估算不会虚高。
  3. 需要注意的实际账单差异点
    • 免费档(Free Tier):如果使用的是 Google AI Studio 免费档 Key(之前配置的 gemini-free),上游真实费用为 $0,Bifrost 的数字属于 “等价商业价值估算”;如果是 Vertex AI 绑定信用卡的 GCP 项目,则是真实扣费。
    • Thinking Tokens(思考模式):模型输出的思考链 Token 均按 ** 输出单价($3.75/1M)** 计费,如果某些请求开启高思考预算且生成较多,输出占比上升会轻微推高费用。
    • 上下文阶梯:超出 128k/200k 的超长上下文场景可能触发官方阶梯费率,但常规 Agent 会话基本稳定在上述估算范围内。
      截屏2026-09-24 12.01.39.webp