成本记账

Sakana Fugu 编排 token 是额外工作,不是脚注

OpenAI 形状的字段名很容易让人把 token_details 当成已经计入总额的拆分。官方定价文档对 Ultra 说的正好相反:编排字段是额外真实用量,并按对应的输入、缓存或输出费率计费。

1. 存官方对象,不要猜子集

直播定价页和 Models 页公布了 Ultra(Models 页也对 Cyber)的这一形状:input_tokens 是发给第一个模型的用户输入;cached_tokens 是该输入的缓存;orchestration_input_tokens 是编排输入合计;orchestration_input_cached_tokens 是编排缓存输入;output_tokens 是最终输出;orchestration_output_tokens 是编排输出;total_tokens 含编排。

usage
{
  "input_tokens": 120,
  "output_tokens": 80,
  "total_tokens": 200,
  "input_tokens_details": {
    "cached_tokens": 0,
    "orchestration_input_tokens": 0,
    "orchestration_input_cached_tokens": 0
  },
  "output_tokens_details": {
    "orchestration_output_tokens": 0
  }
}

2. 先求和,再乘费率

计费输入 = input_tokens + orchestration_input_tokens

计费缓存输入 = cached_tokens + orchestration_input_cached_tokens

计费输出 = output_tokens + orchestration_output_tokens

2026 年 8 月 17 日 Ultra 标准费率仍是每百万 $5 / $0.50 / $30;上下文超过 272K 则为 $10 / $1.00 / $45。只有该次请求的上下文跨过阈值,才用高档。

3. 与计算器相同的工作示例

假设一次标准上下文 Ultra 请求报告:用户输入 1,000,000,缓存输入 250,000,最终输出 250,000,编排输入 2,000,000,编排缓存 500,000,编排输出 500,000。则计费输入 3,000,000 = $15.00,计费缓存 750,000 = $0.375,计费输出 750,000 = $22.50,合计 $37.875。若忽略编排,你会记下 $12.625 再和财务争论。Ultra 计算器就是把字段标清楚的这段算术。它仍然不能给标准 Fugu 或 Cyber 定价。

4. 避免第二次争论的运维规则

  • 原始 usage 对象、算出的金额、所用费率版本要一起保存。
  • 不要假设 total_tokens 按一个混合单价计费。
  • 不要把 Ultra 的 max_output_tokens 当成花费上限。
  • 272K 上下的流量要拆成两次计算。
  • 合作方若不返回这些字段,就不能在没有新证据时套用此公式。

即使算出的美元金额看起来整齐,也要留下原始 JSON。以后定价页再变,或发现漏加了编排缓存,从字段修比重画一张合计截图便宜。标准 Fugu 没有这张公开固定表,Cyber 的公开表也已撤回,所以不要把这段公式套到那两款模型上。

把 usage 和请求 ID、模型 ID、当时使用的费率版本放在同一条日志里。下一次对账时,你要回答的不是“大概花了多少”,而是“哪一次 Ultra 请求因为编排输出把费用抬上去了”。计算器只是同一套算术的界面,不能替代保存原始对象。完整方法论见 价格说明。没有原始对象就无法复盘。

本页不覆盖什么

这里不给标准 Fugu 编混合单价,也不恢复已撤回的 Cyber 公开表。公式只适用于官方仍公布固定费率、且返回编排字段的 Ultra 请求。合作方发票如果字段不同,需要另做证据,不能直接套用。

来源