本站能核验什么,不能核验什么
产品名称、endpoint、model ID、费率和公开分数都对照 Sakana AI 第一方页面。我们不声称拥有未公开权限,也不编造没有证据的“亲自实测”。下文 Benchmark 若没有单独标注独立来源,均指 Sakana AI 公布结果。
一分钟速览
Sakana Fugu 到底是什么
可以把 Fugu 想成藏在一个 model name 后面的项目负责人。请求可能直接回答,也可能被拆给小团队,再合成一份响应。它的编排策略通过训练得到,不是由你维护一张固定工作流。
Fugu、OpenRouter 和自建 LangGraph 不是同一种取舍。OpenRouter 重点是模型入口,自建 graph 重点是显式路由;Fugu 用更少的编排维护成本,换取对学习式路由更少的可见性。
模型选择
Fugu、Fugu Ultra 和 Fugu Cyber 怎么选
起点由任务形态决定,不是名字越强就越适合。
Fugu
适合交互式编程、聊天和常规任务,尤其是响应时间不能太长的场景。
- 在质量和延迟之间平衡
- 根据任务路由到底层模型
- 支持排除指定 provider 或 model
- 按量价格会变,不存在一个公开固定费率
Fugu Ultra
适合质量优先于速度的难题,但要用你自己的复杂任务验证提升是否值得。
- 使用固定的完整 agent pool
- 在 1 到 3 个 agent 间路由
- 固定 token 费率,便于预算
- 编排 token 同样计费
Fugu Cyber
面向经授权的防御性安全分析、漏洞研究和威胁调查。
- 需要提交用途并等待人工审核
- 只支持按量计费
- 固定费率高于 Ultra
- 使用者仍需自行负责授权和测试边界
普通任务先用 Fugu;在 Fugu 容易漏关键细节的任务上,与 Ultra 成对测试。只有在经过授权的防御安全场景、且准入确认后,再考虑 Cyber。
使用透明规则的模型选择器当前公开费率
别漏算看不见的编排 token
下表按每 100 万 token 计价,最后核验于 2026 年 7 月 21 日。
| 模型 | 输入 | 输出 | 缓存输入 | 上下文超过 272K |
|---|---|---|---|---|
| Fugu | 浮动:按底层模型,或参与模型中的最高档费率 | 取决于实际路由 | ||
| Fugu Ultra | $5.00 | $30.00 | $0.50 | $10 / $45 / $1.00 |
| Fugu Cyber | $6.00 | $36.00 | $0.60 | $12 / $54 / $1.20 |
只看“输入加输出”会低估
Ultra 和 Cyber 除了用户输入与最终输出,还会返回编排输入、编排缓存输入和编排输出。Sakana AI 明确说这些字段代表真实使用量,并按相同类别费率计费。多 agent 长任务若忽略这些字段,估算会明显偏低。
订阅方案不能硬算“回本线”
Standard 为 $20/月,Pro 为 $100,Max 为 $200。公开页面只说 Pro 是 Standard 用量的 10 倍、Max 是 20 倍,没有提供能覆盖所有路由的统一 token 数。所以方案价格只能当预算参照,不能假装成确定 token 等价物。
来源:Sakana AI Console Pricing。订阅第二个月免费的活动只写到 2026 年 7 月 31 日,过期后请重新核对。
接入路径
接口长得熟悉,不代表所有 OpenAI 参数都同样生效
Sakana AI 支持 Responses、Chat Completions 和 Models API。官方更推荐 Responses API,以获得更好的工具、多模态、reasoning 和函数调用行为。
import os
from openai import OpenAI
api_key = os.environ["FUGU_API_KEY"]
base_url = os.environ["FUGU_BASE_URL"].rstrip("/")
if not base_url.endswith("/v1"):
base_url += "/v1"
client = OpenAI(api_key=api_key, base_url=base_url)
response = client.responses.create(
model="fugu",
input="审查这个函数,先列正确性风险。",
)
print(response.output_text)
Model ID
使用 fugu、fugu-ultra 或 fugu-cyber。官方目前也保留一个带日期的 Ultra alias。
被忽略的字段
部分 sampling 参数虽然被接受,却不会改变行为。不要默认 temperature、top_p 或 penalty 字段有效。
重试必须有边界
设置有限 timeout 和少量重试。多 agent 请求可能很久,但无限重试可能重复执行昂贵任务。
完整保存 usage
保留完整 usage 对象用于核账。只存最终输入和输出,无法覆盖全部编排成本。
证据,不是装饰
Sakana Fugu Benchmark 应该怎么读
公开表格能说明产品在厂商测试设置中的表现,但不能证明 Ultra 在你的代码库、prompt、工具、延迟预算和故障模式上一定胜出。
表格能支持的结论
- 在 Sakana AI 的评测中,Fugu 与 Ultra 在多项编程、推理任务上有竞争力。
- 多数但并非所有任务上,Ultra 高于 Fugu。
- 不同任务需要不同编排深度。
表格不能证明的事情
- 所有分数都被第三方完整复现
- 延迟更低或总成本更低
- 在私有代码和内部工具上同样稳定
- 出现好坏结果时能完整追溯到具体 agent
公平评估要给 Fugu、Ultra 和现有 baseline 相同 prompt、工具、timeout、评分规则与重复次数。记录失败和成本,不能只挑最好看的回答。
深度指南
三个聚焦问题,不再把重复答案塞进一页
每篇只解决一个具体决策,所有会过期的产品事实都链接到第一方来源。
API 快速上手与故障检查
选择 model ID、校验配置、流式响应、识别无效参数,并把网络重试限制在明确边界内。
价格与编排 token 核算
核对 usage 对象,计算 Ultra 和 Cyber 费用,不再捏造 Fugu 固定费率。
Benchmark 解读与评估流程
把厂商分数变成盲测、可重复、与你团队真实任务有关的对比。
决策清单
做一个能站得住脚的小评估
- 1
选十个代表性任务
覆盖日常、困难、模糊和容易失败的任务,不能只挑最适合多智能体发挥的题。
- 2
冻结运行契约
每个候选模型使用同一 prompt、工具、timeout、输出限制和重试规则。
- 3
隐藏模型名打分
评分者不知道答案来自哪个模型,只看正确性、证据、完整度和多余断言。
- 4
记录运行成本
保存耗时、失败、重试和完整 usage,尤其是编排 token 明细。
- 5
只在赢的地方采用
Fugu 胜出的场景用 Fugu;质量提升值得成本时才升级 Ultra;两者都不值就保留现有工具。
核验记录
2026 年 7 月 21 日重新核对了什么
- 模型:官方产品页与 console 已列出 Fugu、Fugu Ultra、Fugu Cyber。
- Cyber 准入:官方文档写明只支持按量计费,并需提交用途申请。
- Ultra 路由:console model 页面写明 Ultra 会在 1 到 3 个 agent 间路由。
- Usage 字段:编排输入、缓存输入和输出会单独返回并计费。
- 模型命名:当前文档使用稳定的
fugu-ultra,同时保留日期 alias;一个 pricing 页面仍显示日期标识,所以接入时应查询 Models API。
常见问题
Sakana Fugu FAQ
Sakana Fugu 免费吗?
当前价格页没有永久免费层。订阅从 $20/月起,也支持按量计费。官方限时活动称在 2026 年 7 月 31 日前订阅,第二个月免费。
我应该先用哪个模型?
常规和交互任务先用 Fugu;在少量真正困难的任务上测试 Ultra 是否带来值得付费的提升。Cyber 只用于经授权的防御安全任务,并需先确认访问权限。
能提前准确计算 Fugu 按量费用吗?
不能把它简化为一个可靠固定费率。Fugu 按实际底层模型或参与模型中的最高档计费。Ultra 和 Cyber 有固定公开价格,所以计算器只覆盖这两款。
Benchmark 是否已被独立验证?
表格由 Sakana AI 发布,部分 baseline 值来自各模型厂商。它应被当作厂商证据。本站不会假装做过未公开实验,而是提供一套能在你自己任务上复现的评估流程。
SakanaFugu.com 是 Sakana AI 官方网站吗?
不是。SakanaFugu.com 是独立编辑指南,与 Sakana AI 没有关联、背书或赞助关系。
第一方来源
- Sakana AI 产品页:模型、定位、价格概览、FAQ 与地区可用性
- Sakana AI 模型文档:model ID、endpoint、支持字段、Benchmark 和 usage 字段
- Sakana AI 价格文档:固定费率、Fugu 计费逻辑与订阅方案
- Sakana Fugu Technical Report:训练方法与公开评估方法
发现错误可发邮件到 [email protected],最好附上第一方来源。