Sakana Fugu 由东京的 Sakana AI 于 2026 年 6 月 22 日发布,是另一种前沿系统:不是单一大模型,而是以一个模型交付的多智能体编排系统。在单一 OpenAI 兼容 API 之后,Fugu 本身是一个被训练来委派的语言模型——它读取你的请求,要么直接作答,要么组建一支专家模型团队,在内部管理选择、委派、验证与综合。它的标语说得很直白:“One Model to Command Them All”(一个模型,统御众模)。
它分两个变体推出。Fugu 是面向日常编码、代码审查与聊天机器人的均衡、低延迟默认款;Fugu Ultra 在困难、多步问题上最大化质量,依据难度在一到三个专家智能体之间路由。Sakana 称 Fugu Ultra 在最难的工程、科学与推理基准上与 Anthropic 受限的 Fable 5 及 Mythos Preview 并肩——这很惊人,因为两个 Anthropic 模型甚至都不在 Fugu 的池中。
这套说辞既是技术的,也是战略的。可替换的模型池是对单一厂商依赖与出口管制的对冲——Sakana 直指最近那些让 Anthropic 的 Fable 与 Mythos 模型下线的限制。代价是:Fugu 是付费 API 服务、无开源权重,编排会给账单增加 token,而且发布时在欧盟/欧洲经济区不可用。
Sakana Fugu 如何工作
Fugu 不是手写的工作流引擎——它是一个专精编排的语言模型。每次请求,当直接解决足够时它就直接解决,当任务需要更多时它就组建并协调一支专家模型团队。模型选择、委派、智能体间通信、验证与最终综合都发生在内部,因此复杂度永远不会触及你的代码。
- 可替换的智能体池。 Fugu 在闭源与开源模型组成的池中路由,并能递归调用自身的实例。Fugu Ultra 协调更深的池,并在每个问题上于一到三个智能体之间路由。
- 习得的协调,而非固定规则。 Fugu 并非由工程师手工设计哪个模型做什么,而是学会何时委派、智能体应如何对话、以及如何把它们的工作合成一个可靠答案。这建立在 Sakana 的 ICLR 2026 研究之上——Trinity 与 Conductor(见下文)。
- 供应商韧性。 因为池可替换,若某供应商限制访问,Fugu 会绕过它。Sakana 把这框定为“AI 主权”的蓝图,并计划随时间把更新的模型——包括开源模型与自家模型——纳入池中。
- 合规控制。 有数据、隐私或合规要求的团队,可以把特定智能体从池中退出。
Fugu 对比 Fugu Ultra
| Fugu | Fugu Ultra | |
|---|---|---|
| 最适合 | 日常工作:编码、代码审查、聊天机器人 | 困难的多步工作:研究、论文复现、安全分析 |
| 编排 | 均衡且低延迟;当单个最佳模型足够时就路由给它 | 协调更深的池;在 1–3 个专家智能体之间路由 |
| 推理强度 | 通过 reasoning.effort 设 high / xhigh(即 max) | 为最高质量调校 |
| 模型 ID | fugu | fugu-ultra(钉住版:fugu-ultra-20260615) |
| 定价 | 所用顶层模型的单一费率(不叠加费用) | 固定 $5 / $30 每 100 万(见下文) |
基准
Sakana 的技术报告(表 1)把 Fugu 与 Fugu Ultra 同其自身池中的前沿模型作比较。基线分数为各供应商自报数字;每行的领先者以粗体标出。
| 基准 | Fugu Ultra | Fugu | Opus 4.8 | Gemini 3.1 Pro | GPT-5.5 |
|---|---|---|---|---|---|
| SWE-bench Pro | 73.7 | 59.0 | 69.2 | 54.2 | 58.6 |
| Terminal-Bench 2.1 | 82.1 | 80.2 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 93.2 | 92.9 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 90.8 | 87.8 | 84.8 | 82.9 | 88.4 |
| Humanity’s Last Exam | 50.0 | 47.2 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 86.6 | 85.1 | 84.2 | 83.3 | 84.1 |
| GPQA Diamond | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 58.7 | 60.1 | 53.5 | 58.9 | 56.1 |
| τ³-bench (Banking) | 20.6 | 21.7 | 20.6 | 8.4 | 20.6 |
| Long-Context Reasoning | 73.3 | 74.7 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 93.6 | 86.6 | 87.9 | 84.9 | 94.8 |
在最难、控泄漏的编码分组上,Fugu Ultra 领先它所路由的每一个模型:
而在终端/CLI 智能体上,甚至基础款 Fugu——每次请求只挑一个模型——也击败了其池中最强的单模型,这表明路由决策本身就带来性能:
怎么读这些数字:
- 胜负随基准而互换——这正是“并肩”的含义。 Fugu Ultra 在编码、终端与图表推理任务上领先,但基础款 Fugu 实际赢下 SciCode、τ³ 与长上下文,而 GPT-5.5 仍在 MRCRv2 上居首。对阵不在池中的、受限的 Anthropic 模型,Fable 5 在 SWE-bench Pro 上击败 Fugu Ultra(86.0 对 73.7),并在 Humanity’s Last Exam 上略胜(53.3 对 50.0)。
- 这是系统对模型。 一个 Fugu 分数反映的是一次路由选择或一支协调团队,而非单个模型独自作答——更接近“编排所能达到的最佳”,而非同类对同类的模型比较。
- 这是移动靶。 由于 Fugu 在第三方模型间路由,结果会随池的变化而移动;基线为供应商自报,且 SWE 任务使用 mini-swe-agent 运行框架。
定价与成本
Fugu Ultra 有固定、公开的每 token 定价。基础款 Fugu 计费方式不同:当单个智能体处理请求时,你支付该模型的标准费率;当多个智能体协调时,Sakana 按所涉顶层模型的单一费率收费,而非叠加费用。
| token 类型 | 标准(≤ 272K 上下文) | 超过 272K 上下文 |
|---|---|---|
| 输入 | $5.00 | $10.00 |
| 输出 | $30.00 | $45.00 |
| 缓存输入 | $0.50 | $1.00 |
fugu-ultra-20260615 的固定定价,每 100 万 token。
在实践中重要的成本要点:
- 编排 token 算数。 Fugu 的用量对象把用户可见 token 与编排 token 分开,但编排 token 按同样的输入/输出费率计费。一次多智能体运行可能消耗远多于单次模型调用的 token——为此做预算,并用
max_output_tokens与监控设上限。 - 订阅对比按量付费。 计划为每月 $20(Standard)、$100(Pro)、$200(Max),更重与企业级工作负载有按用量计费。在 2026 年 7 月底前订阅,Sakana 会按你的档位额外赠送一个免费月。
- 可预测性的权衡。 你为编排质量付费,而非固定的单模型费率——在困难任务上强大,但比像 Gemini 3.1 Pro 这样的单一模型更难预测。
如何使用 Sakana Fugu
Fugu 是 OpenAI 兼容的,因此你可以复用现有的 OpenAI 客户端——只需更换 base URL 与 key。Sakana 推荐 Responses API;Chat Completions 与 Models API 也受支持。
| 设置 | 值 |
|---|---|
| Base URL | https://api.sakana.ai/v1 |
| 模型 | fugu、fugu-ultra、fugu-ultra-20260615 |
推理强度(fugu) | 通过 reasoning.effort 设 high、xhigh(即 max) |
| 控制台 / key | console.sakana.ai(Google 或邮箱登录) |
from openai import OpenAI
client = OpenAI(
base_url="https://api.sakana.ai/v1",
api_key="YOUR_API_KEY",
)
resp = client.responses.create(
model="fugu-ultra",
input="Reproduce the main result of this paper and report what failed.",
timeout=600.0, # Ultra 运行可能很长——调高客户端超时
)
print(resp.output_text)
几点实务说明:对 fugu 模型,把 reasoning.effort 设为 high 或 xhigh/max(其它值会被拒绝)。对复杂的 fugu-ultra 任务,调高客户端超时。另注意 fugu-ultra 上的 max_output_tokens 只作用于最终响应——编排器仍使用它自己的上限。
应用场景与实战示例
Fugu 的价值更少体现在单次提示的答案里,更多体现在长而杂乱、多步的工作流中——正是 Sakana 在其约 500 用户的 beta 中聚焦之处。
1. 自动化的长跨度研究
beta 用户以接近全自动的研究模式运行 Fugu(Sakana 称之为 AutoResearch):它探索想法、运行实验、解读失败、修正方法,并在极少人工介入下持续取得进展。这种开放式、多步的工作是 Fugu Ultra 的典型任务——也是 Sakana 报告它击败 Gemini 3.1 Pro、Opus 4.8 与 GPT-5.5 之处。
2. 端到端代码审查
“在代码审查上,Fugu Ultra 显著优于 GPT-5.5……别的工具大约标出三个问题的地方,Fugu 浮现出二十多个。它已成为我所有审查都过一遍的模型。” —— 软件工程师(Sakana beta)
由于审查会扇出到多个相互交叉核验的专家智能体,Fugu 往往能浮现出单次过审会漏掉的缺陷。
3. 一次性安全评估
“给一条限定范围的指令,Fugu 端到端地推进了一次完整的安全评估——侦察、XSS/SQLi 检查、鉴权审查,以及一份带证据与复测步骤的干净报告——始终在范围内、避免破坏性动作。” —— 网络安全工程师(Sakana beta)
评审者还注意到,在长会话中其人设稳定性异常强——这对那些其它模型容易漂移的智能体产品很有用。
Sakana Fugu 横向对比
- 对比它所路由的模型(GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8): Fugu 不取代它们——而是指挥它们。Sakana 报告,在应用任务上,编排后的系统击败了这些基础模型各自的高/max/xhigh 档位。
- 对比 Anthropic 受限的前沿(Fable 5、Mythos Preview): 招牌主张是在最难基准上达到并肩,却没有把这些模型放进池中——也没有那种把 Mythos 在发布数天后拉下线的出口管制风险敞口。
- 对比传统多智能体框架(LangGraph、AutoGen、CrewAI): 那些要你设计并维护智能体图;Fugu 把编排作为习得的模型放在单一 API 之后交付,因此没有胶水代码,也无需按任务做工作流工程。
简而言之:当任务长、杂乱、多步,或当供应商韧性重要时,伸手去拿 Fugu;当延迟与成本可预测性更重要时,直接调用单一模型。要看更广的领域,参见我们的 2026 LLM 全景指南。
局限与已知坑
- 发布时无欧盟/欧洲经济区访问。 在 GDPR 合规待定期间,该 API 在那里受限。
- 非开源权重。 Fugu 是依赖其所路由第三方供应商的托管 API;你无法自托管它。
- 成本更难预测。 编排 token 与多智能体运行会让用量膨胀;用
max_output_tokens设上限、倚重缓存输入,并监控用量明细。 - Ultra 延迟。 困难任务可能运行得久到需要调高客户端超时——它为深度而非干脆的交互回合而生。
- 厂商自报、系统对模型的基准。 并肩主张排除了它们所对标的那些 Anthropic 模型;请用你自己的工作负载来验证。
- 年轻的产品。 在约 500 用户的 beta 之后于 2026 年 6 月 22 日正式可用(小变体此前称为 “Fugu Mini”)——预期有粗糙之处与不断演化的池。
Fugu 背后的研究
Fugu 立足于两篇被 ICLR 2026 接收的论文,外加一份技术报告:
- TRINITY: An Evolved LLM Coordinator —— 一个轻量、演化而来的协调器,在多个回合中把模型分配到 Thinker / Worker / Verifier 角色,并随任务动态自适应。
- Learning to Orchestrate Agents in Natural Language with the Conductor —— 用强化学习去发现自然语言协调策略,学会如何提示与路由智能体,而非依赖人工设计的工作流。
- Sakana Fugu Technical Report (2026) —— 系统细节与基准方法学。
Sakana 的编排血统早于 Fugu:其 ALE-Agent 在一场编码竞赛中于 1,000 名人类专家里位列第 21。
可用性与路线图
Sakana Fugu 今天(2026 年 6 月 22 日)正式可用,通过 console.sakana.ai 提供,此前经历了自 2026 年 4 月底起约 500 名用户的 beta。fugu-ultra-20260615 ID 钉住特定的 Fugu Ultra 版本,而 fugu 与 fugu-ultra 跟踪最新版。
Sakana 把这次发布框定为“一个起点,而非终点线”。由于 Fugu 建立在习得式编排而非固定工作流之上,它会随生态系统一同进步:路线图是扩大专家智能体池(含开源模型与 Sakana 自家模型)、强化对长时运行智能体任务的协调,并给用户更多对 Fugu 如何代其路由的控制。
适用场景
- 长跨度的自动化研究与论文复现
- 端到端的代码审查与安全评估
- 必须绕过访问中断的厂商韧性部署
优缺点
优势
- 通过编排可替换模型池达到前沿级结果——无单一厂商锁定
- OpenAI 兼容 API;把现有客户端指向新 base URL 即可,无需 SDK 迁移
- 擅长长而杂乱的智能体工作——研究、代码审查、安全评估
局限
- 不是单一模型;质量、延迟与成本取决于路由与模型池
- 编排 token 会加到账单——多智能体运行比单次模型调用更贵
- 发布时在欧盟/欧洲经济区不可用(GDPR 合规待定);无开源权重
常见问题
Sakana Fugu 是什么?
Sakana Fugu 是东京 Sakana AI 推出的多智能体编排系统,于 2026 年 6 月 22 日发布。它本身是一个被训练来委派的语言模型——在单一 OpenAI 兼容 API 之后,它决定是直接回答请求,还是组建并协调一支专家模型团队,在内部处理选择、委派、验证与综合。
Sakana Fugu 是一个模型还是多个?
都是。从外部看,你通过一个 API 调用一个模型。内部,Fugu 可以直接解决请求,或把它路由到一个可替换的前沿与开源模型池(它甚至能递归调用自己)。多智能体系统的复杂度永远不会触及你的代码。
Fugu 与 Fugu Ultra 有何区别?
Fugu 是面向编码、代码审查与聊天机器人等日常工作的均衡、低延迟默认款。Fugu Ultra 在困难、多步问题上最大化答案质量,依据难度协调更深的模型池并在一到三个专家智能体之间路由。
Sakana Fugu 价格如何?
Fugu Ultra(`fugu-ultra-20260615`)固定为每 100 万输入 $5、每 100 万输出 $30,超过 272K 上下文升至 $10 / $45;缓存输入为 $0.50(超过 272K 则 $1.00)。编排 token 按同样费率计费。订阅计划为每月 $20(Standard)、$100(Pro)与 $200(Max),并对更重的用量提供按量付费。
我如何调用 Sakana Fugu API?
Fugu 是 OpenAI 兼容的。把 OpenAI SDK 指向 `https://api.sakana.ai/v1`,使用来自 console.sakana.ai 的 API key,并以 `fugu` 或 `fugu-ultra` 作为模型。Sakana 推荐 Responses API;Chat Completions 与 Models API 也受支持。
Sakana Fugu 在欧盟可用吗?
发布时不可用。在 Sakana 推进 GDPR 合规期间,该 API 在欧盟与欧洲经济区不可用。
Sakana Fugu 与 Claude Fable 5 相比如何?
Sakana 报告 Fugu Ultra 在最难的工程、科学与推理基准上与 Anthropic 的 Fable 5 及 Mythos Preview 并肩——这值得注意,因为两个 Anthropic 模型都不在 Fugu 的池中。Fugu Ultra 在 Terminal-Bench 2.1 上领先,但在 Humanity's Last Exam 上落后 Fable 5。把这些并肩主张当作厂商自报看待。
Sakana Fugu 的模型 ID 是什么?
模型 ID 为 `fugu`(默认)、`fugu-ultra`(最高质量),以及 `fugu-ultra-20260615`——一个钉住特定 Fugu Ultra 版本的带日期别名。
来源
- Sakana AI — Sakana Fugu: One Model to Command Them All
- Sakana AI — Fugu product page
- Sakana AI — Console: Models
- Sakana AI — Console: Pricing
- The Decoder — Sakana AI's Fugu orchestrates multiple LLMs (benchmark Table 1)
- ITmedia — Sakana AI、一部「ミュトス越えの性能」うたうAIを提供
- sakutto — What Is Sakana Fugu? Performance vs Fable 5 (Fable comparison figures)