大语言模型

Sakana Fugu

东京 Sakana AI 于 2026 年 6 月推出的多智能体编排系统——以单一 OpenAI 兼容模型交付,动态把每个任务路由到一个可替换的前沿与开源模型池。

Sakana Fugu 由东京的 Sakana AI2026 年 6 月 22 日发布,是另一种前沿系统:不是单一大模型,而是以一个模型交付的多智能体编排系统。在单一 OpenAI 兼容 API 之后,Fugu 本身是一个被训练来委派的语言模型——它读取你的请求,要么直接作答,要么组建一支专家模型团队,在内部管理选择、委派、验证与综合。它的标语说得很直白:“One Model to Command Them All”(一个模型,统御众模)。

它分两个变体推出。Fugu 是面向日常编码、代码审查与聊天机器人的均衡、低延迟默认款;Fugu Ultra 在困难、多步问题上最大化质量,依据难度在一到三个专家智能体之间路由。Sakana 称 Fugu Ultra 在最难的工程、科学与推理基准上与 Anthropic 受限的 Fable 5 及 Mythos Preview 并肩——这很惊人,因为两个 Anthropic 模型甚至都不在 Fugu 的池中。

这套说辞既是技术的,也是战略的。可替换的模型池是对单一厂商依赖与出口管制的对冲——Sakana 直指最近那些让 Anthropic 的 Fable 与 Mythos 模型下线的限制。代价是:Fugu 是付费 API 服务、无开源权重,编排会给账单增加 token,而且发布时在欧盟/欧洲经济区不可用

Sakana Fugu 如何工作

Fugu 不是手写的工作流引擎——它是一个专精编排的语言模型。每次请求,当直接解决足够时它就直接解决,当任务需要更多时它就组建并协调一支专家模型团队。模型选择、委派、智能体间通信、验证与最终综合都发生在内部,因此复杂度永远不会触及你的代码。

  • 可替换的智能体池。 Fugu 在闭源与开源模型组成的池中路由,并能递归调用自身的实例。Fugu Ultra 协调更深的池,并在每个问题上于一到三个智能体之间路由。
  • 习得的协调,而非固定规则。 Fugu 并非由工程师手工设计哪个模型做什么,而是学会何时委派、智能体应如何对话、以及如何把它们的工作合成一个可靠答案。这建立在 Sakana 的 ICLR 2026 研究之上——Trinity 与 Conductor(见下文)。
  • 供应商韧性。 因为池可替换,若某供应商限制访问,Fugu 会绕过它。Sakana 把这框定为“AI 主权”的蓝图,并计划随时间把更新的模型——包括开源模型与自家模型——纳入池中。
  • 合规控制。 有数据、隐私或合规要求的团队,可以把特定智能体从池中退出。

Fugu 对比 Fugu Ultra

FuguFugu Ultra
最适合日常工作:编码、代码审查、聊天机器人困难的多步工作:研究、论文复现、安全分析
编排均衡且低延迟;当单个最佳模型足够时就路由给它协调更深的池;在 1–3 个专家智能体之间路由
推理强度通过 reasoning.efforthigh / xhigh(即 max为最高质量调校
模型 IDfugufugu-ultra(钉住版:fugu-ultra-20260615
定价所用顶层模型的单一费率(不叠加费用)固定 $5 / $30 每 100 万(见下文)

基准

Sakana 的技术报告(表 1)把 Fugu 与 Fugu Ultra 同其自身池中的前沿模型作比较。基线分数为各供应商自报数字;每行的领先者以粗体标出。

基准Fugu UltraFuguOpus 4.8Gemini 3.1 ProGPT-5.5
SWE-bench Pro73.759.069.254.258.6
Terminal-Bench 2.182.180.274.670.378.2
LiveCodeBench93.292.987.888.585.3
LiveCodeBench Pro90.887.884.882.988.4
Humanity’s Last Exam50.047.249.844.441.4
CharXiv Reasoning86.685.184.283.384.1
GPQA Diamond95.595.592.094.393.6
SciCode58.760.153.558.956.1
τ³-bench (Banking)20.621.720.68.420.6
Long-Context Reasoning73.374.767.772.774.3
MRCRv293.686.687.984.994.8

在最难、控泄漏的编码分组上,Fugu Ultra 领先它所路由的每一个模型:

智能体编码 — SWE-bench Pro(%)
Fugu Ultra73.7%Claude Opus 4.869.2%Fugu59%GPT-5.558.6%Gemini 3.1 Pro54.2%
编排单模型
Fugu Ultra 在其编排的池中登顶——但不在池中的、受限的 Anthropic Fable 5(86.0)得分更高。
来源:Sakana Fugu 技术报告(表 1),2026 年 6 月。图表由 Heyaiwiki 制作。

而在终端/CLI 智能体上,甚至基础款 Fugu——每次请求只挑一个模型——也击败了其池中最强的单模型,这表明路由决策本身就带来性能:

Terminal-Bench 2.1(%)
Fugu Ultra82.1%Fugu80.2%GPT-5.578.2%Claude Opus 4.874.6%Gemini 3.1 Pro70.3%
编排单模型
基础款 Fugu(80.2)超过其池中最佳单模型 GPT-5.5(78.2)——在任何多智能体协作之前,仅路由就买来了性能。
来源:Sakana Fugu 技术报告(表 1),2026 年 6 月。图表由 Heyaiwiki 制作。

怎么读这些数字:

  • 胜负随基准而互换——这正是“并肩”的含义。 Fugu Ultra 在编码、终端与图表推理任务上领先,但基础款 Fugu 实际赢下 SciCode、τ³ 与长上下文,而 GPT-5.5 仍在 MRCRv2 上居首。对阵不在池中的、受限的 Anthropic 模型,Fable 5 在 SWE-bench Pro 上击败 Fugu Ultra(86.0 对 73.7),并在 Humanity’s Last Exam 上略胜(53.3 对 50.0)。
  • 这是系统对模型。 一个 Fugu 分数反映的是一次路由选择或一支协调团队,而非单个模型独自作答——更接近“编排所能达到的最佳”,而非同类对同类的模型比较。
  • 这是移动靶。 由于 Fugu 在第三方模型间路由,结果会随池的变化而移动;基线为供应商自报,且 SWE 任务使用 mini-swe-agent 运行框架。

定价与成本

Fugu Ultra 有固定、公开的每 token 定价。基础款 Fugu 计费方式不同:当单个智能体处理请求时,你支付该模型的标准费率;当多个智能体协调时,Sakana 按所涉顶层模型的单一费率收费,而非叠加费用。

token 类型标准(≤ 272K 上下文)超过 272K 上下文
输入$5.00$10.00
输出$30.00$45.00
缓存输入$0.50$1.00

fugu-ultra-20260615 的固定定价,每 100 万 token。

在实践中重要的成本要点:

  • 编排 token 算数。 Fugu 的用量对象把用户可见 token 与编排 token 分开,但编排 token 按同样的输入/输出费率计费。一次多智能体运行可能消耗远多于单次模型调用的 token——为此做预算,并用 max_output_tokens 与监控设上限。
  • 订阅对比按量付费。 计划为每月 $20(Standard)、$100(Pro)、$200(Max),更重与企业级工作负载有按用量计费。在 2026 年 7 月底前订阅,Sakana 会按你的档位额外赠送一个免费月。
  • 可预测性的权衡。 你为编排质量付费,而非固定的单模型费率——在困难任务上强大,但比像 Gemini 3.1 Pro 这样的单一模型更难预测。

如何使用 Sakana Fugu

Fugu 是 OpenAI 兼容的,因此你可以复用现有的 OpenAI 客户端——只需更换 base URL 与 key。Sakana 推荐 Responses API;Chat Completions 与 Models API 也受支持。

设置
Base URLhttps://api.sakana.ai/v1
模型fugufugu-ultrafugu-ultra-20260615
推理强度(fugu通过 reasoning.efforthighxhigh(即 max
控制台 / keyconsole.sakana.ai(Google 或邮箱登录)
from openai import OpenAI

client = OpenAI(
    base_url="https://api.sakana.ai/v1",
    api_key="YOUR_API_KEY",
)

resp = client.responses.create(
    model="fugu-ultra",
    input="Reproduce the main result of this paper and report what failed.",
    timeout=600.0,   # Ultra 运行可能很长——调高客户端超时
)
print(resp.output_text)

几点实务说明:对 fugu 模型,把 reasoning.effort 设为 highxhigh/max(其它值会被拒绝)。对复杂的 fugu-ultra 任务,调高客户端超时。另注意 fugu-ultra 上的 max_output_tokens 只作用于最终响应——编排器仍使用它自己的上限。

应用场景与实战示例

Fugu 的价值更少体现在单次提示的答案里,更多体现在长而杂乱、多步的工作流中——正是 Sakana 在其约 500 用户的 beta 中聚焦之处。

1. 自动化的长跨度研究

beta 用户以接近全自动的研究模式运行 Fugu(Sakana 称之为 AutoResearch):它探索想法、运行实验、解读失败、修正方法,并在极少人工介入下持续取得进展。这种开放式、多步的工作是 Fugu Ultra 的典型任务——也是 Sakana 报告它击败 Gemini 3.1 Pro、Opus 4.8 与 GPT-5.5 之处。

2. 端到端代码审查

“在代码审查上,Fugu Ultra 显著优于 GPT-5.5……别的工具大约标出三个问题的地方,Fugu 浮现出二十多个。它已成为我所有审查都过一遍的模型。” —— 软件工程师(Sakana beta)

由于审查会扇出到多个相互交叉核验的专家智能体,Fugu 往往能浮现出单次过审会漏掉的缺陷。

3. 一次性安全评估

“给一条限定范围的指令,Fugu 端到端地推进了一次完整的安全评估——侦察、XSS/SQLi 检查、鉴权审查,以及一份带证据与复测步骤的干净报告——始终在范围内、避免破坏性动作。” —— 网络安全工程师(Sakana beta)

评审者还注意到,在长会话中其人设稳定性异常强——这对那些其它模型容易漂移的智能体产品很有用。

Sakana Fugu 横向对比

  • 对比它所路由的模型(GPT-5.5Gemini 3.1 ProClaude Opus 4.8): Fugu 不取代它们——而是指挥它们。Sakana 报告,在应用任务上,编排后的系统击败了这些基础模型各自的高/max/xhigh 档位。
  • 对比 Anthropic 受限的前沿(Fable 5、Mythos Preview): 招牌主张是在最难基准上达到并肩,却没有把这些模型放进池中——也没有那种把 Mythos 在发布数天后拉下线的出口管制风险敞口。
  • 对比传统多智能体框架(LangGraph、AutoGen、CrewAI): 那些要你设计并维护智能体图;Fugu 把编排作为习得的模型放在单一 API 之后交付,因此没有胶水代码,也无需按任务做工作流工程。

简而言之:当任务长、杂乱、多步,或当供应商韧性重要时,伸手去拿 Fugu;当延迟与成本可预测性更重要时,直接调用单一模型。要看更广的领域,参见我们的 2026 LLM 全景指南

局限与已知坑

  • 发布时无欧盟/欧洲经济区访问。 在 GDPR 合规待定期间,该 API 在那里受限。
  • 非开源权重。 Fugu 是依赖其所路由第三方供应商的托管 API;你无法自托管它。
  • 成本更难预测。 编排 token 与多智能体运行会让用量膨胀;用 max_output_tokens 设上限、倚重缓存输入,并监控用量明细。
  • Ultra 延迟。 困难任务可能运行得久到需要调高客户端超时——它为深度而非干脆的交互回合而生。
  • 厂商自报、系统对模型的基准。 并肩主张排除了它们所对标的那些 Anthropic 模型;请用你自己的工作负载来验证。
  • 年轻的产品。 在约 500 用户的 beta 之后于 2026 年 6 月 22 日正式可用(小变体此前称为 “Fugu Mini”)——预期有粗糙之处与不断演化的池。

Fugu 背后的研究

Fugu 立足于两篇被 ICLR 2026 接收的论文,外加一份技术报告:

  • TRINITY: An Evolved LLM Coordinator —— 一个轻量、演化而来的协调器,在多个回合中把模型分配到 Thinker / Worker / Verifier 角色,并随任务动态自适应。
  • Learning to Orchestrate Agents in Natural Language with the Conductor —— 用强化学习去发现自然语言协调策略,学会如何提示与路由智能体,而非依赖人工设计的工作流。
  • Sakana Fugu Technical Report (2026) —— 系统细节与基准方法学。

Sakana 的编排血统早于 Fugu:其 ALE-Agent 在一场编码竞赛中于 1,000 名人类专家里位列第 21。

可用性与路线图

Sakana Fugu 今天(2026 年 6 月 22 日)正式可用,通过 console.sakana.ai 提供,此前经历了自 2026 年 4 月底起约 500 名用户的 beta。fugu-ultra-20260615 ID 钉住特定的 Fugu Ultra 版本,而 fugufugu-ultra 跟踪最新版。

Sakana 把这次发布框定为“一个起点,而非终点线”。由于 Fugu 建立在习得式编排而非固定工作流之上,它会随生态系统一同进步:路线图是扩大专家智能体池(含开源模型与 Sakana 自家模型)、强化对长时运行智能体任务的协调,并给用户更多对 Fugu 如何代其路由的控制。

适用场景

  • 长跨度的自动化研究与论文复现
  • 端到端的代码审查与安全评估
  • 必须绕过访问中断的厂商韧性部署

优缺点

优势

  • 通过编排可替换模型池达到前沿级结果——无单一厂商锁定
  • OpenAI 兼容 API;把现有客户端指向新 base URL 即可,无需 SDK 迁移
  • 擅长长而杂乱的智能体工作——研究、代码审查、安全评估

局限

  • 不是单一模型;质量、延迟与成本取决于路由与模型池
  • 编排 token 会加到账单——多智能体运行比单次模型调用更贵
  • 发布时在欧盟/欧洲经济区不可用(GDPR 合规待定);无开源权重

常见问题

Sakana Fugu 是什么?

Sakana Fugu 是东京 Sakana AI 推出的多智能体编排系统,于 2026 年 6 月 22 日发布。它本身是一个被训练来委派的语言模型——在单一 OpenAI 兼容 API 之后,它决定是直接回答请求,还是组建并协调一支专家模型团队,在内部处理选择、委派、验证与综合。

Sakana Fugu 是一个模型还是多个?

都是。从外部看,你通过一个 API 调用一个模型。内部,Fugu 可以直接解决请求,或把它路由到一个可替换的前沿与开源模型池(它甚至能递归调用自己)。多智能体系统的复杂度永远不会触及你的代码。

Fugu 与 Fugu Ultra 有何区别?

Fugu 是面向编码、代码审查与聊天机器人等日常工作的均衡、低延迟默认款。Fugu Ultra 在困难、多步问题上最大化答案质量,依据难度协调更深的模型池并在一到三个专家智能体之间路由。

Sakana Fugu 价格如何?

Fugu Ultra(`fugu-ultra-20260615`)固定为每 100 万输入 $5、每 100 万输出 $30,超过 272K 上下文升至 $10 / $45;缓存输入为 $0.50(超过 272K 则 $1.00)。编排 token 按同样费率计费。订阅计划为每月 $20(Standard)、$100(Pro)与 $200(Max),并对更重的用量提供按量付费。

我如何调用 Sakana Fugu API?

Fugu 是 OpenAI 兼容的。把 OpenAI SDK 指向 `https://api.sakana.ai/v1`,使用来自 console.sakana.ai 的 API key,并以 `fugu` 或 `fugu-ultra` 作为模型。Sakana 推荐 Responses API;Chat Completions 与 Models API 也受支持。

Sakana Fugu 在欧盟可用吗?

发布时不可用。在 Sakana 推进 GDPR 合规期间,该 API 在欧盟与欧洲经济区不可用。

Sakana Fugu 与 Claude Fable 5 相比如何?

Sakana 报告 Fugu Ultra 在最难的工程、科学与推理基准上与 Anthropic 的 Fable 5 及 Mythos Preview 并肩——这值得注意,因为两个 Anthropic 模型都不在 Fugu 的池中。Fugu Ultra 在 Terminal-Bench 2.1 上领先,但在 Humanity's Last Exam 上落后 Fable 5。把这些并肩主张当作厂商自报看待。

Sakana Fugu 的模型 ID 是什么?

模型 ID 为 `fugu`(默认)、`fugu-ultra`(最高质量),以及 `fugu-ultra-20260615`——一个钉住特定 Fugu Ultra 版本的带日期别名。

来源

最后更新:2026-06-22 · 规格与价格变动很快——使用前请在厂商官网核实。