Fugu Ultra 是由日本 AI 独角兽
Sakana AI 推出的
多智能体系统(Multi-Agent System),核心理念可以用一句话概括:
“One Model to Command Them All” —— 一个模型,指挥所有。
它不是一个单体大模型,而是一个动态编排层。Fugu Ultra 会从全球顶尖的闭源和开源模型池中,实时选择、组合、协调多个专家智能体,像一个指挥家一样,让它们协作完成复杂的多步骤任务。而你只需要调用一个 OpenAI 兼容的 API。

Fugu Ultra 网站截图
二、核心特色:为什么 Fugu Ultra 不只是”模型路由”
市面上不乏”模型路由器”——根据任务简单地把请求转发给 GPT 或 Claude。但 Fugu 做的事情要深得多:
1. 动态角色分配与多轮协作
Fugu 的底层基于两篇 ICLR 2026 论文:TRINITY 和 Conductor。
换句话说,Fugu 不是”选一个模型来回答”,而是“组建一个临时团队来攻关”。
2. 单一 API,零集成负担
Fugu 提供 OpenAI 兼容 API,意味着你可以直接替换现有代码中的模型端点,无需重写集成逻辑。Fugu 负责在后台完成:
-
模型选择与切换
-
智能体编排
-
多轮协作管理
-
结果汇总与验证
3. 灵活可控的模型池
你可以控制哪些模型能进入 Fugu 的协作池,按需排除特定提供商或模型。这对数据隐私、合规要求严格的团队尤为重要。
三、两个版本:Fugu vs Fugu Ultra
| 版本 |
定位 |
适用场景 |
| Fugu |
性能与延迟平衡 |
日常编码、代码审查、响应式聊天机器人 |
| Fugu Ultra |
极致性能 |
Kaggle 竞赛、论文复现、网络安全分析、文献专利调研 |
Fugu Ultra 协调了更深、更广的专家智能体池,专门攻克高难度、高价值的问题。
四、性能表现:数据说话
Sakana 公布了一系列严格的基准测试结果,对比对象包括 GPT 5.5、Gemini 3.1 Pro、Opus 4.8、Fable 5、Mythos Preview 等
前沿模型。
亮眼成绩:
-
GPQA-D(科学问答):Fugu Ultra 95.5分,与 Fugu 并列第一,超越 Mythos Preview(94.6)
-
LiveCodeBench(代码能力):Fugu Ultra 93.2分,Fugu 92.9分,双双领先 Fable 5(89.8)
-
CharXiv Reasoning(论文推理):Fugu Ultra 86.6分,超越 Mythos Preview(86.1)
-
SWEBench Pro(软件工程):Fugu Ultra 73.7分,仅次于 Fable 5(80.0)
-
CTI-REALM(网络安全情报):Fugu Ultra 69.4分,领先 Mythos Preview(68.5)
更关键的是:Fugu 提供了前沿级性能,同时没有出口管制风险。
五、背后的技术哲学
Sakana AI 的核心方法论是“自然启发式 AI”(Nature-inspired AI),借鉴生物进化、群体智能等原理。Fugu 延续了这一思路:
不是让人类工程师去预设”哪个模型做什么”,而是让系统自己学习如何最优地编排和协作。
这种”涌现式协作”往往能发现人类设计师想不到的高效模式——比如某个开源小模型在特定验证环节的表现,反而优于顶级闭源模型。
六、使用门槛与限制
七、适合谁?
Fugu Ultra 特别适合以下场景:
-
需要处理复杂多步骤任务(如深度研究、代码生成与调试)
-
对单一模型供应商有顾虑,希望降低依赖风险
-
追求前沿性能,但受限于特定模型的出口管制或合规要求
-
已有 OpenAI API 集成,想无缝升级到更强的多智能体能力
总结
Fugu Ultra 代表了一种新的 AI 使用范式:你不再需要选择”用哪个模型”,你只需要提出”要做什么”。剩下的——选谁、怎么分工、如何协作——交给 Fugu 的智能编排系统。
在一个模型爆炸、能力碎片化的时代,Fugu 提供了一种优雅的解决方案:把复杂性藏在 API 后面,把智能呈现在结果前面。