🟡 🛡️ 安全 发布于: · 2 分钟阅读 ·

Sakana AI:Fugu-Cyber在CyberGym测试中达86.9%,在CTI-REALM测试中达72.1%,与GPT-5.5-Cyber相当

用于分析网络安全漏洞的多智能体AI系统抽象示意图

Sakana AI推出了Fugu-Cyber,一个专为网络安全设计的多智能体编排系统,对外表现为单一模型。该模型在CyberGym漏洞分析测试中达到86.9%,在CTI-REALM威胁情报翻译测试中达到72.1%,与GPT-5.5-Cyber和Mythos-Preview相当。可通过API访问,但需人工审批。

🤖

本文由人工智能基于一手来源生成。

Fugu-Cyber是什么,为何表现为单一模型?

Sakana AI推出了Fugu-Cyber,一个多智能体编排系统——即多个专职AI智能体协作完成任务的架构——专为网络安全设计。尽管内部协调多个智能体,该系统对用户而言表现和响应均如同单一模型,各组件之间没有可见的切换过程。

CyberGym与CTI-REALM测试结果

Fugu-Cyber在CyberGym测试中达到86.9%的成功率,该基准测试衡量在复杂真实代码中分析漏洞的能力。在CTI-REALM测试中,该模型达到72.1%,该测试检验将威胁情报——从各种来源收集的威胁情报数据——转化为安全系统具体检测规则的能力。Sakana AI表示,这两项结果均与GPT-5.5-Cyber和Mythos-Preview这两款专注于类似网络安全领域的领先竞品模型相当。

谁可以使用Fugu-Cyber?

该模型的访问入口为API端点sakana.ai/fugu,但仅限于Sakana Token Plan的订阅用户。每一次访问请求都需经过人工审批,用户必须先提供已验证的联系方式才能获得API密钥。这种审批模式遵循该公司的可接受使用政策(Acceptable Usage Policy),该政策明确禁止将工具用于攻击性滥用——例如利用系统开发攻击而非用于防御。

为何与GPT-5.5-Cyber的可比性很重要?

两项基准测试的结果表明,尽管采用了不同的多智能体架构,Fugu-Cyber在性能上并未明显落后于竞争对手的专用模型。对安全团队而言,这意味着在漏洞分析和威胁情报处理工具市场上多了一个选择,且访问控制比目前常见的API产品更为严格。与GPT-5.5-Cyber和Mythos-Preview的比较表明,多智能体架构尽管增加了编排的复杂性,却不一定意味着在专业网络安全任务上性能更低——相反,多个智能体的协调在需要同时进行代码分析和情报解读的任务中可能反而是一种优势。

常见问题

Fugu-Cyber是什么,如何运作?
Fugu-Cyber是Sakana AI推出的专为网络安全任务设计的多智能体编排系统,内部协调多个专职智能体,但对用户而言表现和呈现为单一模型。
Fugu-Cyber在安全测试中的表现如何?
Fugu-Cyber在衡量复杂代码漏洞分析能力的CyberGym测试中达到86.9%的成功率,在衡量将威胁情报转化为检测规则能力的CTI-REALM测试中达到72.1%,与GPT-5.5-Cyber和Mythos-Preview模型的结果相当。
谁可以访问Fugu-Cyber模型?
访问权限仅限于Sakana Token Plan的订阅用户,每个请求都需经过人工审批和已验证联系方式,符合禁止将该工具用于攻击性滥用的可接受使用政策(Acceptable Usage Policy)。

📬 AI 新闻直达您的邮箱

按您的方式定制每日摘要——自选主题、来源和频率,一键退订。