Claude Mythos 已通过测试被确认为漏洞检测的领导者,但它也表现出其他缺点
简体中文翻译:
公司 XBOW 对 Anthropic 的 Mythos Preview AI 模型进行了独立评估。结果显示,该模型在源代码漏洞搜索、原生代码和逆向工程方面优于现有同类,但在孤立代码分析和验证所发现的利用案例的实际可行性方面表现出弱点。模型成本仍是一个问题:Mythos 比 Opus 更昂贵,但在有限的令牌预算下,它有时能展示更高的准确率。
1. XBOW 检查了什么
- 测试量——一系列关于 Mythos Preview 的独立实验。
- 场景——对可访问源代码的运行系统进行审计,孤立代码分析,逆向工程以及与图形界面的交互。
2. 关键结论
| 指标 | Mythos Preview | 对比模型 |
|---|---|---|
| 漏洞检测 | 在所有模型中最佳,尤其在源代码和原生编程方面。 | 较不精确,但有时在特定案例检查更可靠。 |
| 误报过滤 | 去除的“假阳性”比前辈多。 | 经常产生更多虚假警报。 |
| 孤立代码问题 | 在缺乏系统上下文时表现较差。 | 一些模型在逐行分析上更好。 |
| 利用验证 | 倾向于字面解释,有时高估发现的实际价值。 | 对真实可用性更为苛刻。 |
| 逆向工程与原生代码 | 表现强劲;能“理解”无源代码程序逻辑。 | 在这些任务上精度略低。 |
| UI 交互 | 并不总是准确定位元素坐标,但能成功识别浏览器中的必要操作。 | 一些模型在定位方面更精准。 |
3. 成本与效率
- 定价——Anthropic 表示 Mythos 的价格将比 Opus 高五倍。
- 经济分析——XBOW 对“廉价”模型进行了实验,给它们更多工作时间。结果显示,在成本标准化后,Mythos Preview 在高精度任务中并不显得奢侈。
- 基准测试——在固定令牌预算下,Mythos 在 Web 漏洞搜索上超过 Opus 4.6,但落后于 GPT5.5。
4. 总结
Mythos Preview 在源代码审计、原生程序以及逆向工程和 Web 应用分析方面展现出卓越性能。然而,该模型有时低估了所发现漏洞的实际可行性,并在孤立代码分析中表现弱。资源有限时,Mythos 可能比 Opus 更具成本效益;但在完整预算下,GPT5.5 仍是竞争对手。
XBOW 的结论:Mythos Preview 是识别源代码和复杂系统潜在漏洞的可靠工具,但需要额外验证所发现利用案例的实际价值。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论