思科发现,即使看似完美的 AI 网络事件报告,也不应被视为真相的原因。

思科发现,即使看似完美的 AI 网络事件报告,也不应被视为真相的原因。

42 software

Cisco Talos 正在研究大型语言模型在生成网络安全报告方面的准确性

Cisco Talos Incident Response 团队进行了一项测试,以确定现代 LLM(ChatGPT、Claude 和 Gemini)在生成技术性的网络事件报告时有多可靠。结果显示,即使是看起来最“专业”的文件也包含事实错误、不一致和不符合规范的问题。

研究如何进行
* 准备 – 研究人员向每个模型提供了关于事件的原始笔记,并请其撰写报告。
* 输出 – 所有三个 LLM 都生成了视觉上精致的文档,但在详细分析后发现了不准确之处和意外结论。

Nate Pors,Cisco Talos 事故响应高级负责人,在公司博客中详细描述了结果。

LLM 为什么会“出错”
Cisco 将问题归因于模型的概率特性:它们根据统计权重预测下一个词,而不是理解意义。Pors 表示,这些偏差体现在四个方向:

1. 不同的数据片段
每次请求时,模型依赖输入的不同部分,使得难以获得可复制和标准化的结果。

2. 不一致的结论
同样的数据可能导致不同的建议:一份报告可能建议全组织强制更改密码,而另一份则仅提出局部修改。模型往往停留在第一次生成的建议,即使它不合适。

3. 非标准结构
由于 LLM 按标记逐个生成文本,最终文档可能具有不同的结构和格式,在需要模板以确保质量控制的环境中尤为关键。

4. 上下文窗口问题
当输入量超过上下文限制时,模型可能“忘记”会话开始的重要信息,从而产生不可预测或混合的结果。

这对网络安全意味着什么
Cisco 承认理论上可以将任务限定在报告的特定片段,但这种方法会失去用户节省时间的优势。在网络防护领域,即使是小错误也可能代价高昂。因此,最终文档的作者必须仔细核查每个词语,而不能完全依赖 LLM 的建议。

结论:大型语言模型能够快速生成报告,但其输出需要专家进行强制性审核,以避免在关键网络事件背景下出现错误和不一致。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论