微软研究人员表示,AI模型尚未能解决复杂问题。

微软研究人员表示,AI模型尚未能解决复杂问题。

37 hardware

微软研究人员发现现代大型语言模型(LLM)在执行复杂多轮任务时的局限性

在一系列实验中,Microsoft Research 发现即使是最先进的 AI 模型,在被要求完成长期且多步骤操作时也会犯严重错误。测试系统包括 Gemini 3.1 Pro、Claude 4.6 Opus 和 GPT 5.4——平均每个模型在自主处理后失去约 25% 的文档内容。

具体测试内容
* DELEGATE‑52 基准
由菲利普·拉巴纳、托比亚斯·施奈贝尔和珍妮弗·尼维尔团队创建。它模拟了 52 个专业领域的工作流程:从编程和乐谱记谱到晶体学。

* 评估标准
模型根据其在 20 次处理循环后保持文档完整性的程度进行评分。“就绪”阈值设为 98%——若结果低于此阈值,则任务视为失败。

主要结论
领域 | 最佳表现 | 编程 | 最强指标 | 自然语言 | 最不可靠模型
---|---|---|---|---|---
* 质量下降
在超过 80% 的文档组合中,质量降至 80% 或更低。最佳模型(Gemini 3.1 Pro)仅在 52 个领域中的 11 个满足就绪标准。

* 跳跃式错误
损失不是逐步发生,而是“跳跃”式:一次交互循环中,模型可能损失 10% 至 30% 的准确性。更先进的模型(Gemini 3.1 Pro、Claude 4.6、GPT 5.4)试图避免细小错误,将其推迟到后期处理,并减少交互次数。

* 代理式管理
在使用工具进行代理式管理时,结果并未改善:循环结束时质量大约下降了 6%。

这对用户意味着什么
科学家强调,用户仍需仔细监控 AI 系统的工作,在授权其权限时保持警惕。目前模型只能在狭窄领域内实现自主操作。

然而,基准作者指出显著进展:OpenAI 模型族在 16 个月内将性能从 14.7% 提升至 71.5%。这表明 LLM 正在持续发展,但在复杂多轮任务上仍受限。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论