人工智能机器人在与人长时间对话时效率下降——微软的一项大型研究证实了这一点。

人工智能机器人在与人长时间对话时效率下降——微软的一项大型研究证实了这一点。

44 hardware

微软研究与Salesforce的研究:大型AI模型在对话中失去方向感

研究内容
哪些模型 200 000+ 多轮对话,主要LLM GPT‑4.1、Gemini 2.5 Pro、Claude 3.7 Sonnet、OpenAI o3、DeepSeek R1、Llama 4

关键发现
指标 | 结果
---|---
单次查询准确率 | 90 % 正确回答(GPT‑4.1、Gemini 2.5 Pro)
长对话准确率 | ~65 %,效率下降近三分之一
模型行为 | 常常“重复”最初错误答案作为后续回复的基础
答案长度 | 在多轮会话中增加 20–300 %,导致幻觉和推测增多
可靠性 | 降至 112 %(模型过早生成回答,未完整读取请求)

为什么会这样?
1. 重复错误基础
模型坚持最初的结论,即使它是错误的,也用来构建后续答案。
2. 上下文膨胀
每个新问题都会添加更多文本,增加“虚构”事实的数量,模型将其误认为真实信息。
3. 思考令牌问题
即便有额外“思考令牌”(o3、DeepSeek R1),也无法突破此陷阱——它们仍会过早生成答案且缺乏充分分析。

这对用户意味着什么?
- 真实对话中的可靠性低
AI可能失去主题,开始谈论不存在的事物。
- 错误信息风险
放弃传统搜索引擎而转向生成式工具(如 Google‑AI 评论)会增加获取不准确信息的概率。
- 高质量提示的重要性
微软曾指出在创建查询时工程水平低下。失败的问题和“糟糕”的提示可能导致 AI 无法发挥潜力。

结论
大语言模型技术仍处于发展阶段。虽然它们在单次查询中表现出高准确率,但在多轮对话中的可靠性仍是问题。为安全有效地使用 AI,重要的是:

1. 写清晰、具体的问题。
2. 准备好纠正模型的回答。
3. 不完全依赖生成内容,而要核实事实。

最终,通过改进模型并提升其在长对话中的稳健性,是让 AI 成为用户可靠伙伴的关键。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论