ChatGPT、Gemini 和 Claude 对 AI 导致职业消失的评估相互矛盾,科学家们对其可靠性持怀疑态度
关键研究思想
北西大学和美国大学的经济学家发现,三大语言 AI 模型(ChatGPT‑5、Gemini 2.5 和 Claude 4.5)对哪些职业面临自动化风险给出了不同评估。这质疑了“AI 受影响指数”的可靠性——政策制定者和雇主在规划未来劳动力市场时使用的数值指标。
1. 研究如何进行
步骤 做了什么 任务设定 请模型评估各职业对 AI 的脆弱性 答案比较 将评估与真实数据对照 原因分析 发现两个关键因素:模型自身差异和已使用 AI 的专业人员影响。
2. 结果
职业 Claude 4.5 Gemini 2.5 ChatGPT‑5
会计师 高脆弱性 低 中等
广告经理 — 高级管理层 —
* 分歧
- Claude 将会计师排在前列,Gemini 则显著更低。
- 广告经理和高管的评估也存在差异。
- ChatGPT 与 Gemini 在约 75% 的案例中一致,但相差约四分之一。
* “AI 用户”影响
金融分析师积极使用神经网络,创建未来模型训练的数据。这偏移了评估,使已与 AI 紧密相关的职业在模型眼中更易受影响。
3. 受影响指数如何构建
1. 手工——专家评估 AI 对具体任务的影响。
2. 用户调查——收集已使用平台者的意见。
3. 大型语言模型(LLM)——自动生成评估。
* 问题:
- 手工易受主观性影响。
- 调查局限于单一平台,未覆盖整个市场。
尽管如此,这类指数在分析报告、咨询和政策制定中被广泛使用。
4. 对实践的意义
* 评估可靠性——尚不清楚 LLM 是否比专家方法更准确预测。
* 单指标决策风险——作者警告,政策制定者和雇主可能错误地依赖单一数字。
5. 研究人员建议
1. 同时使用多种 AI 模型,而非仅用一个。
2. 明确指出结果的不确定性水平。
3. 用真实用户调查验证结论,以了解 AI 实际应用和执行的任务。
> “我个人不会依赖单一指标来决定换工作或选择专业,”米歇尔·英说。
结论:
当前的 AI 受影响指数需要更批判性的处理方式。结合多模型与经验数据将使预测更可靠,避免基于片面评估做出错误决策。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论