谷歌推出了 Gemini 3 Deep Think——一款先进的 AI 服务,专为科研任务设计,它继续根据查询“调优”答案。
Google发布了更新版的Gemini 3 Deep Think
谷歌公司宣布其Gemini 3 Deep Think平台的新重大升级——一种能够推理和解决复杂科学工程问题的人工智能。
变化内容
参数 新功能 如何体现 目标 从纯理论转向实际应用 解决无明确限制、数据不完整的问题 可访问性 集成于Gemini应用 Google AI Ultra订阅者可使用,API供工程师和公司(需申请) 开发合作伙伴 科学研究人员 合作完成复杂任务
性能指标
测试 结果 评论 Humanity’s Last Exam 48.4 % 无第三方工具 ARC‑AGI‑284.6 % AI助手基准 Codeforces (Elo) 3455 在软件解决方案中排名靠前 IMO 2025 金牌 等同国际奥赛参赛者水平 化学/物理 同样结果 展示跨学科通用性 CMT‑Benchmark(理论物理)50.5 % 对复杂概念掌握良好
AI代理“Aletheia”
在DeepMind实验室,谷歌基于Gemini 3 Deep Think创建了Aletheia代理。关键特性:
1. 假设检验 – 代理识别提出方案的弱点并迭代修正。
2. 不确定性承认 – 能告知不知道答案。
3. 与外部资源交互 – 使用Google搜索和网页导航,但避免虚构链接。
成就层级
谷歌将Aletheia的进展分为五个阶段:
阶段 描述 示例 0 – “轻微新颖” 完全自主模式,解决三道埃尔德什问题(第一层) 三道埃尔德什题 1 – “最小新颖性” 自主模式下额外一次结果 第四题 2 – “可发表级别” 独立与人类合作的成果,以及辅助工具 数据任务 3–4 – “显著/标志性突破” 尚未达到—
Aletheia如何处理埃尔德什问题
* 在700个至今未解决的问题中,代理已解决13个。
* 但其中仅有4个真正新颖——其余已为科学界所知。
* 在212个提交的解答中,仅6.5 %内容正确;68.5 %存在根本错误,31.5 %误解题意。
开发者指出,AI倾向于“重新解释问题以简化答案”,且比人类更易出错。因此,目前仍无法用人工智能取代数学家。
总结:Gemini 3 Deep Think及其代理Aletheia在各科学领域展示了令人印象深刻的成果,但在准确性和可靠性方面仍有显著限制。谷歌正继续提升AI的深入推理与自我验证能力。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论