人工智能的进展因无用数据过剩而放缓——它们太多了

人工智能的进展因无用数据过剩而放缓——它们太多了

21 hardware

要把ChatGPT转变为“真实”机器人,不仅需要大量数据,还需要高质量、相关性强的信息。

财富杂志强调,人工智能行业正处于物理智能和环境模型新时代的门槛。这样的系统必须能够在现实空间中导航:在道路上行驶、叠衣服或协助复杂手术。为此,它们不只是需要“可加载”的数据,而是丰富、多维的信息集合。

为什么数据质量至关重要
1. 过度冗余与无用

在人工智能热潮中,出现了许多初创公司(Scale AI、Surge AI、Mercor),它们试图收集尽可能多的数据。这导致大量“空洞”文件的积累,这些文件并不有助于模型训练。如果研究人员无法过滤掉这些文件,物理人工智能的潜力将被低估。

2. 多维任务的复杂性

理解复杂世界需要更大规模的数据,但它们极难获取。因此工程师采用建模方法:创建真实场景的虚拟重构,以生成机器人和自动驾驶车辆的训练样本。

3. 低质量数据集的风险

不良数据可能导致不可预测的结果。一个例子是OpenAI停止支持视频应用Sora:该模型无法处理物理效果,影响了逼真的预测。

如何解决问题
- 清洗工具

机器学习专家需要能够自动删除多余数据、分析、归一化并校正数据集的技术。这将帮助从“噪声”中提取有价值的信息。

- 注重质量

当前限制因素是缺乏高质量数据。首先意识到这一点并开始投资其收集与处理的公司,将在打造真正可用的人工智能系统方面成为领导者。

因此,从文本模型过渡到能够在现实世界中行动的机器人,必须以系统化的方法提升训练数据质量。财富杂志强调,这一因素将决定物理智能的未来。

评论 (0)

分享你的想法——请保持礼貌并围绕主题。

暂无评论。留下评论,分享你的观点!

要发表评论,请先登录。

登录后发表评论