人工智能的进展因无用数据过剩而放缓——它们太多了
22
hardware
要把ChatGPT转变为“真实”机器人,不仅需要大量数据,还需要高质量、相关性强的信息。
财富杂志强调,人工智能行业正处于物理智能和环境模型新时代的门槛。这样的系统必须能够在现实空间中导航:在道路上行驶、叠衣服或协助复杂手术。为此,它们不只是需要“可加载”的数据,而是丰富、多维的信息集合。
为什么数据质量至关重要
1. 过度冗余与无用
在人工智能热潮中,出现了许多初创公司(Scale AI、Surge AI、Mercor),它们试图收集尽可能多的数据。这导致大量“空洞”文件的积累,这些文件并不有助于模型训练。如果研究人员无法过滤掉这些文件,物理人工智能的潜力将被低估。
2. 多维任务的复杂性
理解复杂世界需要更大规模的数据,但它们极难获取。因此工程师采用建模方法:创建真实场景的虚拟重构,以生成机器人和自动驾驶车辆的训练样本。
3. 低质量数据集的风险
不良数据可能导致不可预测的结果。一个例子是OpenAI停止支持视频应用Sora:该模型无法处理物理效果,影响了逼真的预测。
如何解决问题
- 清洗工具
机器学习专家需要能够自动删除多余数据、分析、归一化并校正数据集的技术。这将帮助从“噪声”中提取有价值的信息。
- 注重质量
当前限制因素是缺乏高质量数据。首先意识到这一点并开始投资其收集与处理的公司,将在打造真正可用的人工智能系统方面成为领导者。
因此,从文本模型过渡到能够在现实世界中行动的机器人,必须以系统化的方法提升训练数据质量。财富杂志强调,这一因素将决定物理智能的未来。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论