DeepSeek V4 是一款新的 AI 模型,需要针对中国的计算硬件加速器进行调优。
29
software
DeepSeek 正在准备发布新模型 V4
本周,根据《金融时报》报道,中国公司 DeepSeek 计划推出备受期待的多模态 AI 模型 V4。其特色是针对华为和寒武纪加速器进行优化,使中国企业能够推广自己的解决方案,而不必过度依赖进口技术。
关键日期与背景
- 模型发布将与中国议会会议同步,会议于 3 月 4 日开始。
- 这将是 DeepSeek 自去年一月推出 R1 模型以来最大的发布。那时有人声称新系统在效率上可与西方同类产品相媲美,同时成本显著更低。
问题与争议
此前发现,DeepSeek 在训练其系统时使用了美国模型的数据,并且曾依赖 Nvidia 加速器。然而,在中国,这些设备受到制裁。因此,公司有意不对 V4 进行 Nvidia 优化。
最初尝试在华为加速器上训练模型的效果并不理想,但 DeepSeek 如今计划提升与这些平台的兼容性。
市场影响
V4 针对华为和寒武纪的优化将刺激中国对这些硬件解决方案的需求,并降低进口依赖。专家预测,这将巩固中国 AI 市场的地位。
补充信息
V4 的摘要将在本周以简短形式发布;完整描述预计约一个月后公布。同时,美国公司 Anthropic 指责 DeepSeek 对其 AI 模型进行“蒸馏”,这加剧了国际间关于人工智能技术关系的紧张。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论