彭博研报:DeepSeek V4.1 Flash 助力中美顶尖模型跑分差距缩至 3%

AI 驱动中国 叶舟 347次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

彭博行业研究指出,随着 DeepSeek 等中国 AI 实验室模型不断进步,美国 AI 公司相对中国同行的性能领先优势急剧缩小。特别是在 DeepSeek 发布 V4.1 Flash 后,中美顶尖模型在基准测试得分上的差距已收窄至 3%,引发对美国科技主导地位及出口限制有效性的讨论。

驱动中国10月5日消息,彭博行业研究最新报告显示,过去几个月内,以 DeepSeek 为代表的中国 AI 实验室模型性能显著提升,导致美国 AI 公司相对于中国同行的领先优势急剧缩小,降至历史最低水平。这一变化被认为对美国在人工智能领域的科技主导地位构成了挑战。

彭博行业研究高级分析师罗伯特·利亚(Robert Lea)在周一发布的报告中指出,自 DeepSeek 于9月发布 V4.1 Flash 模型以来,中国顶尖模型在国际基准测试中的得分仅落后于美国竞争对手 3%。相比之下,今年5月这一差距约为 9%,而在今年早些时候,差距曾高达 15%。

利亚分析认为,这种性能的持续提升意味着中国 AI 竞争者有望进一步扩大其市场份额。报告指出,中国模型技术的崛起主要得益于其 AI 专业能力的不断深化,以及研究人员针对国产硬件进行模型优化的能力。这些技术进展也引发了外界对美国限制技术出口政策有效性的质疑。

据彭博社报道,利亚在报告中称,中国取得的进展“进一步让人质疑美国在 AI 领域的科技主导地位能否长期维持”。作为佐证,DeepSeek 的 V4.1 Flash 模型在上月的 LiveBench 全球排名中位列第六。这是自 DeepSeek 凭借推理模型 R1 在 2025 年取得突破以来,排名最高的中国模型。LiveBench 通过评估 AI 模型对问题、谜题或任务的回答与分析能力进行评分,其机制类似于衡量人类智商。

数据显示,DeepSeek 最近一次在 LiveBench 上的得分为 81.1 分,而 Anthropic 的最高得分为 83.4 分。利亚表示,这一得分差距表明 DeepSeek 模型的表现已经“可以与 Anthropic、OpenAI 的领先 AI 系统相媲美”。不过,尽管得分差距已缩小至 3%,但在 LiveBench 评选出的前 15 个模型中,仅有 3 个来自中国。

利亚同时提醒,此类排名具有动态变化特征,且无论模型在排行榜上的具体排名如何,其商业化变现过程仍可能面临困难。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525208.html
本文价值 ★★★★★ 5 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友

分享卡已生成

长按下方图片保存,转发到朋友圈或微信群

分享卡