国产大模型周榜:多款新模型上榜细分领域

AI 驱动中国 韩序 1,300 次阅读 62 条评论
分享 Q

驱动中国9月7日消息,Arena(arena.ai)平台本周发布2026年第36周(8月31日~9月6日)AI大模型盲测排名。本期榜单迎来多款重量级新模型,其中多款国产模型在细分榜单上表现亮眼,首次入榜即冲进头部阵营,引发业内关注。

在前端开发能力分榜中,阿里巴巴的qwen3.8-max-0902首次入榜便位列第4名,成为本期该榜单中排名最高的国产模型。同属阿里的qwen3.8-flash-next、腾讯的hy4-preview以及智谱的glm-5.3-flash也于本周首次进入榜单,并一同杀入前15名。多款国产模型集中出现在前端开发榜前列,反映出国内厂商在前端代码生成与工程助手这一细分方向上的积累正在加速兑现。

AI视频生成分榜同样迎来重大变化。阿里推出的wan3.0首次入榜就闯入前三名,成为本期视频榜的最大亮点之一。该模型的排名上升,直观展现出国产生成式视频模型在产品能力和用户偏好层面对海外头部产品的追赶态势。虽然当前视频生成赛道仍由海外模型占据主导,但国产模型在特定场景下的竞争力已不容忽视。

综合榜单方面,头部排名整体保持稳定。claude-fable-5以1507分继续位居榜首,claude-opus-4-6-high以1505分紧随其后,两者分差仅2分,在误差范围内被视为并列水平。本期综合榜迎来两款新模型:Anthropic的claude-fable-5.1-max首次入榜便以1504分拿下第3名,表现相当强势;谷歌的gemini-3.8-flash-high则以1494分位列第8名,目前仍处于preliminary(初步)阶段,后续排名或将继续调整。

从前10名的整体情况看,所有入围模型得分均在1492分以上,相互之间分差小于30分,整体竞争异常胶着。ELO积分本身反映的是用户在匿名盲测中的主观偏好,而并非模型的绝对能力测试,因此头部梯队中任何一个名次的变动都可能在统计误差范围内发生,不宜简单理解为能力高下之分。

国产模型在综合榜上整体处于中上游位置,梯队相对稳定。月之暗面的kimi-k3-max排名最高,位列第12名,ELO得分1489分,与上周持平。智谱glm-5.3-max位列第20名,得分1482分,较上周下降5位。阿里qwen3.8-max位列第22名,得分1480分,较上周下降2名。尽管部分模型名次出现小幅波动,但国产模型在第一梯队之后的卡位相对牢固,与头部海外模型的积分差距也维持在较小范围内。

需要说明的是,Arena榜单基于匿名盲测投票,通过ELO算法(智能体榜为百分比信号)计算排名,反映的是用户群体的主观感受与使用偏好,而非标准化测试下的客观能力排序。不同分榜之间相互独立,不宜跨榜直接比较;分差处于误差范围内时均被视为并列。此外,新模型需要积累足够的投票量后才会被正式纳入榜单,因此本期部分新入榜模型的最终排名仍可能随投票数据增加而发生变化。

综合来看,本期周榜释放出两个明确信号:一是头部通用模型竞争进入白热化阶段,领先者之间的分数差距几乎可以忽略不计;二是国产模型正在从综合能力追赶,转向在特定细分榜单中实现集中突破。前端开发和AI视频生成作为当前产业落地最活跃的两大方向,正成为国产大模型厂商秀肌肉的新战场。随着更多新模型陆续通过投票积累期,后续榜单格局仍存在较大变数。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 4.5 64 人已评
登录后为本文打分
网友评论62 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友

分享卡已生成

长按下方图片保存,转发到朋友圈或微信群

分享卡