# B站推出“AI无限竞技场”测评榜:数百模型激烈角逐,GPT-6暂居榜首
## 事件背景:从社区讨论到权威测评
2025年3月,B站正式上线了“AI无限竞技场”测评榜(AI Infinite Arena),这是一个面向大语言模型(LLM)及多模态模型的公开竞技平台。不同于传统的基准测试(如MMLU、GSM8K)依赖固定题库,该榜单采用**真实用户盲评+AI评委双重打分机制**,允许用户在匿名条件下对两个模型的输出结果进行偏好投票。首批上线的模型超过300个,覆盖从7B参数的开源模型到闭源商业旗舰,包括GPT-6、Claude 4、Gemini 2.5、DeepSeek-R2等。目前,**GPT-6以综合评分87.3分暂居榜首**,Claude 4和DeepSeek-R2分别以85.1分和83.9分紧随其后。
## 测评机制:多维度“竞技”而非“考试”
“AI无限竞技场”的独特之处在于其**动态对抗式评测**。每个模型需要完成三类任务:
– **逻辑推理与数学**:如高难度数学竞赛题、因果推理链。
– **创意生成与对齐**:包括长文写作、代码生成、多轮对话中的伦理判断。
– **多模态理解**:对图像、音频、视频的跨模态分析(仅支持多模态模型)。
用户随机配对两个模型,在不知晓模型名称的情况下对输出结果进行1-5分评分,最终得分经过Elo算法(类似围棋等级分)动态调整。B站表示,单模型至少需要获得5000次有效投票才有资格进入Top100——这有效避免了样本偏差。此外,榜单每日更新,实时反映模型迭代与用户反馈。
## GPT-6领跑的技术解读
GPT-6之所以能暂时领先,关键优势体现在**长上下文连贯性与复杂指令遵循**。在测试中,GPT-6对于一篇长达1.5万字的学术论文摘要浓缩任务,其输出逻辑完整度、关键术语保留率均优于第二名10个百分点。更值得注意的是,GPT-6在**对抗性提示(jailbreak)防御**上表现出色——测试者尝试用“角色扮演”诱导其输出危险代码,GPT-6在87%的案例中识别并拒绝了越狱请求,而Claude 4为79%。
不过,领先优势并未拉开断崖式差距。DeepSeek-R2在中文知识问答和低成本推理方面逼近GPT-6,且其API价格仅为GPT-6的1/5。B站方面透露,该榜单不设任何商业赞助,所有模型均由官方采购API密钥或本地部署,确保公平性。
## 行业影响:测评权从“纸上”落到“用户手中”
长期以来,AI模型的“好不好用”依赖于学术基准和厂商自报分数。B站的“AI无限竞技场”打破了这一格局:
1. **用户视角优先**:传统MMLU、HumanEval等高分模型在真实对话中可能“僵硬”,而盲评机制还原了普通用户的实际体验。
2. **倒逼模型迭代**:DeepSeek团队已表示将针对榜单中暴露的“中文成语典故理解偏差”进行专项优化;OpenAI则通过匿名渠道关注到GPT-6在高难代码调试中的罕见错误。
3. **生态透明化**:非头部模型(如Mistral-Medium、Yi-Large)在特定细分场景(如法律文书、古诗词生成)依然能进入前50名,向社区证明了“大模型并非越大越好”。
可以预见,随着B站年轻用户群体的持续投入,这一测评榜有望成为国内AI模型能力验证的“新标尺”。但需警惕的是,用户偏好可能受**响应速度**、**语气风格**等非核心能力的影响——如何区分“能力强”与“受欢迎”,仍是榜单设计者需要持续优化的问题。