B站上线AI无限竞技场,百款大模型由UP主实测打榜

4 阅读

B站搞了个新玩法:让UP主给AI模型“打擂台”

9月16日,B站悄悄上线了一个叫“AI无限竞技场”的新页面。名字听着有点中二,但内容挺实在——它把平台上上百个AI大模型的实测视频集中起来,按UP主的测评结果排了个动态榜单。

文章配图

首期公布的排名里,GPT-6 Astra拿下了最多UP主的认可,在10位参与测评的创作者中被8位评为表现最佳,力压国产模型GLM-5.3登顶。有意思的是,前五名里有三个是中国团队研发的模型:除了GLM-5.3,还有通义千问和月之暗面的Kimi。

文章配图

这个竞技场不是靠官方跑分,也不是实验室数据堆出来的。它的核心逻辑很简单:让真实用户——也就是B站各分区的UP主——用自己的工作流或兴趣项目去“试用”这些模型,然后拍视频说清楚谁好用、谁翻车。

不跑分,只看“能不能干活”

传统的大模型评测往往依赖标准测试集,比如MMLU、HumanEval这些。但普通用户根本不在乎模型在某个学术基准上得了多少分,他们关心的是:“这玩意儿能帮我写代码吗?”“能理清复杂的法律条款吗?”“画图会不会崩手?”

B站的思路是绕过这些抽象指标,直接看实战。比如一位编程区UP主可能让所有模型写一个爬虫脚本,看谁的代码能一次跑通;知识区UP主可能丢给它们同一份财报,比谁的分析更准确、更有洞察;甚至有人让模型玩文字冒险游戏,测试上下文理解和长期记忆能力。

目前竞技场已收录对ChatGPT、Claude、Gemini、DeepSeek、豆包、MiniMax、Hy等主流模型的对比内容。每个测评都来自真实视频,点进去就能看到完整过程,包括模型输出、人工修正、最终效果,甚至UP主的吐槽弹幕。

这种“野生测评”虽然不够标准化,但胜在场景多样、视角多元。一个模型可能在数学题上碾压对手,但在处理中文网络梗时频频掉链子——这类细节恰恰是用户最在意的。

为什么是B站?

过去一年,B站的AI相关内容消费时长涨了72%,每月有超过1.9亿用户在这里看AI相关的视频。从模型发布、开箱体验、使用教程,到故障排查、创意应用、社区共建,B站的视频+弹幕+评论生态天然适合技术爱好者深度交流。

很多开发者习惯先在B站搜“XX模型实测”,而不是去看厂商白皮书。因为这里能看到真实用户的反馈:有人用千问做自媒体脚本生成,有人拿Kimi读论文,还有人用DeepSeek辅助量化交易。这些案例拼凑出的,才是模型真正的“能力地图”。

“AI无限竞技场”本质上是对这种自发内容的系统化整理。它不生产评测,只是把散落在各处的优质实测聚合起来,打上标签、排个序,方便后来者快速找到参考。

榜单会变,规则开放

目前的排名基于首批参与的UP主内容,但B站明确表示,这个榜单是动态更新的。只要你的视频符合要求(比如包含多模型同题对比、有明确评判标准),就可以报名加入竞技场。

这意味着今天的榜首明天可能就被拉下马——如果有更多UP主发现GPT-6 Astra在某些场景下其实不如国产模型,排名自然会调整。这种机制某种程度上比静态榜单更接近真实世界:没有永远的王者,只有不断被验证的适用性。

不过也要提醒一句:UP主的主观偏好会影响结果。比如偏爱简洁输出的创作者可能给Claude高分,而喜欢“话痨”风格的可能更倾向ChatGPT。所以看榜单时最好点进原视频,结合自己的需求判断。

用户真正需要什么?

这场“竞技”背后,其实反映了AI落地的一个关键转变:从参数竞赛走向场景适配。

早期大家比谁家模型参数多、训练数据大。现在用户更关心“在我这个具体任务里,哪个模型最省心”。B站的做法恰好抓住了这一点——它不告诉你模型有多强,而是展示它在某个具体任务里干得怎么样。

比如有位UP主测试了七款模型生成短视频脚本的能力。结果发现,虽然GPT-4 Turbo整体得分高,但在处理“东北方言+网络热梗”混合文本时,千问反而更自然。这种细微差别,只有在真实创作场景中才会暴露出来。

另一个例子是代码生成。有开发者让模型实现一个带权限控制的API接口。GPT-6 Astra写的代码结构清晰但漏了异常处理;GLM-5.3虽然语法稍显啰嗦,但安全校验一步没少。如果你正在做企业级开发,后者可能更靠谱。

别把榜单当圣旨

尽管“AI无限竞技场”提供了难得的真实视角,但它终究不是万能标尺。UP主的测试样本有限,覆盖的场景也未必全面。而且不同人的“好用”标准差异很大——有人要速度,有人要准确,有人图个乐子。

更合理的做法是把榜单当作起点,而不是终点。看到某个模型在你关心的领域表现不错,就去找对应的原视频,看看它到底怎么解决问题的。如果可能,自己也动手试试。

B站这次没搞什么宏大叙事,也没吹“颠覆行业”,就是搭了个台子,让真实用户的声音被听见。在这个AI hype满天飞的时代,这种克制反而显得珍贵。

目前竞技场页面已经开放,链接是 https://www.bilibili.com/blackboard/era/aiarena.html。你可以按模型、按UP主、按测评类型筛选,也能直接提交自己的测评视频申请加入。

至于GPT-6 Astra能不能一直坐在头把交椅上?恐怕得看接下来几个月有多少UP主愿意挑战它了。