视频模型谁最强?meme bench 用 400 位网友的盲选告诉你答案

视频模型谁最强?meme bench 用 400 位网友的盲选告诉你答案
选视频 AI 模型,是不是参数越大、越新就越强?还真不一定。字节的 Seedance 2.5 提升了电影质感、价格大涨,结果在指令遵循、复杂动作上反而倒退。到底怎么判断一个视频模型的真实水平?一个叫 meme bench 的社区盲测项目给了个很接地气的答案——别只看参数,让大量真实网友盲选比一比。
一、什么是 meme bench
meme bench 是一套短视频生成盲测。它筛选了 50 道 B 站、抖音上的热门梗题,每道题用相同图片 + 夸张提示词,让所有主流视频模型各自生成一段视频,然后找 400 多位大学生和网吧网友 在网站上盲选投票——不看品牌、不看参数,纯凭「这段 AI 视频看着好不好」。
它不按比分排名,而是用棋类比赛常用的 Elo 机制:战胜强模型加分多、输给弱模型扣分多,把所有两两对决连起来,算出模型间的相对实力。这套机制能避免打分次数不均影响排名。
一句话:模型好坏的定义权,交给更多普通人,而不是十几个研究员说了算。
二、结果出乎意料:Minimax H3 排第一
测试结果相当反直觉:
- Minimax H3 拿下第一,和 Seedance 2.0 得分接近,两者都明显领先 Seedance 2.5
- 一开始以为是样本量不足,扩大测试人次后,H3 的领先反而扩大,对 Seedance 2.5 保持了 55% 的胜率
(这个测试网站是公开的,你也可以自己上去做一轮题,你的选择也会计入排行榜。)
三、为什么是这个结果
Seedance 2.0:曾经的「王者」,但不完美
在 H3 和 2.5 发布前,Seedance 2.0 甩开其他模型一大截:短剧完成度最高、指令遵循最好,复杂场景画面更流畅丰富,还会自己剪辑运镜。但弱点是高阶动作不够连贯——有时一步到位的动作会「跳步」,比如放电的视频直接从放电切到一片死鱼,没有传导路径。
Minimax H3:升级版 Seedance 2.0
H3 强就强在极强的指令遵循,很多测试里画面连贯流畅,明显好过会在复杂动作里「省略过程」的 Seedance 2.0。它还更擅长生成复杂场景——比如一大群小鸟出现时,H3 有循序渐进的动作过程,而不是违反物理规律地「喷涌而出」。
Seedance 2.5:严重偏科的美术生
2.5 是画面最真实、最接近电影质感的模型——冷链车门打开鸡鸭追人的场景,它生成的画面完全像电影原片,看不出 AI 痕迹。但除了色彩质感和细节,其他能力并没有显著升级,复杂动作的连贯性反而倒退,大场景和具体细节之间的衔接很生硬,被网友吐槽「高级 PPT」。加上价格大涨,这套模型更像给片厂导演用的,而不是给普通人轻松上手的。
四、这件事的意义:审美该归大众
meme bench 想表达的核心观点很直接:不该由一小撮研究员或影视从业者来定义视频模型的美。
倾尽全力模仿电影可能成为「更好的电影」,却未必是「更好用的视频模型」。浓缩了整个互联网知识的大模型,最终应该为所有人服务——这也是为什么它选择用几百个普通网友的盲选来给模型排名,并开放网站让人人参与打榜。
五、怎么用起来
- 想测模型:上手 meme bench 网站,自己做一遍盲测,你的选择也会进排行榜
- 想选视频模型:如果重视指令遵循和复杂动作连贯,可以重点看名列前茅的模型;如果只在意最接近电影的画面质感且预算充足,Seedance 2.5 方向也值得试
- 想看全:完整的逐模型分析报告在文章的飞书链接里,篇幅有限,这份榜单把核心结论浓缩给你了
📌 提醒:榜单是「图生视频」场景下的比拼,考验复杂场景 / 激烈动作 / 指令遵循,可能恰好打在 H3 的舒适区——选模型时要结合自己的实际场景,别只看一个榜单下结论。