

盲测屠榜,第一匹跑赢字节的马。
2026年4月7日,一个叫HappyHorse-1.0的匿名模型忽然空降全球权威AI视频盲测平台Artificial Analysis的Video Arena榜单。在没有发布会、没有技术博客、没有任何公司背书的情况下,它把字节跳动的Seedance 2.0、快手的可灵AI、Google的Veo 3 Fast等一批大厂产品全部斩于马下。
这是什么概念?Artificial Analysis的评分机制不是跑分,而是把同一句提示词丢给不同模型生成视频,随机拉来几千名真人用户盲测评选。谁生成的东西让普通人觉得“看起来更舒服、更真、更有电影感”,谁就涨分。这比常见的刷榜跑分更接近真实感受。
榜单数据相当硬气:在无音频的文生视频赛道,HappyHorse Elo得分约1330+,领先Seedance 2.0超过100分;图生视频同样断层第一。仅在带音频的综合榜单上,Seedance 2.0以极微弱优势保持领先。
三天悬疑大戏后,4月10日阿里正式揭盅——没错,这匹马姓“阿里”,出自新成立的ATH创新事业部。
三大核心参数与功能对照:
维度 | HappyHorse 1.0 | Seedance 2.0 (即梦) | 可灵3.0 |
|---|---|---|---|
生成机制 | 原生音视频联合生成 | 先画后配再对口型 | 分步生成 |
支持语言 | 中/粤/英/日/韩/德/法 7种 | 中文为主 | 中文为主 |
单次推理耗时 | 1080p约38秒 | 视排队而定(日常小时级) | 数分钟 |
免费额度 | 千问APP每日10次 | 有但排队严重 | 有限 |
定价(720P) | 0.44元/秒(Pro) | 会员制 | 约13.44元/分 |
多镜头叙事 | 支持15秒自动分镜 | 依赖提示词 | 基础支持 |
实时音画同步 | 一次推理直接出成片 | 需后期拼接 | 部分支持 |
视频编辑 | 支持风格化/重组/替换 | 基础编辑 | 基础 |
适合人群 | 专业创作者+小白 | 进阶创作者 | 中高阶 |
原生音画一气呵成,不是“拼接怪”。
目前市面上大部分视频模型的运作逻辑是这样的:第一步生成无声画面,第二步用别的工具配上语音,第三步再用另一个工具对齐口型。几道工序下来如同接力传话,时间叠加上去不说,误差也在累积。
HappyHorse走了另一条路——原生多模态统一生成。150亿参数,40层统一自注意力Transformer架构,把文本、图像、视频、音频四种模态的token全部塞进同一个序列里联合建模,一次性完成视频画面与同步音频的输出。
直观感受就是:角色说话时嘴唇在动的同时,人物微表情、背景脚步声、下雨的环境音一并到位。这种一体化方案在画面质感上有肉眼可见的优势,表现在以下方面:
1. 电影级画质,镜头感拉满
不是滤镜调色堆出来的廉价“电影感”。实测中,同样的提示词丢给多个模型,其他模型往往选择“固定机位”这种最不容易出错的保守方案。而HappyHorse像一位懂行的摄影指导——情绪收紧的地方镜头推近,需要交代环境的地方给全景,背后有一套叙事逻辑在驱动运镜与切镜时机。
2. 15秒多镜头叙事,自动分镜
只需一段简单描述,HappyHorse就能自动生成多镜头视频,配合对应的运镜和切镜转场。对于短剧创作者尤为有价值——不必一个镜头生成一帧再手动拼接,直接一句Prompt拿走一组小段落。
3. 七语对口型,声音情绪两不误
支持普通话、粤语、英语、法语、韩语、日语、德语七种语言的口型同步。更关键的是词错误率在同类模型中保持最低水平,角色不仅嘴唇对得上,语调中的情绪变化也与微表情联动,不再出现“音画两张皮”的尴尬。
4. 视频编辑能力
除了从零生成,HappyHorse还支持对已有视频进行二次创作——风格化转换、镜头重组、画面增强、音频替换,零代码快速剪辑。

三步走完,零排队开始。
普通用户开车路线——千问APP:
更新至最新版本,首页下方即可看到“HappyHorse”入口。点击进入后自由选择视频比例(16:9、9:16、1:1等),设定时长(5/10/15秒),支持最高1080p分辨率,每日赠送免费体验额度,生成一段5秒视频通常仅消耗1个额度,等待时长约2-3分钟。
企业/专业用户路线——官网 & 阿里云百炼:
访问 happyhorse.cn 或阿里云百炼平台注册,新用户注册即赠送100积分,可生成3-15秒视频,5个画幅比例自由调节。

电影感在线,短板也在明处。
用千问APP实测:输入一段岩井俊二风格的日剧片段描述,要求过曝柔光、逆光镜头、慢动作和浅景深。生成结果中,人物与背景的层次分离自然细腻,大光圈与浅景深的处理极为克制,整套5秒短片段带着完整的情绪递进——不是短视频常见的碎片化节奏,而是接近于电影语言本身的叙事感。
国联民生证券的研报有另一面的评价:画面饱满、场景真实,但在涉及复杂动作和多人物互动的镜头中,分镜控制稳定性仍不及Seedance 2.0成熟。
客观来说:文戏和氛围感的呈现是它的强项,直接拉满;但涉及高强度的动作场景和多角色交互时,动作僵硬、人物变形等问题偶尔浮现。这不影响它作为当前短剧创作工具中效果最稳定的一支——适合剧情向短剧,动作片建议结合更多后期手法。
三把武器在手,一个人做出工业化效果。
一个完整的AI短剧制作流程大致如下:
🔹 生文:剧本 → 🔹 生图:分镜与角色资产 → 🔹 生视频:成片输出
第一步、剧本创作(生文)
首选Gemini 3.1 Pro,备选GPT-5.4、Claude Opus 4.6或国产Qwen 3.6 Plus、豆包。把小说或原稿丢进去,让模型分析情节转折点、生成分镜脚本、标记每个镜头的画外音与氛围提示。
第二步、角色与场景资产(生图)
首选Nano Banana 2高质量生成角色定妆照与场景背景,备选Banana Pro、Midjourney,国内可用Seedance 2.0、Z-image。生成的角色图确保面部、服装、发型在后续生成视频时可作为参考图锁定一致性。
第三步、生成成片(生视频)——欢乐马正式登场
把分镜脚本和角色参考图按顺序输入HappyHorse,一句描述即可输出15秒多镜头叙事段落,音画同步一步到位。如果要更强的物理动作连续性,可以用Seedance 2.0作为补充。其他备选包括国外的Veo 3.1、Runway,以及国内的Vidu Q3、Kling 3.0。
完整流程工具一览:
步骤 | 目的 | 首选工具 | 备选工具 |
|---|---|---|---|
生文 | 剧本/分镜 | Gemini 3.1 Pro | GPT-5.4 / Qwen 3.6 Plus / 豆包 |
生图 | 角色/场景/道具 | Nano Banana 2 | Midjourney / Z-image |
生视频 | 成片输出 | HappyHorse 1.0 | Seedance 2.0 / Veo 3.1 / Kling 3.0 |
长剧本一键 | 短剧Agent | 小云雀(手机友好) | 即梦AI / LibTV |
其中,字节旗下的小云雀上线了短剧Agent功能——上传最多10万字剧本后一键直出视频成片,自动完成分镜、台词、字幕、音效、转场等工作,是零基础创作者的极速上手之选。小红书随便搜一下就能看到很多个零基础作者用它在平台成功变现的案例。

小结AI短剧目前正处于流量红利期,红果APP的推荐榜首已开始出现AI剧的身影。普通人完全可以用“Gemini写剧本→Nano Banana做角色资产→HappyHorse一次性出片→剪映整理润色”这条工艺链,用极低成本跑完原本需要一个剧组才能完成的生产流程。短视频平台对于AI生成内容的流量扶持仍在上升期,趁工具最顺手、成本最低的窗口,多跑两条赛道总是没错的。
#AI短剧 #HappyHorse #欢乐马 #AI生视频 #阿里开心马 #一人公司 #短剧制作 #即梦排队解决 #AI创作 #视频生成 #千问APP