更新 —— 2026 年 8 月 7 日。 本文描述的是 2026 年 4 月的 HappyHorse,此后有三点变化。HappyHorse 现已公开可用:fal 自 2026 年 4 月 27 日起提供四个官方端点,阿里云百炼亦可调用。阿里官方文档现已列出七个型号,其中 1.1 一代在本文写作之后才出现。下文对 Seedance 的 Elo 领先关系此后已经反转。「完全开源」这一说法出自项目页而非阿里的模型文档,后者对权重与许可证只字未提。当前逐条附来源的口径见我们的 HappyHorse 事实核查页。下文保持原样,作为 2026 年 4 月的记录。
什么是 HappyHorse 1.0
HappyHorse 1.0 是一个 150 亿参数的 AI 视频生成模型,采用统一架构在单次推理中同时生成视频和同步音频。据官方网站描述,该模型由阿里巴巴淘天集团 Future Life Lab 开发,项目负责人为张迪——前快手副总裁,也是 Kling AI 视频模型的核心技术负责人。
该模型于 2026 年 4 月 7 日首次出现在 Artificial Analysis Video Arena 排行榜上。它以匿名身份参赛,通过人类评审的盲测投票进行评估。据 Artificial Analysis 排行榜数据(2026 年 4 月),HappyHorse 1.0 在文生视频和图生视频两个排名中均登顶:
- 文生视频(无音频):Elo 评分约 1333
- 图生视频(无音频):Elo 评分约 1392
需要注意的是,竞技场排名是动态变化的,会随着新投票和新模型的加入而调整。
HappyHorse 1.0 架构
据官方技术描述,HappyHorse 1.0 使用 40 层自注意力 Transformer,不包含交叉注意力模块。架构组织如下:
- 前 4 层和后 4 层是模态专用层,分别处理文本、视频和音频 token。
- 中间 32 层是共享参数层,在单一统一序列中处理所有模态的 token。
这种单流设计意味着文本提示、视频隐变量和音频 token 被拼接成一个序列,在生成过程中联合去噪。据官方声称,这种方法使模型能够学习跨模态关联(例如唇部动作与语音匹配),无需单独的音频或视频分支。
推理速度
据报道,该模型使用 DMD-2 蒸馏技术将去噪步骤减少到 8 步。据官方基准测试数据,这使得在 NVIDIA H100 GPU 上生成 1080p 视频仅需约 38 秒。
多语言唇型同步
据称支持 7 种语言的唇型同步生成:英语、普通话、粤语、日语、韩语、德语和法语。
HappyHorse vs Seedance 2.0 vs Kling
以下表格基于 2026 年 4 月的公开数据,对比 HappyHorse 1.0 与另外两个主流 AI 视频生成模型。
| 维度 | HappyHorse 1.0 | Seedance 2.0 | Kling |
|---|---|---|---|
| 开发者 | 阿里淘天(Future Life Lab) | Seed 团队(字节跳动) | 快手 |
| 参数量 | 150 亿(官方声称) | 未公开 | 未公开 |
| 开源状态 | 已宣布,权重待发布 | 否 | 否 |
| 原生音频生成 | 是(视频+音频联合生成) | 否 | 否 |
| 唇型同步语言 | 7 种语言(官方声称) | 未确认 | 未确认 |
| T2V Elo 评分 | ~1333 | ~1283 | ~1200 |
| I2V Elo 评分 | ~1392 | ~1306 | ~1186 |
| 推理速度(1080p) | H100 上约 38 秒(官方声称) | 未公开 | 未公开 |
| API 可用性 | 尚未提供 | 通过官方平台 | 通过官方平台 |
数据来源:Artificial Analysis Video Arena,2026 年 4 月。排名随投票变化而调整。
HappyHorse 是否开源
据官方项目页面描述,HappyHorse 1.0 被定义为完全开源,计划发布以下组件:
- 基础模型权重
- 蒸馏模型权重(8 步 DMD-2 变体)
- 超分辨率模块
- 推理代码
然而,截至撰写时(2026 年 4 月),GitHub 仓库和 HuggingFace 模型页面均标注为"即将推出",尚未实际发布任何权重。目前没有第三方独立验证其声称的 150 亿参数量或具体架构细节。
社区讨论
在 AI 研究社区中,有关于 HappyHorse 与 WAN 2.7 或 daVinci-MagiHuman 等模型之间潜在关联的猜测。但目前没有确认的证据支持这些说法,HappyHorse 团队也未公开回应这些讨论。
建议
在模型权重实际发布并经过独立验证之前,我们建议对官方声称的技术规格保持适当的审慎态度。
如何生成类似 HappyHorse 的 AI 视频
截至 2026 年 4 月,HappyHorse 1.0 没有公开可用的 API 或托管推理服务,模型权重也未发布,因此无法在本地运行。
如果您希望立即生成高质量的 AI 视频,ImagineToVideo 提供了多个当前可用的顶级模型:
- Kling — 在运动质量和角色一致性方面表现出色
- Google VEO — 具有详细场景理解能力的高保真视频生成
- Seedance — 在文生视频和图生视频任务中均具有竞争力
您可以直接在生成工作台中试用,无需搭建任何本地基础设施。
一旦 HappyHorse 1.0 的 API 公开可用并通过我们的质量评估,ImagineToVideo 将考虑将其集成到平台中。
常见问题
HappyHorse AI 是什么?
HappyHorse AI 是指 HappyHorse 1.0 模型,一个由阿里巴巴淘天集团(Future Life Lab)开发的 150 亿参数统一 Transformer。据官方描述,它在单次前向传播中联合生成视频和同步音频,截至 2026 年 4 月在 Artificial Analysis Video Arena 的文生视频和图生视频排行榜上均排名第一。
谁开发了 HappyHorse 1.0?
据公开信息,HappyHorse 1.0 由阿里巴巴淘天集团的 Future Life Lab 开发,项目负责人为张迪,他此前曾担任快手副总裁,是 Kling AI 的核心技术负责人。
HappyHorse 1.0 是开源的吗?
该项目已宣布完全开源,计划发布基础模型权重、蒸馏模型权重、超分辨率模块和推理代码。但截至 2026 年 4 月,尚未发布任何权重或代码,GitHub 和 HuggingFace 页面仍处于"即将推出"状态。
HappyHorse 与 Seedance 2.0 相比如何?
根据 2026 年 4 月的 Artificial Analysis Video Arena 数据,HappyHorse 1.0 在文生视频(Elo 约 1333 对 1283)和图生视频(Elo 约 1392 对 1306)的盲测评估中均优于 Seedance 2.0。HappyHorse 还声称支持原生音频生成和多语言唇型同步,而 Seedance 2.0 目前不提供这些功能。但 Seedance 2.0 目前可以使用,而 HappyHorse 尚不可用。
我现在可以使用 HappyHorse 生成视频吗?
不可以。截至 2026 年 4 月,HappyHorse 1.0 没有公开 API、没有托管服务,模型权重也未发布。如需立即生成 AI 视频,ImagineToVideo 等平台提供了 Kling 和 Seedance 等顶级模型的访问。
本地运行 HappyHorse 需要什么硬件?
由于模型权重尚未发布,硬件需求未经官方确认。根据声称的 150 亿参数量,本地运行可能需要具有大量显存的高端 GPU(FP16 推理估计需要 40GB 以上),但在权重发布之前这仍是推测。
HappyHorse 能否同时生成音频和视频?
据官方项目描述,可以。HappyHorse 1.0 使用统一架构,在单次去噪过程中联合生成视频帧和同步音频,还声称支持 7 种语言的唇型同步输出。这些声称尚未通过开源代码审查得到独立验证。



