更新 — 2026 年 8 月 7 日。 本文描述的是 HappyHorse 於 2026 年 4 月的狀況,此後有三件事已經改變。HappyHorse 目前已可公開使用:fal 自 2026 年 4 月 27 日起提供四個官方端點,該模型也可透過阿里雲取得。阿里巴巴自家文件現已列出 七 個模型,包含本文寫作時尚未出現的 1.1 世代。而下文中與 Seedance 的 Elo 比較結果,如今也已逆轉。「完全開源」的說法出自專案頁面,而非阿里巴巴的模型文件;後者對權重與授權隻字未提。若想逐一對照各來源的最新狀況,請參閱我們的 HappyHorse 事實查核。以下文章保留原貌,作為 2026 年 4 月的紀錄。
HappyHorse 1.0 是什麼
HappyHorse 1.0 是一款擁有 150 億參數的 AI 影片生成模型,設計目標是在單一統一架構中同時產生影片與同步音訊。根據官方專案網站,它由阿里巴巴淘天集團的 Future Life Lab 開發,由張迪領軍——他過去曾任快手副總裁,也是 Kling AI 影片模型背後的關鍵技術負責人。
該模型於 2026 年 4 月 7 日首次出現在 Artificial Analysis Video Arena 排行榜上。它以匿名身分進入競技場,透過人類評審的盲測對決投票進行評估。根據 Artificial Analysis 排行榜資料(2026 年 4 月),HappyHorse 1.0 在 文字轉影片 與 圖片轉影片 兩項排名中皆登上首位:
- 文字轉影片(無音訊):Elo 評分約 1333
- 圖片轉影片(無音訊):Elo 評分約 1392
在測量當下,這些 Elo 分數領先所有其他受評模型。值得注意的是,競技場排名是動態的,會隨著新投票的累積與新模型的加入而變動。
HappyHorse 1.0 架構
根據官方技術說明,HappyHorse 1.0 採用 40 層自注意力 Transformer,不含交叉注意力模組。架構安排如下:
- 前 4 層與後 4 層為 模態專屬層,分別處理文字、影片與音訊 token。
- 中間 32 層為 共享參數層,在單一統一序列中處理所有模態的 token。
這種單一串流設計意味著文字提示詞、影片潛在表示與音訊 token 會串接成一條序列,在生成過程中共同去雜訊。根據專案說法,此方法讓模型無需分立的音訊或影片分支,就能學習跨模態關聯(例如嘴型與語音的對應)。
推論速度
據稱該模型採用 DMD-2 蒸餾,將去雜訊步數壓縮至 8 步。根據官方基準測試,這使其能在 NVIDIA H100 GPU 上約 38 秒 生成 1080p 影片。
多語言對嘴
其宣稱特色之一是支援 7 種語言的對嘴生成:英語、普通話、粵語、日語、韓語、德語與法語。根據專案說明,該模型能生成人物談話影片,且嘴型動作與上述任一語言的音訊輸出同步。
HappyHorse 與 Seedance 2.0、Kling 比較
下表根據截至 2026 年 4 月的公開資料,將 HappyHorse 1.0 與另外兩款知名 AI 影片生成模型進行比較。資料來源包括 Artificial Analysis Video Arena 與官方專案頁面。
| 面向 | HappyHorse 1.0 | Seedance 2.0 | Kling |
|---|---|---|---|
| 開發者 | 阿里巴巴淘天(Future Life Lab) | Seed 團隊(ByteDance) | 快手 |
| 參數量 | 150 億(宣稱) | 未確認 | 未確認 |
| 開源 | 已宣布,權重尚未釋出 | 否 | 否 |
| 原生音訊生成 | 是(影片+音訊聯合生成) | 否 | 否 |
| 對嘴語言 | 7 種語言(宣稱) | 未確認 | 未確認 |
| T2V Elo(Artificial Analysis) | 約 1333 | 約 1283 | 約 1200 |
| I2V Elo(Artificial Analysis) | 約 1392 | 約 1306 | 約 1186 |
| 推論速度(1080p) | H100 上約 38 秒(宣稱) | 未確認 | 未確認 |
| 最低硬體需求(本機) | 待定(權重未釋出) | 不適用(閉源) | 不適用(閉源) |
| API 供應狀況 | 尚未提供 | 透過官方平台 | 透過官方平台 |
資料來源:Artificial Analysis Video Arena,2026 年 4 月。排名會隨新投票累積而變動。
HappyHorse 是開源的嗎
根據官方專案頁面,HappyHorse 1.0 被描述為 完全開源,並計畫釋出以下項目:
- 基礎模型權重
- 蒸餾模型權重(8 步 DMD-2 版本)
- 超解析度模組
- 推論程式碼
然而,截至本文撰寫時(2026 年 4 月),GitHub 儲存庫與 HuggingFace 模型頁面仍標示為「coming soon」,尚未公開釋出任何權重。宣稱的 150 億參數量與上述具體架構細節,也沒有獨立第三方驗證。
社群臆測
在 AI 研究社群中,有人臆測 HappyHorse 與 WAN 2.7 或 daVinci-MagiHuman 等其他模型之間可能存在關聯。不過目前尚無確切證據佐證這些說法,HappyHorse 團隊也未公開回應相關討論。
建議
在模型權重實際釋出並經過獨立驗證之前,我們建議以適度保留的態度看待其宣稱的規格。Artificial Analysis 競技場結果是基於生成輸出的盲測評估,可獨立驗證;但內部架構的說法仍屬自行申報。
如何生成 HappyHorse 等級的 AI 影片
截至 2026 年 4 月,HappyHorse 1.0 尚未 提供公開 API 或代管推論服務。模型權重也未釋出,因此無法在本機執行。
如果你想在今天就生成高品質 AI 影片,ImagineToVideo 可讓你使用多款目前即可取用的頂尖模型:
- Kling — 動態品質與角色一致性表現出色
- Google VEO — 高擬真影片生成,場景理解細膩
- Seedance — 在文字轉影片與圖片轉影片任務上皆具競爭力
依照你的使用情境,每款模型各有所長。你可以直接在生成工作區試用,無需自行架設任何本機環境。
一旦 HappyHorse 1.0 的 API 公開開放並通過我們的品質評估,ImagineToVideo 將會考慮將其整合至平台。
常見問題
HappyHorse AI 是什麼?
HappyHorse AI 指的是 HappyHorse 1.0 模型,這是一款由阿里巴巴淘天集團(Future Life Lab)開發、擁有 150 億參數的統一 Transformer。根據官方說明,它能在單次前向傳遞中同時生成影片與同步音訊;截至 2026 年 4 月,它在 Artificial Analysis Video Arena 的文字轉影片與圖片轉影片排行榜上皆位居第一。
HappyHorse 1.0 由誰打造?
根據公開資訊,HappyHorse 1.0 由阿里巴巴淘天集團的 Future Life Lab 開發。專案由張迪領軍,他先前擔任快手副總裁,並且是 Kling AI 背後的關鍵技術負責人。
HappyHorse 1.0 是開源的嗎?
該專案已宣布為完全開源,並計畫釋出基礎模型權重、蒸餾模型權重、超解析度模組與推論程式碼。不過截至 2026 年 4 月,尚未公開釋出任何權重或程式碼,GitHub 與 HuggingFace 頁面仍停留在「coming soon」狀態。
HappyHorse 與 Seedance 2.0 相比如何?
根據 2026 年 4 月的 Artificial Analysis Video Arena 資料,HappyHorse 1.0 在文字轉影片(Elo 約 1333 對約 1283)與圖片轉影片(Elo 約 1392 對約 1306)的盲測評估中皆勝過 Seedance 2.0。HappyHorse 另宣稱具備原生音訊生成與多語言對嘴功能,這是 Seedance 2.0 目前所沒有的。不過,Seedance 2.0 現在就能使用,HappyHorse 則否。
我現在可以用 HappyHorse 生成影片嗎?
不行。截至 2026 年 4 月,HappyHorse 1.0 沒有公開 API、沒有代管服務,模型權重也尚未釋出,因此無法直接使用。若想立即生成 AI 影片,ImagineToVideo 等平台提供包括 Kling 與 Seedance 在內的其他頂級模型。
在本機執行 HappyHorse 需要什麼硬體?
由於模型權重尚未釋出,硬體需求尚未獲得官方確認。以宣稱的 150 億參數量推估,在本機執行大概需要具備充足 VRAM 的高階 GPU(FP16 推論預估需 40GB 以上),但在權重釋出前這仍屬推測。
HappyHorse 會連同影片一起生成音訊嗎?
根據官方專案說明,是的。HappyHorse 1.0 採用統一架構,在單一去雜訊流程中同時生成影片畫格與同步音訊,並宣稱支援 7 種語言的對嘴輸出。這些說法尚未透過開源程式碼審查取得獨立驗證。



