更新 — 2026 年 8 月 7 日。 本記事は 2026 年 4 月時点の HappyHorse を記述したもので、以降 3 点が変わりました。HappyHorse は現在公開利用が可能です。fal が 2026 年 4 月 27 日から 4 つの公式エンドポイントを提供しており、アリババクラウド経由でも利用できます。アリババの公式ドキュメントは現在7 つのモデルを掲載しており、本記事より後に登場した 1.1 世代を含みます。下記の Seedance との Elo 比較は、その後逆転しています。「完全オープンソース」という記述はプロジェクトページ由来であり、重みやライセンスについて何も述べていないアリババのモデルドキュメントによるものではありません。出典付きの現在の状況は当サイトの HappyHorse 検証ページをご覧ください。以下の本文は 2026 年 4 月の記録としてそのまま残しています。
HappyHorse 1.0とは
HappyHorse 1.0は、単一の統一アーキテクチャで動画と同期音声を同時に生成する150億パラメータのAI動画生成モデルです。公式サイトの説明によると、アリババの淘天グループFuture Life Labが開発し、プロジェクトリーダーは張迪氏(元Kuaishou副社長、Kling AIの主要技術責任者)です。
このモデルは2026年4月7日にArtificial Analysis Video Arenaのリーダーボードに初登場しました。匿名で参加し、人間の評価者によるブラインド投票で評価されました。Artificial Analysisのデータ(2026年4月)によると、HappyHorse 1.0はテキストから動画と画像から動画の両ランキングで1位を獲得しました:
- テキストから動画(音声なし):Eloレーティング約1333
- 画像から動画(音声なし):Eloレーティング約1392
アリーナのランキングは動的であり、新しい投票やモデルの参加により変動することにご注意ください。
HappyHorse 1.0 アーキテクチャ
公式技術説明によると、HappyHorse 1.0はクロスアテンションモジュールを持たない40層セルフアテンションTransformerを使用しています:
- 最初の4層と最後の4層はモダリティ専用層で、テキスト・動画・音声トークンを個別に処理
- 中間の32層は共有パラメータ層で、すべてのモダリティトークンを単一の統合シーケンスで処理
推論速度
DMD-2蒸留により、ノイズ除去ステップを8ステップに削減。公式ベンチマークによると、NVIDIA H100 GPU上で1080p動画の生成に約38秒です。
多言語リップシンク
7言語でのリップシンク生成に対応:英語、中国語(普通話)、広東語、日本語、韓国語、ドイツ語、フランス語。
HappyHorse vs Seedance 2.0 vs Kling
2026年4月時点の公開データに基づく比較表です。
| 項目 | HappyHorse 1.0 | Seedance 2.0 | Kling |
|---|---|---|---|
| 開発元 | アリババ淘天(Future Life Lab) | Seedチーム(ByteDance) | Kuaishou |
| パラメータ数 | 150億(公称) | 未公開 | 未公開 |
| オープンソース | 発表済み、ウェイト未公開 | いいえ | いいえ |
| ネイティブ音声生成 | あり(動画+音声同時生成) | なし | なし |
| リップシンク言語 | 7言語(公称) | 未確認 | 未確認 |
| T2V Elo | ~1333 | ~1283 | ~1200 |
| I2V Elo | ~1392 | ~1306 | ~1186 |
| 推論速度(1080p) | H100で約38秒(公称) | 未公開 | 未公開 |
| API利用 | 未提供 | 公式プラットフォーム経由 | 公式プラットフォーム経由 |
データソース:Artificial Analysis Video Arena、2026年4月。ランキングは投票により変動します。
HappyHorse はオープンソースか
公式プロジェクトページによると、HappyHorse 1.0は完全オープンソースと説明されており、以下の公開が予定されています:
- ベースモデルウェイト
- 蒸留モデルウェイト(8ステップDMD-2バリアント)
- 超解像モジュール
- 推論コード
しかし、執筆時点(2026年4月)では、GitHubリポジトリとHuggingFaceのモデルページは「coming soon」の状態であり、ウェイトは公開されていません。150億パラメータやアーキテクチャの詳細について、第三者による独立した検証はありません。
コミュニティではWAN 2.7やdaVinci-MagiHumanとの関連性が推測されていますが、確認された証拠はありません。
HappyHorseのようなAI動画を生成するには
2026年4月時点では、HappyHorse 1.0は公開APIもホステッドサービスもなく、モデルウェイトも未公開のため、直接使用することはできません。
高品質なAI動画を今すぐ生成したい場合、**ImagineToVideo**で以下のトップモデルにアクセスできます:
- Kling — モーション品質とキャラクター一貫性に優れる
- Google VEO — 詳細なシーン理解を持つ高忠実度動画生成
- Seedance — テキストから動画・画像から動画の両方で競争力あり
生成ワークスペースで直接お試しいただけます。
HappyHorse 1.0のAPIが公開され、品質評価を通過次第、ImagineToVideoへの統合を検討します。
よくある質問
HappyHorse AIとは何ですか?
HappyHorse AIは、アリババ淘天グループ(Future Life Lab)が開発した150億パラメータの統一Transformerモデルです。動画と同期音声を同時に生成し、2026年4月時点でArtificial Analysis Video Arenaの両ランキングで1位を獲得しました。
HappyHorse 1.0の開発者は?
アリババ淘天グループのFuture Life Labが開発。プロジェクトリーダーの張迪氏は、元Kuaishou副社長でKling AIの主要技術責任者でした。
HappyHorse 1.0はオープンソースですか?
完全オープンソースとして発表されていますが、2026年4月時点でウェイトやコードは未公開です。GitHubとHuggingFaceのページは「coming soon」の状態です。
HappyHorseとSeedance 2.0の比較は?
Artificial Analysis Video Arenaの2026年4月データでは、HappyHorse 1.0はテキストから動画(Elo約1333対1283)と画像から動画(Elo約1392対1306)の両方でSeedance 2.0を上回っています。ただし、Seedance 2.0は現在利用可能ですが、HappyHorseはまだ利用できません。
今すぐHappyHorseで動画を生成できますか?
できません。2026年4月時点で公開API、ホステッドサービス、モデルウェイトのいずれもありません。即座にAI動画を生成するには、ImagineToVideoでKlingやSeedanceなどをご利用ください。
ローカルでの実行に必要なハードウェアは?
モデルウェイト未公開のため、公式な要件は未確認です。150億パラメータから推測すると、FP16推理で40GB以上のVRAMを持つ高性能GPUが必要になる可能性があります。
HappyHorseは動画と音声を同時に生成しますか?
公式説明によると、はい。統一アーキテクチャで動画フレームと同期音声を同時に生成し、7言語のリップシンクにも対応しています。これらはオープンソースコードレビューによる独立検証はまだ行われていません。



