FLUX 3 Video —— 20 秒帶原生音訊,如果那些主張站得住的話
受審批的早期訪問。無公開 API,無公佈定價,無獨立實測。
FLUX 3 Video 是 Black Forest Labs 於 2026 年 7 月 23 日官宣的 FLUX 3 系列中的影片模型。BFL 主張它能在五種模式下單次生成 20 秒並原生帶音訊。本頁把這些規格與它們各自的驗證狀態並列擺出,同時告訴你今天有什麼能在不排隊的情況下把同樣的活幹了。
官方影片
看一下:Black Forest Labs 展示的 FLUX 3
Black Forest Labs 於 2026 年 7 月 23 日釋出的官方公告影片。片中每一段畫面都由 BFL 渲染——沒有任何一段是在 ImagineToVideo 上生成的,也沒有任何一段被第三方復現過。
FLUX 3 Video 規格 —— BFL 主張了什麼 vs 今天在跑什麼
單次生成 20 秒片段(官方主張)
Black Forest Labs 稱 FLUX 3 Video 單次生成最長 20 秒。而 Seedance 2.5 在本站單次已經能到 30 秒,所以 20 秒並不是紀錄。⚠️ 廠商主張;模型尚未公開發布,沒有任何第三方測量過。
原生音訊與多語種對白(官方主張)
音訊與畫面一同生成,而不是事後配音,並支援多語種對白、聲音與畫面事件對齊。公佈的評測在 720p 下進行。⚠️ 廠商主張,未經獨立復現。
一個模型五種生成模式(官方主張)
文生影片、圖生影片(動畫化或作為參考)、影片轉影片、影片與音訊續寫、關鍵幀生成影片,外加用於延長時長的 agentic chaining——全部出自 BFL 稱為 Self Flow 的同一套主幹。⚠️ 這是官方能力清單,不是已驗證清單。
今天就能跑的原生音訊影片
無需申請、無需排隊:Seedance 2.5(4–30 秒,480p/720p,含影片轉影片)、Kling V3 與 Kling V3 Omni(3–15 秒,720p/1080p)、VEO 3.1 與 VEO 3.1 Fast(4/6/8 秒,720p/1080p)、Seedance 2.0(4–15 秒,480p/720p/1080p)。全部支援原生音訊,全部已在 ImagineToVideo 上線。
FLUX 3 Video 瞄準什麼 —— 以及今天什麼能交付
對白類廣告片
原生音訊最核心的用法:一條提示詞,畫面與人聲一起出。VEO 3.1 今天就能做到,時長 4、6 或 8 秒——付費社媒短片的標準長度,且無需候補名單。
更長的單鏡頭
單次生成 20 秒是 FLUX 3 Video 被引用最多的數字(⚠️ 未實測)。而 Seedance 2.5 單次已經能跑到 30 秒(480p/720p),Kling V3 則提供每條 3–15 秒、最高 1080p——單鏡需求今天就能覆蓋,不必拼接。
多鏡頭序列
對於超過單次生成長度的內容,BFL 給出的答案是 agentic chaining。而 Kling V3 Omni 已經能在 ImagineToVideo 上串接連續鏡頭,並讓同一個角色貫穿其中。
改造已有素材
影片轉影片與影片音訊續寫都在 FLUX 3 Video 的官方模式清單裡。而 Seedance 2.5 的影片轉影片今天就在跑——傳入素材、參考圖或末幀,最長拿回 30 秒。
怎麼對待 FLUX 3 Video
去排隊,同時手上的片子照常出
先申請 FLUX 3 Video 早期訪問
FLUX 3 Video 卡在 Black Forest Labs 的申請審批方案之後。提交申請,然後繼續手上的活——在 BFL 批准之前沒有可呼叫的端點,也沒有可用於做預算的公佈定價。
把音訊寫進提示詞
把鏡頭描述、臺詞和環境音寫在同一段提示詞裡。所有原生音訊影片模型都是這麼讀輸入的——今天在跑的這些是,FLUX 3 自稱的那種也是——所以換模型後這條提示詞依然有效。
按活兒選模型
4、6、8 秒的人物對白:選 VEO 3.1。鏡頭運動與 15 秒單鏡:選 Kling V3。單條最長 30 秒,或改造已有素材:選 Seedance 2.5——影片轉影片也由它承擔。三者都在 /video/text-to-video 的同一個面板裡。
720p 出草稿,1080p 出終稿
先用便宜的 720p 鎖定運動與構圖,再只把成立的那一條重渲。需要多個鏡頭就去 /video/multi-scene 串接。等 FLUX 3 Video 開放後,把同一條提示詞重跑一遍做並排對比。
FLUX 3 Video 常見問題
FLUX 3 Video 是什麼?
FLUX 3 Video 是 Black Forest Labs 於 2026 年 7 月 23 日官宣的 FLUX 3 系列中的影片生成模型。它與影像、音訊在同一套主幹上聯合訓練,該方法 BFL 稱為 Self Flow;BFL 表示它把音訊與畫面一起原生生成,而不是作為單獨的配音環節。
FLUX 3 影片能做多長?解析度是多少?
Black Forest Labs 稱單次生成最長 20 秒,公佈的評測在 720p 下進行。其他解析度沒有披露,幀率同樣沒有披露。⚠️ 這兩個數字都出自 BFL 自己——模型尚未公開可用,因此早期訪問方案之外沒有人能驗證其中任何一項。
FLUX 3 Video 真的能生成聲音嗎?
這是官方的說法。BFL 稱音訊與影片一同原生生成,包括多語種對白,以及與畫面內物理事件對齊的聲音,並把影片與音訊續寫列為支援的模式。⚠️ 在 BFL 之外未經測試。如果你今天就需要原生音訊,VEO 3.1 與 Kling V3 已經能在 ImagineToVideo 上做到,無需候補名單。
FLUX 3 Video 支援哪些生成模式?
官方清單是:文生影片、圖生影片(作為動畫化或作為參考)、影片轉影片、影片與音訊續寫、關鍵幀控制的轉場,外加用 agentic chaining 拼出超過單次生成長度的序列。⚠️ 這是 BFL 公佈的能力清單,不是任何人已獨立跑通的行為集合。
FLUX 3 Video 和 Kling、VEO、Runway、Luma 比如何?
Black Forest Labs 公佈的偏好勝率是:對 Grok 69%、對 Kling v3 Pro 60%、對 Runway Gen-4.5 77%、對 Luma Ray 3.2 93%。⚠️ 這是廠商自評結果,不是獨立盲測——評測協議、樣本量、評分人數與提示詞集都未公佈。在 FLUX 3 Video 正式開放之前,你無法自己跑這個對比。
我能在 ImagineToVideo 上用 FLUX 3 Video 嗎?
今天還不能。FLUX 3 Video 處於受審批的早期訪問,既無公開 API 也無公佈定價,因此它不在我們的模型登錄檔裡。我們方案在官方 API 與定價公開後評估接入,先用實測規格對照官方主張,再折算成點數價格——時間取決於 Black Forest Labs,因此我們不承諾日期。Seedance 2.5、Kling V3 與 VEO 3.1 現在就可用,且支援原生音訊。