Black Forest Labs 推出 FLUX 3:從靜態影像到 20 秒影片與機器人運動
重點
Black Forest Labs 已在早期存取釋出 FLUX 3,這是其首個能夠產生最多 20 秒並具同步音訊的旗艦影片模型。相同的多模態骨幹驅動 FLUX-mimic,這是一個與 Zurich-based mimic robotics 共同開發的機器人應用,已由 Audi 試用於軟體組裝任務。 FLUX 3 的多模態訓練旨在捕捉底層物理特性──重量、接觸、時機──這使得既能產生令人信服的影片,也能將預測轉譯為實際機器人運動。 影片與動作功能目前透過 API 與合作夥伴提供,計劃於 2026 年稍後釋出開放「Dev」權重。
情感分析
- 整體語氣對技術進展與實際應用持正面且樂觀態度。以評測比較與合作夥伴試驗作為強大表現的證據。情感強度為中高,反映出熱忱但受限於早期存取與完全開放釋出的延遲所節制。
文章內容
Black Forest Labs (BFL) 在早期存取中推出 FLUX 3,標誌著該公司從靜態影像生成跨入影片領域的首度嘗試。FLUX 3 以真正的多模態方式同時在影像、影片與音訊上進行訓練,旨在將這些訊號統一於單一模型,而非結合多個分離工具。結果是一個能生成長達 20 秒的片段的生成器,且音訊會產生並與畫面事件(如對話、音效與環境聲)同步。
BFL 引述的人類偏好測試顯示強勁結果:評估者在直接比較中偏好 FLUX 3 胜過數個競品。這類測試在設計上是主觀的──評審觀看兩段片段並選出較具說服力者──但它們提供了模型在視覺與聽覺維度上具競爭力的初步指標。同時,FLUX 3 保留了 FLUX 系列一向擅長的彈性與風格範圍,能處理靜態與動態影像的寫實與風格化輸出。
BFL 將 FLUX 3 定位為不僅僅是內容創作工具。該公司主張訓練模型預測影片會迫使模型學習物理世界的面向──物體如何互動、運動如何隨時間展開,以及力與接觸如何表現。 這種對物理動力學的紮根是 BFL 更大雄心的核心:將模型預測轉譯為實際的機器人行為。 為了追求這個目標,BFL 與位於蘇黎世的 mimic robotics 共同開發了 FLUX-mimic,它在 FLUX 3 的內部運動表示上附加一個小型解碼器。該解碼器解讀模型學到的運動先驗,並將其映射為機器人驅動指令。
FLUX-mimic 已在工業合作夥伴處進行試驗。Audi 在如安裝可柔性車門密封條等任務上使用該系統──此類操作對傳統自動化而言較難可靠處理。公司聲明稱,整合後的系統能在約 101 毫秒內反應,這一反應時間可與人類視覺反射相當,從而使得動態、接觸敏感的操作成為可能,這是較舊型機器人難以執行的。
FLUX 3 的崛起延續了 Black Forest Labs 由曾參與早期生成影像研究的研究人員創立時就開始的發展軌跡。FLUX 系列模型先前在開源影像生成領域樹立了高標準,在數個基準與社群比較中獲得讚譽。隨著時間推移,其他專案的競爭改變了格局,但 FLUX 3 透過將能力延伸到影片與機器人領域,使研究室有望捲土重來。
在可用性方面,BFL 已對釋出做出限制:影片與動作功能目前可透過 API 與合作夥伴存取,而影像生成功能將在接下來數週內提供。公司計劃僅提供可供本地使用的開放「Dev」權重,但該釋出排定於 2026 年稍後而非立即。此分階段策略在以合作夥伴為中心的部署與受控的早期存取之間取得平衡,並朝向未來更廣泛的開放性邁進。
從技術與實務角度來看,FLUX 3 展現了朝向能同時服務創意與操作用途的多模態系統的趨勢。透過在多種模態上訓練,模型捕捉到視覺與聲音之間的連貫關係,並學習到在內容製作之外也有用的時間動力學。搭配輕量解碼器時,這些學到的動力學能用來指導物理控制策略,使得在工業環境中進行新的軟體與接觸豐富操作成為可能。
展望未來,關鍵問題包括泛化能力、安全性與實際環境的韌性。要將學到的運動先驗轉譯為安全且可重複的機器人控制,需謹慎驗證並與現有安全協定整合。如果這些挑戰能被克服,FLUX 3 與 FLUX-mimic 表明了一條路徑,生成模型不僅能創作媒體,還能幫助機器理解並在物理世界中採取行動。
關鍵洞見表
| 面向 | 描述 |
|---|---|
| 核心能力 | 使用單一多模態模型生成長達 20 秒的影片片段並同步音訊。 |
| 機器人整合 | FLUX-mimic 增加輕量解碼器以將模型預測映射為機器人動作;正由 Audi 試用於軟體任務。 |
| 表現 | 人類偏好測試在多個一對一比較中偏好 FLUX 3 胜過數個競爭者。 |
| 可用性 | 影片與動作現透過 API 與合作夥伴提供;影像生成將很快推出;開放「Dev」權重計劃於 2026 年稍後釋出。 |
| 影響 | 多模態訓練可能讓模型學習對真實世界機器人控制與進階內容創作有用的物理動力學。 |