支持文本、图片与视频输入
你可以从提示词直接生成,也可以从图片继续,或对源视频进行重演,同时保留主体、运动线索和整体氛围。
使用 FLUX 3 AI 视频生成器完成文生视频、图生视频和视频转视频创作,在同一个多模态世界模型里获得原生音频、多语言对白和更稳定的人物一致性。
Black Forest Labs 将 FLUX 3 定义为一个多模态基础模型,可同时从图像、视频、音频和语言中学习。这个首页把这套叙事落成一个更清晰的 AI 视频生成器,用来承接文生视频、图生视频和参考驱动创作。
你可以从提示词直接生成,也可以从图片继续,或对源视频进行重演,同时保留主体、运动线索和整体氛围。
官方首发材料强调了更强的表情表现、多语言对白能力,以及在更长片段中通过参考保持角色一致性。
早期材料已经指向把多个片段串成更长序列的能力,这让它不仅适合创作者,也适合产品和内容团队。
FLUX 3 试图让声音与物理事件更自然地对齐,因此撞击、说话和动作之间的因果关系会更连贯。
FLUX 3 联合训练图像、视频和音频,让生成与理解共享同一个世界模型,而不是拆散成多个彼此割裂的流程。
除了电影感画面,FLUX 3 也被定位为能处理动态设计、强排版表现,以及多种比例和风格输出。
看看创作者如何用多模态 AI 视频制作品牌短片、多角色场景与精致产品画面。浏览精选示例 — 电影感运动、参考引导控制与生产级画面质感,涵盖动感动作、时尚风格与氛围叙事。

动感场景,流畅镜头与丰富氛围。

舞蹈动作复刻,运镜流畅、动作真实。

产品向视觉,构图干净、运镜精致。

户外梦幻场景,电影感色调与轻柔动态。

时尚风格画面,角色细节跨帧保持一致。

电影感人像,柔和光影与自然动作。

角色驱动片段,身份稳定、动作富有表现力。

都市氛围场景,层次丰富、节奏有电影感。

风格化叙事画面,色彩鲜明、转场流畅。
这些使用场景把 FLUX 3 的多模态视频能力映射到真实工作流里,包括发布短片、讲解内容、多语言创意版本和参考驱动剪辑。
生成短发布片、产品预告和广告变体,而不需要分别维护图像、视频和音频三套生成流程。
在进入高成本拍摄或后期之前,先验证场景、镜头想法和对白驱动的片段结构。
以图片或源视频为参考,在保留主体和场景的前提下,探索不同节奏、风格和语境。
预演剪辑、测试片段节奏,并用更短的反馈闭环推动团队和利益相关方达成一致。
围绕同一视觉基础,快速输出多语言口播和不同地区版本的创意内容。
用于节奏、声音与画面因果关系都很重要的场景,比如音乐宣发、品牌动态片和风格化剪辑。
使用流程
先写提示词或上传参考,再明确动作与声音,最后生成一个可回看、可迭代的 FLUX 3 短视频版本。
如果你需要更强的主体、场景或构图控制,可以输入文本,也可以添加图片或源视频参考。
描述镜头感、动作、对白、语言和环境声,让模型有更清晰的因果目标。
先得到一个候选片段,再从节奏、连贯性和风格上比较,必要时用更具体的参考继续收窄。
预览检查
先看运动节奏、镜头能量和整体时机,再决定是否继续收窄。
当提示更窄、更视觉化、并且明确写出音频意图时,FLUX 3 往往表现更好。这些建议适用于文生视频、图生视频和视频转视频。
先定义一个明确的物理事件或一个清晰主体动作,让片段有稳定的因果中心,而不是多段动作互相抢夺注意力。
如果角色、产品或画面构图必须稳定,优先加入图片或源视频参考,不要只依赖文字描述。
对白、环境音和撞击节奏都要明确写进提示词。FLUX 3 的关键卖点之一就是视听对齐,所以声音本身就是需求的一部分。
如果结果偏得太远,就一次只调整一个因素:镜头运动、主体动作、台词内容或参考素材。
下面的套餐保留了当前公开价格梯度,同时把积分映射到早期 FLUX 3 视频工作流的实际消耗。
适合每月体验少量 FLUX 3 短视频生成
$0.030 / 积分
适合常规创意验证、营销和社媒内容输出
$0.017 / 积分
适合更高频的生产循环和更快迭代
$0.012 / 积分
这些回答基于 Black Forest Labs 于 2026 年 7 月 23 日发布的 FLUX 3 首发文章,以及 flux-3.com 的产品表达方式。