Black Forest Labs FLUX 3 抢先体验

面向文本、图片和源视频输入的 FLUX 3 AI 视频生成器

使用 FLUX 3 AI 视频生成器完成文生视频、图生视频和视频转视频创作,在同一个多模态世界模型里获得原生音频、多语言对白和更稳定的人物一致性。

最长 20 秒视频720p 首发工作流文本、图片、视频、音频提示词 + 参考控制
原生音频输出多语言对白最长 20 秒视频

FLUX 3 AI 视频生成器到底能做什么

Black Forest Labs 将 FLUX 3 定义为一个多模态基础模型,可同时从图像、视频、音频和语言中学习。这个首页把这套叙事落成一个更清晰的 AI 视频生成器,用来承接文生视频、图生视频和参考驱动创作。

支持文本、图片与视频输入

你可以从提示词直接生成,也可以从图片继续,或对源视频进行重演,同时保留主体、运动线索和整体氛围。

Prompt-led controlFewer manual retriesProduction-ready output

多语言角色与对白一致性

官方首发材料强调了更强的表情表现、多语言对白能力,以及在更长片段中通过参考保持角色一致性。

Prompt-led controlFewer manual retriesProduction-ready output

更适合多镜头串联

早期材料已经指向把多个片段串成更长序列的能力,这让它不仅适合创作者,也适合产品和内容团队。

Prompt-led controlFewer manual retriesProduction-ready output

原生音频生成

FLUX 3 试图让声音与物理事件更自然地对齐,因此撞击、说话和动作之间的因果关系会更连贯。

一个模型覆盖多种模态

FLUX 3 联合训练图像、视频和音频,让生成与理解共享同一个世界模型,而不是拆散成多个彼此割裂的流程。

排版与设计动画能力

除了电影感画面,FLUX 3 也被定位为能处理动态设计、强排版表现,以及多种比例和风格输出。

社区创作精选

看看创作者如何用多模态 AI 视频制作品牌短片、多角色场景与精致产品画面。浏览精选示例 — 电影感运动、参考引导控制与生产级画面质感,涵盖动感动作、时尚风格与氛围叙事。

动感场景,流畅镜头与丰富氛围。

动感场景,流畅镜头与丰富氛围。

舞蹈动作复刻,运镜流畅、动作真实。

舞蹈动作复刻,运镜流畅、动作真实。

产品向视觉,构图干净、运镜精致。

产品向视觉,构图干净、运镜精致。

户外梦幻场景,电影感色调与轻柔动态。

户外梦幻场景,电影感色调与轻柔动态。

时尚风格画面,角色细节跨帧保持一致。

时尚风格画面,角色细节跨帧保持一致。

电影感人像,柔和光影与自然动作。

电影感人像,柔和光影与自然动作。

角色驱动片段,身份稳定、动作富有表现力。

角色驱动片段,身份稳定、动作富有表现力。

都市氛围场景,层次丰富、节奏有电影感。

都市氛围场景,层次丰富、节奏有电影感。

风格化叙事画面,色彩鲜明、转场流畅。

风格化叙事画面,色彩鲜明、转场流畅。

适合产品视频、营销短片和高频概念迭代

这些使用场景把 FLUX 3 的多模态视频能力映射到真实工作流里,包括发布短片、讲解内容、多语言创意版本和参考驱动剪辑。

营销发布

生成短发布片、产品预告和广告变体,而不需要分别维护图像、视频和音频三套生成流程。

叙事原型

在进入高成本拍摄或后期之前,先验证场景、镜头想法和对白驱动的片段结构。

参考驱动的运动生成

以图片或源视频为参考,在保留主体和场景的前提下,探索不同节奏、风格和语境。

概念开发

预演剪辑、测试片段节奏,并用更短的反馈闭环推动团队和利益相关方达成一致。

本地化对白版本

围绕同一视觉基础,快速输出多语言口播和不同地区版本的创意内容。

声音驱动创意

用于节奏、声音与画面因果关系都很重要的场景,比如音乐宣发、品牌动态片和风格化剪辑。

使用流程

三步用好 FLUX 3 AI 视频生成器

先写提示词或上传参考,再明确动作与声音,最后生成一个可回看、可迭代的 FLUX 3 短视频版本。

01

从提示词或参考开始

如果你需要更强的主体、场景或构图控制,可以输入文本,也可以添加图片或源视频参考。

02

明确动作与声音

描述镜头感、动作、对白、语言和环境声,让模型有更清晰的因果目标。

03

生成并比较结果

先得到一个候选片段,再从节奏、连贯性和风格上比较,必要时用更具体的参考继续收窄。

步骤 1

预览检查

先看运动节奏、镜头能量和整体时机,再决定是否继续收窄。

提升 FLUX 3 视频结果的提示词建议

当提示更窄、更视觉化、并且明确写出音频意图时,FLUX 3 往往表现更好。这些建议适用于文生视频、图生视频和视频转视频。

先锚定一个主动作

先定义一个明确的物理事件或一个清晰主体动作,让片段有稳定的因果中心,而不是多段动作互相抢夺注意力。

身份一致时优先用参考

如果角色、产品或画面构图必须稳定,优先加入图片或源视频参考,不要只依赖文字描述。

把音频意图直接写出来

对白、环境音和撞击节奏都要明确写进提示词。FLUX 3 的关键卖点之一就是视听对齐,所以声音本身就是需求的一部分。

每次只改一个变量

如果结果偏得太远,就一次只调整一个因素:镜头运动、主体动作、台词内容或参考素材。

简单直接的首发定价

下面的套餐保留了当前公开价格梯度,同时把积分映射到早期 FLUX 3 视频工作流的实际消耗。

基础版

适合每月体验少量 FLUX 3 短视频生成

$0.030 / 积分

$14.90/月
$357.60$178.80/年省 50%
6,000 积分/年
  • 1,000 积分/月
  • 标准生成每次 20 积分
  • 支持文本、图片和视频输入
  • 支持 FLUX 3 原生音频工作流
  • 标准队列优先级
  • 无水印

工作室版

适合更高频的生产循环和更快迭代

$0.012 / 积分

$49.90/月
$1,197.60$598.80/年省 50%
48,000 积分/年
  • 8,000 积分/月
  • 标准生成每次 20 积分
  • 支持文本、图片和视频输入
  • 支持 FLUX 3 原生音频工作流
  • 最高队列优先级
  • 无水印

常见问题

这些回答基于 Black Forest Labs 于 2026 年 7 月 23 日发布的 FLUX 3 首发文章,以及 flux-3.com 的产品表达方式。

准备好把 FLUX 3 AI 视频生成器放进真实工作流了吗?

直接打开生成器,试一条文生视频或图生视频任务,把对模型的好奇心变成可执行的多模态视频流程。