FLUX 3 - Black Forest Labs 发布的首款多模态基础模型

堆友AI

FLUX 3是什么

FLUX 3 是德国 AI 公司 Black Forest Labs 发布的首款多模态基础模型,基于自研 Self-Flow 架构,在单一网络中统一训练图像、视频、音频与动作预测,实现真正的"全能模型"能力。首次支持原生音频同步生成,单次可输出最长 20 秒、720p 分辨率的高清音视频片段,对白、音效与画面动作精准对应,同时覆盖文生视频、图生视频、关键帧转场、多镜头叙事及情境内图像编辑等丰富功能。评测显示其表现超越 Luma Ray 3.2、Runway Gen-4.5 等主流模型。

FLUX 3 - Black Forest Labs 发布的首款多模态基础模型

FLUX 3的功能特色

  • 统一多模态架构:基于自研 Self-Flow 架构,在单一网络中联合训练图像、视频、音频与动作预测,实现真正的多模态一体化生成,而非多个独立模型的简单拼接。
  • 原生音频同步生成:首次原生支持音频输出,可生成与画面动作精准对应的对白、音效与环境音,单次最长输出 20 秒、720p 分辨率的音视频同步片段。
  • 文生视频(Text-to-Video):支持通过文字提示词直接生成带声音的高质量视频内容。
  • 图生视频(Image-to-Video):可将静态图片作为起始画面,扩展生成动态视频片段。
  • 视频转视频(Video-to-Video):支持对已有视频进行风格转换、内容改写与再创作。
  • 关键帧转场:可设定首尾关键帧,由模型自动补全中间的平滑过渡动画。
  • 多镜头串联:支持多镜头(Multi-shot)叙事生成,实现连贯的镜头切换与故事表达。
  • 多语言对白:支持生成多种语言的口型同步对白,适合全球化内容创作。
  • 图像生成与情境内编辑:延续 Flux Kontext 血统,支持高质量文生图与基于上下文的图像智能编辑(In-context Editing)。
  • 动作预测与机器人控制:衍生动作模型 FLUX-mimic 可将视频预测能力用于机器人灵巧操作,反应时间约 101 毫秒。

FLUX 3的核心优势

  • 性能表现领先:在早期人工评测(720p、10 秒带声片段)中,FLUX 3 对 Luma Ray 3.2 胜率达 93%、对 Runway Gen-4.5 达 77%,对 Seedance 2.0 和 Gemini Omni Flash 也略占优势,处于行业第一梯队。
  • 真正的多模态统一:不同于"多模型拼装"方案,Self-Flow 架构在单一网络中联合训练图像、视频、音频与动作预测,模态间理解更深、协同更自然。
  • 音视频原生同步:原生音频生成能力让对白、音效、环境音与画面动作精准对齐,省去后期配音与对口型的繁琐流程。
  • 画质与时长兼具:单次即可输出最长 20 秒、720p 分辨率的高清片段,满足短内容创作的实际需求。
  • 传承 Kontext 编辑基因:延续 Flux Kontext 的情境内编辑能力,图像合成与局部修改保持高度一致性。
  • 顶尖团队背书:黑森林实验室核心成员来自 Stable Diffusion 创始团队,技术积淀深厚,FLUX 系列已有广泛行业口碑。

FLUX 3官网是什么

  • Project website:https://bfl.ai/blog/flux-3

FLUX 3的操作步骤

  • 访问官方渠道:认准 Black Forest Labs 官网 https://bfl.ai/,进入 Models 板块找到 FLUX 3 页面(谨防第三方假冒网站)。
  • 申请抢先体验:目前 FLUX 3 Video 处于 Early Access 阶段,需通过官方页面填写申请表,提交邮箱与使用场景,等待官方审核邀请。
  • 登录体验平台:收到批准通知后,登录官方平台进入 FLUX 3 的创作界面。
  • Select Generation Mode:根据需求选择文生视频、图生视频、视频转视频、关键帧转场或多镜头串联等模式。
  • Enter the prompt:用文字描述想要的画面内容、镜头运动、人物动作,以及需要的对白语言、音效和环境音。
  • Setting parameters:配置视频时长(最长 20 秒)、分辨率(最高 720p)及是否启用音频生成等选项。
  • Generate & Preview:提交生成任务,等待模型输出音视频同步片段,在线预览效果。
  • 调整迭代:对不满意的部分修改提示词或关键帧重新生成,多轮打磨至满意效果。
  • 导出下载:将最终成品导出保存,用于后续剪辑或直接发布。

FLUX 3的适用人群

  • 短视频与自媒体创作者:适合需要快速产出带声视频片段的抖音、TikTok、YouTube Shorts 创作者,20 秒原生音频同步能力非常契合短内容需求。
  • MV 与音乐视频制作者:可利用音视频同步生成、多镜头串联能力,低成本制作音乐视频与视觉素材。
  • 影视与广告从业者:适合用于分镜预演、概念样片、广告创意快速验证,关键帧转场与多镜头叙事可满足专业表达。
  • 电商与营销团队:适合需要批量生成产品展示视频、口播素材的营销人员,多语言对白能力利于出海本地化。
  • 动漫与短剧创作者:可通过图生视频、视频转视频能力将插画、分镜稿快速动态化,降低漫剧、短剧制作成本。
  • 独立设计师与视觉艺术家:延续 Flux Kontext 的图像生成与情境内编辑能力,适合图像创作与视频创作一体化的艺术探索。

FLUX 3的常见问题

Q:FLUX 3 生成的视频规格是多少?

A:目前单次最长可生成 20 秒,720p 分辨率的视频片段,且原生支持音频同步生成(对白、音效、环境音与画面动作精准对应)。


Q:FLUX 3 支持哪些生成方式?

A:支持文生视频、图生视频、视频转视频、关键帧转场、多镜头串联、多语言对白,以及图像生成与情境内编辑。


Q:FLUX 3 的价格是多少?

A:目前 API 与定价尚未公布,将在 FLUX 3 Image 开放时一并公布。Early Access 阶段的费用政策需以申请页面官方说明为准。


Q:FLUX 3 开源吗?

A:FLUX 3 确认将发布开放权重版本(FLUX 3 Dev),延续"商业版 + 开源版"双轨策略,但具体发布时间与许可条款尚未公布。


Q:FLUX 3 相比其他模型水平如何?

A:早期人工评测(720p、10 秒带声片段)显示:对 Luma Ray 3.2 胜率 93%、对 Runway Gen-4.5 胜率 77%,对 Seedance 2.0 和 Gemini Omni Flash 约 52%,处于行业第一梯队。


Q:FLUX 3 能否用于机器人?
A:可以。BFL 与 Mimic Robotics 合作推出动作模型 FLUX-mimic,将视频预测能力用于机器人灵巧操作,已在奥迪工厂实测生产任务,反应时间约 101 毫秒。
© Copyright notes

Related posts

No comments

You must be logged in to leave a comment!
Login immediately
none
No comments...