7月24日,black forest labs正式推出全新多模态基础模型——flux 3。该模型基于统一架构设计,实现图像、视频与音频的联合训练,致力于构建对现实物理世界的深层次认知能力。
FLUX 3展现出卓越的多模态生成性能,支持文本生成视频、图像生成视频以及视频续写等多种任务,单次输出最长可达20秒、分辨率720p且具备原生音画同步的高质量视频。在初步基准测试中,其综合表现已超越Grok Imagine Video、Runway Gen-4.5及Luma Ray 3.2等当前主流视频生成模型。同时,该模型在图像合成与编辑任务上亦取得明显进步。
面向物理AI方向,Black Forest Labs携手mimic robotics共同研发了视频驱动的机器人动作模型FLUX-mimic,该模型依托FLUX 3的视频理解骨干网络,实现对机器人操作动作的精准预测。目前,FLUX-mimic已在奥迪工厂的实际产线环境中启动验证测试。FLUX 3 Video版本现已开启早期体验通道,图像生成能力及开源权重也将按计划分阶段发布。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜



















