7月23日,德国人工智能新锐企业黑森林实验室(black forest labs)正式推出全新多模态基础模型flux3,为生成式视频技术发展树立关键里程碑。该模型依托自主研发的self-flow架构,集成面向图像、视频、音频及动作信号的专用编解码器,首次实现对现实物理空间与虚拟数字环境的一体化感知与协同生成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

作为业内首个原生支持音频合成的端到端视频生成模型,Flux3可一次性生成时长高达20秒、音画精准同步的多媒体内容,全面覆盖文本→视频、图像→视频、视频→视频等多种生成范式,并支持关键帧驱动的平滑转场、多语种语音交互等进阶能力。在720p分辨率、10秒时长的标准测试条件下,Flux3表现突出:相较Luma Ray3.2胜率达93%,领先Runway Gen-4.5达77%,同时在与Seedance2.0、Gemini Omni Flash等前沿模型的横向对比中稳居前列。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
值得一提的是,黑森林实验室携手Mimic Robotics共同研发了面向具身智能场景的视频动作理解模型Flux-mimic,目前已进入真实工业产线验证阶段,在奥迪工厂开展实际生产任务部署测试。BFL采用渐进式发布路径:Flux3Video已正式开放服务;Flux3Image及开源版本“Flux3Dev”权重也将于近期分批上线。凭借突破单模态认知边界的能力,Flux3正有力推动AI系统向兼具环境感知力与物理执行力的“世界模型”加速演进。

















