混元3d世界模型 2.0(hy-world 2.0)是腾讯混元正式发布的开源多模态世界建模系统,具备从文本、单张图像、多视角图像或视频中生成可自由漫游的3d高斯溅射(3dgs)场景的能力。该模型采用“全景生成→轨迹规划→世界扩展→3d重建”四阶段协同架构,首次在开源框架内实现“文/图驱动3d世界生成”与“视频驱动3d世界重建”的一体化统一。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

混元3D世界模型 2.0的核心能力
- 世界生成:支持基于自然语言描述或单张任意视角图片,输出360°全向可交互的3DGS/Mesh沉浸式空间。
- 世界重建:通过多视角图像序列或短视频,精准还原真实环境的高保真3D数字孪生体。
- 全景图合成(HY-Pano 2.0):将文字提示或普通透视图自动映射为无缝360°等距圆柱投影(ERP)全景图。
- 智能路径规划(WorldNav):融合几何结构与语义理解,生成符合物理规律、规避穿模与碰撞的多样化探索轨迹。
- 角色自主探索:内置可操控虚拟角色,支持在生成场景中进行步行、环绕、俯瞰等多模式交互式漫游。
- 多格式资产导出:兼容3DGS、三角网格(Mesh)、点云、全景视频等多种标准格式,并原生适配Unity与Unreal Engine引擎接口。
混元3D世界模型 2.0的技术实现机制
- 全景图生成(HY-Pano 2.0):采用端到端隐式建模方式,依托多模态Diffusion Transformer(MMDiT)直接学习透视图像到ERP全景的空间映射关系,无需相机内参;创新引入圆形填充(Circle Padding)与像素混合策略解决ERP左右边界断裂问题,并结合真实采集全景数据与UE渲染合成数据联合训练。
- 轨迹规划(WorldNav):整合点云、Mesh、语义分割图及导航网格(NavMesh),构建具备空间逻辑的语义-几何联合表征,据此生成覆盖度高、路径自然、避障可靠的探索路线,涵盖常规行走、环绕扫描、重建优化、自由漫游及空中巡航等多种策略。
- 世界扩展(WorldStereo 2.0):以关键帧为驱动而非逐帧预测,嵌入全局几何记忆与立体空间记忆模块,保障跨视角一致性;通过知识蒸馏压缩模型规模,在维持质量前提下提升长序列扩展效率。
- 世界重建(WorldMirror 2.0):设计前馈式三维几何预测主干,引入归一化位置编码、显式法线监督及深度掩码引导机制增强结构精度;最终以3D高斯溅射(3DGS)作为统一表征完成视图融合与细节优化,兼顾生成视图与真实输入的鲁棒重建能力。
混元3D世界模型 2.0的使用流程
- 平台接入:前往腾讯混元3D官网完成账号登录。
- 输入设定:上传一张任意角度照片,或输入具象化文本指令(例如:“未来科技感办公室,落地窗透光,悬浮UI界面”)。
- 参数定制:选择任务类型(生成 / 重建)、风格倾向、漫游区域范围、输出精度等级等配置项。
- 一键生成:触发后系统按四阶段流水线自动执行——先生成全景基础视图,再规划合理探索路径,随后沿路径扩展场景几何,最后完成精细化3D重建。
- 成果交付:可下载3DGS/Mesh原始文件,或直接导出Unity/UE引擎可识别的标准资产包用于后续开发。
混元3D世界模型 2.0的关键特性与运行条件
- 研发主体:由腾讯混元(Tencent Hunyuan)团队自主研发并主导发布。
- 开源程度:全部模型权重、训练推理代码、完整技术白皮书均已公开,支持学术研究与工业应用自由复用。
- 输入灵活性:全面兼容文本提示、单图输入、多视角图像组及动态视频流四种模态。
- 输出多样性:支持导出3D高斯溅射(3DGS)、网格模型(Mesh)、点云(Point Cloud)、360°全景图及动态漫游视频序列。
- 引擎集成性:生成资产已针对Unity与Unreal Engine(UE)做深度适配,导入即用,无需额外转换。
- 硬件依赖:本地部署建议配备NVIDIA GPU,显存不低于16GB以保障全流程高效运行。
混元3D世界模型 2.0的核心竞争力
- 生成与重建双范式融合:业界首个完全开源、同时支持“零样本生成”与“真实场景重建”的统一世界建模框架。
- 物理可交互性强化:生成结果内置空间拓扑逻辑与实时碰撞检测机制,支持角色自由移动与交互反馈。
- 免相机标定全景生成:HY-Pano 2.0不依赖焦距、FOV、位姿等先验信息,适配手机随手拍等非结构化图像输入。
- 全景边界无损处理:彻底消除传统ERP格式常见的左右接缝撕裂现象,实现真正意义上的360°视觉连续。
- 长程漫游一致性保障:通过世界扩展阶段的记忆机制,确保数百帧级轨迹下的几何与纹理连贯稳定。
- 开箱即用工业兼容性:资产格式直通主流游戏引擎与仿真平台,大幅缩短从AI生成到实际部署的链路周期。
混元3D世界模型 2.0的官方资源入口
- 项目官网:https://www.php.cn/link/93fb03efcd98ca5aa136ff9f761c9c2d
- GitHub仓库:https://www.php.cn/link/382eb7cfc227924eadb64ffc62bb0e58
- HuggingFace模型库:https://www.php.cn/link/5001c2f5718ea51b03f9bac94edbe5b8
- 技术论文:https://www.php.cn/link/93fb03efcd98ca5aa136ff9f761c9c2dworld2\_0/HY\_World\_2\_0.pdf
混元3D世界模型 2.0与主流竞品横向对比
| 对比维度 | 混元3D世界模型 2.0 | WonderWorld | Marble |
|---|---|---|---|
| **开发方** | 腾讯混元 | Snap Research / UC Berkeley | World Labs(李飞飞) |
| **开源状态** | 完全开源(权重+代码) | 开源(研究代码) | 闭源/有限开放 |
| **输入模态** | 文本/单图/多视图/视频 | 单图/文本 | 单图/文本 |
| **核心输出** | 3DGS/Mesh | 3DGS | 3DGS |
| **生成与重建** | 统一支持 | 侧重生成 | 侧重生成 |
| **物理交互** | 支持角色漫游+碰撞检测 | 基础漫游 | 基础探索 |
| **引擎导出** | Unity/UE原生支持 | 需转换 | 有限支持 |
| **全景生成** | HY-Pano 2.0(无相机参数需求) | 需已知相机位姿 | 依赖深度估计 |
混元3D世界模型 2.0的典型应用场景
- 游戏内容生产:助力开发者快速构建带物理响应机制的3D关卡原型,显著压缩传统手工建模与测试验证周期。
- VR/AR沉浸体验构建:生成高拟真度、低延迟、全向可交互的虚拟空间,适用于教育实训、远程协作、虚拟社交等终端场景。
- 轻量级数字孪生建设:仅需数张实景照片或一段短视频,即可自动化构建城市部件、工厂产线、室内空间等对象的高精度三维镜像。
- 具身智能训练沙盒:提供具备真实物理属性与动态交互能力的仿真环境,支撑机器人导航、人机协作、自动驾驶策略的安全闭环验证。
- 影视工业化预演系统:自动生成电影级360°虚拟布景与动态背景资产,服务于虚拟制片、镜头预演、绿幕合成及后期特效集成。


















