来源:环球网
【环球网科技报道 记者 李文瑶】8月17日,智象未来(HiDream.ai)正式发布原生全模态交互式世界模型HiDream-O1-World。该模型具备漫游、编辑、交互三大功能,支持文本、图像及交互式操控等多模态输入,用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。
据智象未来介绍,HiDream-O1-World搭载了公司自研的原生全模态UiT架构,该架构在交互式世界模型公认的时空一致性与物理一致性两大核心技术挑战上取得关键突破。当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应亦高度符合真实世界的因果逻辑。
在技术实现层面,HiDream-O1-World通过“3D先验注入Memory上下文”与“Test-Time Training在线维护”协同设计,解决长时程交互中的空间漂移与场景“重置”难题;同时从训练数据与推理机制两端强化物理一致性,借助物理模拟数据驱动的归纳偏置学习和在线自适应微调,使画面运动符合常识物理。据披露,该模型在视觉合理性评测中相比行业平均提升13.6%,在因果保真度评测中提升12.7%。相关研究成果已入选2026年欧洲计算机视觉国际会议(ECCV)。
智象未来CTO姚霆表示,交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。
在应用层面,HiDream-O1-World可支持人类、动物、虚构角色等多种角色构建,覆盖真实城市场景、自然地貌及二次元卡通、3A游戏渲染等多元艺术风格。产业方面,模型有望为AI互动影游提供分支剧情演进能力,为具身智能仿真打造高精度虚拟试验底座,并可辅助3D场景生产,甚至向微观世界延伸,用于模拟细胞行为与蛋白相互作用等生命过程,为药物发现与疾病研究开辟数字仿真新路径。
智象未来表示,随着开发者与创作者不断加入,交互式世界模型的应用边界将远超当前所能描绘的范围。公司将持续推动原生全模态架构技术路线的纵深发展,构建世界模型的核心技术壁垒。