本文作者: 郑佳美
2026-08-17 16:46
导语:HiDream-O1-World,一款原生全模态交互式世界模型。
HiDream-O1-World,一款原生全模态交互式世界模型。
HiDream-O1-World 具备漫游、编辑、交互三大功能,支持文本、图像、交互等多模态方式输入。用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。
HiDream-O1-World 搭载的是智象自研的原生全模态(UiT)架构。作为核心基座,UiT此次迎来升级,在交互式世界模型领域公认的核心技术挑战——时空一致性与物理一致性上,取得了关键性突破。在新发布的世界模型中,这种突破表现为:当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。
智象未来CTO姚霆表示:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。HiDreamO1World,正是这场系统性重塑的第一道桥梁——让每一次交互,都通往一个从未抵达的世界。它的突破性效果,既坚定了我们推动原生全模态架构技术路线纵深发展的信心,也为智象持续构建世界模型的核心技术壁垒提供了关键支撑。”
不久前,HiDream-O1-World 在第三方评测中交出了首份成绩单。由美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench公布了最新榜单。智象HiDream-O1-World在核心的Navi分榜中,以平均分80.9的成绩登顶榜首,其中在物理(Physical)维度以73.3分位列第一,Consistency(一致性)维度达88.0分。两项关键指标均位居前列,成为该榜单中综合表现排名第一的模型。

WBench是业内首个面向交互式世界模型的系统性评测基准,涵盖289个多轮交互案例、共计1058个交互轮次,并基于五大维度、22项指标构建起一套严谨的量化评测体系。评测分为Navi与Full两个榜单,其中Navi分榜聚焦空间导航与视角控制,被业内视为衡量世界模型空间理解能力的核心标尺。HiDream-O1-World首次参评即登顶Navi分榜,刷新交互式世界模型性能上限。这背后,是智象自研UiT架构在时空一致性与物理一致性上的关键突破,让“构建可信交互世界”有了坚实的技术支点。
02. 一键生成世界,开启沉浸式交互体验
模型支持文本、图像、交互式操控等多模态输入方式,用户只需一段文字描述、一张图片或简单交互,即可一键生成结构完整、质感细腻、风格多元的交互世界。对用户而言,这不只是“进入”一个世界,而是亲手“创造”一个世界。比如,上传一张室内照片,模型便能快速构建出高精度的数字孪生空间,自动补全整间卧室的全景图——空间比例精准协调,画面细节精准且质感十足,令人仿佛置身其中。

在功能上,模型提供了第一人称和第三人称两种视角的漫游体验。用户可自由驱动角色行走并任意调整视角方向。以潜水场景为例,视角移动时,水面光影与海底碎光同步变幻,珊瑚礁色彩分明、鱼群游弋自如。镜头拉近后珊瑚的纹理细节清晰可见,画面全程稳定无漂移。

不止于漫游,HiDream-O1-World 赋予用户实时编辑能力。用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。这并非简单的局部微调,而是基于几何、光照、材质到物理逻辑的全局统一,确保每一次交互都真实自洽。

强大的泛化能力,是HiDream-O1-World构建多元交互世界的基础。
模型支持人类、动物、虚构角色等多种角色的构建。无论是街头漫步的行人、空中盘旋的飞鸟,还是幻想中的异兽,模型都能精准适配其形态与运动,让每一种角色都踩准自己“应有”的节奏。以登雪山的场景为例:登山人行进中,脚印在雪面上压出真实凹陷。雪花随风飘落的动作缓急有致。远处群山轮廓与脚下岩石纹理随视角推移,衔接得非常自然。

模型还拥有极其丰富的场景与风格化创造空间。它既可高度还原真实城市街景、自然地貌、室内空间等各类实景,让光影、材质、空间结构高度贴合现实物理世界;亦可自由解锁幻想异世界、二次元卡通、3A游戏渲染等多元艺术风格,轻松打造极具想象力的风格化数字场景。虚实之间,游刃有余。


03. 两大核心突破:长时程的时空一致性与物理一致性
交互式世界模型长期受制于空间、物理与记忆三大核心难题。动态交互中,相机视角切换常引发画面模糊畸变、场景漂移乃至空间结构紊乱,三维形态难以维系;同时,画面中也极易出现人物穿墙、物体悬浮等,明显违背物理规律的情况,会严重折损场景的可信度;而更棘手的是,模型缺乏长效记忆——视角稍作转动,已生成物件便可能凭空消失或细节飘忽,世界状态始终无法被忠实留存。这三重挑战彼此纠缠,共同构成模型从即时生成迈向持续存在的根本壁垒
HiDream-O1-World基于自研原生全模态(UiT)世界模型架构,在上述挑战上实现了关键突破。在长时程交互中,画面严格遵循物理法则,视角切换间始终保持了高度的空间稳定性。这一能力的实现,依托于两大核心能力的协同支撑:时空一致性与物理一致性。
长时程时空一致性
HiDream-O1-World的核心突破,在于将“3D先验注入Memory上下文”与“Test-Time Training在线维护”进行协同设计:
传统世界模型如同“画师逐帧作画”——每次交互都要重新绘制整幅画面,几何与外观深度耦合,任何微小偏差都会在长序列中被不断放大,最终导致物体漂移、形变甚至凭空消失。HiDream-O1-World则如同一位拥有“空间记忆”的导演:每到一个新场景,模型不是每步重新揣测环境,而是在Memory中持续记录场景的空间结构;当镜头移动或视角切换时,依据这份记忆快速调取对应视角下的场景呈现,再通过实时的在线微调确保每一次生成都准确无误。镜头推拉摇移之间,物体不消失、不漂移、不“失忆”。
在WBench的Consistency(一致性)维度,HiDream-O1-World得分88.0,位列榜单前列,也充分印证了“Memory+TTT”架构在长时序交互中维持3D几何与空间一致性的出色能力。
全局稳态物理一致性
为实现物理层面的一致性并确保画面符合现实逻辑,模型从训练数据与推理机制两端同时着手,形成合力。
训练阶段——物理模拟数据驱动的归纳偏置学习
推理阶段——Test-Time Training在线适应物理场景
TTT机制不仅作用于3D维度,同样为物理一致性提供在线增强。在交互过程中,模型通过轻量级在线自适应,能够针对当前场景的特定物理属性进行快速微调。例如,当场景中出现新物体类型或材料时,模型可在推理中动态调整内部表征,使后续生成帧更好地符合该场景特有的物理规律——如水的流动性、刚体的碰撞响应等。这种“边交互边适应”的能力,使模型即使在训练数据未完全覆盖的物理情景下,依然能保持较高的物理合理性。
这种“架构创新”与“数据策略”双轮驱动的设计,使HiDream-O1-World在物理模拟真实感上带来了实质性突破——在评估画面运动是否符合常识物理的视觉合理性评测中,模型相比行业平均提升13.6%;在更具挑战性的因果保真度评测中,通过对流体、碰撞、形变等物理维度的全面衡量,模型同样实现了12.7%的大幅跃升。
值得一提的是,这一技术路线已获得国际顶会认可。聚焦空间一致性研究的论文,正式入选2026年欧洲计算机视觉国际会议(ECCV* 2026),为交互式世界模型在三维空间理解与长时序生成方向上,开辟了一条兼具理论原创性与工程可行性的技术路径。
*ECCV(European Conference on Computer Vision):全球计算机视觉与人工智能领域的三大顶级学术会议之一,每两年举行一届。
论文标题:DreamWorld: Geometry-Grounded
Video Diffusion for 3D-Consistent World Modeling
项目主页:https://yanghb22-fdu.github.io/DreamWorld
04. 三大全新产业格局,向新世界开启
除了技术突破之外,HiDream-O1-World也正在打开智能时代全新的产业重塑可能性。
1. AI互动影游——开启互动影游智能化新阶段
AI互动影游是以影视级视听叙事为外壳、用户交互为内核的新兴内容形态。然而,实现二者的高效统一,一直是制约行业升维的核心瓶颈。HiDream-O1-World交互式世界模型的发布,让我们看到了这一命题的全新可能性——用户不再被动跟随线性剧情,而是成为叙事的主动参与者,世界会随其探索持续沿着不同的分支剧情演进。由此,用户在影视级视觉质感中获得前所未有的沉浸感,并享受探索多重结局的乐趣。
2. 具身智能仿真——打造高精度仿真底座
HiDream-O1-World世界模型能够高效搭建高度还原、遵循物理规则的城市、工厂、室内等多类型仿真空间,为智能机器人训练、自动驾驶、智能制造等场景提供高质量的虚拟试验底座。这意味着,高成本、高风险的实景测试可由智能仿真替代,加速具身智能产业发展。
3. 3D场景生产——从创意捕捉,到微观世界推演
面向创作者与设计师,HiDream-O1-World能轻松生成3D手办、家居场景及艺术空间等内容,结构完整、细节丰富,并支持结构微调、风格秒换与智能补全,有效缩短创意到成品的迭代路径。更具想象空间的是其向微观世界的延伸:借助HiDream-O1-World生成高精度的微观世界,可以精准模拟细胞行为、蛋白相互作用等生命过程,为药物发现与疾病机理研究开辟全新的数字仿真路径。
当物理世界可以被一键生成、自由交互,很多行业都值得被重新想象。这些领域,还只是冰山一角。随着开发者与创作者不断加入,交互式世界模型的应用边界,将远超我们今天所能描绘的范围。

WAIC 2026|智象未来推出 vivago R1,开启无限时长 ...

GAIR Paper 099:中科大&智象未来:强模型打底、轻模 ...

智象未来超两千亿参数图像大模型HiDream-O1-Image-P ...

智象未来完成新一轮融资,全力打造下一代原生全模态 ...

编辑
Kimi K3 发布 47 页技术报告,最有价值的创新点是这些
刚刚,DeepSeek V4 系列更新,架构没变,Agent 能力为何大涨
白宫下场亲自「围攻」Kimi K3,评论区全员唱反调?
GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟
苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍?
YC 开源自家 Harness,3 天斩获 3.9k Star,QM 如何划清 Agent 的权限边界
拆解 Mistral AI 新项目Shieldstral,看 3B 小模型如何重构 AI 安全审核范式
关于 Hugging Face 入侵事件,OpenAI 终于放出了时间线
为了「自我锤炼」,OpenAI 造了一个攻击力极强的「AI 黑客」
深度拆解 DeepSeek Harness 架构:AGI 的自进化,终于有了「后悔药」
中国电信领投,觅蜂科技再获数亿元融资,聚焦物理AI数据服务平台