近日,昆仑万维举办的“世界模型与多模态范式跃迁”专场论坛在上海举行,时间是2026世界人工智能大会期间。昆仑万维董事长兼CEO方汉在会上宣布,已经进入了“世界模型元年”,AI技术正在从内容生成向物理世界交互转变。
论坛上,昆仑万维推出了升级后的核心模型——Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,这些模型覆盖了世界模型、AIGC创作等领域。方汉预测,未来3到5年,世界模型将成为游戏行业的基础设施,并对影视等行业产生深远影响。
在圆桌讨论中,演员黄晓明表示,AI技术的更新速度超出了人们的想象,AI生成的人物微表情和毛孔细节已经可以达到以假乱真的程度。他看好AI赛道,并有意进行相关投资。演员王珞丹则分享了自己在创作中调试提示词、寻找理想镜头的经历,她认为AI只是创作的辅助,人类独特的表达冲动才是内容的灵魂,观众最终共情的还是故事本身,而不是生成媒介。
论坛结束后,方汉与搜狐科技等媒体就世界模型技术逻辑、文娱产业变革、AI行业竞争等话题进行了深入交流。
以下是部分对话内容:
媒体问:为什么把2026年定义为“世界模型元年”?今年行业有哪些关键突破?
方汉回答:过去两年,AI行业的主要任务是“生成”,包括文字、图片、视频和音乐的批量生产。但这些AI应用都无法理解真实的物理规则。今年,我们验证了异构普通视频数据可以规模化训练世界模型,这是一个重要的转折点。
媒体问:如何理解这个技术?它带来了什么效果?
方汉:以前,行业训练机器人和世界模型只能依赖UMI动捕、真机采集。一套动捕设备要十几万,单小时采集成本在500到2000元之间。想要训练出千万小时的数据集,投入至少要几十亿,没有企业能长期负担。
而现在,普通人用手机摄像头拍摄的日常操作视频就是异构数据,通过深度重建就能转化为高质量的训练素材。成本有望降到每小时10元。
只有低成本、多样化的真实数据供给打通,世界模型才有规模化落地的可能。这就是我们认定今年是元年的原因。
媒体问:Matrix-Game 3.5、Mureka音乐模型解决了哪些行业痛点?
方汉:Matrix-Game 3.5主打可交互世界模型,首创Patch级空间记忆,解决了长期困扰行业的画面跨帧不一致、相机抖动失真问题。积累的视频数据既能赋能游戏自动生成虚拟场景,也能为具身机器人提供环境推演底座。
Mureka v9.5则主打“去AI味”,更自然地还原人声和情绪,把专业音乐制作的门槛降到普通人可操作。
媒体问:世界模型的数据规模门槛有多高?行业何时能迎来技术质变?
方汉:对标自动驾驶的发展规律,具身世界模型最终都会收敛到端到端技术路线。数据规模是决定模型能力的核心。行业共识是,模型有效收敛需要千万小时训练数据,甚至上亿小时训练数据才可能实现通用化。
媒体问:目前市场上各家训练数据处于什么水平?突破千万小时门槛预计需要多久?
方汉:目前普遍是在十几万小时,今年头部有望突破百万小时。预计2027年底会有企业摸到千万小时门槛,亿小时规模则需要3到5年。
数据积累的比拼不仅在于资金,更依托产业链。中国拥有全球最全的工业、家政等场景数据,未来全球大概率都会来华采购训练数据。
媒体问:现在很多企业扎堆做垂直应用,是否意味着模型研发已不再是重心?
方汉:我不认同重心转向应用、模型就不重要了的说法。垂直应用的能力很容易被大模型原生内化,单纯做应用层壁垒极低,风险很高。
媒体问:对于创业者而言,现在市场机会在哪里?
方汉认为,关键是要拿着钉子找锤子,而非拿着锤子找钉子。创业者不必先有模型再硬套行业,反倒可以先扎根垂直行业(如短视频、工业机器人、家政等)了解真实需求,针对性开发轻量化模型工具,建立差异化壁垒。反观单纯做通用应用,很容易被头部大模型迭代覆盖。
媒体问:中国在世界模型、具身智能赛道,对比海外有哪些独特优势?
方汉:首先是硬件供应链,动捕采集摄像头等设备全都是国产化,行业内卷不断压低硬件成本;第二是数据多样性,工厂、家政、物流等海量真实交互数据;第三是人才供给,国内训练视频、生成模型的技术人才储备充足,视频赛道如今存活的头部厂商基本都是中国团队,未来具身智能赛道大概率会复制这一格局。
媒体问:当下AI影视、AI游戏热度都很高,世界模型会如何重塑文娱行业?
方汉:结合黄晓明、王珞丹的现场分享,我对文娱产业有三大判断。第一,游戏会最先迎来范式变革,未来3到5年世界模型会成为游戏行业的基础设施,不再需要数百人团队手工搭建,玩家行为可以实时驱动虚拟世界演化。当前推理硬件成本过高是最大阻碍。
AI音乐、短视频创作将彻底大众化,Mureka这类工具是让普通人释放表达,而不是替代创作者。AI影视技术层面已经成熟,目前缺的是敢于试水的创作者。短剧成本低迭代最快,会率先跑出商业化爆款。
院线AI电影只是时间问题,只是有些传统影视从业者存在心态顾虑,担心作品被贴上“AI 制作”标签。整体来看,未来演员、导演的职业边界会越来越模糊。
媒体问:昆仑万维同时布局音乐、视频、游戏、世界模型,多线研发如何控制资源投入?会持续很“烧钱”吗?
方汉:几条赛道底层技术完全互通,均基于DiT生成架构,数据清洗、推理优化的技术经验可以互相迁移,不存在完全独立的研发成本。
我们会持续深耕AIGC音乐、视频业务稳住基本盘,同时加码世界模型长期布局,抢占Physical AI时代入场券。








