国产世界模型登顶李飞飞团队榜单!适配昇腾算力,代码权重全开源

量子位 2026-07-25T05:23:17.089122

李飞飞团队最新发布的世界模型榜单上,国产模型 UniWorld-View 拿下第一。它由兔展智能团队联合北大、鹏城实验室研发,支持单图或视频生成任意相机轨迹的新视角视频,已适配国产昇腾算力,代码和权重全部开源。其核心创新在于解决大基线视角合成中的几何穿帮问题,采用遮挡感知点云渲染和双流架构,让生成内容既准又真。

给它一张图,还你整个世界

李飞飞团队的世界模型榜单,刚刚换了新榜首。

登顶的是兔展智能团队联合北大、鹏城实验室研发的UniWorld-View(模型已适配国产昇腾算力):

你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频——推、拉、摇、移,甚至“绕着场景360°转一圈”都可以,提供“精确听话的相机位姿控制”。

不管是单图3D生成还是视频4D生成,用的是“同一套代码、同一个模型”。真·Uni(统一)World-View了。本次世界模型的训练数据来自北大系初创企业元空智能,代码和权重也已全部开源:

官方地址:PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View

为什么难:只看正脸,画出后脑勺

先说这事儿为什么难。

新视角合成(Novel View Synthesis),本质上是让AI“脑补”没拍到的角度。而难点全在“大基线(large-baseline)”三个字上——说白了就是:只给AI看正脸,让它画出侧脸,甚至后脑勺。

传统路线NeRF、3DGS,走的是“重建”逻辑:看得越多,建得越好。可随手拍的单目视频,视角覆盖约等于没有。喂给它们,轻则空洞伪影满天飞,重则直接摆烂。

生成式路线倒是敢画。但大多数方法只是把相机位姿当个“口头指令”(一个抽象的条件向量)塞进扩散模型——没有显式3D建模,走两步就飘,转大角度直接失控。

于是近两年出现了第三条路:先用几何模型把画面撑成3D点云,再把目标视角的点云渲染图喂给视频扩散模型当条件。几何归几何,生成归生成,相机控制一下子准了。ViewCrafter、英伟达GEN3C,走的都是这条路。

但在研发过程中,团队发现,这条路上藏着一个大家都踩过、却没人认真填的坑。

点云渲染,会“穿帮”

坑就出在点云渲染这一步。

点云是一堆孤立的点:既不知道谁跟谁相连,也不知道哪面朝外。视角一转大,渲染图会出现两种经典穿帮:

一是前景背景撕裂。深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。

二是背面漏光。点云没有“面”的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。

小幅度换视角时,这些穿帮不明显,生成模型还能糊弄过去。可一旦上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。

UniWorld-View的第一板斧,就砍向这里——“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)。

第一招:双重投影,专治撕裂。

把源画面投影到目标视角,再原路投影回来。来回一倒腾,凡是“回不来”的像素,就是会被遮挡的区域。把这些区域沿相机轨迹逐帧累积成遮挡mask,渲染时直接挖掉——该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。

第二招:法向过滤,专治背面漏光。

给每个点估计法向量,和视线方向算个夹角:背对相机的点,直接踢出渲染。

两招下来,条件图里的错误信号清零,剩下的全是可靠几何+明确的待补区域。

双分支架构:一个管构图,一个管上色

几何理顺了,还剩第二个矛盾:点云渲染图“位置对,但内容缺”;源视频“内容全,但位置不对”。怎么让生成结果既贴合目标视角,又和原视频长得一模一样?

UniWorld-View的答案是“双流条件注入”:

一个管构图,一个管上色,分工明确。

关键要点

本文介绍UniWorld模型如何通过空间与时间解耦,把单目视频变成可自由视角漫游的4D场景,并解读其背后的技术巧思与产业落地进展。模型已完全开源,适配国产昇腾芯片。

4D重建:从单目视频到自由视角漫游

想换个机位看同一段视频?UniWorld让这成为可能——而且不止换一个,它能生成多个机位的同步画面,相当于把一段单目视频"拍"成了多视角视频。

多视角视频到手后,4D重建(即动态3D高斯泼溅,简称动态3DGS)就不再是难题,从"不可能"变成了"常规操作"。

这里的核心巧思是:传统生成式方法里,相机是"边走边拍"的——空间变换和时间推进混在一起,视角在四维空间里分布极不均匀。UniWorld-View直接把两者解耦,分成两步走:

  1. 先拍定妆照:把时间冻结在第一帧,围绕场景生成一圈静态环绕视图,作为整个场景的外观锚点;
  2. 再开机拍动态:在固定机位上生成同步多视角视频,每个机位的第一帧用"定妆照"对齐,前景的自遮挡部分靠迭代生成逐步补全。

生成多视角视频后,交给4DGS优化,就能得到最终的4D场景。从"单目随手拍"到"可自由视角漫游的4D场景"——一条龙打通。

模型产业落地:RabbitVis即将登场

UniWorld背后的公司兔展智能,由北京大学校友与北京大学视觉领域的青年领军人才联合创立,专注于视觉AI大模型研发,具有基于视觉大模型的多模态底层自研能力,是国内视觉AI大模型领域的代表企业。

公司自主研发了Open-Sora Plan、UniWorld等系列视觉AI模型。其中:
- Open-Sora Plan是行业首个开源文生视频模型,2024年代码引用量位居全球第一;
- UniWorld率先探索了理解与生成统一架构。

2025年,兔展智能发布了UniWorld-V2——理解与生成统一架构的视觉大模型,引领了理解生成一体化方向。2026年4月,UniWorld-V2.5发布,在InfoGraph、图文交错、文字密集等场景上对齐了同期发布的GPT-Image-2的生成能力。

在持续推进技术演进的同时,兔展智能正加速推动UniWorld能力的产品化,近期将推出产模一体设计生产工具RabbitVis,进一步让视觉AI进入商业设计工作流。

延伸阅读

关键要点

查看原文