World Model, Video Generation 和 Representation | Liao Jiayi

World Model, Video Generation 和 Representation

Liao Jiayi Liao Jiayi

LLM 当前的研究基本已经完成并且处于大规模应用和商业化的阶段,Spatial Intelligence 是当前 AI 界还未解决,并且是需要很长一段路才能解决的问题。

World Model, Video Generation 和 Representation

序

Spatial Intelligence 相关的研究,大多可以落到三点:

  1. World Model: 通过视频数据来学习视频帧之内和之间的动作,比如 OpenAI 早期的 VPT,Google DeepMind 的 Genie 系列;
  2. Video Generation: 通过视频生成来合成实际没有发生的世界状态,比如碰一下杯子后,杯子的运动学状态等,典型研究如 Sora;
  3. Representation: 如何找一个好的表征来压缩/建模视频和图像,使得其中的视觉信息、运动信息等内容不丢,如 Lecun 的 JEPA 系列;

关于数据层面上,早期研究大幅度利用了游戏数据,因为游戏视频有几个特点:

  1. 干净且统一(地图、任务、色彩),不会出现很多 OOD 的变化
  2. 数据容易采集,相比 Robot 公司需要很多人戴着头显做操作
  3. 采集效率高,基本都可以在线上完成
  4. 脏数据/噪音较少(相比互联网数据来说)

但是后期随着应用场景的泛化,比如 Robotics,逐步过渡到利用大量的互联网视频数据来建模,各类的研究已经持续了 2 年左右,但是很多领域都没达成共识,比如

  • 世界理解上没有出现明显的 Scaling Law:这里指的是场景的 Zero-shot,比如从游戏 A 训练的模型,是否能够在游戏 B 上也做到差不多的水平?这里讲的更多的是“组合泛化”的概念,而不是单纯的把轨迹训进模型里;
  • 视频生成,是否内部真的包含了足够的物理信息?我们所看到的 MiniMax H3、Seedance,都存在大量物理不真实的情况(即使是常见视频和 prompt);
  • 如何表征多模态数据? 只看像素的建模是不够的,因为大部分表征即使能够正确编解码 video,但是没有办法让 Robot 读到真实世界的信息;

下面是近两年来关于这个主题的研究

World Model

VPT

Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos, 2022 年 OpenAI 发布的(OpenAI 对 Video 多模态的研究非常早,甚至是 robotics 上也早于很多人的想象)

  • 背景:互联网有大量游戏和操作视频,但通常没有键鼠或机器人动作标签,无法直接用于 BC(Behaviour Cloning);从零强化学习又很难探索出长链条技能;
  • 解决思路:用少量带动作标签的数据训练逆动力学模型(IDM),给大量无标签视频补上动作标签,再训练策略。
    • 标签来源?1) 研究者雇人玩 Minecraft,同时录制游戏 video 和键盘 action,按时间对齐,来自于操作日志; 2) 用 1 的数据训模型,再利用互联网视频,算出相邻 window 之间的 action,作为伪标签(这里应该会产生误差)
    • 动作表征?直接在 transformer 上加 action head 生成离散值;
    • 模型结构:分两个,一个是 IDM 补标签 model,一个是生成 action 的 model,前者能看到未来,后者是 casual attention;
  • 具体方案:先用约 2,000 小时带键鼠记录的 Minecraft 数据训练 IDM,通过动作前后的画面推断动作;随后为约 70,000 小时网络视频生成伪标签,训练仅依赖历史观测的行为克隆策略;最后进行任务数据微调或强化学习微调。
  • 效果:预训练模型已能砍树、制作木板和工作台。加入强化学习微调后,在 10 分钟游戏回合中制作钻石镐的成功率为 2.5%。这个钻石镐结果包含在线强化学习,不能归为纯离线视频学习。

image

Genie

Genie: Generative Interactive Environments

  • 背景:传统世界模型依赖“观测—动作”配对数据,普通视频缺少动作记录;视频生成模型也通常不支持逐步控制。
  • 方案:和 VPT 类似,从帧间发现 latent action,再学习这些动作生成的画面;
    • Tokenizer: 视频 ST-Transformer 编解码的 VQ-VAE 有 1024 个码,动作有 8 个码;
    • LAM(Latent Action Model): 编码器看到前后两帧图片,训出来的 latent action,并压到 8 个码本之中;
    • Dyanmics Model:接收 action code 和上一帧,预测下一帧;
  • 效果:能把 2D 图片变成 2D 可交互环境

image

观点:这个架构相比于现在的 e2e model 的训练方式似乎是有点落后了,本身在 action 压缩到 码本大小为 8 的空间里,其实是有信息损失的。

LAPA

Latent Action Pretraining From Videos

  • 背景:24 年发布的,VLA 模型依赖昂贵的机器人遥操作数据,而且不同机器人的动作空间不统一,人类视频难以直接复用。本质上实际在训一个 VQ-VAE 的视频 Encoder/Decoder;
  • 方案:用的是 unsupervised 的训练方法(现有很多 WAM 也是类似的思路)
    1. 输入相邻视频帧,使用 VQ-VAE 转成离散 action 信号(固定大小的 codebook),训出 action 的 codebook(VQ-VAE),再用 action code 和视频帧过一次 Decoder 生成视频帧
      • VQ-VAE: Vector Quantization,连续向量转离散信号的编码器
      • 这里的 Encoder 和 Decoder 并不是可重建的
    2. 用训练好的 VQ-VAE codebook 和视频帧做大量的 pretraining,得到 image+text -> action 的训练数据
    3. 少部分 teleop 数据 fine-tune

image

GR00T N1

GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

  • 背景:NVIDIA 25 年发布的,让人形机器人理解 Vision + Language,生成连续 action,并且适应不同机器人本体形态。
  • 解决思路:采用理解与控制相结合的双系统架构,并混合真实机器人、人类视频和合成数据训练。
  • 具体方案:System 2 使用 Eagle-2 VLM 编码图像和指令;System 1 使用 DiT,通过 flow matching 生成连续动作块。不同机器人采用专属状态与动作适配层。人类视频通过 LAPA 式潜在动作参与训练,合成数据来自视频生成和仿真轨迹扩增。
    • 这里也首次正式提出了 Data Pyramid 的概念

image

Isaac 0.5

Introducing Isaac 0.5: An Open-Source Embodied Foundation Model:

  • Perception 发的模型,36B + MoE,动态激活参数,特点是支持「视频理解」+「动作生成」
  • 训练
    • 目标:视频理解、空间定位、任务进度预测、动作生成
    • 预测画面里和任务相关的状态变化(percepts)

Video Generation

Sora

Video generation models as world simulators

  • OpenAI 在 2024 年发布的 Sora 还是值得讲一下,“高开低走”,再过几年,可能很多人已经都不记得这个模型了
  • 背景:长视频存在大量的身份、运动、空间不一致的问题,第一个长视频的生成模型
  • 方案:图像和 Image token 化(这里的 tokenizer 怎么设计的没有写),然后用大规模的 transformer-diffusion 架构实现 denoise 过程,训练中保留了不同尺寸视频,并使用了大量的文本描述,增强 instruct-following 能力;
    • 核心是把当时图像的 DiT 架构迁移到了视频上, 并且加入了“时空一致”的能力,具体细节没有说

Genie 2

Genie 2: A large-scale foundation world model, DeepMind 2024 年发的世界模型,已经和 26 年 WorldLabs 发布的 Marble 有些类似了

  • 背景:Agent 需要大量的环境来做真实交互,所以 Genie2 期望做的事情是 Image-to-Environment,从 2D 图片变成一个三维可交互的环境
  • 方案:和上面的方案类似,用 casual-transformer 训练,每一步输入历史帧和 action,生成下一帧;
    • 记忆怎么做的? report 里没有细写,考虑到 context 不长,有可能本身就是模型 pretraining 数据带来的能力;
  • 效果:展示了移动、开门、跳跃、物体交互以及离开视野后的场景记忆;一致环境最长可维持约 1 分钟,多数示例为 10–20 秒

Dreamer 4

Training Agents Inside of Scalable World Models

  • 背景:在游戏里训练 Agent,需要一个世界模型(能看懂 image+action -> 下一帧),这样预测的下一帧可以作为 Agent RL 的 reward,(其实跟机器人会非常像?)
  • 方案:
    • Tokenizer: Tokenizer 训练用的是 image 重建和损失感知(随机遮挡 patch 做预测),采用 casual transformer 做编码器(并且这一帧的编码会利用上一帧的信息)
    • 网络结构采用 Dynamics Transformer,接收历史视觉表示,动作,噪声等,然后 block-casual attention,帧内交叉,时间方向不能看未来
    • Shortcut Forcing: denoise 的步长也同样可以做预测,并且这里
  • 特点
    • 能预测更多的交互动作,比如 MineCraft 里砍树等,原因是粒度更细的 token,更长的上下文,

Representation

RAE / VAE / V-RAE

输入图片 x
↓ 编码器
输出分布参数 μ(x)、σ(x)
↓ 从这个分布采样
潜变量 z
↓ 解码器
重建图片 x̂

DINO-WM

DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning

  • 背景:像素重建容易消耗大量能力拟合纹理细节;任务专属奖励和策略训练又限制世界模型的复用;
  • 方案:其实和 Genie2 这些会很类似,只不过是用了 DINOv2 来做图像的编码,都是把相邻帧之间的 latent/hidden states 作为动力学模型的表征,学两个东西:
    • o(t) + z -> o(t+1): 当前状态加上一个动作,预测下一个状态
    • o(t) + o(t+1) -> z:状态变化预测动作

image

V-JEPA 2 / V-JEPA 2.1

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

  • 背景:逐像素预测需要处理大量与任务无关、不可预测的细节;模型需要从观察中学到可用于理解与控制的表示。
  • 解决思路:在表示空间预测被遮挡的视频内容,再通过少量机器人交互数据补上动作条件。
  • 具体方案:在超过 100 万小时互联网视频及图像上进行 JEPA 预训练:上下文编码器和预测器预测目标编码器的特征。随后冻结视觉表示,训练 V-JEPA 2-AC,根据历史特征和动作预测未来特征,配合目标图像进行 MPC。 image

JiT

Back to Basics: Let Denoising Generative Models Denoise by Kaiming He

  • 背景:当前 denoise 的过程中,都是通过预测 noise 来得到最后的 image,但实际上噪声是个高维且难以预测的目标,如果直接预测目标,可能就能转化成一个低维目标预测,模型的结构和效率会更加简单和准确。
  • 方案:
    • Manifold Assumption: 一张 256x256 的图片有 20w pixels,可以看做是 20w 维的高维数据,但实际上表达内容(比如一只猫的轮廓),可能只占很小的一部分
    • 相比传统的 DiT 网络结构有两个改动:1) input 变成了 patch 后的像素,不做任何的压缩 2) output 换成了目标而不是 noise

image