合成数据中的光流:物体光流与全局光流
概述
光流描述同一三维点在相邻两帧图像上的二维位移。像素运动可能来自场景物体运动与相机运动两部分。将两种用途拆成两种输出,可同时支撑「仅关注物体相对运动」与「整幅图像相对上一时刻的总位移」等任务。IADataSDG 在虚幻引擎实时合成管线中,将物体光流(强调物体自身引起的位移,静态背景相对相机运动的分量趋近于零)与全局光流(包含相机运动在内的像素总位移)作为两种并列模态;在公开 UE 系工具中,二者同时产品化仍相对少见。
背景与意义
- 若只提供单一定义,要么丢失相机引起的整幅运动信息,要么难以单独监督「仅前景运动」。
- 两种定义并存时,同一次采集可按需选用或同时使用,无需为另一种定义更换工具或离线重跑。
两种光流的定义与用途
物体光流
刻画场景中运动物体在像平面上的位移;静态背景上对应分量接近零。可理解为在相机参考系下「谁在动、动了多少」,不把相机扫视导致的背景整体位移计入背景像素。
适用:运动目标检测与跟踪、与分割联动的运动分析、需要将「物体运动」与「相机运动」分离的监督信号。若关注前景与背景的运动差异,而非车载相机整幅刚性运动,通常优先选用该定义。
全局光流
为相机运动与物体运动的合成效果,即每个像素从上一帧到下一帧的完整位移。在已知深度与两帧相机位姿的前提下,可将像素反投影至三维,再经上一帧相机重投影得到总位移。
适用:视频预测与插帧(模型输入为真实总位移)、视觉里程计 / SLAM 类方法的仿真真值、假设手持或车载相机持续运动的动态三维理解设定。
能力范围
- 物体光流与全局光流并列输出,便于与 KITTI、视频预测、SLAM 等文献中的假设对齐,而无需在仿真阶段自行拼接两套管线。
- 说明:在超广鱼眼与360° ERP 全景路径上,上述两种光流当前不提供(与相机专题中的模态表一致),因全向展开下「屏幕平面速度」语义需单独的球面几何处理。
为什么实时光流比 RGB 更挑采集点
很多人会把光流理解成“顺手再存一张速度图”。真正做起来才会发现,它比 RGB 挑剔得多。RGB 只要画面出来了,通常就能取;光流却依赖前后两帧之间那份很严格的对应关系。只要采集得太早,或者上下文还没准备好,拿到的就可能只是看起来像数据、实际却没法训练的结果。
这也是超广鱼眼和 ERP 暂时不输出光流的原因。困难不只是“画面更宽”,而是到了全景展开以后,像素位移这件事本身就不该再沿用透视图的理解方式。与其给出一张表面完整、实际语义含糊的流场图,不如明确告诉用户:这一类真值现在还没有被稳妥地定义好。
与常见路线对比
- CARLA、AirSim、UnrealCV、NDDS等公开能力上普遍未提供光流真值;具备深度、语义也未必具备光流。实时路径上需帧间矩阵一致、多视图时间对齐,产品侧往往优先 RGB / 深度 / 分割等标配。
- IADataSDG:在UE 系实时 SDG中同时提供物体光流与全局光流,与「只有一种或完全没有」的常见情况形成对照。
- NVIDIA Isaac Sim:Replicator 等提供含相机运动的motion vectors,语义接近全局光流;生态成熟,但为 Omniverse / RTX 路线,非虚幻系统。
- BlenderProc、Kubric:离线路径或物理仿真渲染,可产出光流类数据,非实时游戏引擎节拍。
概括:离线 Blender 系多能给出物理一致的光流;实时 Omniverse 系在全局运动向量上产品化较强;实时 UE 系中同时覆盖「物体」与「全局」两种语义、且与 SDG 一体化配置的选项仍较稀缺。
在 AI 模型训练中的价值
- 光流估计模型:RAFT、FlowFormer、VideoFlow 等方法在 FlyingChairs / Sintel 等合成数据集上预训练后再在真实数据微调;IADataSDG 可生成驾驶场景特化的光流真值,比通用合成集更贴近目标域,减少预训练–微调间的域差。同时提供物体与全局两种语义,一份采集可支撑多种光流定义下的训练。
- 视频预测与世界模型:GAIA-1、DriveDreamer、UniSim 等自动驾驶世界模型以光流作为运动先验或监督信号;全局光流提供逐像素的完整位移真值,可直接用于训练运动预测分支,而无需从 RGB 对估计光流引入额外噪声。
- 动作识别与行为预测:SlowFast、VideoMAE 等视频理解模型中,光流常作为双流架构的运动分支输入;物体光流将前景运动从相机运动中分离,可更纯净地监督运动特征学习。
- 场景流:FlowStep3D、NSFP 等 3D 场景流方法需要光流 + 深度联合真值;仿真可同帧提供两种光流 + 两种深度 + 相机内外参,构成完整的 2D-3D 运动监督。
- 自监督视觉表示:DINO、VideoMAE 等自监督方法可利用光流做时间一致性约束;合成光流精度高于任何估计器输出,用于自监督信号质量更可靠。
参考文献
[1] Z. Teed, J. Deng, "RAFT: Recurrent All-Pairs Field Transforms for Optical Flow,"ECCV, 2020.
[2] Z. Huang et al., "FlowFormer: A Transformer Architecture for Optical Flow,"ECCV, 2022.
[3] A. Dosovitskiy et al., "FlowNet: Learning Optical Flow with Convolutional Networks,"ICCV, 2015.
[4] D.J. Butler et al., "A Naturalistic Open Source Movie for Optical Flow Evaluation,"ECCV, 2012. (MPI-Sintel)
[5] H. Hu et al., "GAIA-1: A Generative World Model for Autonomous Driving," arXiv:2309.17080, 2023.
[6] C. Feichtenhofer et al., "SlowFast Networks for Video Recognition,"ICCV, 2019.
[7] Z. Tong et al., "VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training,"NeurIPS, 2022.
[8] Y. Kittenplon et al., "FlowStep3D: Model Unrolling for Self-Supervised Scene Flow Estimation,"CVPR, 2021.