SDG 合成数据 IADataSDG

合成数据中的三种分割:语义、实例与材质

像素级类别、实例与材质等标签需求。

2026-04-09 5 分钟阅读
文章目录10

合成数据中的三种分割:语义、实例与材质

概述

像素级标签可分为三个层次。语义分割回答「该像素属于哪一类」(道路、车辆、行人等);实例分割回答「属于哪一个具体物体」(同类多实例可区分);材质分割回答「该像素对应哪一份材质设定」(同一几何更换漆面等可在图像中区分)。前两者在车载与机器人仿真中较常见;按引擎材质实例切分在公开工具中较少见,有此类真值需求时需单独评估。在针孔、常规鱼眼与 360° 全景(ERP)路径上,IADataSDG 均可输出上述三类(全景路径下部分深度、光流因几何定义受限而不提供,分割三类不在此限)。


背景与意义

  • 语义:与 Cityscapes、nuScenes 等公开集对齐,是检测与分割训练的常用真值。
  • 实例:需要区分「第几辆车、哪一辆」时,依赖per-物体唯一ID,支撑跟踪与计数等任务。
  • 材质:分析「同类物体、不同漆面 / 保险杠」对算法的影响,或做换材质实验时,材质级标签比仅有类 ID 更细。

能力范围

  • 语义分割:每像素一个类别;对象侧按规则写入可在图像中解码的编号,再映射为类别色或导出标签。
  • 实例分割:每像素一个物体 ID(稳定、可计数);与语义走不同信息路径,可同时采集,分别表达「是什么」与「是哪一个」。
  • 材质分割:按材质实例分像素;与实例分割类似,为整数图加对照表可读名称。公开竞品对比中,Isaac Sim、CARLA、BlenderProc普遍具备语义与实例,少见与引擎材质实例一一对应的材质分割输出;IADataSDG 将其作为明确差异化能力写入对比文档。

适用场景

  • 自动驾驶感知:语义、实例直接服务分割头;材质可用于材质随机化或域差距分析。
  • 机器人与场景理解:实例 ID 区分具体物体;语义提供稠密类别;材质辅助抓取、反光等与表面相关的任务。
  • 仿真与真实差距:外观差异常来自纹理与材质;具备材质级真值时,评估或训练可按材质分组,而不必全部混在实例或类 ID 中。

不同投影下的可用性

  • 透视(针孔):三种分割均可与 RGB 等同管线输出。
  • 鱼眼(中等视场):三种均可;与深度测试一致的几何一并输出。
  • 超广鱼眼与 ERP 全景:三种分割均支持;全景路径上部分深度与光流受限,分割三类不受上述限制

环视同时需要 RGB 与分割真值时,无需在「仅语义、无实例」等能力上妥协;三类均可纳入数据规格。


同样是分割,底层承载格式未必相同

对训练者来说,真正重要的从来不是缓冲区里存的是整数还是浮点,而是同一辆车、同一块材质、同一个语义类别,在不同投影下还能不能始终认成同一个对象

也正因为如此,IADataSDG 在底层并不会执着于“所有路径都必须用完全相同的存法”。透视、鱼眼和全景面对的重采样过程并不一样,系统会选择更稳妥的承载方式来保护这些 ID。用户真正需要关心的是另一件事:无论底层怎么存,最后拿到的标签语义都应该是一致的,不能因为投影变了,ID 的含义也跟着变。


在 AI 模型训练中的价值

  • 语义分割预训练:SegFormer、Mask2Former、OneFormer 等模型在 Cityscapes / ADE20K 上训练时,标注瓶颈在于逐像素人工标记;合成语义分割可按 nuScenes / Cityscapes 类别体系自动生成数万帧稠密标注,用于预训练后在少量真实标注上微调,已有工作证明可显著提升尾部类别(如施工锥桶、骑行者)的 mIoU。
  • 实例分割与跟踪:Mask R-CNN、QueryInst、IDOL 等实例级模型需要 per-object mask 标注;合成数据中每个物体天然带唯一 ID,可直接生成 COCO-style 实例标注,且跨帧 ID 一致,可同时用于视频实例分割(VIS)与多目标跟踪(MOT)的训练。
  • 全景分割:Panoptic-DeepLab、kMaX-DeepLab 等全景分割方法需要 stuff + thing 的联合标注;合成数据同时提供语义(stuff 类别)和实例(thing 个体),可直接拼装为全景格式,省去人工合并两套标注的成本。
  • 材质域适应:sim-to-real 中外观差异很大程度来自材质纹理;材质分割提供了按引擎材质实例区分的标签,可训练材质感知的域适应网络——例如仅对「金属车身」与「玻璃」做有针对性的 style transfer,而非对全图做统一风格变换。
  • 弱监督与半监督:当真实数据仅有图像级或框级标注时,合成的稠密分割掩码可作为伪标签教师(pseudo-label teacher)或一致性正则化的参照,帮助半监督分割模型(UniMatch、AugSeg)在少量真实标注下逼近全监督精度。

与竞品对比(分割维度)

能力IADataSDGIsaac SimCARLABlenderProc
语义分割
实例分割
材质分割

若论文或数据集强调材质级对齐或 sim-to-real 中的材质变量,材质分割在竞品侧较难复现;若仅关心类与实例,差异更多体现在渲染质量、传感器丰富度与集成成本。


总结

三层分别对应:类别、个体、表面材质。与 Isaac、CARLA、BlenderProc 相比,材质分割在公开对标中最少见。具体分辨率、帧率与存盘格式需单独制定数据规格;本文仅界定能力边界,不涉及内部通道与实现细节。


参考文献

[1] M. Cordts et al., "The Cityscapes Dataset for Semantic Urban Scene Understanding,"CVPR, 2016.

[2] E. Xie et al., "SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers,"NeurIPS, 2021.

[3] B. Cheng et al., "Masked-attention Mask Transformer for Universal Image Segmentation,"CVPR, 2022. (Mask2Former)

[4] J. Jain et al., "OneFormer: One Transformer to Rule Universal Image Segmentation,"CVPR, 2023.

[5] K. He et al., "Mask R-CNN,"ICCV, 2017.

[6] B. Cheng et al., "Panoptic-DeepLab: A Simple, Strong, and Fast Baseline for Bottom-Up Panoptic Segmentation,"CVPR, 2020.

[7] L. Yang et al., "Revisiting Weak-to-Strong Consistency in Semi-Supervised Semantic Segmentation,"CVPR, 2023. (UniMatch)

[8] H. Caesar et al., "nuScenes: A multimodal dataset for autonomous driving,"CVPR, 2020.