融合数据 仿真数据 真机数据 数据飞轮 自动标注

融合数据生产平台

以统一场景、仿真运行、自动采集标注、清洗质检、版本分发和真机对齐管线组织数据生产,并将失败样本转化为定向再生成任务,形成可持续的数据飞轮。

2026-07-22 13 分钟阅读
文章目录23

客户问题

智能系统的数据问题通常不只是“样本数量不足”,而是数据生产与模型研发彼此脱节:场景定义散落在文档中,仿真配置无法复用,采集与标注采用不同口径,数据集缺少完整版本关系,真机日志难以映射回仿真条件,现场失败也无法稳定转化为下一轮训练和回归数据。

常见障碍包括:

  • 一次性交付难以迭代:数据按项目或批次交付后,场景参数、传感器配置和处理过程无法重放,需求变化时只能重新组织生产。
  • 场景与数据脱节:文件保留了图像或点云,却没有关联任务、环境、参与者、传感器、随机种子和事件条件。
  • 标注口径不统一:仿真真值、人工标注与模型伪标签采用不同类别、坐标和质量规则,数据合并后难以直接消费。
  • 质量问题发现过晚:缺帧、时间不同步、标定错误、标签越界、坐标误用和分布偏差往往到训练阶段才暴露。
  • 仿真与真机难以对齐:噪声、时延、内外参、环境分布和行为分布没有统一分析入口,仿真数据难以针对真实问题调整。
  • 失败样本没有闭环:现场日志可以说明“发生了失败”,却缺少把失败条件复现、扩展并转化为训练集与回归集的机制。
  • 数据资产不可追溯:数据集、模型、场景、资产、软件版本和评测结果缺少关联,难以回答某个模型究竟使用了哪些数据。

融合数据生产平台把上述环节组织为一条可定义、可执行、可检查、可追溯和可再次调用的数据生产线。

方案总览

平台以场景定义为生产起点,以版本化数据产品为交付对象,以真机数据和失败样本为下一轮生产输入,贯通以下链路:

场景定义 → 仿真运行 → 自动采集与标注 → 清洗质检 → 版本管理 → 分发调用 → 仿真与真机对齐 → 失败样本定向再生成

场景定义描述任务、环境、参与者、资产、传感器、采样分布和验收条件;仿真运行把定义编译为可执行任务,并记录每次运行的完整上下文;采集与标注管线同步输出传感器数据、系统状态和真值;清洗质检在数据进入训练前执行完整性、几何一致性和分布检查;版本管理把数据与场景、资产、引擎、算法和处理配方关联;分发层通过数据包、接口或挂载方式供训练、评测和分析系统调用。

真机数据进入同一治理体系后,用于校准传感器、环境和行为分布。失败样本被索引到对应场景因子和系统版本,再通过条件复现、参数扫描和反事实变体生成训练数据与固定回归用例。平台由此把数据交付从单次项目活动转化为持续循环的数据飞轮。

系统架构

平台采用七层架构:

层级主要职责核心产物
场景与任务定义层描述业务任务、环境、对象、事件、传感器、分布和验收条件场景规格、采样计划、数据需求
仿真执行层编译运行配置、调度任务、管理种子、快照和运行状态可重放仿真运行与运行清单
采集与标注层同步采集多传感器数据、状态、轨迹、事件和真值原始数据、自动标注、时间与坐标信息
数据工程层清洗、转换、切分、增强、去重、异常检测和质量门禁规范化样本与质量结果
数据治理层管理目录、标签、血缘、版本、权限、审计和生命周期版本化数据集与完整血缘
分发与调用层提供数据包、查询、API、SDK、存储挂载和任务触发面向训练、评测和分析的消费接口
对齐与再生成层对比仿真与真机分布,重建失败条件并生成定向变体校准参数、失败索引、补充集与回归集

贯穿各层的是统一数据清单。清单关联场景版本、资产版本、仿真引擎与插件版本、传感器配置、随机种子、采集时间、标注词表、处理配方、质量规则和访问权限。每个交付数据集都可以追溯到具体运行和具体生产条件。

核心能力

1. 场景定义

平台使用结构化方式表达数据需求,而不是仅以文件数量描述任务:

  • 业务任务、运行区域、参与者角色和事件条件;
  • 地图、环境、资产、本体与初始状态;
  • 天气、光照、材质、遮挡、交通流或作业流程等环境因子;
  • 相机、LiDAR、雷达、IMU、定位及其他传感器配置;
  • 采样范围、参数分布、变量组合、随机种子和停止条件;
  • 类别词表、标注模态、数据格式、切分规则和质量门槛;
  • 正常工况、边界工况、异常工况和重点失败模式;
  • 训练、验证、测试与固定回归用途。

场景规格与数据规格分离:同一场景可按不同传感器和标签要求采集,同一数据需求也可在不同场景族上执行。

2. 仿真运行

执行层把场景规格编译为运行任务,完成资源装载、参与者初始化、传感器配置、事件调度和采集控制。每次运行保留:

  • 场景、资产、本体和策略版本;
  • 引擎、插件、配置和运行环境信息;
  • 随机种子、参数取值和初始状态;
  • 时间轴、事件、状态快照和终止原因;
  • 采集文件、日志、异常和质量状态。

任务可以按场景族、参数组合或失败条件批量组织,并通过快照和种子重放关键运行。运行异常与数据质量问题分开记录,便于区分“仿真没有完成”和“仿真完成但数据不合格”。

3. 自动采集与标注

采集管线在统一时间与坐标约定下输出多源数据:

  • RGB、BaseColor、深度、法线、光流和边缘等视觉模态;
  • 语义分割、实例分割、材质分割和可见性信息;
  • 2D/3D 包围框、对象位姿、速度、轨迹和生命周期;
  • LiDAR 点云、雷达、IMU、定位与其他传感器数据;
  • 占据、可通行区域、接触、碰撞和任务事件真值;
  • 本体状态、控制量、策略输出和环境状态;
  • 相机内参、传感器外参、时间戳、坐标变换与标定信息。

自动标注直接来源于仿真世界状态和渲染、物理管线,避免把人工标注误差带入合成数据。标注规则、类别词表和格式转换均纳入版本管理。

4. 清洗与质量控制

质量管线从文件、时间、几何、语义和分布五个层面检查数据:

  • 文件完整性:文件缺失、损坏、重复、大小异常与清单不一致。
  • 时间一致性:时间戳单调性、跨传感器同步、掉帧、采样频率与延迟。
  • 几何一致性:内外参、坐标变换、深度、点云、2D/3D 投影和遮挡关系。
  • 语义一致性:类别映射、实例连续性、标注空值、标签越界和跨模态一致性。
  • 运行有效性:场景初始化、任务完成、碰撞、异常终止和采集状态。
  • 分布覆盖:场景因子、类别、距离、遮挡、天气、事件和失败模式的覆盖情况。
  • 数据泄漏:训练、验证、测试与回归集之间的场景、序列或近重复样本检查。

不合格样本进入隔离区并保留原因码;可修复问题进入重处理队列,需要重新仿真的问题返回对应场景和运行任务。

5. 版本、血缘与权限管理

平台为资产、场景、运行、原始数据、派生数据、标注、质量规则和数据集分别建立版本,并通过血缘关系连接:

数据集版本 → 样本版本 → 处理配方 → 仿真运行 → 场景与资产 → 传感器与软件配置

模型训练或评测任务可以反向记录所消费的数据集版本。数据更新时,平台能够识别受影响的派生产物和消费任务。权限按组织、项目、数据级别和操作类型配置,下载、修改、发布与删除均可审计。

6. 分发与调用

数据不局限于人工下载,可按下游系统需要提供:

  • 冻结的数据集包、清单和校验值;
  • 对象存储、文件系统或数据仓库挂载;
  • 按场景、事件、标签、质量和版本查询的 API;
  • 面向训练脚本、评测任务和 Agent 的 SDK;
  • 数据转换、抽样、切分和导出任务;
  • 通过数据集标识锁定版本的可复现实验入口;
  • 面向在线回归或持续训练的增量订阅。

分发记录与数据版本绑定,确保消费方使用的内容、格式和权限均可追踪。

7. 仿真与真机对齐

真机数据与仿真数据采用共同的任务分类、场景标签、时间与坐标约定,并围绕以下维度对齐:

  • 传感器内参、外参、采样频率、曝光、扫描方式和时间延迟;
  • 图像噪声、点云噪声、丢点、漂移、畸变和测量范围;
  • 天气、光照、材质、遮挡、背景和对象外观;
  • 对象类别、尺寸、速度、距离、姿态和交互行为;
  • 本体动力学、执行器响应、控制延迟和状态估计误差;
  • 事件频率、失败模式和业务任务分布。

对齐结果转化为传感器模型参数、场景采样权重、资产修正项和质量规则。平台保留调整前后的数据版本,使分布变化能够被评测和回溯。

8. 失败样本定向再生成

平台将真机日志、评测失败和模型退化统一转化为可执行的数据任务:

  1. 解析失败发生时的观测、状态、动作、环境和软件版本。
  2. 将失败关联到场景对象、事件、传感器和系统模块。
  3. 重建可重复的初始条件与关键时间窗口。
  4. 围绕可疑因子执行单变量扫描、参数邻域采样和反事实分支。
  5. 自动采集并质检新样本,形成针对性的训练补充集。
  6. 冻结代表性失败条件,形成版本回归集。
  7. 将训练结果送回同一回归基线,检查问题修复与其他场景退化。

失败样本因此不再停留在问题单和日志附件中,而成为可复用的场景、数据和评测资产。

业务流程

首轮数据生产

  1. 明确算法任务、数据模态、标签规范、数据格式和验收条件。
  2. 建立场景因子、资产、本体、传感器与采样分布。
  3. 编译并运行仿真任务,记录场景、配置、种子和运行状态。
  4. 同步采集数据、自动标注、系统状态和真值。
  5. 执行清洗、格式转换、几何检查、语义检查和分布分析。
  6. 按训练、验证、测试与回归用途切分并冻结数据版本。
  7. 通过数据包、存储或接口向训练与评测系统分发。

真机对齐

  1. 接入真机传感器数据、系统日志、标定信息和任务上下文。
  2. 统一时间、坐标、类别、事件和数据格式。
  3. 对比仿真与真机在传感器、环境、对象、行为和失败模式上的分布。
  4. 更新传感器参数、场景采样权重和质量规则。
  5. 生成对齐后的补充数据,并在固定基线上验证。

数据飞轮

  1. 模型训练和评测产生结果、错误和失败样本。
  2. 失败索引回连场景、数据、模型和软件版本。
  3. 平台复现失败并生成条件邻域与反事实样本。
  4. 新数据进入质检、版本和分发流程。
  5. 模型更新后使用固定回归集与新增失败集重新评测。
  6. 结果继续进入下一轮场景定义和数据生产。

典型场景

换了新相机,却要等三个月才有数据

一家做仓储 AGV 的团队换了一款新相机,想训练一个“识别地面障碍物”的模型。按老办法,得先等样机装好、推到仓库里跑上几个月收集画面,再雇人一帧一帧把障碍物框出来——这几个月里算法团队基本无事可做,只能干等数据。

我们在仿真里按他们的相机型号、安装位置和实际作业场景,直接生成大量画面,并自动标好每个障碍物的位置和类别,不需要人工一帧帧去框;等真机数据陆续到位,再用它来校准和补充。

于是算法团队在样机还在装配的时候就能开始训练,几个月的空窗期变成“边仿真边推进”;省掉大部分人工标注的花费;那些平时难得一见的障碍物也能提前造出来练,模型上线时更稳。

一年遇不到几次的危险场景

一家做自动驾驶的团队,最担心的是那种“一年碰不到几回”的情况:暴雨里突然窜出来的行人、掉在高速路上的轮胎。真实路测很难专门蹲守这些场景,更不可能为了收集数据故意制造危险。

我们在仿真里按需把这些罕见、危险的场景造出来,要多少造多少,还能连同“当时的天气、位置、车速”这些设定一起交付,保证以后能一模一样地重现。

这样原本靠运气加大量路测才能偶遇的场景,现在可以定向批量生产,既省钱又没有安全风险;针对这些极端情况反复训练,模型在关键时刻更靠得住。

把现场故障变成训练数据

一家做配送机器人的公司,产品上线后陆续收到现场故障:机器人在某种玻璃门前定位丢了、在某个坡道上打滑。这些故障现在只写在售后工单里,工程师在办公室很难重现,更别说把它变成能拿来训练的数据。

我们把现场故障还原成仿真里可以反复重演的场景,再围绕出问题的那个因素(比如反光、坡度)造出一批相似样本用于训练,并把这个故障固定下来,作为以后每次升级都要通过的“考题”。

现场“救火”于是变成办公室里的线上迭代,修得更快、出差成本更低;固定考题保证老毛病不会改着改着又犯——产品每遇到一次故障,能用的数据就厚一分。

交付形式

  • 场景定义、数据规格、标签词表和质量标准;
  • 仿真任务编排、运行管理和自动采集标注服务;
  • 多模态数据处理、格式转换、清洗与质检管线;
  • 数据目录、版本、血缘、权限与审计服务;
  • 数据查询、导出、挂载、API、SDK 与 Agent 调用接口;
  • 仿真—真机对齐工具、校准参数与分布分析报告;
  • 失败样本索引、复现场景、定向训练补充集与固定回归集;
  • 按用途冻结的数据集、清单、校验值和质量报告;
  • 面向企业内网、私有云或混合环境的部署与运维文档。

平台可按模块接入客户已有仿真引擎、数据湖、训练平台和评测系统,也可作为完整数据生产链路交付。

客户价值

  • 把数据需求变成可执行规格:场景、传感器、标注、分布和验收条件在生产前统一。
  • 提高数据可复现性:每个样本关联运行配置、场景版本、资产版本和随机种子。
  • 降低质量问题后移成本:在训练前发现缺帧、标定、坐标、标签和分布问题。
  • 统一仿真与真机治理:两类数据共享任务、场景、版本、质量和消费接口。
  • 缩短失败修复链路:现场失败可直接进入复现、再生成、训练和回归流程。
  • 保护研发可追溯性:数据集、模型、实验和评测结果通过血缘关系关联。
  • 支持持续的数据飞轮:每次运行、训练、评测和部署反馈都能转化为下一轮数据资产。

参考文档

  1. 绘卷 · AI 仿真技术平台:场景、采集、标注与交付工作流
  2. 融合数据生产与数据飞轮平台:仿真先行与真机协同
  3. SDG 专栏:多模态采集、传感器与数据工程
  4. 可用性与数据管线:格式、预检与训练工具链对接
  5. 传感器域随机化:相机、LiDAR、IMU 与物理扰动
  6. 仿真:具身智能训练的效率引擎与验证底座