# 商超场景货架取货 Ego 第一人称多模态数据集介绍:RGB 双目 + 鱼眼阵列 + IMU + SLAM 同步采集
## 1. 数据集简介
商超场景-货架取货 是一套由 Ego 第一人称(Ego)可穿戴设备在真实商超环境中采集的多模态感知数据集,记录了货架取货作业(浏览货架、定位商品、伸手取拿、取出复核等拣选动作)过程中佩戴者的第一视角画面、头部运动与空间位姿信息。数据集包含 3 个采集片段(Episode),单段时长 46–60 秒,总时长约 161 秒,由同一台设备(序列号 26004294)于 2026 年 9 月 9 日采集完成。所有模态数据基于统一的微秒级时钟域(CLOCK_MONOTONIC_RAW)严格对齐,可直接用于 Ego 第一人称行为理解、具身智能与多模态融合等研究方向。
## 2. 数据集概览
| 片段 ID | 时长 (s) | RGB 帧数 (60fps) | 鱼眼帧数 (30fps) | IMU 采样 | SLAM 位姿 | 音频帧数 |
|---|---|---|---|---|---|---|
| episode_20260909_095409 | 54.80 | 3285 | 1642 | 27629 | 27403 | 855 |
| episode_20260909_132623 | 60.24 | 3613 | 1806 | 30375 | 30121 | 940 |
| episode_20260909_145830 | 45.83 | 2747 | 1374 | 23102 | 22913 | 715 |
| 合计 | ≈160.9 | 9645 | 4822 | 81106 | 80437 | 2510 |
- 总数据量:约 0.97 GB(30 个文件)
- 数据完整性:所有片段均通过完整性校验(episode_complete: true),无异常断电记录
- 丢帧情况:仅个别 RGB/鱼眼帧丢失(每片段 ≤3 帧),IMU、SLAM、音频零丢失
## 3. 采集设备
| 项目 | 规格 |
|---|---|
| 设备名称 | dc(XR 可穿戴设备) |
| 序列号 | 26004294 |
| 固件版本 | laurel-1.1.17-20260812 |
| 时钟域 | CLOCK_MONOTONIC_RAW(微秒级时间戳) |
设备以头戴(第一人称视角)方式佩戴,传感器与头部刚性连接,SLAM 输出的位姿即佩戴者头部在场景坐标系下的 6-DoF 轨迹。
## 4. 数据模态详解
### 4.1 RGB 双目相机(rgb_left / rgb_right)
| 参数 | 规格 |
|---|---|
| 分辨率 | 1600 × 1200 |
| 帧率 | 60 fps |
| 编码 | H.264 |
| 布局 | 左右双目,适合近距离精细感知 |
每片段 46–60 秒视频,双目时间戳对齐(同帧率同帧数),高帧率完整覆盖"扫视货架 → 伸手 → 抓取 → 取回"的快速连续动作,可用于双目深度估计、手部-物体交互检测与商品识别。
### 4.2 鱼眼相机阵列(fisheye_A)
| 参数 | 规格 |
|---|---|
| 单目分辨率 | 640 × 480 × 4 目 |
| 存储格式 | 640 × 1920(4 目垂直拼接)MJPEG |
| 帧率 | 30 fps |
| 视场 | 大视场角鱼眼,覆盖头部周边环境 |
四目鱼眼阵列提供近全向环境感知能力,适合 SLAM、场景级 3D 重建与货架区域环境建模;与 RGB 双目形成"中心精细 + 周边广域"的互补布局。
### 4.3 头部 IMU(imu_head)
| 参数 | 规格 |
|---|---|
| 采样频率 | 500 Hz |
| 输出 | 加速度计(accel, 3 轴)+ 陀螺仪(gyro, 3 轴) |
| 预处理 | 已提供零偏(bias)与标定系数,corrected = scale_inv * (raw - bias) |
每片段约 2.3–3.0 万条采样,可与视觉做紧耦合融合(VIO),头部朝向变化(扫视定位商品)亦是取货动作分段的辅助信号。
### 4.4 SLAM 头部位姿(slam)
| 参数 | 规格 |
|---|---|
| 采样频率 | 500 Hz |
| 输出 | 7 维位姿 [tx, ty, tz, qx, qy, qz, qw](位置 + 四元数) |
| 附加字段 | tracking_status(跟踪状态)、confidence(置信度) |
设备端实时 SLAM 输出的 6-DoF 轨迹,可直接作为头部运动真值参考,或用于与离线重建结果对比。
### 4.5 音频(audio)
| 参数 | 规格 |
|---|---|
| 采样率 | 16 kHz |
| 声道 | 2(双声道) |
| 位深 | 16-bit PCM(WAV) |
记录取货过程中的环境声与操作声(如商品触碰、包装摩擦、货架声响),可辅助动作分段与场景理解。
### 4.6 手部通道(可选,本批未启用)
数据结构预留了 imu_hand_left / imu_hand_right / slam_hand_left / slam_hand_right 四组手部传感器通道,本批采集未启用(样本数为 0),相关字段结构保持一致,便于后续扩展。
## 5. 相机标定
每个片段的 calibration/ 目录提供完整标定文件:
| 文件 | 内容 |
|---|---|
| rgb_left.json / rgb_right.json | 双 RGB 相机标定:SEUCM 模型(内参 + 投影中心 + α/β 畸变参数)与 PDCM 模型(Brown-Conrady 多项式 k1/k2/k3/p1/p2)双套参数,含外参 T/R |
| fisheye.json | 4 目鱼眼 SEUCM 模型标定(内参、投影中心、畸变、外参) |
| imu.json | 头部 IMU 加速度计/陀螺仪零偏与尺度校正 |
SEUCM 与 PDCM 双模型并行提供,方便用户根据下游算法(鱼眼去畸变、立体校正、BA 优化)灵活选用。
## 6. 目录结构
text
商超场景-货架取货/
└── episode_20260909_095409/ # 单个采集片段(3 个片段结构相同)
├── metadata.json # 片段元数据:时间、设备、流配置、完整性统计
├── data/
│ └── states.hdf5 # 所有时间序列的索引与传感器数据(HDF5)
├── audio/
│ └── 0001.wav # 16kHz 双声道 PCM 音频
├── calibration/
│ ├── fisheye.json # 鱼眼阵列标定
│ ├── imu.json # IMU 标定
│ ├── rgb_left.json # 左 RGB 标定
│ └── rgb_right.json # 右 RGB 标定
└── videos/
├── fisheye_A/0001.mjpg # 4 目鱼眼拼接视频流
├── rgb_left/0001.h264 # 左目 H.264 裸流
└── rgb_right/0001.h264 # 右目 H.264 裸流## 7. states.hdf5 数据格式
data/states.hdf5 是整个片段的时间序列中枢,按模态分组存储:- 视频模态(rgb_left / rgb_right / fisheye_A):提供 timestamp_us、frame_id、file_id、file_offset、frame_size、status,支持对视频文件按帧精确随机访问与逐帧时间戳对齐;
- IMU(imu_head):timestamp_us、accel (N×3)、gyro (N×3)、status;
- SLAM(slam):timestamp_us、pose (N×7)、tracking_status、confidence;
- 音频(audio):timestamp_us、file_id、file_offset、frame_size 等;
- 预留通道(fisheye_B / imu_hand_ / slam_hand_):结构一致,本批样本数为 0。
快速读取示例:
python
import h5pyf = h5py.File("episode_20260909_095409/data/states.hdf5", "r")
slam_pose = f["slam/pose"][:] # (N, 7) 位置 + 四元数
imu_accel = f["imu_head/accel"][:] # (N, 3) 加速度
rgb_ts = f["rgb_left/timestamp_us"][:] # 视频帧微秒时间戳
## 8. 时间同步机制
所有模态共用同一时间域(CLOCK_MONOTONIC_RAW),以微秒(us)为单位记录时间戳:
- 视频流:逐帧时间戳(帧率 30/60 fps);
- IMU / SLAM:500 Hz 高频时间戳;
- 音频:块级时间戳。
metadata.json 中的 record_time 给出了各模态的公共起止时间(common_start_us / common_end_us),可直接做多模态裁剪与对齐,无需额外的跨设备时钟换算。
## 9. 适用研究方向
1. Ego 第一人称行为理解:货架取货/拣选动作识别(定位、伸手、抓取、取回)、任务步骤分段与细粒度操作分析;
2. 具身智能与机器人学习:作为人手取货演示数据,用于模仿学习、抓取策略学习与拣选流程自动化;
3. 多模态融合:视觉 + IMU + 位姿 + 音频的联合建模(VIO、音视频动作检测);
4. 3D 场景重建:双目深度、鱼眼全向重建、货架数字孪生与商品空间定位;
5. 手部-物体交互:抓取目标检测、取放时序定位、交互片段自动切分;
6. SLAM 算法评测:设备端实时 SLAM 轨迹 + 完整标定,可作为基准数据。
## 10. 数据引用与许可
数据集目录为 商超场景-货架取货,含 3 个 episode,采集日期 2026-09-09。使用本数据集时请保留原始目录结构与 metadata.json 中的设备与时间信息,以便结果复现。
看了又看
验证报告
以下为卖家选择提供的数据验证报告:






