华东具身智能数据采集中心

verify-tagEgo第一视角多场景具身智能数据集:农业葡萄采摘与物业保洁清洁运维(含双目60FPS微秒级IMUSLAM位姿多模态原始数据)

Ego农业葡萄采摘物业保洁具身智能多模态原始数据

4,999

9.62GB

数据标识:D17879158708809327

发布时间:2026/08/28

# 【原始未标注 Raw Data】Ego第一视角多场景具身智能数据集:农业葡萄采摘与物业保洁清洁运维(含双目60FPS/微秒级IMU/SLAM位姿/多模态原始数据)

本数据集由 Ego(第一视角具身佩戴/采集设备) 在真实物理环境中采集,涵盖精准农业(葡萄采摘)物业保洁运维(灭火器保养、消火栓深度清洁)两大典型垂直场景。数据集为全量原始采集文件(Raw Data,未标注),完整记录了操作者在真实动态复杂环境下的双手精细操作、长程动作规划、工具交互及全身运动轨迹。

---

## 一、 数据集整体基本概况

* 数据性质:真实环境第一视角多模态原始采集数据(未标注 / Raw Data
* 涉及核心场景
1. 农业采摘场景:露天/棚内葡萄果串识别、托举与剪切果梗作业。
2. 物业保洁场景 - 灭火器维护:灭火器箱开合、瓶身擦拭、喷管清洁与归位整理。
3. 物业保洁场景 - 消防栓维护:铰接箱门锁扣解开、立面视窗玻璃擦拭、水带卷盘及管阀死角除尘。
* 数据规模:包含多个完整独立 Episode 操作序列,以及配套的多人次第三人称视角录像(MP4)与现场高分辨率照片。
* 时间基准:微秒级($\mu s$)高精度单调时钟对齐(CLOCK_MONOTONIC_RAW),保证跨模态动力学与视觉时序严密同步。

---

## 二、 传感器配置与多模态数据结构

每个 Episode 数据包均包含标准化、高同步率的多模态传感数据:

| 模态类别 | 传感器 / 数据通道 | 规格参数 | 存储形式 / 作用说明 |
| :--- | :--- | :--- | :--- |
| 第一视角双目视觉 | rgb_left / rgb_right | 1600×1200 @ 60 FPS (H.264) | 毫秒级双手精细操作与果梗/阀门接触近景 |
| 超广角环视全景 | fisheye_A | 640×1920 @ 30 FPS (MJPEG) | 操作者周边空间布局与全身动作视域 |
| 头部高频 IMU | imu_head | 500 Hz 采样率 | data/states.hdf5,头部加速度与角速度动力学信号 |
| 空间 6-DoF 位姿 | slam | 500 Hz 采样率 | data/states.hdf5,高精空间运动与第一视角轨迹解算 |
| 现场双声道音频 | audio | 16kHz / 16-bit PCM 双声道 | audio/0001.wav,记录剪切、擦拭摩擦及金属撞击声 |
| 高精几何标定 | calibration/ | 内参/外参矩阵 (SEUCM / PDCM) | calibration/*.json,支持双目立体匹配与 3D 点云重建 |
| 辅助第三视角资料 | 手机/相机录像与照片 | 1080P/4K MP4 & JPG | 提供外部宏观视角对照与多视角协同验证 |

---

## 三、 分场景核心特点与技术价值

### 1. 农业场景:葡萄采摘(Grape Harvesting)
* 场景挑战:强自然光照变化(逆光、强光、树荫斑驳)、叶片重度遮挡、果实易损易破。
* 技术价值
* 柔性果实精细操作(Fine Manipulation):记录“手托果串底部 + 剪刀精准剪切果梗”的双臂协同,避免拉扯损伤果实。
* 复杂背景 3D 视觉:双目 60FPS 结合精确标定参数,便于训练在复杂枝叶遮挡下的果梗空间 3D 定位与避障模型。

### 2. 物业保洁场景:灭火器维护(Fire Extinguisher Maintenance)
* 场景挑战:长程多阶段工序(2 分钟以上连续动作)、圆柱金属与软管异质材料贴合擦拭、大范围俯仰与下蹲姿态切换。
* 技术价值
* 长序列任务规划(Long-Horizon Tasks):提供从寻址、搬运、全角度擦拭到复原归位的全流程示范,适配分层动作规划(Hierarchical Policy)。
* 接触力学与声音反馈:同步录制擦拭声音与 500Hz 头部运动,支撑多模态接触感知研究。

### 3. 物业保洁场景:消防栓维护(Fire Hydrant Cleaning)
* 场景挑战:铰接机构(柜门开合)、高反光/透明介质(视窗玻璃)、狭窄箱体内部死角避障。
* 技术价值
* 铰接物体操作(Articulated Object Manipulation):包含开门扣锁、旋转拉开柜门、复位锁闭的完整物理交互动作。
* 高反光环境 3D 感知:为透明玻璃及金属高光表面的位姿估计与三维高斯溅射(3DGS)重建提供极具挑战性的基准数据。

---

## 四、 适用研究与落地应用方向

* 具身智能与 VLA(Vision-Language-Action)大模型:作为高质量的第一视角人类专家示范(Ego-Demonstrations),用于模仿学习(Imitation Learning)、Diffusion Policy 与动作轨迹生成。
* 特种与服务机器人研发:直接赋能农业果蔬采摘机器人商用清洁机器人轮式/双足双臂巡检作业机器人的末端操作算法。
* 三维场景重建与空间智能:基于微秒级对齐的 SLAM 轨迹与双目视频,开展 3D Gaussian Splatting (3DGS) 及 NeRF 动态环境稠密建模。

---

## 五、 联系方式

本数据集为原始采集文件(未标注),如需获取完整数据集、技术文档或洽谈数据定制与算法合作,欢迎与我们联系:

* 联系人:唐先生
* 联系电话:15210269336

看了又看

验证报告

以下为卖家选择提供的数据验证报告:

data icon
Ego第一视角多场景具身智能数据集:农业葡萄采摘与物业保洁清洁运维(含双目60FPS微秒级IMUSLAM位姿多模态原始数据)
4,999
9.62GB
申请报告