为扩充视频生成与具身世界模型的训练数据规模,典枢数据现面向具备数据集批量下载能力的团队,发布通用开源数据集采购需求。本次需求目标是下载10万+小时量级的优质开源数据,欢迎具备相关技术能力与带宽资源的团队联系合作。
需求说明
目标:下载10w+小时量级的优质数据。
- 需求:由我们提供数据集下载链接,合作方全量下载数据集,包括csv文件下的各视频链接均需下载,不需要数据清洗
- 存储:我们可提供云服务器或硬盘,外网流量费用可单独计算
- 验收标准:抽查数据完整性和可读性
- 交付时间:7.31交付,按优先级顺序推进
数据集清单与优先级
以下为示例数据集链接,请按照优先级(P0-P3)依次交付:
- P0级(最优先保证下载):
- Panda 10M(70M子集)— 37k hours,YT反爬 ✅
- InternVid-10M-FLT — 32.5k hours,YT反爬 ✅
- P1级:
- Koala-36M — 172K h / 48.9G,720p,YT反爬 ✅
- Sekai — 5K h / 102G,720p,YT反爬部分
- Panda-70M — 167K h / 36TB,720p,YT反爬 ✅
- P2级:
- DropletVideo-10M — 20K h / 13.5G,720p,YT反爬部分
- P3级:
- MiraData — 16K h,720p,YT反爬 ✅
- ShareGPT4Video — 3K h,720p,YT反爬部分
- InterVid(InternVid-Full)— YouTube数据,需爬虫,720p,YT反爬 ✅
数采需求 – 典枢数据数据采购需求发布栏目