通用开源数据集批量下载需求:10万+小时视频数据交付

为扩充视频生成与具身世界模型的训练数据规模,典枢数据现面向具备数据集批量下载能力的团队,发布通用开源数据集采购需求。本次需求目标是下载10万+小时量级的优质开源数据,欢迎具备相关技术能力与带宽资源的团队联系合作。

需求说明

目标:下载10w+小时量级的优质数据。

  • 需求:由我们提供数据集下载链接,合作方全量下载数据集,包括csv文件下的各视频链接均需下载,不需要数据清洗
  • 存储:我们可提供云服务器或硬盘,外网流量费用可单独计算
  • 验收标准:抽查数据完整性和可读性
  • 交付时间:7.31交付,按优先级顺序推进

数据集清单与优先级

以下为示例数据集链接,请按照优先级(P0-P3)依次交付:

  • P0级(最优先保证下载)
    • Panda 10M(70M子集)— 37k hours,YT反爬 ✅
    • InternVid-10M-FLT — 32.5k hours,YT反爬 ✅
  • P1级
    • Koala-36M — 172K h / 48.9G,720p,YT反爬 ✅
    • Sekai — 5K h / 102G,720p,YT反爬部分
    • Panda-70M — 167K h / 36TB,720p,YT反爬 ✅
  • P2级
    • DropletVideo-10M — 20K h / 13.5G,720p,YT反爬部分
  • P3级
    • MiraData — 16K h,720p,YT反爬 ✅
    • ShareGPT4Video — 3K h,720p,YT反爬部分
    • InterVid(InternVid-Full)— YouTube数据,需爬虫,720p,YT反爬 ✅

数采需求 – 典枢数据数据采购需求发布栏目

相关文章

发表评论

滚动至顶部