物理AI数据基建合作需求:开源数据集下载、数据平台共建与行业数据集合作

物理AI的数据基建正迎来爆发期。具身世界模型可用的真实交互数据不足大语言模型训练数据的万分之一,而实现可用的具身智能至少需要1000万小时多模态数据,目前全球积累不足5%。为构建完善的数据基础设施,典枢数据现面向具备大规模数据工程能力的团队,发布开源数据集批量下载与数据基础设施合作需求。

需求背景:数据是物理AI最大短板

据行业研究,以人形机器人为代表的物理AI赛道中,数据是最卡脖子的领域。大语言模型拥有万亿级token训练数据,而具身模型可用的真实交互数据不足其万分之一。行业专家共识认为,机器人实现”GPT时刻”至少需要1亿小时级真实操作训练数据,全球有效具身数据仅约几十万小时,存在2-3个数量级的缺口。

当前全国已建成高质量数据集约12万个、总量超1565PB,其中7个数据标注先行先试城市的标注规模超119PB,服务425个大模型研发。但具身智能领域的数据供给仍远远不足,这正是我们开展大规模数据采购与基建合作的原因。

合作方向一:开源数据集批量下载

我们提供数据集下载链接,合作方负责全量下载,包括csv文件下的各视频链接均需下载,无需数据清洗。重点关注以下数据源:

  • P0优先级:Panda-70M、InternVid-10M-FLT(合计约7万小时)
  • P1优先级:Koala-36M、Sekai、Panda-70M完整版(含36TB的Panda-70M全量)
  • P2优先级:DropletVideo-10M、MiraData
  • P3优先级:ShareGPT4Video、InternVid-Full(需爬虫)

交付要求:按P0-P3优先级顺序交付,目标10万+小时量级,交付时间7.31前。我们可提供云服务器或硬盘,外网流量费用可单独计算,验收标准为抽查数据完整性和可读性。

合作方向二:数据平台与数采设备合作

我们正在构建从”采集硬件-数据平台-开源数据集-真机验证”的完整数据闭环,诚邀以下能力方合作:

  • 数采设备供应商:EGO头戴相机、UMI夹持器、WristCam腕带相机、触觉传感器、灵巧手等
  • 数据标注平台:具备AI预标注+人工审核能力,可支撑VLA模型替代人工完成80%以上标注工作的平台
  • 数据格式工程:支持HDF5/MCAP/LeRobot等多模态格式互转的工程团队
  • 真机验证伙伴:可配合进行数据跨本体迁移验证的机器人企业

合作方向三:行业高质量数据集共建

我们关注医疗、工业、低空经济、具身智能等重点领域的行业高质量数据集建设,诚邀拥有以下资源的机构合作:

  • 行业数据持有方:拥有医疗、工业、物流等垂直领域数据的机构
  • 专家标注团队:具备医学、工业等专业标注能力的专家网络
  • 数据集共建方:愿意参与”数据采集-标注-评测-运营”全流程的合作伙伴

合作方式

我们提供清晰的交付标准、合理的结算方案与长期合作空间,欢迎具备相关能力的团队联系合作。有意者请提供贵方能力简介、过往案例与报价,我们将尽快评估并推进。


数采需求 – 典枢数据数据采购需求发布栏目

相关文章

发表评论

滚动至顶部