NVIDIA开源10T tokens、跨维智能发布跨源机器人数据集:AI数据进入开源爆发期

7月的AI数据领域,开源成为最响亮的主题。跨维智能在WAIC 2026上发布全球首个跨源机器人大规模数据集Aligned DexWorld,整合七大公开数据集打破机器人数据孤岛;NVIDIA一口气开源Nemotron系列15个子集、超10T tokens的训练数据;葡萄牙发布首个国家级AI模型并完全开源;Inkling以975B参数和多模态能力加入开源模型阵营。当头部企业和国家力量同时选择”开源”作为AI数据集的分发策略时,数据要素的流动方式正在被重新定义——从封闭的私域数据交易,走向开放的行业数据共建。

一、跨维智能发布Aligned DexWorld:全球首个跨源机器人数据集

2026世界人工智能大会(WAIC)期间,跨维智能发布全球首个贯通”人类-仿真-真机”三源对齐的大规模开源数据集Aligned DexWorld。该数据集包含超过200万个人类和机器人数据样本,创新性地整合了Droid、AgiBotWorld-Beta、RoboMIND、RH20T、LIBERO、RoboTwin、VITRA等七大主流公开数据集,实现了时间、空间、动作三个维度的统一对齐。

这一发布的意义在于解决了具身智能领域长期存在的”数据孤岛”问题。过去,不同来源的机器人数据集在采样频率、坐标系定义、动作表示方式上各自为政,模型开发者需要花大量精力做数据预处理。Aligned DexWorld通过对齐三大维度,让来自不同源的数据可以直接混合训练——这意味着机器人模型的泛化能力有望显著提升。同步发布的DexVerse实时多物理场仿真引擎则为持续生成训练数据提供了基础设施。数据集面向学术机构和产业开发者免费开源。

来源:证券时报新浪财经

二、NVIDIA开源Nemotron数据集系列:超10T tokens免费可用

NVIDIA在7月17日开源了Nemotron系列数据集,涵盖超过10T tokens + 4000万条后训练样本,包含15个子集。核心覆盖数学推理、代码生成、多语言对话、通用文本预训练、监督微调等领域。亮点包括Nemotron-CC-v2(基于2024-2025年Common Crawl数据翻译至15种语言)、Nemotron-Pretraining-Code(覆盖11种编程语言)、以及1330亿token的数学预训练数据集Nemotron-CC-Math。

NVIDIA此次开源的规模和质量都极具竞争性。此前的超大规模高质量训练数据(如RefinedWeb、Dolma)大多来自学术机构或开源社区,而这次是头部AI芯片企业直接下场开源训练数据。其背后的商业逻辑值得深思:NVIDIA并不需要靠卖数据赚钱,开源高质量训练数据可以吸引更多开发者使用NVIDIA的GPU和NeMo框架进行模型训练——数据开源本质上是算力生态的”护城河”工程。对于数据交易平台而言,这一趋势意味着基础通用数据的商业价值正在被开源稀释,垂直领域的高质量标注数据和行业专用数据集将成为真正的稀缺资源。

来源:北京智源社区

三、葡萄牙发布国家级AI模型Amália:主权AI的数据开源实验

葡萄牙发布了其首个国家级AI模型Amália,基于EuroLLM-9B微调优化,面向欧洲葡萄牙语。该模型的最大特色是**完全开源**——权重、数据集、代码全部公开。这一被称为”主权AI”的策略,反映了一种新兴趋势:中小国家正在通过开源构建自己的AI能力,而非依赖封闭的商业模型。

Amália的数据集包含大量葡萄牙语语料和欧洲葡萄牙语的特有表达,对于一个只有约1000万人口的国家而言,如果没有开源社区的力量,几乎不可能获得足够的高质量训练数据。Amália的开源决策与其说是”选择”,不如说是”必然”——通过开源吸引全球开发者的贡献,用社区的力量弥补数据规模上的不足。这种模式对同样面临数据稀缺的小语种国家和地区具有示范意义。

来源:TNW

四、Inkling开源:975B参数多模态模型加入开源阵营

Thinking Machines Lab发布Inkling模型,一个975B参数的多模态模型(文本、图像、音频、视频),在45T tokens上训练,采用Apache 2.0开源协议。Inkling使用了公开数据和开源数据集进行训练,在多个基准上表现接近同级别的闭源模型。

Inkling的发布再次印证了一个趋势:开源大模型与闭源大模型之间的能力差距正在系统性缩小。从2024年初约8个百分点的差距,到现在开源模型已经在多个基准上逼近闭源标杆。支撑这一追赶的核心要素之一就是高质量开源数据集的不断涌现——NVIDIA Nemotron、DCLM、FineWeb等数据集为开源模型提供了不再明显劣于互联网巨头的数据基础。对于数据行业而言,这意味着”为训练数据付费”的市场正从通用数据转向垂直专业数据和领域专属数据的交易。

来源:Simon Willison

五、开源数据集井喷:从能源到医学,多模态数据百花齐放

7月还有多个值得关注的开源数据集发布:mAIEnergy能源领域多模态数据集(CC BY 4.0协议,整合5万文本+2万图像+2500万时序数据)、FOMO260K脑部MRI数据集(26万次扫描、5.5万受试者、聚合自910个公开来源)、NVIDIA Nemotron-VLM-Dataset-v2(800万+多模态样本,CC BY 4.0,可用于商业用途)。

这些数据集的共同特征是:规模越来越大(百万到十亿级别)、许可越来越开放(CC BY 4.0和Apache 2.0成为主流)、领域越来越垂直(从能源到医学到遥感)。开源数据集从”可有可无的补充”变为”模型训练的主流选择”,正在从根本上改变AI训练数据的供给格局。对于数据交易平台而言,这意味着商业模式需要相应进化:从”卖通用数据”转向”卖行业定制化数据解决方案”和”数据工程服务”。

来源:Scientific Data中国信通院AI Hub


数据星球·新闻资讯 – 典枢数据旗下AI数据行业栏目

相关文章

发表评论

滚动至顶部