7月的AI数据集新闻中,两个新发布格外引人注目:MIT与IBM联合推出的ChartNet,用150万张合成图表教会AI读懂数据可视化;香港中文大学领衔的CUHK-X,用七种同步模态刺破了视觉语言模型的”感知泡沫”。两个数据集代表了完全不同的技术方向——一个是用合成数据解决真实标注的稀缺,另一个是用真实多模态数据揭示现有模型的盲区。它们共同揭示了一个判断:AI模型的性能瓶颈正在从”算力”转向”数据质量与多元性”。
一、ChartNet:MIT+IBM推出150万张合成图表数据集,小模型碾压GPT-4o
MIT CSAIL与IBM研究院联合发布ChartNet,这是目前已知最大的合成图表数据集,包含150万个多样化图表样本,覆盖24种图表类型(柱状图、折线图、饼图、散点图等)和6种绘图库(Matplotlib、Seaborn、Plotly等)。该成果被CVPR 2026接收。
ChartNet的每个样本包含:图表图像、对应的绘图代码、生成图表的表格数据(CSV)、自然语言描述、以及带有链式推理的问答对。此外还附加了9.6万条人工标注数据、3万张真实世界图表和安全性数据子集。其生成方式采用”代码引导式合成”:先用现有图表图像反向生成代码,再通过LLM迭代修改代码中的数据、标签、颜色、图表类型等参数,一张种子图表可以扩展出数百种变体,再经过自动化质量筛选确保准确性。
最令人意外的结果是:在ChartNet上微调的小型开源VLM(2B-7B参数)在图表理解任务上显著超越了GPT-4o。这一结果对”模型越大越好”的主流认知构成了直接挑战——在特定垂直任务中,高质量的专有训练数据比模型规模的单纯膨胀更重要。对于数据交易平台而言,这印证了一个判断:垂直领域的高质量专有数据集,其价值可能不亚于基础模型训练数据的边际增量。
二、CUHK-X七模态数据集:235B参数的模型也过不了的感知考试
香港中文大学AIoT实验室联合UIUC、哥伦比亚大学、匹兹堡大学发布CUHK-X数据集,这是首个同时覆盖RGB、深度、热成像、红外、骨架、IMU、毫米波雷达七种同步模态的大规模人类活动数据集。包含64,267个样本、40种日常动作、30名参与者在两个真实室内环境中采集,总时长19小时。成果被移动计算顶会ACM MobiSys 2026接收。
评测结果颇具冲击力:七模态平均识别准确率76.52%,其中热成像达到92.57%的识别准确率,而IMU(45.52%)和毫米波雷达(46.63%)虽然单独表现不佳,但在遮挡、弱光和隐私保护场景中提供不可替代的互补价值。更值得关注的是推理能力的差距——HAU四项子任务的平均准确率仅40.76%,即使用Doubao-seed-2.0这样的大模型也未超过55%。
CUHK-X的核心发现是:当前最强的视觉语言模型的能力集中在RGB模态上,一旦面对热成像、深度、毫米波等真实物理世界中常见的非RGB模态,能力出现断崖式下降。这意味着,如果AI Agent要走出”看图说话”的舒适区,进入需要综合多种传感器信号的物理世界,现有模型的感知能力还远远不够。该数据集的未来扩展计划包括引入音频、WiFi信号、触觉、心率、脑电等更多模态,这将进一步拉开AI能力测试的上限。
三、COinCO:扩散模型”篡改”COCO图像,测试AI的上下文感知能力
CVPR 2026录用的COinCO数据集采用了一种别出心裁的方式:利用扩散模型对COCO数据集中的图像进行上下文一致的修复替换,生成了97,722张独特图像,其中包含上下文一致和不一致两种场景。然后经大型视觉语言模型验证并分类标注。
这个数据集的设计哲学值得一提:它不是从零开始”拍照片”生成数据集,而是在已有成熟数据集(COCO)的基础上进行”定向改造”,用最小的成本创造一个有挑战性的新评测基准。这种方法论的启示在于——数据集的创新不一定要从零开始采集,通过对已有数据的结构性改造,同样可以创造出高质量的评测资源。在数据采集成本持续攀升的背景下,这种”改造而非创造”的思路值得数据行业借鉴。
来源:CVPR 2026
四、AI Agent评测数据集集中爆发:微软/北大/港大等发布10个新基准
2026年7月,微软、北京大学、香港大学、上海交通大学等机构密集发布了10个AI Agent评测数据集,覆盖从长程记忆到真实环境任务执行的全场景。包括RHELM(推理与任务执行)、MemLens(长程记忆)、LongBlocks(多步骤规划)、AgentTrove(工具使用)、Claw-Eval(环境交互)等。
这些数据集的集中出现并非巧合。随着AI Agent的概念从”聊天机器人”进化为”能执行多步骤任务的数字助手”,市场对Agent能力评测的需求急剧上升。然而,Agent的能力维度远比传统NLP模型复杂——它需要推理、记忆、规划、工具调用、环境感知等多种能力的协同。这些评测数据集的出现,说明行业正在系统性地构建Agent能力的”考试体系”。对于数据交易平台而言,Agent训练数据和评测数据的需求可能会成为下一波数据采购的增长点——尤其是涵盖真实环境交互(如浏览器操作、API调用、文件管理等)的行为数据。
来源:北京智源社区
五、GPIC:李飞飞团队1亿级宽松许可图文数据集,对标”生成式AI时代的ImageNet”
斯坦福视觉实验室李飞飞团队发布GPIC(Giant Permissive Image Corpus)大规模图像数据集,包含超过1亿个图文样本,所有数据均采用宽松许可(CC BY、CC0、Public Domain等),明确可商用、可研究。这是当前规模最大的宽松许可图像数据集之一,被部分研究者称为”生成式AI时代的ImageNet”。
GPIC的核心贡献不在于技术突破,而在于解决了长期困扰行业的”许可困境”——此前大规模图文数据集(如LAION-5B)的许可状态模糊,部分数据存在版权风险,使得商业公司无法放心使用。GPIC通过严格的许可筛选,确保了每一张图像都是合法的训练素材。这种将”合规性”作为数据集核心设计理念的思路,代表了AI数据行业从”野蛮生长”到”精细化运营”的转折。对于商业化的数据交易平台而言,许可清晰、可商用的数据集正是当前市场最稀缺的资源。
来源:CSDN
数据星球·新闻资讯 – 典枢数据旗下AI数据行业栏目