# MiroVerse-v0.1数据集:16万条多步推理对话数据,赋能智能体与大模型训练
## 引言与背景
MiroVerse-v0.1是一个大规模的多步推理对话数据集,旨在为智能体和大语言模型的训练提供高质量的训练数据。该数据集包含超过16万条记录,涵盖了丰富的多步推理场景,包括问答、网页浏览、表格推理、任务规划等多种任务类型。随着人工智能技术的快速发展,具备多步推理能力的智能体和大语言模型在知识问答、信息检索、决策辅助等领域展现出巨大的应用潜力。然而,高质量的多步推理训练数据一直是制约模型性能提升的关键瓶颈。MiroVerse-v0.1数据集的发布,为解决这一问题提供了有力的数据支撑。
该数据集由两部分构成:第一部分是SFT(监督微调)训练数据,包含147,985条多轮对话记录,涵盖12个子数据集;第二部分是DPO(直接偏好优化)数据,包含12,443条偏好对记录,用于强化学习训练。数据以JSONL和JSON格式存储,每条记录包含完整的对话历史,包括系统提示、用户问题和助手回复。数据集覆盖了多跳问答、网页浏览、表格推理、科学问答、任务规划等多个领域,为模型提供了多样化的训练场景。
MiroVerse-v0.1数据集对科研和产业应用具有重要价值。在科研方面,该数据集可用于研究多步推理机制、工具使用策略、对话管理等前沿课题;在产业应用方面,可用于训练具备复杂推理能力的智能助手、自动化问答系统、数据分析工具等。完整的对话历史记录使得模型能够学习到真实场景下的推理过程和工具使用策略,显著提升模型的实际应用能力。
## 数据基本信息
### 数据字段说明
| 字段名称 | 字段类型 | 字段含义 | 数据示例 | 完整性 |
|---------|---------|---------|---------|--------|
| messages | list | 对话消息列表,包含完整的对话历史 | [{"role": "system", "content": "系统提示..."}, {"role": "user", "content": "用户问题..."}, {"role": "assistant", "content": "助手回复..."}] | 100% |
| role | string | 消息角色,取值为system、user、assistant | "user" | 100% |
| content | string | 消息内容,包含文本、工具调用指令等 | "When did the country where Piltene is located become part of the USSR?" | 100% |
| split | string | 数据集来源标识 | "MiroVerse-HotpotQA" | 100% |
| chosen | list | DPO数据中的优选回复对话 | [{"role": "assistant", "content": "优选回复..."}] | 100%(DPO数据) |
| rejected | list | DPO数据中的次选回复对话 | [{"role": "assistant", "content": "次选回复..."}] | 100%(DPO数据) |
### 数据集分布情况
#### SFT数据子集分布
| 数据集名称 | 记录数量 | 占比 | 累计占比 |
|-----------|---------|------|---------|
| MiroVerse-Voyager1.0 | 59,097 | 39.94% | 39.94% |
| MiroVerse-MuSiQue | 29,572 | 19.99% | 59.93% |
| MiroVerse-HotpotQA | 12,942 | 8.75% | 68.68% |
| MiroVerse-WebWalkerQA-Silver | 10,817 | 7.31% | 75.99% |
| MiroVerse-MegaScience | 10,615 | 7.17% | 83.16% |
| MiroVerse-TaskCraft | 8,890 | 6.01% | 89.17% |
| MiroVerse-QA-Expert-Multi-Hop-V1.0 | 6,187 | 4.18% | 93.35% |
| MiroVerse-OneGen-TrainDataset-MultiHopQA | 3,289 | 2.22% | 95.57% |
| MiroVerse-2WikiMultihopQA | 3,001 | 2.03% | 97.60% |
| MiroVerse-WikiTables | 1,606 | 1.08% | 98.68% |
| MiroVerse-WebShaper | 1,514 | 1.02% | 99.70% |
| MiroVerse-WebDancer | 455 | 0.30% | 100.00% |
| 合计 | 147,985 | 100.00% | - |
#### DPO数据分布
| 数据集名称 | 记录数量 | 占比 |
|-----------|---------|------|
| MiroThinker-8B-DPO-Data | 5,179 | 41.62% |
| MiroThinker-14B-DPO-Data | 4,464 | 35.88% |
| MiroThinker-32B-DPO-Data | 2,800 | 22.50% |
| 合计 | 12,443 | 100.00% |
#### 消息角色分布
| 角色 | 数量 | 占比 |
|------|------|------|
| user | 903,599 | 46.22% |
| assistant | 903,599 | 46.22% |
| system | 147,985 | 7.57% |
| 合计 | 1,955,183 | 100.00% |
#### 对话轮次分布
| 轮次范围 | 特点 |
|---------|------|
| 平均轮次 | 13.21轮 |
| 最小轮次 | 3轮 |
| 最大轮次 | 39轮 |
| 7轮对话 | 最多,约34,617条 |
### 主要实体分布
#### 任务类型分布
| 任务类型 | 对应数据集 | 记录数量 | 占比 |
|---------|-----------|---------|------|
| 网页浏览推理 | MiroVerse-Voyager1.0, WebWalkerQA-Silver | 69,914 | 47.25% |
| 多跳问答 | MuSiQue, HotpotQA, 2WikiMultihopQA, QA-Expert | 51,907 | 35.10% |
| 科学问答 | MegaScience | 10,615 | 7.17% |
| 任务规划 | TaskCraft | 8,890 | 6.01% |
| 表格推理 | WikiTables | 1,606 | 1.08% |
| 网页交互 | WebShaper, WebDancer | 1,969 | 1.33% |
| 通用多跳 | OneGen | 3,289 | 2.22% |
## 数据优势
| 优势特征 | 具体表现 | 应用价值 |
|---------|---------|---------|
| 大规模数据量 | 总计160,428条记录,包含147,985条SFT对话和12,443条DPO偏好对 | 为大模型提供充足的训练数据,支持大规模预训练和微调 |
| 多步推理能力 | 平均对话轮次达13.21轮,最大39轮,涵盖复杂推理过程 | 训练模型具备深度推理和多步骤问题解决能力 |
| 丰富任务类型 | 覆盖多跳问答、网页浏览、表格推理、科学问答、任务规划等12种任务类型 | 支持多领域模型训练,提升模型通用性 |
| 工具使用场景 | 包含真实的工具调用记录(搜索、浏览、代码执行等) | 训练智能体掌握工具使用策略,增强实用能力 |
| 高质量标注 | SFT数据包含完整的对话历史,DPO数据包含优选/次选对比 | 提升模型回答质量和偏好对齐能力 |
| 多模型适配 | 提供8B/14B/32B不同规模模型的DPO数据 | 支持不同参数量模型的训练需求 |
| 标准化格式 | JSONL/JSON格式,统一的字段结构 | 便于数据处理和模型集成 |
## 数据样例
### SFT数据样例
以下为来自不同子数据集的多步推理对话样例:
样例1:MiroVerse-HotpotQA(多跳问答)json
{
"messages": [
{"role": "system", "content": "你是一个任务解决助手,使用工具逐步回答问题..."},
{"role": "user", "content": "Ran Nakash是一位以色列拳击手,他唯一的失利是在什么日期对阵WBO拳王Marco Huck?"},
{"role": "assistant", "content": "我将搜索这场拳击比赛的日期信息。"},
{"role": "user", "content": "搜索结果显示比赛日期为2011年4月2日..."},
{"role": "assistant", "content": "\\boxed{April 2, 2011}"}
],
"split": "MiroVerse-HotpotQA"
}样例2:MiroVerse-Voyager1.0(复杂推理链)
json
{
"messages": [
{"role": "system", "content": "你是一个任务解决助手,使用工具逐步回答问题..."},
{"role": "user", "content": "追溯从1970年代纽约残疾人权利活动家抗议到Helvetica字体设计的历史链..."},
{"role": "assistant", "content": "步骤1:搜索1970年代纽约残疾人权利活动家..."},
{"role": "user", "content": "搜索结果:Judith Heumann是关键活动家..."},
{"role": "assistant", "content": "步骤2:搜索纽约地铁地图重新设计和字体..."},
{"role": "user", "content": "Massimo Vignelli重新设计了地铁地图,使用Helvetica字体..."},
{"role": "assistant", "content": "步骤3:追溯Helvetica的字体谱系..."},
{"role": "user", "content": "Helvetica源于Bell字体(1788年)..."},
{"role": "assistant", "content": "\\boxed{Alexander Findlater}"}
],
"split": "MiroVerse-Voyager1.0"
}样例3:MiroVerse-WikiTables(表格推理)
json
{
"messages": [
{"role": "system", "content": "你是一个表格推理助手,可以使用工具查询和分析数据..."},
{"role": "user", "content": "查找《纽约卧底》第二季中有多少集标题为\"Man's Best Friend\"?"},
{"role": "assistant", "content": "搜索纽约卧底第二季的完整剧集列表..."},
{"role": "user", "content": "搜索结果:Season 2共有26集,第3集标题为\"Man's Best Friend\"..."},
{"role": "assistant", "content": "根据搜索结果,只有1集标题为\"Man's Best Friend\""}
],
"split": "MiroVerse-WikiTables"
}样例4:MiroVerse-MegaScience(科学问答)
json
{
"messages": [
{"role": "system", "content": "你是一个科学问答助手,使用工具获取准确信息..."},
{"role": "user", "content": "解释量子纠缠现象及其在量子计算中的应用"},
{"role": "assistant", "content": "搜索量子纠缠的定义和应用..."},
{"role": "user", "content": "量子纠缠是量子力学中的一种现象..."},
{"role": "assistant", "content": "量子纠缠在量子计算中用于量子并行处理和量子通信..."},
{"role": "user", "content": "详细解释量子密钥分发原理..."},
{"role": "assistant", "content": "量子密钥分发利用量子态的不可克隆性..."},
{"role": "assistant", "content": "总结:量子纠缠是量子计算和量子通信的基础..."},
{"role": "assistant", "content": "\\boxed{量子纠缠}"}
],
"split": "MiroVerse-MegaScience"
}### DPO数据样例
样例5:MiroThinker-8B-DPO-Data(偏好对比)json
{
"chosen": [
{"role": "system", "content": "你是一个任务解决助手..."},
{"role": "user", "content": "Piltene所在的国家何时加入苏联?"},
{"role": "assistant", "content": "步骤1:确定Piltene所在国家..."},
{"role": "user", "content": "Piltene位于拉脱维亚..."},
{"role": "assistant", "content": "步骤2:搜索拉脱维亚加入苏联的时间..."},
{"role": "user", "content": "拉脱维亚于1940年8月5日加入苏联..."},
{"role": "assistant", "content": "\\boxed{August 5, 1940}"}
],
"rejected": [
{"role": "system", "content": "你是一个任务解决助手..."},
{"role": "user", "content": "Piltene所在的国家何时加入苏联?"},
{"role": "assistant", "content": "Piltene在拉脱维亚,苏联成立于1922年..."},
{"role": "user", "content": "需要准确日期..."}
]
}### 样例说明
以上样例展示了MiroVerse-v0.1数据集的多样性特征:
- 多跳问答:需要多次搜索和推理才能得到答案
- 复杂推理链:需要多步骤追溯历史事件和关联知识
- 表格推理:需要分析结构化数据并提取特定信息
- 科学问答:需要专业知识和深度解释
- 偏好优化:包含优选和次选回复的对比数据
## 应用场景
### 智能体训练
MiroVerse-v0.1数据集为智能体训练提供了丰富的多步推理场景。智能体需要学会使用工具(搜索、浏览、代码执行等)来完成复杂任务,数据集包含大量真实的工具调用记录,使智能体能够学习到在不同场景下选择合适工具的策略。例如,在回答历史问题时,智能体可以学习到先搜索人物信息,再搜索相关事件,最后综合信息得出结论的推理流程。这种多步骤的工具使用策略对于构建实用的智能助手至关重要。
### 大语言模型微调
该数据集可用于大语言模型的SFT和DPO微调。SFT数据包含完整的对话历史,使模型能够学习到高质量的回答风格和推理过程;DPO数据包含优选和次选回复的对比,用于强化学习训练,提升模型的回答质量和用户偏好对齐能力。通过在该数据集上微调,模型可以显著提升多步推理能力、工具使用能力和回答的准确性。
### 多跳问答系统开发
MiroVerse-v0.1包含多个多跳问答子数据集(HotpotQA、MuSiQue、2WikiMultihopQA等),这些数据可用于开发和优化多跳问答系统。多跳问答需要模型能够整合多个来源的信息来回答问题,数据集提供了丰富的训练案例,使系统能够学习到复杂的推理模式和信息整合策略。
### 网页浏览助手开发
数据集中包含大量网页浏览推理数据(Voyager1.0、WebWalkerQA-Silver、WebShaper等),这些数据记录了真实的网页搜索和浏览过程。基于这些数据,可以开发具备网页浏览能力的智能助手,能够自动搜索信息、浏览网页内容、提取关键信息并回答用户问题。
### 表格推理系统开发
WikiTables子数据集专门用于表格推理任务,包含大量表格数据和相关问题。基于这些数据,可以开发和优化表格推理系统,使系统能够理解表格结构、执行计算和比较操作,并回答基于表格数据的问题。
### 科学问答系统开发
MegaScience子数据集专注于科学领域的问答,涵盖物理、化学、生物等多个学科。基于这些数据,可以开发专业的科学问答系统,为科研人员和学生提供准确的科学知识解答。
### 任务规划系统开发
TaskCraft子数据集包含任务规划和执行的对话记录,可用于开发任务规划系统。这类系统能够将复杂任务分解为多个子任务,并规划执行顺序,提高自动化处理能力。
## 结尾
MiroVerse-v0.1数据集是一个大规模、高质量的多步推理对话数据集,包含超过16万条记录,涵盖多种任务类型和推理场景。该数据集为智能体训练、大语言模型微调、多跳问答系统、网页浏览助手等应用提供了丰富的训练数据。
数据集的核心优势在于其大规模的数据量、丰富的任务类型、高质量的标注信息以及完整的对话历史记录。这些特点使得MiroVerse-v0.1成为训练具备复杂推理能力的AI模型的理想选择。
通过使用MiroVerse-v0.1数据集,研究人员和开发者可以显著提升模型的多步推理能力、工具使用能力和实际应用能力。该数据集适用于多种AI应用场景,包括智能助手、问答系统、数据分析工具等。
如需获取更多关于数据集的详细信息或获取完整数据,可私信联系。
看了又看
验证报告
以下为卖家选择提供的数据验证报告:






