panpan

verify-tag IN-CXR胸部X光影像数据集

胸部X光影像

19.9

359.69MB

数据标识:D17846883092001538

发布时间:2026/07/22

## 引言与背景

胸部X光检查是临床诊断中最常用的影像学检查方法之一,广泛应用于肺炎、肺结核、肺癌、心脏病等多种疾病的筛查与诊断。随着人工智能技术的快速发展,基于深度学习的医学影像分析系统正在成为辅助医生诊断的重要工具。高质量的标注数据集是训练可靠AI模型的基础,然而医学影像数据的获取和标注面临诸多挑战,包括数据隐私保护、标注专家资源稀缺、标注一致性难以保证等问题。

IN-CXR胸部X光影像数据集正是为应对这些挑战而构建的专业医学影像数据集。该数据集包含12600张经过预处理的胸部X光片,涵盖正常与异常两种类别,每类各6300张图像。数据集的完整内容构成包括:原始图像文件(PNG格式)、基于文件夹结构的类别标注(Normal/AbNormal目录划分)、多种命名模式(序列命名和哈希命名)以及统一的图像预处理标准。这种结构设计使得数据集既保留了完整的原始影像信息,又提供了清晰的分类标注,便于研究人员和开发者直接用于模型训练和验证。

该数据集对科研和产业应用具有重要价值。在科研领域,它可以支持胸部X光异常检测算法的研究与比较,促进医学影像AI技术的发展;在产业应用中,它可用于训练临床辅助诊断系统,提高疾病筛查效率和准确性。数据集的均衡类别分布和标准化预处理流程,为算法评估提供了公平的基准条件。

## 数据基本信息

### 数据字段说明

| 字段名称 | 字段类型 | 字段含义 | 数据示例 | 完整性 |
|---------|---------|---------|---------|--------|
| 图像ID | 字符串 | 图像唯一标识符,采用序列编号或MD5哈希值 | AB_training_1 / Normal_Training_10956 / 0005931495bf3d305a04572d1b899ea0 | 100% |
| 图像类别 | 字符串 | 图像所属类别,正常或异常 | Normal / AbNormal | 100% |
| 文件格式 | 字符串 | 图像存储格式 | PNG | 100% |
| 文件大小 | 整数 | 图像文件字节数 | 9734-47798字节 | 100% |
| 图像尺寸 | 整数 | 图像像素尺寸(统一预处理后) | 224×224像素 | 100% |
| 命名模式 | 字符串 | 文件命名方式 | 序列命名 / 哈希命名 | 100% |

### 数据分布情况

#### 类别分布

| 类别 | 记录数量 | 占比 |
|-----|---------|------|
| Normal(正常) | 6300 | 50.00% |
| AbNormal(异常) | 6300 | 50.00% |
| 总计 | 12600 | 100.00% |

#### 文件格式分布

| 文件格式 | 记录数量 | 占比 |
|---------|---------|------|
| PNG | 12600 | 100.00% |

#### 文件大小分布

| 大小范围 | 记录数量 | 占比 |
|---------|---------|------|
| 10KB以下 | 1 | 0.01% |
| 10KB-20KB | 58 | 0.46% |
| 20KB-30KB | 7690 | 61.03% |
| 30KB-40KB | 4784 | 38.00% |
| 40KB以上 | 67 | 0.53% |
| 总计 | 12600 | 100.00% |

#### 命名模式分布

| 命名模式 | 记录数量 | 占比 |
|---------|---------|------|
| 序列命名(AB_training_.png / Normal_Training_.png / Abnormal_Training_*.png) | 3291 | 26.12% |
| 哈希命名(_Normal.png / _Abnormal.png) | 9309 | 73.88% |
| 总计 | 12600 | 100.00% |

#### 类别与命名模式交叉分布

| 类别 | 序列命名数量 | 哈希命名数量 | 小计 |
|-----|------------|------------|------|
| Normal(正常) | 628 | 5672 | 6300 |
| AbNormal(异常) | 2663 | 3637 | 6300 |
| 总计 | 3291 | 9309 | 12600 |

#### 具体命名模式细分

| 命名模式 | 所属类别 | 记录数量 | 占比 |
|---------|---------|---------|------|
| AB_training_*.png | AbNormal | 2363 | 18.75% |
| Abnormal_Training_*.png | AbNormal | 300 | 2.38% |
| Normal_Training_*.png | Normal | 628 | 5.00% |
| *_Normal.png | Normal | 5672 | 45.02% |
| *_Abnormal.png | AbNormal | 3637 | 28.86% |
| 总计 | - | 12600 | 100.00% |

### 数据规模与特征

- 数据总量:12600张胸部X光影像
- 类别数量:2类(正常、异常)
- 图像格式:PNG格式
- 图像尺寸:统一为224×224像素
- 文件大小:范围9734-47798字节,平均约30KB每张
- 命名模式:序列命名3291张(AB_training_ 2363张、Abnormal_Training_ 300张、Normal_Training_ 628张),哈希命名9309张(_Normal.png 5672张、*_Abnormal.png 3637张)
- 数据来源:临床真实胸部X光检查影像
- 预处理:已完成统一的归一化、尺寸调整和格式转换

## 数据优势

| 优势特征 | 具体表现 | 应用价值 |
|---------|---------|---------|
| 大规模数据集 | 包含12600张胸部X光片,类别分布均衡 | 支持深度学习模型的充分训练,提高模型泛化能力 |
| 完整原始文件 | 提供完整的PNG格式图像文件,保留全部影像细节 | 可直接用于图像识别、特征提取、模型训练等任务 |
| 明确类别标注 | 通过文件夹结构清晰划分正常与异常两类 | 便于监督学习模型训练,简化数据加载流程 |
| 标准化预处理 | 所有图像统一调整为224×224像素,格式一致 | 减少数据预处理工作量,提高实验可重复性 |
| 类别分布均衡 | 正常与异常类别各占50% | 避免模型偏向多数类,保证分类器的公平性 |
| 多样化命名模式 | 支持序列命名和哈希命名多种模式 | 适应不同的数据管理和溯源需求 |
| 临床真实数据 | 数据来源于真实临床检查场景 | 训练出的模型更贴近实际应用需求,具有临床价值 |

## 数据样例

由于PNG图像文件无法直接在文章中展示,以下提供数据集的文件列表样例,实际数据集中包含完整的原始图像文件可供使用。

### 正常类别样例(哈希命名)

1. 0005931495bf3d305a04572d1b899ea0_Normal.png - 文件大小:25,813字节
2. 0010366eb45712867fe54eb46414ddba_Normal.png - 文件大小:35,050字节
3. 001c4fd6f9aee4937890dd3712076cf5_Normal.png - 文件大小:37,721字节
4. 003238542a63c2b240c05c51337c11cd_Normal.png - 文件大小:27,346字节
5. 003c01de48bd8f5d978a48830b8e452a_Normal.png - 文件大小:37,798字节

### 正常类别样例(序列命名)

6. Normal_Training_10956.png - 文件大小:29,657字节
7. Normal_Training_10957.png - 文件大小:31,980字节
8. Normal_Training_10958.png - 文件大小:31,012字节
9. Normal_Training_10959.png - 文件大小:29,927字节
10. Normal_Training_10960.png - 文件大小:31,872字节

### 异常类别样例(序列命名 AB_training_*)

1. AB_training_1.png - 文件大小:31,683字节
2. AB_training_10.png - 文件大小:28,136字节
3. AB_training_100.png - 文件大小:30,011字节
4. AB_training_1000.png - 文件大小:27,341字节
5. AB_training_1001.png - 文件大小:31,006字节

### 异常类别样例(序列命名 Abnormal_Training_*)

6. Abnormal_Training_22997.png
7. Abnormal_Training_22998.png
8. Abnormal_Training_22999.png
9. Abnormal_Training_23000.png
10. Abnormal_Training_23001.png

### 异常类别样例(哈希命名)

1. 0002cf17990411884714c891625b41f8_Abnormal.png - 文件大小:31,475字节
2. 002b7cc36b8730684907451365938c47_Abnormal.png - 文件大小:26,787字节
3. 003941c644f14c6b49233343a8973df1_Abnormal.png - 文件大小:31,210字节
4. 003bfdbd3ae65eaf9801de11b347e8fa_Abnormal.png - 文件大小:34,180字节
5. 007ae1519525452792f25b9df59fecd7_Abnormal.png - 文件大小:20,129字节

## 应用场景

### 胸部X光异常检测模型训练

胸部X光异常检测是医学影像AI领域的重要研究方向。利用IN-CXR数据集,研究人员可以训练深度学习模型来自动识别胸部X光片中的异常病变。该数据集包含6300张异常影像,涵盖了多种常见的胸部疾病表现,如肺部感染、结节、积液、气胸等。通过对这些标注数据的学习,模型可以提取出异常病变的特征模式,实现对胸部X光片的自动筛查。在实际应用中,这样的AI系统可以作为医生的辅助工具,帮助快速筛选出需要进一步诊断的病例,提高筛查效率,减轻医生工作负担。尤其在基层医疗机构或医疗资源紧张的地区,AI辅助诊断系统可以显著提升疾病筛查能力。

### 医学影像二分类算法研究

IN-CXR数据集的均衡类别分布使其成为评估医学影像二分类算法性能的理想基准数据集。研究人员可以使用该数据集来测试和比较不同深度学习架构在胸部X光分类任务上的表现,如卷积神经网络(CNN)、Transformer等。数据集的标准化预处理确保了实验的可重复性,使得不同研究团队的结果可以直接进行对比。此外,研究人员还可以基于该数据集开展数据增强、迁移学习、半监督学习等方向的研究,探索提高模型性能的新方法。通过在该数据集上的实验验证,研究成果可以为医学影像AI领域的发展提供参考和借鉴。

### 临床辅助诊断系统开发

基于IN-CXR数据集训练的AI模型可以集成到临床辅助诊断系统中,为医生提供决策支持。在实际临床工作中,医生每天需要阅读大量的胸部X光片,长时间工作容易导致疲劳和漏诊。AI系统可以在医生阅片前对影像进行初步分析,标记出可能存在异常的区域,并给出初步的诊断建议。医生可以参考AI的分析结果,结合自己的专业知识进行最终诊断。这种人机协作的模式不仅可以提高诊断的准确性,还可以缩短报告生成时间,提升患者就医体验。对于大规模体检筛查场景,AI辅助诊断系统可以显著提高筛查效率,降低人力成本。

### 医学影像预处理算法验证

IN-CXR数据集本身已经经过标准化预处理,这使得它可以作为验证新的医学影像预处理算法的基准。研究人员可以使用原始数据(如果可用)测试不同的预处理方法,如图像增强、噪声去除、对比度调整等,并在IN-CXR数据集上验证这些方法对模型性能的影响。此外,数据集的统一格式和尺寸也为研究不同预处理流程提供了便利条件。通过在该数据集上的实验,研究人员可以评估不同预处理策略的效果,为医学影像处理流程的优化提供依据。

## 结尾

IN-CXR胸部X光影像数据集是一个高质量的医学影像数据集,包含12600张经过标准化预处理的胸部X光片,类别分布均衡,标注清晰。该数据集的核心价值在于提供了大规模、高质量的原始图像数据,为医学影像AI研究和应用提供了坚实的基础。

数据集的主要创新点包括:一是大规模的样本量,支持深度学习模型的充分训练;二是均衡的类别分布,保证了分类模型的公平性;三是标准化的预处理流程,提高了实验的可重复性;四是完整的原始图像文件,保留了全部影像细节信息;五是多样化的命名模式,适应不同的数据管理需求。

基于完整原始文件的特性,该数据集可广泛应用于图像识别、特征提取、模型训练等多种任务。研究人员和开发者可以直接使用该数据集进行胸部X光异常检测、分类算法研究、辅助诊断系统开发等工作。

该数据集的使用无需特殊获取方式,可直接下载使用。如有需要可私信获取更多信息。

看了又看

验证报告

以下为卖家选择提供的数据验证报告:

data icon
IN-CXR胸部X光影像数据集
19.9
359.69MB
申请报告