质谱峰检测基准数据集 - 登记与结构说明

云盘位置:/工作相关/Personnal/2017工作/软件组/质谱数据/ 规模:2040 个文件,合计约 792 MB(其中 数据2--峰值检测 2012 个文件 / 734 MB)

为什么单独登记

这个目录下全部是纯数值的原始谱线与真值表(一列 m/z、一列 intensity 的矩阵),逐文件消化没有知识增量,但数量高达 2040 个、按队列排序规则(work 类别优先)又会长期占据队首,导致每轮都在原地打转。本笔记作为该数据簇的登记凭证:结构说明一次讲清,原始文件按数据集整簇跳过。

数据集结构

数据1—卵巢癌(20 个样本)

项说明
文件A01.csv ~ A20.csv,每个约 330 KB
形态两列数值矩阵(质谱谱线),无表头说明
推测20 例卵巢癌样本的质谱采集结果,可用于标志物筛查类算法的输入

数据2—峰值检测(Dataset_1 ~ Dataset_10)

每个 Dataset_N 是一个完整的峰检测评测单元,内部结构一致:

子项数量说明
RawSpectra/noisy1.txt ~ noisy100.txt100含噪声的原始谱线,每条约 0.5 MB,作为算法输入
truePeaks/100与 noisy 文件一一对应的真实峰位置真值
truth1.txt ~ truth100.txt100真值序列(与 truePeaks 互为对照写法)
true_peaks.txt1该数据集汇总的真值峰表
sim_data_100/150/200/250/300.txt5不同信噪比档位的仿真数据
Y.txt / Y_bc.txt仅 Dataset_1基线校正前 / 校正后的信号序列,可用于验证基线扣除步骤

命名含义:noisy* 是待分析输入,truth* / truePeaks / true_peaks.txt 是标准答案,Y / Y_bc 对应原始信号与基线校正信号。这是一套”输入 + 标准答案”齐备的算法评测集,典型用途是评估峰检测与重叠峰分辨算法的准确率、召回率。

与研究方向的关联

本地知识库中已有多篇同主题笔记,这个数据集正是它们的实验素材:

三者都在做”重叠峰解析”(小波基函数选择、高斯拟合、分形理论),而 数据2--峰值检测 提供的 noisy/truth 配对正好是这类算法的量化评测基准。若后续要复现或对比这些算法,按 Dataset_N 为单位取用即可,不必全量下载。

处理决定

  • 原始文件:整簇跳过,不下载、不逐文件建笔记(纯数值无知识价值)。
  • 队列侧:已在 build-ingest-queue.py 中新增 RAW_DATA_RE 规则(匹配 数据N--、RawSpectra/、truePeaks/ 的 csv/txt 原始数据),使这 2040 项不再进入待消化队列,队列统计的 skipped 相应增加。
  • 待确认:该数据集的确切出处(公开基准集还是项目内部采集/仿真)与采集参数(仪器型号、质量范围),云盘目录内未见说明文档。