质谱峰检测基准数据集 - 登记与结构说明
云盘位置:
/工作相关/Personnal/2017工作/软件组/质谱数据/规模:2040 个文件,合计约 792 MB(其中数据2--峰值检测2012 个文件 / 734 MB)
为什么单独登记
这个目录下全部是纯数值的原始谱线与真值表(一列 m/z、一列 intensity 的矩阵),逐文件消化没有知识增量,但数量高达 2040 个、按队列排序规则(work 类别优先)又会长期占据队首,导致每轮都在原地打转。本笔记作为该数据簇的登记凭证:结构说明一次讲清,原始文件按数据集整簇跳过。
数据集结构
数据1—卵巢癌(20 个样本)
| 项 | 说明 |
|---|---|
| 文件 | A01.csv ~ A20.csv,每个约 330 KB |
| 形态 | 两列数值矩阵(质谱谱线),无表头说明 |
| 推测 | 20 例卵巢癌样本的质谱采集结果,可用于标志物筛查类算法的输入 |
数据2—峰值检测(Dataset_1 ~ Dataset_10)
每个 Dataset_N 是一个完整的峰检测评测单元,内部结构一致:
| 子项 | 数量 | 说明 |
|---|---|---|
RawSpectra/noisy1.txt ~ noisy100.txt | 100 | 含噪声的原始谱线,每条约 0.5 MB,作为算法输入 |
truePeaks/ | 100 | 与 noisy 文件一一对应的真实峰位置真值 |
truth1.txt ~ truth100.txt | 100 | 真值序列(与 truePeaks 互为对照写法) |
true_peaks.txt | 1 | 该数据集汇总的真值峰表 |
sim_data_100/150/200/250/300.txt | 5 | 不同信噪比档位的仿真数据 |
Y.txt / Y_bc.txt | 仅 Dataset_1 | 基线校正前 / 校正后的信号序列,可用于验证基线扣除步骤 |
命名含义:noisy* 是待分析输入,truth* / truePeaks / true_peaks.txt 是标准答案,Y / Y_bc 对应原始信号与基线校正信号。这是一套”输入 + 标准答案”齐备的算法评测集,典型用途是评估峰检测与重叠峰分辨算法的准确率、召回率。
与研究方向的关联
本地知识库中已有多篇同主题笔记,这个数据集正是它们的实验素材:
三者都在做”重叠峰解析”(小波基函数选择、高斯拟合、分形理论),而 数据2--峰值检测 提供的 noisy/truth 配对正好是这类算法的量化评测基准。若后续要复现或对比这些算法,按 Dataset_N 为单位取用即可,不必全量下载。
处理决定
- 原始文件:整簇跳过,不下载、不逐文件建笔记(纯数值无知识价值)。
- 队列侧:已在
build-ingest-queue.py中新增RAW_DATA_RE规则(匹配数据N--、RawSpectra/、truePeaks/的 csv/txt 原始数据),使这 2040 项不再进入待消化队列,队列统计的 skipped 相应增加。 - 待确认:该数据集的确切出处(公开基准集还是项目内部采集/仿真)与采集参数(仪器型号、质量范围),云盘目录内未见说明文档。