蛋白质组质谱数据鉴定与质量控制
课程背景
2017年10月成都蛋白质组学与质谱分析培训班,中国科学院计算技术研究所杨冬主讲。
核心内容结构
一、蛋白质鉴定质谱技术基本原理
质谱仪组成
- 离子源:ESI(电喷雾电离)、MALDI(基质辅助激光解吸电离)
- 质量分析器:四极杆(Q)、离子阱(IT)、飞行时间(TOF)、傅里叶变换离子回旋共振(FT-ICR)
- 检测器:Faraday杯、电子倍增器等
肽段碎裂模式(CID)
- b离子系列:N端碎片
- y离子系列:C端碎片
- 常用肽段:SGFLEEDELK (MW=1166)
- b系列:88, 145, 292, 405, 534, 663, 778, 907, 1020, 1166
- y系列:146, 260, 389, 504, 633, 762, 875, 1022, 1166
二、蛋白质组鉴定整体流程
Top-down vs Bottom-up策略
| 策略 | 描述 | 特点 |
|---|
| Top-down | 完整蛋白分离后鉴定 | 通量低,信息丰富 |
| Bottom-up(鸟枪法) | 蛋白酶切为肽段后鉴定 | 主流方法,高通量 |
分析流程
蛋白质样品 → 酶切( Trypsin) → 肽段分离(LC) → MS/MS → 数据库搜索 → 肽段列表
↓
蛋白推导(组装)
↓
蛋白质列表+定量+质控
三、肽段序列鉴定方法
三种主要策略对比
| 方法 | 优势 | 劣势 | 应用场景 |
|---|
| 图谱库搜索 | 考虑强度信息,精度高 | 需要先验图谱数据 | 特殊产物鉴定 |
| 序列数据库搜索 | 搜索空间小,精度高 | 只能鉴定已知肽段 | 最常用 |
| De novo测序 | 不依赖数据库 | 搜索空间大,准确性差 | 未知修饰/新蛋白 |
数据库搜索软件
- SEQUEST、Mascot、XTandem、Comet等
- 基于概率模型过滤:PeptideProphet、ProteinProphet
四、蛋白推导(组装)
简约法原则(Occam’s Razor)
蛋白推导困境
常用工具
- ProteinProphet(概率分配)
- IDpicker(二分图算法)
- MAYU(超几何分布)
五、质量控制
三层质控体系
- 谱图水平质控:Target-decoy策略估计FDR
- 肽段水平质控:PeptideProphet、Percolator
- 蛋白水平质控:ProteinProphet、MAYU
Target-Decoy策略
- 原理:错误匹配在target和decoy库中概率相同
- FDR估算公式:
- 混合搜库:
FDR = 2*N_decoy / (N_target + N_decoy)
- 分开搜库:
FDR = N_decoy / N_target
质控工具
| 工具 | 方法 | 特点 |
|---|
| PeptideProphet | 贝叶斯概率模型 | 经典方法,TPP套件 |
| Percolator | 支持向量机(SVM) | 提高灵敏度,MASCOT内置 |
| ProteinProphet | 概率分配 | 蛋白水平FDR控制 |
| MAYU | 超几何分布 | 考虑数据集/数据库大小 |
HPPP质控标准(人类蛋白质组计划)
| 电荷数 | Xcorr阈值 | ΔCn阈值 | 肽段长度 |
|---|
| +1 | 2.00 | 0.10 | ≥6 |
| +2 | 2.20 | 0.10 | ≥7 |
| +3 | 3.50 | 0.10 | ≥7 |
六、翻译后修饰鉴定
修饰类型
- 化学基团修饰:磷酸化、乙酰化、甲基化
- 多肽修饰:泛素化、SUMO化
- 复合分子修饰:糖基化
修饰鉴定方法
- 常规修饰:固定修饰+可变修饰设定
- 非限制修饰:MassShift搜索,发现新修饰
位点定位质控
- Ascore(二项分布)
- PhosphoRS(概率模型)
- Mascot Delta Score
注意事项
- 可变修饰越多,灵敏度越低
- 高丰度修饰:分开关控
- 低丰度修饰:直接卡值
关键软件工具
| 工具 | 用途 |
|---|
| SEQUEST/Mascot | 数据库搜索 |
| PeptideProphet | 肽段质控 |
| ProteinProphet | 蛋白质控 |
| Percolator | 机器学习质控 |
| MaxQuant | 集成分析平台 |
| PEAKS | De novo测序 |
| NovoSolve | 从头测序 |
| InsPect | 非限制修饰搜索 |
应用领域
- 生物标志物发现
- 疾病机制研究
- 药物靶点鉴定
- 精准医学
关联笔记