title: 定量蛋白质组学培训讲义 - 方法、数据库与MaxQuant应用 original_path: /工作相关/Personnal/2017工作/蛋白质培训材料/2.定量蛋白质组方法和应用.pdf file_size: 4.28 MB total_pages: 71 author: 孙大林培训材料 processed_date: 2026-09-20 method: PDF文本提取(pdf-inspector) status: done also_covers:
- /工作相关/Personnal/2017工作/蛋白质培训材料/3.蛋白质组实验数据库和数据提交.pdf
- /工作相关/Personnal/2017工作/蛋白质培训材料/4.蛋白质组实验数据介绍及MaxQuant上机实习.pdf
定量蛋白质组学培训讲义 - 方法、数据库与MaxQuant应用
来源: 中科院苏州生物医学工程技术研究所 - 蛋白质组学培训材料
文件路径: /工作相关/Personnal/2017工作/蛋白质培训材料/
作者: 培训讲义(孙大林课题组)
核心内容概述
本系列讲义涵盖定量蛋白质组学的三个核心主题:
- 定量蛋白质组学方法(无标定量、有标定量、靶蛋白质组)
- 蛋白质组实验数据库与数据共享平台
- MaxQuant软件的上机操作与数据处理流程
一、定量蛋白质组学背景与策略
1.1 定量已成为研究热点
定量蛋白质组学已成为质谱蛋白质组研究的热点领域。从文献统计看,2000-2016年间PubMed搜索关键词(“quantitative” OR “quantification”) AND (“proteome” OR “proteomic” OR “proteomics”)的相关文献数量显著增长。
1.2 定量的核心问题
质谱技术的本质限制:质谱用于测量带电粒子的质荷比(m/z),不能直接测量物质的量。
解决方案:通过同位素标记,使同一实验中的不同分子具有相同的理化性质,从而可以进行比较。
1.3 定量分类体系
| 分类维度 | 类型 | 说明 |
|---|---|---|
| 信息类型 | 相对定量(Relative quantification) | 比较样品间的蛋白或全蛋白质组量的变化 |
| 绝对定量(Absolute quantification) | 获得单个蛋白的绝对量或浓度,如ng/ml | |
| 方法学 | 有标定量(Label-based) | SILAC、ICAT、iTRAQ、TMT等 |
| 无标定量(Label-free) | 基于XIC或谱图计数 | |
| 蛋白范围 | 发现蛋白质组(Discovery) | 全面扫描,需要大样品量 |
| 靶蛋白质组(Targeted) | SRM/MRM技术,针对少量蛋白优化 |
1.4 定量发展历史
| 发展时期 | 技术方法 | 定量精度 | 代表技术 |
|---|---|---|---|
| 初创期 | 2DE-PMF | 胶染色深度定量 | 图谱计数法 |
| 发展期 | 低精度shotgun鉴定 | 谱峰强度定量 | Spectral count |
| 成熟期 | 高精度shotgun鉴定 | 谱峰强度定量 | XIC |
| 拓展期 | SRM/MRM | XIC | 绝对定量 |
二、无标定量方法
2.1 谱图计数法(Spectral Counting)
原理假设:蛋白质丰度越高,酶切产生的肽段越多,被质谱扫描次数越多,对应二级谱图数目越多。
优点:对任何shotgun技术结果都可用;运算速度快 缺点:定量准确性不高;动态范围有限
常用计算方法:
| 方法 | 公式 | 特点 |
|---|---|---|
| SpCn | SpC_n / L_n | 蛋白质谱图数/长度 |
| NSAF | SpC_n / Σ(SpC_i) | 用总谱图数归一化 |
| emPAI | 1 - 10^(-PAI_i) | 指数变换改善线性 |
| APEX | Σ(OpSpC_k)/ΣP | 考虑蛋白质鉴定概率 |
| SIn | SI_n / Σ(SI_j) | 消除重复实验变化影响 |
2.2 基于离子流色谱峰的方法(XIC-based)
XIC定义:某个肽段(m/z)在保留时间(RT)轴上的连续采样信号。
不依赖鉴定结果的方法:
- Feature Detection(特征检测)
- Retention Time Alignment(保留时间对齐)
- AMT标签匹配
常用软件:MaxQuant、msInspect、PEPPE、SuperHirn、SIEVE等
2.3 交叉搜索策略
通过建立LC-Run I与LC Run II之间的保留时间关系模型(RT Alignment),预测t1和t2i,可以定量更多肽段。
2.4 无标定量小结
- 无标定量能直接利用蛋白质鉴定信息,无需额外操作
- 应用广泛,适合大规模筛查
- 需要保证实验重复性以保证准确性
三、有标定量方法
3.1 主要标记类型比较
| 标记方法 | 原子/标签 | 标记原理 | 优点 | 缺点 |
|---|---|---|---|---|
| SILAC | ¹⁵N/¹³C/²H | 代谢标记,体内掺入 | 标记效率高,适合体内标记 | 只能标记两个样本 |
| ¹⁸O | ¹⁸O | 酸催化替换C端¹⁶O为¹⁸O | 操作简单,成本低 | 标记效率因多肽不同 |
| ICAT | 同位素标签 | 与巯基反应引入质量差 | 可降低样品复杂度 | 只能标记含巯基多肽 |
| iTRAQ | 子离子标签 | 与-NH₂反应引入质量标签 | 4/8重标记,高通量 | 存在ratio抑制现象 |
| TMT | 子离子标签 | 与-NH₂反应引入质量标签 | 标记效率高,6/16重标记 | 存在ratio抑制现象 |
3.2 SILAC(稳定性同位素标记氨基酸细胞培养)
经典流程:
- 轻标和重标同位素氨基酸分别培养细胞
- 等量混合后进行LC-MS分析
- 每个肽段都是一对峰,根据峰差异定量
3.3 iTRAQ/TMT技术
实验流程:
- 蛋白质酶解
- 不同样品用不同标签标记
- 混合后进行分析
- 通过子离子碎片进行定量
3.4 有标定量小结
- 计算方法简单,计算量小
- 不需要交叉搜索
- 一般都需要归一化校正
- 适合精确的相对定量研究
四、靶蛋白质组技术(SRM/MRM)
4.1 技术原理
SRM(Selected Reaction Monitoring,选择反应监测):
- 在母离子中选择符合假设条件的母离子
- 进行碎裂后形成子离子
- 在多个子离子中选出符合假设条件的子离子
- 通过两次选择,有效去除噪声和干扰
MRM(Multiple Reaction Monitoring,多反应监测):
- 监测一系列母子离子对
- 用于绝对定量
4.2 SRM vs. PRM vs. SWATH
| 方法 | 前体离子 | 子离子 | 特点 |
|---|---|---|---|
| SRM | 单个 | 单个 | 三重四极杆,高灵敏度 |
| PRM | 单个 | 所有 | Orbitrap,高分辨率 |
| DIA/SWATH | 多个窗口 | 所有 | 非数据依赖采集,高通量 |
4.3 SRM常用工具
- ESP Predictor(GenePattern中)
- STEPP(命令行,开源)
- PepFly(命令行)
- Skyline(C/S模式,免费)
- PinPoint(Thermo商业软件)
- MRMPilot(AB商业软件)
4.4 SRM数据库
- PeptideAtlas:蛋白质组综合数据库
- SRMAtlas:SRM专用数据库
- GPM:Global Proteome Machine数据库
- PRIDE:蛋白质组学鉴定数据库
五、定量显著性分析
5.1 统计学检验方法
| 条件 | 方法 | 说明 |
|---|---|---|
| 正态分布,n≥3 | t-test | 常用参数检验 |
| 非正态分布 | Permutation test | 置换检验 |
| 样本量不足 | 孤点距离 + p-value + FC | 联合卡值筛选 |
5.2 p-value的注意事项
- 不要迷信p-value,需同时考察置信区间和检验效能
- 建议:在不同intensity区段内,卡p-value + FC
- 蛋白丰度越低,误差越高,差异筛选标准也要越高
参考文献:
- Nature. 2014;506(7487):150-2. “P-values, the ‘gold standard’ of statistical validity, are not as reliable as many scientists assume.”
5.3 差异蛋白筛选策略
- 无重复实验:使用fold change阈值(如±0.50即1.3倍)
- 三次重复:t检验 + p < 0.05
- 多次重复:BH校正,q value ≤ 0.02
六、蛋白质组数据库与数据共享
6.1 国际数据共享原则
阿姆斯特丹原则(Amsterdam Principles, 2008):
- 时效性:尽快发布数据
- 完整性:全面数据
- 格式标准:标准化格式
- 质量标准:质量指标
- 数据存储平台:公共数据库
悉尼会议(2010):制定质谱数据质量指标
6.2 主要数据库平台
| 数据库 | 网址 | 特点 |
|---|---|---|
| PRIDE | ebi.ac.uk/pride | 欧洲,接收MS/MS数据 |
| PeptideAtlas | peptideatlas.org | 统一流程分析,PASSEL |
| MassIVE | massive.ucsd.edu | NIH资助,原ProteomeCommons |
| jPOST | repository.jpostdb.org | 日本蛋白质组数据库 |
| iProX | iprox.org | 中国蛋白质组数据中心 |
6.3 ProteomeXchange联盟
- PRIDE:负责tandem MS数据
- PASSEL:负责SRM数据
- MassIVE:原始数据存储
- jPOST:亚洲节点
- iProX:中国节点
6.4 iProX平台
功能特点:
- 结构化数据管理系统
- 项目-子项目层次关系管理
- 权限管理(private/group/public)
- 标准化实验信息收集(CV词汇表)
- 邮件通知功能
存储规模:
- 北京30TB
- 武汉、上海、长沙、深圳、广州等多节点
- 已收集多物种、多组织、多疾病数据
6.5 数据提交要求
PRIDE支持的数据格式:
- 原始数据:mzML, mzXML, mzData, Thermo .RAW, AB .wiff等
- 结果文件:PRIDE XML, mzIdentML, mzTab
提交类型:
- Complete submission:原始数据+结果文件
- Partial submission:原始数据+搜索引擎结果
七、MaxQuant软件操作
7.1 MaxQuant简介
开发机构:马普生化研究所 支持系统:Windows Vista SP2及以上版本 核心功能:
- 数据库搜索(Andromeda)
- 质量控制
- 无标/有标定量
- 修饰分析
7.2 安装与环境配置
必需软件:
- MSFileReader(访问Thermo数据)
- .NET Framework 4.5
- Windows系统
7.3 操作流程
Step 1:导入数据
- 加载raw文件目录
- 指定experimentalDesignTemplate.txt
Step 2:设置实验设计
- 文件:Name, Fraction, Experiment, Data1, Data2
- 无标定量必须设置实验设计!
Step 3:搜库参数设置
- 母离子标记:最多三重标记(轻、中、重)
- 可变修饰:常见修饰如氧化(M)、乙酰化(K)
- 酶切方式:Trypsin/P
- 定量方式:Standard(无标/母离子)或Reporter ion(子离子)
Step 4:质控参数
- FDR阈值设置
- 蛋白/肽段FDR控制
Step 5:定量参数
- Protein ratio count ≥ 2
- 使用Unique + razor肽段做蛋白定量
7.4 不同定量类型设置
SILAC定量:
- K6标记:赖氨酸K6
- K8R10标记:赖氨酸K8 + 精氨酸R10
- K4R6 vs K8R10:双重标记
iTRAQ定量:
- 8-plex iTRAQ:设置 reporter ion mass
Label-free定量:
- 在”Label-free quantification”中选择LFQ
磷酸化定量:
- 特殊修饰位点分析
7.5 MaxQuant优缺点
优点:
- 综合性强:集搜库、质控、定量、修饰分析于一体
- 免费使用
- 支持多种文件格式(mzXML, wiff等)
不足:
- 没有中间结果和计算过程输出
- 只读取原始质谱数据,不兼容其他搜库软件
- 不开源,黑箱操作
适用对象:
- 刚接触质谱数据处理的初学者
- 只需常规分析结果的实验人员
- 缺少商业软件或自建流程的团队
八、关键参考文献
- Nat Biotechnol. 2008;26(12):1367-1372. MaxQuant论文
- Mol Cell Proteomics. 2010;9(1):131-44. 交叉搜索策略
- J Proteome Res. 2013;12(11):5096-5109. iTRAQ数据分析
- Mol Cell Proteomics. 2014;13(5):1198-218. 多次重复实验分析
- Nature. 2014;506(7487):150-2. p-value的可靠性讨论
九、行动建议
- 实验设计:至少三次生物学重复,确保统计效力
- 数据分析:使用MaxQuant进行常规分析,结合其他工具验证
- 数据共享:投稿前向PRIDE或iProX提交数据
- 质量控制:设置合理的FDR阈值,关注低丰度蛋白的准确性
提取方法: PDF文本提取(pdf-inspector),合并三份讲义(71+71+45页) 状态: 已消化整理