title: 定量蛋白质组学培训讲义 - 方法、数据库与MaxQuant应用 original_path: /工作相关/Personnal/2017工作/蛋白质培训材料/2.定量蛋白质组方法和应用.pdf file_size: 4.28 MB total_pages: 71 author: 孙大林培训材料 processed_date: 2026-09-20 method: PDF文本提取(pdf-inspector) status: done also_covers:

  • /工作相关/Personnal/2017工作/蛋白质培训材料/3.蛋白质组实验数据库和数据提交.pdf
  • /工作相关/Personnal/2017工作/蛋白质培训材料/4.蛋白质组实验数据介绍及MaxQuant上机实习.pdf

定量蛋白质组学培训讲义 - 方法、数据库与MaxQuant应用

来源: 中科院苏州生物医学工程技术研究所 - 蛋白质组学培训材料 文件路径: /工作相关/Personnal/2017工作/蛋白质培训材料/ 作者: 培训讲义(孙大林课题组)

核心内容概述

本系列讲义涵盖定量蛋白质组学的三个核心主题:

  1. 定量蛋白质组学方法(无标定量、有标定量、靶蛋白质组)
  2. 蛋白质组实验数据库与数据共享平台
  3. MaxQuant软件的上机操作与数据处理流程

一、定量蛋白质组学背景与策略

1.1 定量已成为研究热点

定量蛋白质组学已成为质谱蛋白质组研究的热点领域。从文献统计看,2000-2016年间PubMed搜索关键词(“quantitative” OR “quantification”) AND (“proteome” OR “proteomic” OR “proteomics”)的相关文献数量显著增长。

1.2 定量的核心问题

质谱技术的本质限制:质谱用于测量带电粒子的质荷比(m/z),不能直接测量物质的量。

解决方案:通过同位素标记,使同一实验中的不同分子具有相同的理化性质,从而可以进行比较。

1.3 定量分类体系

分类维度类型说明
信息类型相对定量(Relative quantification)比较样品间的蛋白或全蛋白质组量的变化
绝对定量(Absolute quantification)获得单个蛋白的绝对量或浓度,如ng/ml
方法学有标定量(Label-based)SILAC、ICAT、iTRAQ、TMT等
无标定量(Label-free)基于XIC或谱图计数
蛋白范围发现蛋白质组(Discovery)全面扫描,需要大样品量
靶蛋白质组(Targeted)SRM/MRM技术,针对少量蛋白优化

1.4 定量发展历史

发展时期技术方法定量精度代表技术
初创期2DE-PMF胶染色深度定量图谱计数法
发展期低精度shotgun鉴定谱峰强度定量Spectral count
成熟期高精度shotgun鉴定谱峰强度定量XIC
拓展期SRM/MRMXIC绝对定量

二、无标定量方法

2.1 谱图计数法(Spectral Counting)

原理假设:蛋白质丰度越高,酶切产生的肽段越多,被质谱扫描次数越多,对应二级谱图数目越多。

优点:对任何shotgun技术结果都可用;运算速度快 缺点:定量准确性不高;动态范围有限

常用计算方法:

方法公式特点
SpCnSpC_n / L_n蛋白质谱图数/长度
NSAFSpC_n / Σ(SpC_i)用总谱图数归一化
emPAI1 - 10^(-PAI_i)指数变换改善线性
APEXΣ(OpSpC_k)/ΣP考虑蛋白质鉴定概率
SInSI_n / Σ(SI_j)消除重复实验变化影响

2.2 基于离子流色谱峰的方法(XIC-based)

XIC定义:某个肽段(m/z)在保留时间(RT)轴上的连续采样信号。

不依赖鉴定结果的方法:

  • Feature Detection(特征检测)
  • Retention Time Alignment(保留时间对齐)
  • AMT标签匹配

常用软件:MaxQuant、msInspect、PEPPE、SuperHirn、SIEVE等

2.3 交叉搜索策略

通过建立LC-Run I与LC Run II之间的保留时间关系模型(RT Alignment),预测t1和t2i,可以定量更多肽段。

2.4 无标定量小结

  • 无标定量能直接利用蛋白质鉴定信息,无需额外操作
  • 应用广泛,适合大规模筛查
  • 需要保证实验重复性以保证准确性

三、有标定量方法

3.1 主要标记类型比较

标记方法原子/标签标记原理优点缺点
SILAC¹⁵N/¹³C/²H代谢标记,体内掺入标记效率高,适合体内标记只能标记两个样本
¹⁸O¹⁸O酸催化替换C端¹⁶O为¹⁸O操作简单,成本低标记效率因多肽不同
ICAT同位素标签与巯基反应引入质量差可降低样品复杂度只能标记含巯基多肽
iTRAQ子离子标签与-NH₂反应引入质量标签4/8重标记,高通量存在ratio抑制现象
TMT子离子标签与-NH₂反应引入质量标签标记效率高,6/16重标记存在ratio抑制现象

3.2 SILAC(稳定性同位素标记氨基酸细胞培养)

经典流程:

  • 轻标和重标同位素氨基酸分别培养细胞
  • 等量混合后进行LC-MS分析
  • 每个肽段都是一对峰,根据峰差异定量

3.3 iTRAQ/TMT技术

实验流程:

  1. 蛋白质酶解
  2. 不同样品用不同标签标记
  3. 混合后进行分析
  4. 通过子离子碎片进行定量

3.4 有标定量小结

  • 计算方法简单,计算量小
  • 不需要交叉搜索
  • 一般都需要归一化校正
  • 适合精确的相对定量研究

四、靶蛋白质组技术(SRM/MRM)

4.1 技术原理

SRM(Selected Reaction Monitoring,选择反应监测):

  • 在母离子中选择符合假设条件的母离子
  • 进行碎裂后形成子离子
  • 在多个子离子中选出符合假设条件的子离子
  • 通过两次选择,有效去除噪声和干扰

MRM(Multiple Reaction Monitoring,多反应监测):

  • 监测一系列母子离子对
  • 用于绝对定量

4.2 SRM vs. PRM vs. SWATH

方法前体离子子离子特点
SRM单个单个三重四极杆,高灵敏度
PRM单个所有Orbitrap,高分辨率
DIA/SWATH多个窗口所有非数据依赖采集,高通量

4.3 SRM常用工具

  • ESP Predictor(GenePattern中)
  • STEPP(命令行,开源)
  • PepFly(命令行)
  • Skyline(C/S模式,免费)
  • PinPoint(Thermo商业软件)
  • MRMPilot(AB商业软件)

4.4 SRM数据库

  • PeptideAtlas:蛋白质组综合数据库
  • SRMAtlas:SRM专用数据库
  • GPM:Global Proteome Machine数据库
  • PRIDE:蛋白质组学鉴定数据库

五、定量显著性分析

5.1 统计学检验方法

条件方法说明
正态分布,n≥3t-test常用参数检验
非正态分布Permutation test置换检验
样本量不足孤点距离 + p-value + FC联合卡值筛选

5.2 p-value的注意事项

  • 不要迷信p-value,需同时考察置信区间和检验效能
  • 建议:在不同intensity区段内,卡p-value + FC
  • 蛋白丰度越低,误差越高,差异筛选标准也要越高

参考文献:

  • Nature. 2014;506(7487):150-2. “P-values, the ‘gold standard’ of statistical validity, are not as reliable as many scientists assume.”

5.3 差异蛋白筛选策略

  • 无重复实验:使用fold change阈值(如±0.50即1.3倍)
  • 三次重复:t检验 + p < 0.05
  • 多次重复:BH校正,q value ≤ 0.02

六、蛋白质组数据库与数据共享

6.1 国际数据共享原则

阿姆斯特丹原则(Amsterdam Principles, 2008):

  • 时效性:尽快发布数据
  • 完整性:全面数据
  • 格式标准:标准化格式
  • 质量标准:质量指标
  • 数据存储平台:公共数据库

悉尼会议(2010):制定质谱数据质量指标

6.2 主要数据库平台

数据库网址特点
PRIDEebi.ac.uk/pride欧洲,接收MS/MS数据
PeptideAtlaspeptideatlas.org统一流程分析,PASSEL
MassIVEmassive.ucsd.eduNIH资助,原ProteomeCommons
jPOSTrepository.jpostdb.org日本蛋白质组数据库
iProXiprox.org中国蛋白质组数据中心

6.3 ProteomeXchange联盟

  • PRIDE:负责tandem MS数据
  • PASSEL:负责SRM数据
  • MassIVE:原始数据存储
  • jPOST:亚洲节点
  • iProX:中国节点

6.4 iProX平台

功能特点:

  • 结构化数据管理系统
  • 项目-子项目层次关系管理
  • 权限管理(private/group/public)
  • 标准化实验信息收集(CV词汇表)
  • 邮件通知功能

存储规模:

  • 北京30TB
  • 武汉、上海、长沙、深圳、广州等多节点
  • 已收集多物种、多组织、多疾病数据

6.5 数据提交要求

PRIDE支持的数据格式:

  • 原始数据:mzML, mzXML, mzData, Thermo .RAW, AB .wiff等
  • 结果文件:PRIDE XML, mzIdentML, mzTab

提交类型:

  • Complete submission:原始数据+结果文件
  • Partial submission:原始数据+搜索引擎结果

七、MaxQuant软件操作

7.1 MaxQuant简介

开发机构:马普生化研究所 支持系统:Windows Vista SP2及以上版本 核心功能:

  • 数据库搜索(Andromeda)
  • 质量控制
  • 无标/有标定量
  • 修饰分析

7.2 安装与环境配置

必需软件:

  • MSFileReader(访问Thermo数据)
  • .NET Framework 4.5
  • Windows系统

7.3 操作流程

Step 1:导入数据

  • 加载raw文件目录
  • 指定experimentalDesignTemplate.txt

Step 2:设置实验设计

  • 文件:Name, Fraction, Experiment, Data1, Data2
  • 无标定量必须设置实验设计!

Step 3:搜库参数设置

  • 母离子标记:最多三重标记(轻、中、重)
  • 可变修饰:常见修饰如氧化(M)、乙酰化(K)
  • 酶切方式:Trypsin/P
  • 定量方式:Standard(无标/母离子)或Reporter ion(子离子)

Step 4:质控参数

  • FDR阈值设置
  • 蛋白/肽段FDR控制

Step 5:定量参数

  • Protein ratio count ≥ 2
  • 使用Unique + razor肽段做蛋白定量

7.4 不同定量类型设置

SILAC定量:

  • K6标记:赖氨酸K6
  • K8R10标记:赖氨酸K8 + 精氨酸R10
  • K4R6 vs K8R10:双重标记

iTRAQ定量:

  • 8-plex iTRAQ:设置 reporter ion mass

Label-free定量:

  • 在”Label-free quantification”中选择LFQ

磷酸化定量:

  • 特殊修饰位点分析

7.5 MaxQuant优缺点

优点:

  • 综合性强:集搜库、质控、定量、修饰分析于一体
  • 免费使用
  • 支持多种文件格式(mzXML, wiff等)

不足:

  • 没有中间结果和计算过程输出
  • 只读取原始质谱数据,不兼容其他搜库软件
  • 不开源,黑箱操作

适用对象:

  • 刚接触质谱数据处理的初学者
  • 只需常规分析结果的实验人员
  • 缺少商业软件或自建流程的团队

八、关键参考文献

  1. Nat Biotechnol. 2008;26(12):1367-1372. MaxQuant论文
  2. Mol Cell Proteomics. 2010;9(1):131-44. 交叉搜索策略
  3. J Proteome Res. 2013;12(11):5096-5109. iTRAQ数据分析
  4. Mol Cell Proteomics. 2014;13(5):1198-218. 多次重复实验分析
  5. Nature. 2014;506(7487):150-2. p-value的可靠性讨论

九、行动建议

  1. 实验设计:至少三次生物学重复,确保统计效力
  2. 数据分析:使用MaxQuant进行常规分析,结合其他工具验证
  3. 数据共享:投稿前向PRIDE或iProX提交数据
  4. 质量控制:设置合理的FDR阈值,关注低丰度蛋白的准确性

提取方法: PDF文本提取(pdf-inspector),合并三份讲义(71+71+45页) 状态: 已消化整理