蛋白质组信息学与数据挖掘-杨冬培训班第一天(103页完整版)
2017-10-29~30 北京蛋白质组研究中心(BPRC,凤凰中心)“生物信息学最新技术——蛋白质组学与质谱分析”高级培训班,杨冬(进化发育蛋白质组学课题组)主讲。本文件为 10-29 第一天讲稿完整版(103 页),与已归档的 10-30 版(67/75 页,侧重数据注释与进化分析)互补:本讲侧重质谱方法学、搜库策略、修饰/多肽组学与蛋白质基因组学。
讲座结构(第一天 5 部分)
- 蛋白质组学及蛋白质组信息学基本概念
- 蛋白质组学实验设计及常用软件(含上机实习)
- 修饰蛋白质组学技术原理及应用
- 多肽组学技术原理及应用
- 质谱数据挖掘和蛋白质基因组学
一、基本概念
- HUPO 定义修正:蛋白质组 = 特定生物系统/实体(特定时空)中存在的所有蛋白质及其相互作用;基因组近乎静态,蛋白质组状态持续变化。
- 描述蛋白质组构成的”四要素”:时(进化/发育/condition)、空(器官组织细胞 OTC)、质(蛋白类别与形式 Isoform/PTM)、量(分子拷贝数)。
- 核心问题:在特定时空,有什么蛋白质?有多少?
- 组学方法论(贺福初 2013):组学引领生命科学大发现时代。
二、实验设计与搜库软件
可解决的科学问题
- 定性定量鉴定蛋白质组构成
- 差异蛋白质组学:生理/病理过程中蛋白质组动态变化
- 相互作用蛋白质组学:AP-MS/MS(CoIP、TAP、pull-down;EMSA+MS 分离 DNA 结合蛋白),体内/体外策略
- 质谱研究蛋白质修饰及动态变化
- 结论性观点:质谱蛋白质组学是强大的”假设产生机器”
搜库流程主线
Raw data → 格式转换(Thermo/Waters .raw、ABI .wiff、Bruker .baf → mzML/mzXML)→ 选搜索引擎 → 选数据库 → 参数设置 → 搜库 → 质控 → 定性/定量分析 → 数据挖掘。
搜索引擎与软件包
- 商业:SEQUEST(Sorcerer)、Mascot、Phynex、ProteinPilot;Proteome Discoverer、Scaffold、Peaks、Progenesis LC-MS
- 免费:X!Tandem、OMSSA、MassMatrix、MaxQuant、pFind、Inspect、TPP、OpenMS
- 打分模型:启发式(SEQUEST、X!Tandem)vs 概率(Mascot、Andromeda)
- 选型建议:固定一种常用引擎即可,不必多引擎混用;Mascot 与 MaxQuant 认可度最高
搜库参数推荐值(重点表格)
| 参数 | 推荐设置 |
|---|---|
| 固定修饰 | Carbamidomethyl (C) |
| 可变修饰 | Oxidation (M), phospho (STY) |
| 酶切 | trypsin,漏切 2~4(推荐 2) |
| 母离子误差 | 高精度仪器 10~20 ppm |
| 子离子误差 | CID 0.5 Da;HCD 0.1 Da 以下 |
- 正反混合库(decoy)搜库用于后期 FDR 质控。
- 数据库:UniProt(Swiss-Prot/TrEMBL)、RefSeq、Ensembl protein;无蛋白库物种可用 EST/转录组/基因组翻译。
三、修饰蛋白质组学
- 重要性:忽略修饰图谱会低估蛋白表达量(人肝细胞器 BIRM 数据 ~2000 万张谱图仅 ~90 万张高可信鉴定,低图谱鉴定率 4.5%)。
- Unimod 记载修饰 976 种;修饰=质谱数据中氨基酸质量改变(体内 PTM / 体外实验引入 / 氨基酸突变)。
- 鉴定原理:候选肽段库中加入修饰变体肽段常规搜索(如 D→E +14Da);b/y 离子最常见。
- 两条算法路线:常规修饰鉴定(指定类型,固定+可变修饰搜索)vs 非限制修饰鉴定(不指定类型,发现潜在/新修饰,工具:DeltAMT、pCluster、MODa、pMatch;位点定位:Ascore、PhosphoRS)。
- 质控策略:体外修饰同常规(蛋白 FDR<1%);高丰度体内修饰与非修饰肽段分开质控;低丰度修饰直接卡值。
- 注意事项:多数引擎限可变修饰 ≤10 个;可变修饰越多灵敏度越低;准确性优先于灵敏度;亚计量修饰难检测。
- 多批次搜库策略:先无修饰定候选蛋白,剩余谱图加可变修饰再搜。
四、多肽组学
- 多肽组 peptidome = 活体生物器官/组织/细胞/体液中全部内源性多肽;填补蛋白质组学与代谢组学之间的空缺。
- 来源:体液(血、乳汁、脑脊液、尿液、毒囊等)、组织、部分植物。
- 与蛋白质组学对比:多肽组全覆盖序列、低丰度、快降解、不依赖基因组(de novo)。
- 应用路线:非原位(血清多肽组)与原位(质谱成像,可获得空间分布与相对丰度,规避”提取完全吗/组成偏好吗”的标志物研究缺陷)。
五、搜库数据库选择与蛋白质基因组学
数据库选择三案例
- Case1 模式生物:冗余度悖论——库越大可搜结果越多,但搜索空间加大导致卡分需上调,可能反而减少鉴定。结论:搜完善且紧凑的库;混合样品只搜主要关心物种(Nat Methods 2015 评论)。
- Case2 有基因组无蛋白库(例 Rhodotorula mucilaginosa):用 Web server Augustus 做编码蛋白预测(1034 scaffold / 19.98 Mb → 6413 蛋白)。
- Case3 基因组缺乏:EST/SAGE 片段库六相位穷举翻译,或跨物种近缘种搜索。
蛋白质基因组学 Proteogenomics
- 定义:用蛋白质组实验数据精细验证/补充基因组基因注释;广义扩展为整合蛋白质组+转录组+基因组。
- 发展阶段:2007 前概念形成;2008-2013 缓慢;2014 后进入新阶段。
- 用途:修正基因模型(基因内新肽段)、发现新基因(基因间肽段)、Onco-proteogenomics 肿瘤新抗原。
- 待强化:数据质控、可变剪接肽段鉴定(人类 1/4 肽段跨外显子连接位点;spliced-exon graph / de Bruijn graph 缩小搜索空间)、搜索速度。
关联
- 成都培训-蛋白质组信息学及数据挖掘笔记(同培训 10-30 第二天,数据注释/WGCNA/进化分析)
- 蛋白质组质谱数据鉴定与质量控制-杨冬培训讲义
- 关联实体:计算所蛋白质组培训班(OpenViking)
备注
- 提取方法:zipfile+regex 直读 OOXML slide XML(103 页全文)。
- 联系人信息(讲者公开联系方式)见 slide1,笔记不复述私人号码。