蛋白质组信息学与数据挖掘-杨冬培训班第一天(103页完整版)

2017-10-29~30 北京蛋白质组研究中心(BPRC,凤凰中心)“生物信息学最新技术——蛋白质组学与质谱分析”高级培训班,杨冬(进化发育蛋白质组学课题组)主讲。本文件为 10-29 第一天讲稿完整版(103 页),与已归档的 10-30 版(67/75 页,侧重数据注释与进化分析)互补:本讲侧重质谱方法学、搜库策略、修饰/多肽组学与蛋白质基因组学。

讲座结构(第一天 5 部分)

  1. 蛋白质组学及蛋白质组信息学基本概念
  2. 蛋白质组学实验设计及常用软件(含上机实习)
  3. 修饰蛋白质组学技术原理及应用
  4. 多肽组学技术原理及应用
  5. 质谱数据挖掘和蛋白质基因组学

一、基本概念

  • HUPO 定义修正:蛋白质组 = 特定生物系统/实体(特定时空)中存在的所有蛋白质及其相互作用;基因组近乎静态,蛋白质组状态持续变化。
  • 描述蛋白质组构成的”四要素”:时(进化/发育/condition)、空(器官组织细胞 OTC)、质(蛋白类别与形式 Isoform/PTM)、量(分子拷贝数)。
  • 核心问题:在特定时空,有什么蛋白质?有多少?
  • 组学方法论(贺福初 2013):组学引领生命科学大发现时代。

二、实验设计与搜库软件

可解决的科学问题

  • 定性定量鉴定蛋白质组构成
  • 差异蛋白质组学:生理/病理过程中蛋白质组动态变化
  • 相互作用蛋白质组学:AP-MS/MS(CoIP、TAP、pull-down;EMSA+MS 分离 DNA 结合蛋白),体内/体外策略
  • 质谱研究蛋白质修饰及动态变化
  • 结论性观点:质谱蛋白质组学是强大的”假设产生机器”

搜库流程主线

Raw data → 格式转换(Thermo/Waters .raw、ABI .wiff、Bruker .baf → mzML/mzXML)→ 选搜索引擎 → 选数据库 → 参数设置 → 搜库 → 质控 → 定性/定量分析 → 数据挖掘。

搜索引擎与软件包

  • 商业:SEQUEST(Sorcerer)、Mascot、Phynex、ProteinPilot;Proteome Discoverer、Scaffold、Peaks、Progenesis LC-MS
  • 免费:X!Tandem、OMSSA、MassMatrix、MaxQuant、pFind、Inspect、TPP、OpenMS
  • 打分模型:启发式(SEQUEST、X!Tandem)vs 概率(Mascot、Andromeda)
  • 选型建议:固定一种常用引擎即可,不必多引擎混用;Mascot 与 MaxQuant 认可度最高

搜库参数推荐值(重点表格)

参数推荐设置
固定修饰Carbamidomethyl (C)
可变修饰Oxidation (M), phospho (STY)
酶切trypsin,漏切 2~4(推荐 2)
母离子误差高精度仪器 10~20 ppm
子离子误差CID 0.5 Da;HCD 0.1 Da 以下
  • 正反混合库(decoy)搜库用于后期 FDR 质控。
  • 数据库:UniProt(Swiss-Prot/TrEMBL)、RefSeq、Ensembl protein;无蛋白库物种可用 EST/转录组/基因组翻译。

三、修饰蛋白质组学

  • 重要性:忽略修饰图谱会低估蛋白表达量(人肝细胞器 BIRM 数据 ~2000 万张谱图仅 ~90 万张高可信鉴定,低图谱鉴定率 4.5%)。
  • Unimod 记载修饰 976 种;修饰=质谱数据中氨基酸质量改变(体内 PTM / 体外实验引入 / 氨基酸突变)。
  • 鉴定原理:候选肽段库中加入修饰变体肽段常规搜索(如 D→E +14Da);b/y 离子最常见。
  • 两条算法路线:常规修饰鉴定(指定类型,固定+可变修饰搜索)vs 非限制修饰鉴定(不指定类型,发现潜在/新修饰,工具:DeltAMT、pCluster、MODa、pMatch;位点定位:Ascore、PhosphoRS)。
  • 质控策略:体外修饰同常规(蛋白 FDR<1%);高丰度体内修饰与非修饰肽段分开质控;低丰度修饰直接卡值。
  • 注意事项:多数引擎限可变修饰 ≤10 个;可变修饰越多灵敏度越低;准确性优先于灵敏度;亚计量修饰难检测。
  • 多批次搜库策略:先无修饰定候选蛋白,剩余谱图加可变修饰再搜。

四、多肽组学

  • 多肽组 peptidome = 活体生物器官/组织/细胞/体液中全部内源性多肽;填补蛋白质组学与代谢组学之间的空缺。
  • 来源:体液(血、乳汁、脑脊液、尿液、毒囊等)、组织、部分植物。
  • 与蛋白质组学对比:多肽组全覆盖序列、低丰度、快降解、不依赖基因组(de novo)。
  • 应用路线:非原位(血清多肽组)与原位(质谱成像,可获得空间分布与相对丰度,规避”提取完全吗/组成偏好吗”的标志物研究缺陷)。

五、搜库数据库选择与蛋白质基因组学

数据库选择三案例

  • Case1 模式生物:冗余度悖论——库越大可搜结果越多,但搜索空间加大导致卡分需上调,可能反而减少鉴定。结论:搜完善且紧凑的库;混合样品只搜主要关心物种(Nat Methods 2015 评论)。
  • Case2 有基因组无蛋白库(例 Rhodotorula mucilaginosa):用 Web server Augustus 做编码蛋白预测(1034 scaffold / 19.98 Mb → 6413 蛋白)。
  • Case3 基因组缺乏:EST/SAGE 片段库六相位穷举翻译,或跨物种近缘种搜索。

蛋白质基因组学 Proteogenomics

  • 定义:用蛋白质组实验数据精细验证/补充基因组基因注释;广义扩展为整合蛋白质组+转录组+基因组。
  • 发展阶段:2007 前概念形成;2008-2013 缓慢;2014 后进入新阶段。
  • 用途:修正基因模型(基因内新肽段)、发现新基因(基因间肽段)、Onco-proteogenomics 肿瘤新抗原。
  • 待强化:数据质控、可变剪接肽段鉴定(人类 1/4 肽段跨外显子连接位点;spliced-exon graph / de Bruijn graph 缩小搜索空间)、搜索速度。

关联

备注

  • 提取方法:zipfile+regex 直读 OOXML slide XML(103 页全文)。
  • 联系人信息(讲者公开联系方式)见 slide1,笔记不复述私人号码。