成都培训-蛋白质组信息学及数据挖掘笔记

  • title: “成都培训-蛋白质组信息学及数据挖掘笔记”
  • source: “/工作相关/Personnal/2017工作/成都培训.pptx”
  • original_path: “/工作相关/Personnal/2017工作/成都培训.pptx”
  • author: “培训讲义(2017.10.30)”
  • size: “10.9 MB”
  • pages: 67
  • date: “2017-10-30”
  • processed_date: “2026-09-22”
  • method: “PPTX文本提取”
  • status: “done”

培训内容概述

2017年10月30日”生物信息学最新技术——蛋白质组学与质谱分析”高级培训班(成都/北京蛋白质组研究中心凤凰中心)的讲义,主讲人杨冬(进化发育蛋白质组学课题组,云盘另存完整75页版 2017-10-30-计算所培训班-成都-杨冬.pptx,本笔记基于67页精简版,两者主题结构一致)。课程分为两大部分:蛋白质组数据注释及功能分析、蛋白质组数据分析常用数据库和工具。


第一部分:蛋白质组数据注释及功能分析

1. 数据注释流程

蛋白质鉴定列表 → 蛋白质注释信息表 → 数据挖掘

注释内容包括:

  • 序列特征
  • 结构特征
  • 功能特征
  • 表达特征
  • 定位特征
  • 相互作用
  • 网络特征
  • 进化特征

核心观点:通过各类数据库及数据整合程序实现规模化、自动化信息注释,为后续数据挖掘提供必要信息。

2. 蛋白质-基因编号Mapping

最常用工具:

标准名称规范:

  • 标准基因名称:Entrez Gene ID (NCBI locus link), HGNC
  • 标准蛋白名称:Uniprot, Ensembl, IPI

3. 聚类分析

K-Means聚类

  • 优点:简洁快速
  • 缺点:需要预先指定聚类数K,结果依赖初始中心选择
  • 算法步骤:
    1. 初始化:选择(或人为指定)某些记录作为凝聚点
    2. 循环:按就近原则归类 → 重新计算中心位置 → 重新聚类
    3. 直到凝聚点位置收敛

层次聚类(系统聚类)

  • 距离度量:欧氏距离、马氏距离、明氏距离、相关系数、夹角余弦
  • 类间距离计算方法:最短距离法、最长距离法、类平均法、重心法、中间距离法、离差平方和法

4. WGCNA(加权基因共表达网络分析)

基本原理:

  1. 计算基因间相关矩阵 S
  2. 构建邻接矩阵 A = |S|
  3. 根据无尺度网络原则确定β(log(k)与log(p(k))相关系数≥0.8)
  4. 构建拓扑重叠矩阵 Ω
  5. 计算相异系数 d = 1 - ω
  6. 层次聚类 → 动态剪切法划分模块

应用场景:寻找协同表达的基因模块,探索基因网络与表型的关联关系。

5. 富集/缺失分析

超几何分布模型:

  • M: GEP中蛋白质总数
  • N: CSP中蛋白质总数
  • m: GEP中具有X特征的蛋白质数目
  • n: CSP中具有X特征的蛋白质数目

判断标准:

  • P2 < P1 且 P2 ≤ 0.05 → X特征在CSP中显著富集
  • P1 < P2 且 P1 ≤ 0.05 → X特征在CSP中显著缺失

6. GO/Pathway功能注释

Gene Ontology (GO)

  • 分子功能 (Molecular Function)
  • 细胞组分 (Subcellular Location)
  • 生物过程 (Biological Process)

常用工具:DAVID, Gostat, Gosurfer, Gotcha, MappFinder, OntoGate, Godist…

KEGG(京都基因与基因组百科全书)

  • 主要功能:Pathway查询与分析
  • 通路类型:
    • 细胞过程(5类)
    • 环境信息处理(29类)
    • 遗传信息处理(21类)
    • 生物体系统(26类)
    • 人类疾病(31类)
    • 代谢(多个子类)

实例:Wnt信号通路分析

7. 染色体定位分析

数据来源:Ensembl, NCBI(可通过BioMart或FTP下载)

特殊染色体编号:

  • GL/JH开头:unplaced scaffolds
  • PATCH:genome assembly中的修复区域

8. 蛋白质互作网络分析

推荐工具:PRINCESS

网络类型:

  • 基因转录调控网络
  • 生物代谢与信号传导网络
  • 蛋白质相互作用网络

第二部分:常用数据库和工具

1. 主要机构及数据库

机构数据库/工具
NCBIGenBank, Taxonomy, GEO, SRA, OMIM, BLAST, PubMed, Gene, Protein
EMBL欧洲分子生物学实验室
EBIEnsembl, UniProt, Pfam, InterPro, PRIDE, Reactome, Expression Atlas
SIBExPASy, neXtProt
Kanehisa LabKEGG
ISBPeptide Atlas
NCPSB-BeijingiProX, LiverBase, Formiana, Princess, ProDoctor

2. UniProt数据库

  • Swiss-Prot (SP):手动注释,适合数据挖掘
  • TrEMBL:计算分析,待人工注释

注意:SP库不一定适合搜库(如小鼠数据)

3. Ensembl & BioMart

用途:下载基因-蛋白质对应表、染色体定位信息、Ka/Ks等

4. PRIDE数据库

  • 全称:PRoteomics IDEntifications database
  • 内容:标准化蛋白质组学数据公共仓库
  • 特点:支持PTM(翻译后修饰)注释

5. 其他重要数据库

  • Peptide Atlas (ISB):肽段鉴定数据库
  • Human Protein Atlas:蛋白质组学图谱
  • Subcellular Protein Atlas:亚细胞定位蛋白图谱(65000张高分辨率共聚焦图像)

6. 蛋白质结构与进化数据库

  • PDB:蛋白质结构数据库
  • Pfam:蛋白质结构域家族数据库
  • InterPro:蛋白质结构域整合数据库
  • CDD:Conserved Domain Database
  • SMART:简单模块化氨基酸结构域分析工具

SCOP分类体系(六个等级):

  1. 结构类别(α/β)
  2. 折叠(Fold)
  3. 超家族(Superfamily)
  4. 家族(Family)
  5. 同源蛋白簇(Orthologous Group)
  6. 谱系特异性扩增(Lineage-specific expansion)

7. 结构域判定方法

  • 直接依赖数据库注释(SP库)
  • RPS-BLAST:序列vs结构域保守序列比对
  • HMMER:基于隐马尔可夫模型

ProDoctor平台:http://prodoctor.ncpsb.org/

  • 一站式分析:结构域年龄、进化速率、无序率等

第三部分:进化分析

1. 基因年龄判定方法

三步法:

  1. 确定时间”刻度”(物种树结点或序列分歧程度)
  2. 推断基因进化事件:
    • “获取-丢失”(Dollo parsimony, phylostratigraphy)
    • “系统发生谱系重建”(EnsemblCompara)
  3. 基于进化史赋予基因年龄

2. 同源蛋白判定方法

方法原理
Inparanoid, KOGs, OrthoMCLBLAST matches
Ensembl-Compara, HomoloGeneBLAST + synteny
HOGENOM, TreeFam, STRAW, PHYLDOGphylogenetic tree

3. 分子进化理论

三种进化模式:

  1. 阳性选择:非同义替代显著,产生新功能
  2. 阴性选择(净化选择):同义替代显著,功能高度保守
  3. 中性进化:同义与非同义替代比例相当

Ka/Ks比值:

  • Ka/Ks ≈ 1:中性进化
  • Ka/Ks << 1:阴性选择
  • Ka/Ks >> 1:阳性选择(适应性进化)

工具:PAML, MEGA


上机练习建议

  1. PRIDE/Peptide Atlas:查找一个Human liver蛋白质组数据集
  2. Gene数据库:查找P53分子已知相互作用蛋白
  3. Ensembl BioMart:下载人类所有PCG的基因和蛋白质对应表
  4. Pfam:查找P53蛋白的结构域及物种分布
  5. Ensembl:下载人和小鼠直系同源列表及dN/dS信息

关键知识点总结

  1. 数据标准化是前提:所有生物信息分析工具只接受特定格式的标准名称
  2. 富集/缺失分析用超几何分布:“富集”=显著多,“缺失”=显著少
  3. WGCNA是无监督网络构建方法:通过无尺度原则确定参数β
  4. 数据库选择要看目的:SP库适合数据挖掘,TrEMBL适合搜库
  5. 进化分析三步走:定时间刻度→推进化事件→赋基因年龄
  6. Ka/Ks是选择压力的量化指标:<<1净化选择,>>1正向选择

75页完整版补充(2017-10-30-计算所培训班-成都-杨冬.pptx)

  • Ka/Ks 计算细节:Ka=每个非同义位点的非同义替代数(dN),Ks=每个同义位点的同义替代数(dS);多数基因中性进化,仅约 1% 受阳性选择;工具 PAML/MEGA,Ensembl BioMart 可直接下载每基因 Ka/Ks。
  • 分子进化三模式:阳性选择(非同义替代显著→新功能)、阴性/净化选择(同义替代显著→功能保守)、中性进化(两者相当)。
  • 新基因判定三要素:角度(序列/结构/功能)+ 范围(比较物种范围)+ 阈值;基因年龄判定用”获取-丢失”(Dollo/Wagner parsimony,如 phylostratigraphy)或”系统发生谱系重建”(基因树+物种树,可避免并行丢失的典型错误,2013 Trends Genet)。
  • 同源判定方法分级:BLAST matches(InParanoid/KOGs/OrthoMCL)→ BLAST+共线性(Ensembl-Compara/HomoloGene)→ 系统发生树(HOGENOM/TreeFam/STRAW/PhyloDog)。
  • 结构域规模化判定:直接依赖 SP 注释 / RPS-BLAST 比对 Pfam / HMMER(隐马尔可夫模型);ProDoctor 平台可做结构域年龄、进化速率、无序率一站式分析。
  • 蛋白质分类层次(SCOP/CATH):结构类别→折叠→超家族→家族→同源蛋白簇→谱系特异性扩增。
  • 上机练习题目:PRIDE/PeptideAtlas 查 Human liver 蛋白质组数据集;Gene 库查 P53 互作蛋白;BioMart 下载人类 PCG 基因-蛋白对应表;Pfam 查找 P53 结构域及物种分布推断起源时间。
  • 主讲人背景:杨冬课题组(军事医学科学院/国家蛋白质科学中心北京 PHOENIX),方向为进化发育蛋白质组学(肝脏蛋白质组、ESC 肝向分化、HBx 与 HCC),并提供 iTRAQ/SILAC/非标定量/PRM/SRM、磷酸化蛋白质组等技术服务。

相关:蛋白质组质谱数据鉴定与质量控制-杨冬培训讲义、成都培训结论-蛋白质组信息学与数据挖掘、蛋白质组实验数据介绍及MaxQuant上机实习-培训讲义