成都培训-蛋白质组信息学及数据挖掘笔记
- title: “成都培训-蛋白质组信息学及数据挖掘笔记”
- source: “/工作相关/Personnal/2017工作/成都培训.pptx”
- original_path: “/工作相关/Personnal/2017工作/成都培训.pptx”
- author: “培训讲义(2017.10.30)”
- size: “10.9 MB”
- pages: 67
- date: “2017-10-30”
- processed_date: “2026-09-22”
- method: “PPTX文本提取”
- status: “done”
培训内容概述
2017年10月30日”生物信息学最新技术——蛋白质组学与质谱分析”高级培训班(成都/北京蛋白质组研究中心凤凰中心)的讲义,主讲人杨冬(进化发育蛋白质组学课题组,云盘另存完整75页版 2017-10-30-计算所培训班-成都-杨冬.pptx,本笔记基于67页精简版,两者主题结构一致)。课程分为两大部分:蛋白质组数据注释及功能分析、蛋白质组数据分析常用数据库和工具。
第一部分:蛋白质组数据注释及功能分析
1. 数据注释流程
蛋白质鉴定列表 → 蛋白质注释信息表 → 数据挖掘
注释内容包括:
- 序列特征
- 结构特征
- 功能特征
- 表达特征
- 定位特征
- 相互作用
- 网络特征
- 进化特征
核心观点:通过各类数据库及数据整合程序实现规模化、自动化信息注释,为后续数据挖掘提供必要信息。
2. 蛋白质-基因编号Mapping
最常用工具:
- DAVID: https://david.ncifcrf.gov/
- UniProt ID mapping: http://www.uniprot.org/uploadlists/
- PICR: http://www.ebi.ac.uk/Tools/picr/(多物种蛋白ID转换)
- MatchMiner: http://discover.nci.nih.gov/matchminer/(基因ID转换,仅人和小鼠)
- CRONOS: http://mips.helmholtz-muenchen.de/(人、大小鼠基因ID转换)
标准名称规范:
- 标准基因名称:Entrez Gene ID (NCBI locus link), HGNC
- 标准蛋白名称:Uniprot, Ensembl, IPI
3. 聚类分析
K-Means聚类
- 优点:简洁快速
- 缺点:需要预先指定聚类数K,结果依赖初始中心选择
- 算法步骤:
- 初始化:选择(或人为指定)某些记录作为凝聚点
- 循环:按就近原则归类 → 重新计算中心位置 → 重新聚类
- 直到凝聚点位置收敛
层次聚类(系统聚类)
- 距离度量:欧氏距离、马氏距离、明氏距离、相关系数、夹角余弦
- 类间距离计算方法:最短距离法、最长距离法、类平均法、重心法、中间距离法、离差平方和法
4. WGCNA(加权基因共表达网络分析)
基本原理:
- 计算基因间相关矩阵 S
- 构建邻接矩阵 A = |S|
- 根据无尺度网络原则确定β(log(k)与log(p(k))相关系数≥0.8)
- 构建拓扑重叠矩阵 Ω
- 计算相异系数 d = 1 - ω
- 层次聚类 → 动态剪切法划分模块
应用场景:寻找协同表达的基因模块,探索基因网络与表型的关联关系。
5. 富集/缺失分析
超几何分布模型:
- M: GEP中蛋白质总数
- N: CSP中蛋白质总数
- m: GEP中具有X特征的蛋白质数目
- n: CSP中具有X特征的蛋白质数目
判断标准:
- P2 < P1 且 P2 ≤ 0.05 → X特征在CSP中显著富集
- P1 < P2 且 P1 ≤ 0.05 → X特征在CSP中显著缺失
6. GO/Pathway功能注释
Gene Ontology (GO)
- 分子功能 (Molecular Function)
- 细胞组分 (Subcellular Location)
- 生物过程 (Biological Process)
常用工具:DAVID, Gostat, Gosurfer, Gotcha, MappFinder, OntoGate, Godist…
KEGG(京都基因与基因组百科全书)
- 主要功能:Pathway查询与分析
- 通路类型:
- 细胞过程(5类)
- 环境信息处理(29类)
- 遗传信息处理(21类)
- 生物体系统(26类)
- 人类疾病(31类)
- 代谢(多个子类)
实例:Wnt信号通路分析
7. 染色体定位分析
数据来源:Ensembl, NCBI(可通过BioMart或FTP下载)
特殊染色体编号:
- GL/JH开头:unplaced scaffolds
- PATCH:genome assembly中的修复区域
8. 蛋白质互作网络分析
推荐工具:PRINCESS
网络类型:
- 基因转录调控网络
- 生物代谢与信号传导网络
- 蛋白质相互作用网络
第二部分:常用数据库和工具
1. 主要机构及数据库
| 机构 | 数据库/工具 |
|---|---|
| NCBI | GenBank, Taxonomy, GEO, SRA, OMIM, BLAST, PubMed, Gene, Protein |
| EMBL | 欧洲分子生物学实验室 |
| EBI | Ensembl, UniProt, Pfam, InterPro, PRIDE, Reactome, Expression Atlas |
| SIB | ExPASy, neXtProt |
| Kanehisa Lab | KEGG |
| ISB | Peptide Atlas |
| NCPSB-Beijing | iProX, LiverBase, Formiana, Princess, ProDoctor |
2. UniProt数据库
- Swiss-Prot (SP):手动注释,适合数据挖掘
- TrEMBL:计算分析,待人工注释
注意:SP库不一定适合搜库(如小鼠数据)
3. Ensembl & BioMart
用途:下载基因-蛋白质对应表、染色体定位信息、Ka/Ks等
4. PRIDE数据库
- 全称:PRoteomics IDEntifications database
- 内容:标准化蛋白质组学数据公共仓库
- 特点:支持PTM(翻译后修饰)注释
5. 其他重要数据库
- Peptide Atlas (ISB):肽段鉴定数据库
- Human Protein Atlas:蛋白质组学图谱
- Subcellular Protein Atlas:亚细胞定位蛋白图谱(65000张高分辨率共聚焦图像)
6. 蛋白质结构与进化数据库
- PDB:蛋白质结构数据库
- Pfam:蛋白质结构域家族数据库
- InterPro:蛋白质结构域整合数据库
- CDD:Conserved Domain Database
- SMART:简单模块化氨基酸结构域分析工具
SCOP分类体系(六个等级):
- 结构类别(α/β)
- 折叠(Fold)
- 超家族(Superfamily)
- 家族(Family)
- 同源蛋白簇(Orthologous Group)
- 谱系特异性扩增(Lineage-specific expansion)
7. 结构域判定方法
- 直接依赖数据库注释(SP库)
- RPS-BLAST:序列vs结构域保守序列比对
- HMMER:基于隐马尔可夫模型
ProDoctor平台:http://prodoctor.ncpsb.org/
- 一站式分析:结构域年龄、进化速率、无序率等
第三部分:进化分析
1. 基因年龄判定方法
三步法:
- 确定时间”刻度”(物种树结点或序列分歧程度)
- 推断基因进化事件:
- “获取-丢失”(Dollo parsimony, phylostratigraphy)
- “系统发生谱系重建”(EnsemblCompara)
- 基于进化史赋予基因年龄
2. 同源蛋白判定方法
| 方法 | 原理 |
|---|---|
| Inparanoid, KOGs, OrthoMCL | BLAST matches |
| Ensembl-Compara, HomoloGene | BLAST + synteny |
| HOGENOM, TreeFam, STRAW, PHYLDOG | phylogenetic tree |
3. 分子进化理论
三种进化模式:
- 阳性选择:非同义替代显著,产生新功能
- 阴性选择(净化选择):同义替代显著,功能高度保守
- 中性进化:同义与非同义替代比例相当
Ka/Ks比值:
- Ka/Ks ≈ 1:中性进化
- Ka/Ks << 1:阴性选择
- Ka/Ks >> 1:阳性选择(适应性进化)
工具:PAML, MEGA
上机练习建议
- PRIDE/Peptide Atlas:查找一个Human liver蛋白质组数据集
- Gene数据库:查找P53分子已知相互作用蛋白
- Ensembl BioMart:下载人类所有PCG的基因和蛋白质对应表
- Pfam:查找P53蛋白的结构域及物种分布
- Ensembl:下载人和小鼠直系同源列表及dN/dS信息
关键知识点总结
- 数据标准化是前提:所有生物信息分析工具只接受特定格式的标准名称
- 富集/缺失分析用超几何分布:“富集”=显著多,“缺失”=显著少
- WGCNA是无监督网络构建方法:通过无尺度原则确定参数β
- 数据库选择要看目的:SP库适合数据挖掘,TrEMBL适合搜库
- 进化分析三步走:定时间刻度→推进化事件→赋基因年龄
- Ka/Ks是选择压力的量化指标:<<1净化选择,>>1正向选择
75页完整版补充(2017-10-30-计算所培训班-成都-杨冬.pptx)
- Ka/Ks 计算细节:Ka=每个非同义位点的非同义替代数(dN),Ks=每个同义位点的同义替代数(dS);多数基因中性进化,仅约 1% 受阳性选择;工具 PAML/MEGA,Ensembl BioMart 可直接下载每基因 Ka/Ks。
- 分子进化三模式:阳性选择(非同义替代显著→新功能)、阴性/净化选择(同义替代显著→功能保守)、中性进化(两者相当)。
- 新基因判定三要素:角度(序列/结构/功能)+ 范围(比较物种范围)+ 阈值;基因年龄判定用”获取-丢失”(Dollo/Wagner parsimony,如 phylostratigraphy)或”系统发生谱系重建”(基因树+物种树,可避免并行丢失的典型错误,2013 Trends Genet)。
- 同源判定方法分级:BLAST matches(InParanoid/KOGs/OrthoMCL)→ BLAST+共线性(Ensembl-Compara/HomoloGene)→ 系统发生树(HOGENOM/TreeFam/STRAW/PhyloDog)。
- 结构域规模化判定:直接依赖 SP 注释 / RPS-BLAST 比对 Pfam / HMMER(隐马尔可夫模型);ProDoctor 平台可做结构域年龄、进化速率、无序率一站式分析。
- 蛋白质分类层次(SCOP/CATH):结构类别→折叠→超家族→家族→同源蛋白簇→谱系特异性扩增。
- 上机练习题目:PRIDE/PeptideAtlas 查 Human liver 蛋白质组数据集;Gene 库查 P53 互作蛋白;BioMart 下载人类 PCG 基因-蛋白对应表;Pfam 查找 P53 结构域及物种分布推断起源时间。
- 主讲人背景:杨冬课题组(军事医学科学院/国家蛋白质科学中心北京 PHOENIX),方向为进化发育蛋白质组学(肝脏蛋白质组、ESC 肝向分化、HBx 与 HCC),并提供 iTRAQ/SILAC/非标定量/PRM/SRM、磷酸化蛋白质组等技术服务。
相关:蛋白质组质谱数据鉴定与质量控制-杨冬培训讲义、成都培训结论-蛋白质组信息学与数据挖掘、蛋白质组实验数据介绍及MaxQuant上机实习-培训讲义