成都培训结论 —— 蛋白质组信息学与数据挖掘培训大纲
2017年10月「生物信息学最新技术——蛋白质组学与质谱分析」高级培训班(成都)的培训结论课件,20页,内容为课程大纲+关键方法要点。属于云盘个人工作目录下质谱仪软件架构调研期间的学习资料。
培训课程结构(2017-10-30)
上午:蛋白质组数据注释及功能分析
- 蛋白质-基因编号 mapping
- 蛋白质表达数据的聚类分析、相关性分析
- 富集/缺失分析、GO/Pathway 功能注释
- 染色体定位分析
- 蛋白质互作网络分析
- 上机练习
下午:蛋白质组数据分析常用数据库和工具
- 常用生物信息学数据库和工具
- 蛋白质结构和进化分析主要数据库和工具
- 上机练习
核心知识点
数据注释的八个维度
从蛋白质鉴定列表(全部/差异/特定群体)生成蛋白质注释信息表,注释维度包括: 序列特征、结构特征、功能特征、表达特征、定位特征、相互作用、网络特征、进化特征。
关键思想:基于各类数据库及数据整合程序实现规模化、自动化的信息注释,为后续数据挖掘提供必要信息。即注释不是逐条手工查库,而是管线化批量处理——这与质谱仪软件「自动化报告」的工程需求一致。
富集/缺失分析的统计模型
基于超几何分布模型(hypergeometric distribution)做 GO/Pathway 的富集或缺失显著性检验——即从 N 个蛋白中取 n 个差异蛋白,某功能类目 K 中命中 k 个的概率分布。这是功能富集分析(GO enrichment)的标准统计框架。
规模化结构域判定的三种方法
- 直接依赖数据库注释(如 SwissProt 库自带的 domain 注释)
- RPS-BLAST:蛋白质序列 vs 保守结构域库(如 CDD/Pfam)的逆 BLAST。课件给出了实际命令示例(rpsblast -i 输入fasta -d Pfam库 -e 0.001 -o 输出文件),并注意 BLAST 结束后需另写程序提取结果信息(工程落地要点)。
- HMMER:基于隐马尔可夫模型(HMM)的结构域/家族搜索。
著名机构及其代表性数据库
课件列举了生物信息学最著名的机构及代表性数据库/工具,以及蛋白质结构/进化相关数据库(Pfam 蛋白家族与折叠分布等)。幻灯片中的具体清单以图片呈现,未能提取文本(待确认)。
工程视角的启示(供质谱仪软件参考)
- 蛋白质组数据分析的通用范式:鉴定列表 -> 批量注释总表 -> 统计挖掘(聚类/相关/富集)-> 可视化(网络/通路),可直接映射为软件的信息架构。
- 注释管线高度依赖外部数据库(UniProt/SP、Pfam、GO、KEGG),软件设计需考虑数据库版本管理与本地化部署。
- rpsblast 输出需要后处理程序——工具链缝隙处正是软件价值所在。
关联
- 质谱仪软件架构调研(同期资料的主题背景)
- 相关概念:质谱鉴定(MALDI-TOF)、生物信息学注释