蛋白质组实验数据库和数据提交

概述

本培训材料介绍了蛋白质组学数据共享的国际策略、主要数据库平台和数据提交规范。

数据共享的重要性

国际趋势

  • 基因组研究的快速发展得益于全民数据共享原则
  • 人类蛋白质组计划进入全面发展时期
  • 学术界对蛋白质组数据共享的需要日益迫切
  • 数据开源有利于增加文献被引用率

国际策略演进

  • 2008 Amsterdam Principles:荷兰阿姆斯特丹蛋白质组数据共享峰会
  • 2010 Sydney Meeting:悉尼会议扩展了Amsterdam原则
  • 强调时效性、完整性、格式标准、质量标准

主要数据库平台

1. PRIDE (Proteomics Identifications Database)

  • 网址:http://www.ebi.ac.uk/pride/archive/
  • 机构:欧洲生物信息研究所(EBI)
  • 特点:
    • 接受MS/MS数据
    • 严格的数据格式和元数据要求
    • 与HUPO-PSI紧密合作
    • 工具:PRIDE Inspector, PRIDE Converter, PRIDE Cluster

2. PeptideAtlas

  • 网址:http://www.peptideatlas.org/
  • 机构:美国西雅图系统生物学研究所(ISB)
  • 特点:
    • 使用统一流程(TPP)分析所有数据
    • 按物种/组织构建整合数据集
    • 包含PASSEL SRM数据库

3. MassIVE

  • 网址:http://massive.ucsd.edu/
  • 机构:加州大学圣地亚哥分校
  • 特点:
    • NIH资助的计算质谱中心
    • 存储和管理原始质谱数据
    • 接管了ProteomeCommons停止后的数据

4. jPOST

5. iProX (中国)

  • 网址:www.iprox.org
  • 特点:
    • 中国蛋白质组数据中心
    • 支持结构化数据管理
    • 三级权限系统(私有/群组/公开)
    • 标准化实验元信息收集
    • 承担CNHPP和C-HPP数据共享任务

ProteomeXchange 联盟

组成

  • PRIDE (MS/MS数据)
  • PASSEL (SRM数据)
  • MassIVE
  • jPOST
  • ProteomeCentral

功能

  • 统一提交平台
  • 数据自动传播到各成员数据库
  • 生成唯一ID (PXDxxxxxx)
  • 支持审稿人访问

数据提交要求

文件格式

原始数据:

  • mzML, mzXML, mzData
  • Thermo .RAW, ABSCIEX .wiff/.wiff.scan
  • Agilent .d/, Waters .raw/
  • imzML, Shimadzu .run/, Bruker .yep

结果文件:

  • PRIDE XML
  • mzIdentML (需配peaks文件)
  • mzTab

峰列表(不支持作为原始数据):

  • mgf, dta, ms2, pkl 等

提交类型

完整提交 (Complete Submission):

  • 必须包含:RAW + RESULT (PRIDE XML 或 mzIdentML)
  • 若用mzIdentML,还需PEAK文件

部分提交 (Partial Submission):

  • 必须包含:RAW + SEARCH结果
  • 不能包含RESULT文件

杂志要求

Molecular & Cellular Proteomics

  • 接受后必须提交所有质谱数据到公开数据库
  • 优先提交原始仪器文件格式
  • 鼓励转换为开放格式(mzML)

Journal of Proteome Research

  • 强烈鼓励提交所有MS/MS谱图
  • 作者可提供额外访问方式

Proteomics

  • PRIDE存储为强制要求
  • 建议符合MIAPE标准
  • 需在致谢中声明MIAPE合规性

必需信息

  1. 从质谱原始文件获取peaklist的软件/方法及版本
  2. 数据搜索软件及版本
  3. 搜索数据库名称及版本
  4. 谱图-肽段质控方法(阈值等)
  5. Decoy库搜索和FDR统计
  6. 肽段序列、电荷信息
  7. 修饰数据(修饰位点)
  8. 定量数据及统计方法

iProX 系统特点

功能模块

  • 结构化数据管理(项目/子项目)
  • 三级权限管理
  • 标准化CV词表收集实验信息
  • 邮件通知系统
  • 站内信功能

数据存储

  • 北京:30TB
  • 多节点:大连、上海、武汉、长沙、深圳、广州
  • 覆盖多物种、多组织、多疾病、多定量策略

数据提交流程

  1. 准备数据(格式转换、质量控制)
  2. 填写Metadata(CV词表)
  3. 在线提交或FTP上传
  4. 获取数据集ID
  5. 投稿时提供ID和审稿人访问权限

与其他笔记关联