[ PROMPT_NODE_26570 ]
proteomics_metabolomics_formats
[ SKILL_DOCUMENTATION ]
# 蛋白质组学与代谢组学文件格式参考
本参考指南涵盖了蛋白质组学、代谢组学、脂质组学及相关组学工作流中特定的文件格式。
## 基于质谱的蛋白质组学
### .mzML - 质谱标记语言 (Mass Spectrometry Markup Language)
**描述:** MS 数据的标准 XML 格式
**典型数据:** MS1 和 MS2 谱图、保留时间、强度
**应用场景:** 蛋白质组学、代谢组学管线
**Python 库:**
- `pymzml`: `pymzml.run.Reader('file.mzML')`
- `pyteomics.mzml`: `pyteomics.mzml.read('file.mzML')`
- `pyopenms`: OpenMS Python 绑定
**EDA 方法:**
- 扫描计数和 MS 级别分布
- 总离子流色谱图 (TIC) 分析
- 基峰色谱图 (BPC)
- m/z 覆盖率和分辨率
- 保留时间范围
- 前体选择模式
- 数据完整性
- 质量控制指标(锁定质量、标准品)
### .mzXML - 旧版 MS XML 格式
**描述:** 较旧的基于 XML 的 MS 格式
**典型数据:** 带有元数据的质谱图
**应用场景:** 旧版蛋白质组学数据
**Python 库:**
- `pyteomics.mzxml`
- `pymzml`: 可读取 mzXML
**EDA 方法:**
- 同 mzML
- 格式版本兼容性
- 转换质量验证
- 元数据保留检查
### .mzIdentML - 肽段鉴定格式 (Peptide Identification Format)
**描述:** 用于肽段鉴定的 PSI 标准
**典型数据:** 肽段-谱图匹配 (PSM)、蛋白质、得分
**应用场景:** 搜索引擎结果、蛋白质组学工作流
**Python 库:**
- `pyteomics.mzid`
- `pyopenms`: MzIdentML 支持
**EDA 方法:**
- PSM 计数和得分分布
- FDR 计算和过滤
- 修饰分析
- 漏切位点统计
- 蛋白质推断结果
- 搜索参数验证
- 诱饵库命中分析
- Rank-1 与低排名的对比
### .pepXML - 跨蛋白质组学管线肽段 XML (Trans-Proteomic Pipeline Peptide XML)
**描述:** 用于肽段鉴定的 TPP 格式
**典型数据:** 带有统计验证的搜索结果
**应用场景:** 蛋白质组学数据库搜索输出
**Python 库:**
- `pyteomics.pepxml`
**EDA 方法:**
- 搜索引擎比较
- 得分分布 (XCorr, expect value 等)
- 电荷状态分析
- 修饰频率
- PeptideProphet 概率
- 蛋白质覆盖率
- 谱图计数
### .protXML - 蛋白质推断结果
**描述:** TPP 蛋白质水平鉴定
**典型数据:** 蛋白质组、概率、肽段
**应用场景:** 蛋白质水平分析
**Python 库:**
- `pyteomics.protxml`
**EDA 方法:**
- 蛋白质 g