[ PROMPT_NODE_26562 ]
bioinformatics_genomics_formats
[ SKILL_DOCUMENTATION ]
# 生物信息学与基因组学文件格式参考
本参考涵盖了基因组学、转录组学、序列分析及相关生物信息学应用中使用的文件格式。
## 序列数据格式
### .fasta / .fa / .fna - FASTA 格式
**描述:** 基于文本的核苷酸或蛋白质序列格式
**典型数据:** 带有头信息的 DNA、RNA 或蛋白质序列
**用例:** 序列存储、BLAST 搜索、比对
**Python 库:**
- `Biopython`: `SeqIO.parse('file.fasta', 'fasta')`
- `pyfaidx`: 快速索引 FASTA 访问
- `screed`: 快速序列解析
**EDA 方法:**
- 序列计数和长度分布
- GC 含量分析
- N 含量 (模糊碱基)
- 序列 ID 解析
- 重复检测
- 组装质量指标 (N50, L50)
### .fastq / .fq - FASTQ 格式
**描述:** 带有碱基质量分数的序列数据
**典型数据:** 带有 Phred 质量分数的原始测序读段
**用例:** NGS 数据、质量控制、读段映射
**Python 库:**
- `Biopython`: `SeqIO.parse('file.fastq', 'fastq')`
- `pysam`: 快速 FASTQ/BAM 操作
- `HTSeq`: 测序数据分析
**EDA 方法:**
- 读段计数和长度分布
- 质量分数分布 (每碱基、每读段)
- GC 含量和偏差
- 重复率估计
- 接头污染检测
- k-mer 频率分析
- 编码格式验证 (Phred33/64)
### .sam - 序列比对/映射格式
**描述:** 用于比对的制表符分隔文本格式
**典型数据:** 带有映射质量的比对测序读段
**用例:** 读段比对存储、变异检测
**Python 库:**
- `pysam`: `pysam.AlignmentFile('file.sam', 'r')`
- `HTSeq`: `HTSeq.SAM_Reader('file.sam')`
**EDA 方法:**
- 映射率和质量分布
- 覆盖度分析
- 插入片段大小分布 (双端测序)
- 比对标志分布
- CIGAR 字符串模式
- 错配和插入缺失率
- 重复和补充比对计数
### .bam - 二进制比对/映射格式
**描述:** SAM 的压缩二进制版本
**典型数据:** 压缩格式的比对读段
**用例:** 高效存储和处理比对结果
**Python 库:**
- `pysam`: 带有索引的完整 BAM 支持
- `bamnostic`: 纯 Python BAM 读取器
**EDA 方法:**
- 同 SAM,外加:
- 压缩比分析
- 索引文件 (.bai) 验证
- 染色体统计
- 链偏差检测
- 读段组分析
### .cram - CRAM 格式
**描述:** 高度压缩的