콘텐츠로 이동

데이터 형식 레퍼런스

FASTQ, SAM/BAM, GTF, VCF는 생물정보를 저장하고 전달하는 파일 형식입니다. 이 문서는 개인 유전체·전사체 분석에서 자주 만나는 형식을 발현량(RNA)변이(DNA) 두 흐름으로 묶어 정리합니다.

시퀀서가 내놓는 원시 read 와 품질 점수. RNA-seq·DNA 시퀀싱 모두 여기서 출발합니다. 4줄이 한 read.

@SEQ_ID
GATTTGGGGTTCAAAGCAG
+
!''*((((***+))%%%++

레퍼런스(게놈 또는 전사체)에 정렬된 read. SAM은 텍스트, BAM은 그 압축 바이너리입니다. 한 레코드의 구조는 SAM/BAM 한 줄 읽기에서 설명합니다.

게놈 위에 유전자·전사체·엑손 좌표를 적어둔 주석 파일. RNA-seq에서 정렬된 read를 어느 유전자에 배정할지 결정할 때 씁니다. 자세한 내용은 GTF 레퍼런스를 참고하세요.


유전자 발현 행렬 (expression matrix)

섹션 제목: “유전자 발현 행렬 (expression matrix)”

벌크 RNA-seq의 최종 산출물. 행=유전자, 열=샘플, 값은 발현량.

여러 세포가 섞인 조직(tissue)에서 만든 bulk RNA-seq 행렬은 세포별 값이 아니라 조직 조각 전체에서 나온 RNA를 합친 값입니다.

gene control_1 control_2 treated_1
gene_A 842.1 93.4 88.0
gene_B 210.5 198.2 205.7
단위의미
counts정렬된 read를 유전자에 배정해 센 정규화 전 값
CPM / TPM / FPKM라이브러리 크기·유전자 길이로 정규화한 값 (샘플 간 비교용)

정량 도구: featureCounts, Salmon, kallisto. 정렬 도구의 차이는 Aligner에서 설명합니다.

세포 하나하나를 따로 읽으므로 행렬이 거대하고 희소합니다. 10x MEX 원본은 feature × barcode, AnnData는 보통 cell × gene 방향으로 다루므로 축을 함께 확인해야 합니다.

형식내용
.h5ad (AnnData)Python(scanpy) 표준. 행렬 + 세포/유전자 메타데이터를 한 파일에
.rds (Seurat)R 생태계 표준 객체
10x MatrixMarketmatrix.mtx + barcodes.tsv + features.tsv 3종 세트

대표 도구: Python의 scanpy, R의 Seurat.

raw·filtered matrix, MEX·H5·h5ad와 Seurat 객체의 축과 slot은 싱글셀 데이터 구조와 파일 형식에서 설명합니다.


레퍼런스 대비 변이 목록. 전장엑솜(WES)·전장유전체(WGS) 분석의 핵심 형식.

#CHROM POS ID REF ALT QUAL FILTER INFO
1 11856378 rs1801133 G A 99 PASS ...

bcftools 로 필터·조회·병합합니다.

탭 구분 텍스트. SNP 칩이 측정한 수십만 개 변이의 genotype. 검사기관이 돌려주는 가장 흔한 raw 데이터.

컬럼의미
rsiddbSNP 변이 식별자 (rs...)
chromosome염색체
position좌표 (특정 게놈 빌드 기준, 보통 GRCh37)
genotype두 대립유전자 (예: AA, AG)

DB용도
GEO연구 단위의 유전자 발현 데이터와 실험 정보
ENAFASTQ 같은 공개 원본 시퀀싱 데이터
GTEx정상 조직별 발현량 레퍼런스 (발현이 “높다/낮다”의 기준)
dbSNP변이 식별자·기본 정보
ClinVar변이의 임상적 의미(병원성)
gnomAD집단 내 대립유전자 빈도
SNPedia커뮤니티 표현형 해석