# 싱글셀 QC 지표 읽기

> barcode-rank curve, UMI·검출 유전자·미토콘드리아 비율, doublet score와 ambient RNA 신호의 입력·의미·실패 조건을 독립적으로 확인하는 레퍼런스.

싱글셀 QC 지표는 **barcode가 실제 세포인지, 포획된 세포의 발현표가 분석 가능한지 평가하는 관측값**입니다. 입력은 raw·filtered feature-barcode matrix이고, 출력은 유지·검토·제외할 barcode와 그 판단 근거입니다.

## barcode-rank curve

모든 barcode를 total UMI가 큰 순서로 정렬한 그림입니다.

| 축 | 뜻 |
| --- | --- |
| x | UMI count 순위의 barcode |
| y | barcode별 total UMI, 보통 log scale |

왼쪽의 높은 구간에는 세포가 든 방울이 많고, 오른쪽의 긴 꼬리에는 background barcode가 많습니다. knee나 inflection은 후보 경계지만 실제 세포와 empty droplet을 완벽히 나누는 선은 아닙니다.

RNA 함량이 낮은 세포 종류는 꼬리 가까이에 놓일 수 있습니다. total UMI만 자르면 이런 세포가 선택적으로 사라질 수 있습니다.

## total UMI count

한 barcode에서 모든 gene의 UMI count를 더한 값입니다. 라이브러리 복잡도와 세포의 RNA 함량이 함께 반영됩니다.

- 매우 낮음: empty droplet, 손상 세포, 낮은 포획 효율 가능성
- 매우 높음: doublet 또는 원래 RNA가 많은 큰 세포 가능성

높고 낮음의 절대 기준은 조직(tissue)의 종류와 protocol마다 다릅니다. sample별 분포와 cell type marker를 함께 봅니다.

## detected genes

UMI count가 1 이상인 gene 수입니다. 한 세포에서 얼마나 다양한 전사체가 검출됐는지 나타냅니다.

total UMI와 강하게 연관되므로 두 지표를 산점도로 함께 봅니다. UMI는 높은데 gene 수가 비정상적으로 적다면 일부 고발현 RNA나 background가 값을 지배하는지 확인합니다.

## mitochondrial fraction

미토콘드리아 gene에 배정된 UMI가 전체 UMI에서 차지하는 비율입니다.

세포막이 손상돼 세포질 RNA가 빠져나가면 상대적으로 mitochondrial fraction이 높아질 수 있습니다. 그러나 조직과 세포 종류에 따라 정상 범위가 다르고, 높은 에너지 대사를 가진 정상 세포도 값이 높을 수 있습니다.

gene symbol의 `MT-` 접두어에 의존하면 종·annotation 차이로 잘못 계산할 수 있습니다. 사용한 mitochondrial gene 목록을 기록합니다.

## ribosomal·hemoglobin·stress signal

ribosomal gene 비율, hemoglobin gene, heat-shock와 immediate-early gene은 시료 상태와 조직 분리 artifact를 찾는 보조 신호입니다.

이 값만으로 행을 자동 삭제하지 않습니다. 예를 들어 혈액이 많은 조직에서는 hemoglobin RNA가 실제 세포 구성과 ambient contamination을 모두 반영할 수 있습니다.

## doublet score

두 세포가 한 barcode에 들어간 것과 닮은 정도를 나타내는 모델 기반 점수입니다. Scrublet은 관측 세포를 합친 인공 doublet을 만들고 이웃 구조에서 실제 세포와 비교합니다.

점수의 scale과 threshold는 도구·run마다 달라질 수 있습니다. 다음 증거를 함께 봅니다.

- 예상 loading에 따른 doublet rate
- 높은 total UMI·detected genes
- 양립하기 어려운 두 계통 marker의 동시 발현
- doublet 후보가 모인 cluster

## ambient RNA contamination

세포가 깨지며 나온 RNA가 방울 용액에 떠다니는 현상입니다. empty droplet의 발현 profile과 실제 세포 행에 낮게 퍼진 고발현 gene을 비교해 오염 비율을 추정할 수 있습니다.

SoupX·CellBender 같은 도구의 보정값은 측정값이 아니라 모델 추정치입니다. 보정 전후 matrix를 모두 보존하고, 알려진 marker의 특이성과 전체 count가 어떻게 바뀌었는지 확인합니다.

## sample 수준 지표

| 지표 | 답하는 질문 |
| --- | --- |
| estimated cells | 예상한 수만큼 cell-associated barcode를 얻었는가? |
| reads per cell | 세포당 얼마나 시퀀싱했는가? |
| sequencing saturation | 더 읽을 때 새로운 UMI가 얼마나 늘 가능성이 있는가? |
| fraction reads in cells | 유효 read 중 called cell barcode에 속한 비율은 얼마인가? |
| mapping rate | cDNA read가 reference에 얼마나 정렬됐는가? |

한 지표가 나쁘다고 원인이 하나로 정해지지 않습니다. 낮은 fraction reads in cells는 많은 ambient RNA, 낮은 세포 생존율이나 잘못된 cell calling과 연결될 수 있습니다.

## QC 보고서에 남길 것

- raw barcodes와 called cells 수
- metric별 sample 분포 그림
- 적용한 lower·upper threshold
- 단계별 제외 cell 수
- doublet·ambient 도구와 버전
- 보정 전후 matrix 위치
- 제외된 후보 cell type이 없는지 검토한 결과

### 공식 자료와 원 논문

- [10x Genomics Cell Ranger web summary 해석](https://www.10xgenomics.com/support/software/cell-ranger/latest/analysis/outputs/cr-outputs-web-summary)
- [EmptyDrops, *Genome Biology* (2019)](https://pmc.ncbi.nlm.nih.gov/articles/PMC6431044/)
- [SoupX, *GigaScience* (2020)](https://pmc.ncbi.nlm.nih.gov/articles/PMC7763177/)
- [Scrublet, *Cell Systems* (2019)](https://pmc.ncbi.nlm.nih.gov/articles/PMC6625319/)