싱글셀 QC 지표 읽기
싱글셀 QC 지표는 barcode가 실제 세포인지, 포획된 세포의 발현표가 분석 가능한지 평가하는 관측값입니다. 입력은 raw·filtered feature-barcode matrix이고, 출력은 유지·검토·제외할 barcode와 그 판단 근거입니다.
barcode-rank curve
섹션 제목: “barcode-rank curve”모든 barcode를 total UMI가 큰 순서로 정렬한 그림입니다.
| 축 | 뜻 |
|---|---|
| x | UMI count 순위의 barcode |
| y | barcode별 total UMI, 보통 log scale |
왼쪽의 높은 구간에는 세포가 든 방울이 많고, 오른쪽의 긴 꼬리에는 background barcode가 많습니다. knee나 inflection은 후보 경계지만 실제 세포와 empty droplet을 완벽히 나누는 선은 아닙니다.
RNA 함량이 낮은 세포 종류는 꼬리 가까이에 놓일 수 있습니다. total UMI만 자르면 이런 세포가 선택적으로 사라질 수 있습니다.
total UMI count
섹션 제목: “total UMI count”한 barcode에서 모든 gene의 UMI count를 더한 값입니다. 라이브러리 복잡도와 세포의 RNA 함량이 함께 반영됩니다.
- 매우 낮음: empty droplet, 손상 세포, 낮은 포획 효율 가능성
- 매우 높음: doublet 또는 원래 RNA가 많은 큰 세포 가능성
높고 낮음의 절대 기준은 조직(tissue)의 종류와 protocol마다 다릅니다. sample별 분포와 cell type marker를 함께 봅니다.
detected genes
섹션 제목: “detected genes”UMI count가 1 이상인 gene 수입니다. 한 세포에서 얼마나 다양한 전사체가 검출됐는지 나타냅니다.
total UMI와 강하게 연관되므로 두 지표를 산점도로 함께 봅니다. UMI는 높은데 gene 수가 비정상적으로 적다면 일부 고발현 RNA나 background가 값을 지배하는지 확인합니다.
mitochondrial fraction
섹션 제목: “mitochondrial fraction”미토콘드리아 gene에 배정된 UMI가 전체 UMI에서 차지하는 비율입니다.
세포막이 손상돼 세포질 RNA가 빠져나가면 상대적으로 mitochondrial fraction이 높아질 수 있습니다. 그러나 조직과 세포 종류에 따라 정상 범위가 다르고, 높은 에너지 대사를 가진 정상 세포도 값이 높을 수 있습니다.
gene symbol의 MT- 접두어에 의존하면 종·annotation 차이로 잘못 계산할 수 있습니다. 사용한 mitochondrial gene 목록을 기록합니다.
ribosomal·hemoglobin·stress signal
섹션 제목: “ribosomal·hemoglobin·stress signal”ribosomal gene 비율, hemoglobin gene, heat-shock와 immediate-early gene은 시료 상태와 조직 분리 artifact를 찾는 보조 신호입니다.
이 값만으로 행을 자동 삭제하지 않습니다. 예를 들어 혈액이 많은 조직에서는 hemoglobin RNA가 실제 세포 구성과 ambient contamination을 모두 반영할 수 있습니다.
doublet score
섹션 제목: “doublet score”두 세포가 한 barcode에 들어간 것과 닮은 정도를 나타내는 모델 기반 점수입니다. Scrublet은 관측 세포를 합친 인공 doublet을 만들고 이웃 구조에서 실제 세포와 비교합니다.
점수의 scale과 threshold는 도구·run마다 달라질 수 있습니다. 다음 증거를 함께 봅니다.
- 예상 loading에 따른 doublet rate
- 높은 total UMI·detected genes
- 양립하기 어려운 두 계통 marker의 동시 발현
- doublet 후보가 모인 cluster
ambient RNA contamination
섹션 제목: “ambient RNA contamination”세포가 깨지며 나온 RNA가 방울 용액에 떠다니는 현상입니다. empty droplet의 발현 profile과 실제 세포 행에 낮게 퍼진 고발현 gene을 비교해 오염 비율을 추정할 수 있습니다.
SoupX·CellBender 같은 도구의 보정값은 측정값이 아니라 모델 추정치입니다. 보정 전후 matrix를 모두 보존하고, 알려진 marker의 특이성과 전체 count가 어떻게 바뀌었는지 확인합니다.
sample 수준 지표
섹션 제목: “sample 수준 지표”| 지표 | 답하는 질문 |
|---|---|
| estimated cells | 예상한 수만큼 cell-associated barcode를 얻었는가? |
| reads per cell | 세포당 얼마나 시퀀싱했는가? |
| sequencing saturation | 더 읽을 때 새로운 UMI가 얼마나 늘 가능성이 있는가? |
| fraction reads in cells | 유효 read 중 called cell barcode에 속한 비율은 얼마인가? |
| mapping rate | cDNA read가 reference에 얼마나 정렬됐는가? |
한 지표가 나쁘다고 원인이 하나로 정해지지 않습니다. 낮은 fraction reads in cells는 많은 ambient RNA, 낮은 세포 생존율이나 잘못된 cell calling과 연결될 수 있습니다.
QC 보고서에 남길 것
섹션 제목: “QC 보고서에 남길 것”- raw barcodes와 called cells 수
- metric별 sample 분포 그림
- 적용한 lower·upper threshold
- 단계별 제외 cell 수
- doublet·ambient 도구와 버전
- 보정 전후 matrix 위치
- 제외된 후보 cell type이 없는지 검토한 결과