# 01. 싱글셀 RNA 시퀀싱이란

> 싱글셀 RNA 시퀀싱이 세포별 RNA를 어떻게 표지하고 읽어 세포×유전자 발현 행렬로 바꾸는지, 입력·실험 과정·출력과 해석 범위를 설명한다.

싱글셀 RNA 시퀀싱(single-cell RNA sequencing, scRNA-seq)은 **한 조직(tissue) 샘플에 섞여 있는 세포들의 RNA를 세포별로 구분해 측정하는 실험 방법**입니다. 세포나 핵의 현탁액을 입력받아 각 세포에서 검출된 유전자별 RNA 분자 수를 담은 `cell × gene` 행렬을 만듭니다.

> **이 수업의 질문**: 섞여 있던 세포가 어떻게 표의 서로 다른 행으로 바뀌는가?

## 결과부터 보면 세포 하나가 표의 한 행이다

종양 조직 샘플에서 세포 네 개를 포획했다고 가정해 봅시다. 아래 값은 설명을 위한 가상 RNA 분자 수입니다.

| cell | EPCAM | CD3D | COL1A1 |
| --- | ---: | ---: | ---: |
| cell_1 | 18 | 0 | 0 |
| cell_2 | 15 | 0 | 1 |
| cell_3 | 0 | 21 | 0 |
| cell_4 | 1 | 0 | 16 |

`cell_1`과 `cell_2`는 `EPCAM`, `cell_3`은 `CD3D`, `cell_4`는 `COL1A1` RNA가 많이 검출됐습니다. 연구자는 이런 발현 조합을 이용해 상피세포, T세포, 섬유아세포 같은 세포 집단을 찾습니다.

여기서 한 행은 원래 샘플에 있던 세포의 완전한 복사본이 아닙니다. 실험 장치에 들어온 RNA 일부가 DNA 사본인 cDNA로 바뀌고, 시퀀서가 읽은 짧은 서열 조각인 read로 표본 추출된 결과입니다. 값이 `0`이어도 그 세포에 RNA가 전혀 없었다기보다 검출되지 않았을 수 있습니다.

## 대표적인 미세 방울 실험은 네 단계로 진행된다

### 1. 조직 샘플을 세포 또는 핵으로 분리한다

고형 조직은 효소와 물리적 처리를 거쳐 세포 현탁액으로 만듭니다. 냉동 조직 샘플처럼 온전한 세포를 얻기 어려우면 핵만 분리하는 single-nucleus RNA-seq를 사용할 수 있습니다.

### 2. 세포마다 고유한 표지를 붙인다

Droplet 방식에서는 보통 세포 하나와 고유 서열 표지(barcode)가 달린 bead 하나를 미세한 방울에 함께 넣습니다. 세포의 mRNA를 DNA 사본인 cDNA로 복사할 때 **cell barcode**와 **UMI**(unique molecular identifier, 고유 분자 식별자)가 붙습니다.

- cell barcode: 이 cDNA가 어느 세포에서 왔는지 표시
- UMI: 원래 RNA 분자 하나를 구분해 DNA 사본을 늘리는 중합효소연쇄반응(polymerase chain reaction, PCR)에서 생긴 복제본을 하나로 접는 표지

### 3. cDNA를 한데 모아 시퀀싱한다

Barcode를 붙인 뒤에는 여러 세포의 cDNA를 섞어 같은 시퀀서에서 읽을 수 있습니다. 각 read에는 세포 출처를 알려 주는 barcode와 유전자에 정렬할 cDNA 서열이 함께 연결됩니다.

### 4. read를 다시 세포별 count로 모은다

분석 소프트웨어는 cDNA 서열을 유전자에 배정하고, 같은 cell barcode끼리 read를 모으며, UMI를 이용해 PCR 중복을 제거합니다. 최종 출력은 barcode마다 유전자별 count를 적은 행렬이며, 대부분 값이 `0`이라 희소 행렬이라고 부릅니다.

## 이름에 들어 있는 세 단어를 구분해 읽는다

| 단어 | 뜻 | 흔한 오해 |
| --- | --- | --- |
| single-cell | 세포 출처를 barcode로 구분 | 세포마다 시퀀서를 따로 돌린다는 뜻은 아님 |
| RNA | 그 시점에 검출된 전사체를 측정 | DNA 변이나 단백질을 직접 측정하는 것은 아님 |
| sequencing | cDNA 조각을 read로 표본 추출 | 세포 안의 모든 RNA를 빠짐없이 읽는 것은 아님 |

따라서 scRNA-seq는 세포의 전체 모습을 그대로 촬영하는 기술이 아닙니다. 포획 시점의 RNA 일부를 읽어 **어떤 세포 집단이 있고, 각 집단이 어떤 유전자 프로그램을 보이는지** 추정하는 기술입니다.

## 무엇을 답할 수 있는가

- 조직 샘플에 어떤 세포 집단이 섞여 있는가?
- 드문 세포 집단이 존재하는가?
- 같은 세포 종류 안에서 활성화·증식·스트레스 상태가 다른가?
- 질환군과 대조군에서 특정 세포 종류의 구성이나 발현이 달라지는가?

반면 세포가 원래 조직의 어느 위치에 있었는지, RNA 변화가 단백질 변화로 이어졌는지, 관찰된 차이가 원인인지 결과인지는 count matrix만으로 알 수 없습니다. 공간 전사체, 단백질 측정, 시간 정보나 기능 실험이 별도로 필요합니다.

## 전체 분석 흐름에서의 위치

시퀀싱할 cDNA 조각의 모음을 **library**라고 합니다. 시퀀서 출력은 각 read의 서열과 품질 점수를 담은 **FASTQ 파일**입니다.

| 구간 | 입력 | 출력 |
| --- | --- | --- |
| 실험 | 조직 샘플, 세포 또는 핵 현탁액 | barcode가 붙은 cDNA library |
| 시퀀싱 | cDNA library | FASTQ read |
| 1차 분석 | FASTQ와 참조 유전체 | cell × gene count matrix |
| 2차 분석 | count matrix와 샘플 정보 | 품질 관리, 세포 군집, 세포 종류와 조건 비교 |

## 정리

싱글셀 RNA 시퀀싱은 섞여 있던 세포의 RNA에 세포별 표지를 붙이고 함께 시퀀싱한 뒤, read를 다시 세포별 유전자 count로 모으는 방법입니다. 핵심 결과물은 세포가 행, 유전자가 열인 희소 행렬이며, 이 행렬로 세포 구성과 세포별 상태 차이를 분석합니다.

다음 [조직(tissue) 평균에서 세포별 발현으로](/lessons/single-cell-resolution/)에서는 같은 조직 샘플을 bulk와 싱글셀로 측정했을 때 어떤 정보가 남고 사라지는지 비교합니다.

---

### 출처

- 초기 단일세포 전사체 측정: [Tang et al., *Nature Methods* (2009)](https://www.nature.com/articles/nmeth.1315)
- droplet 기반 대량 단일세포 전사체 측정: [Zheng et al., *Nature Communications* (2017)](https://www.nature.com/articles/ncomms14049)
- 싱글셀 전사체 분석 모범 사례: [Heumos et al., *Nature Reviews Genetics* (2023)](https://www.nature.com/articles/s41576-023-00586-w)