# 03. 어떤 생체 데이터를 만들 것인가

> 질문과 예산에 맞춰 유전자 패널·WES·WGS의 범위와 뎁스, 벌크·싱글셀·공간 RNA-seq의 측정 단위를 선택하는 기준.

생체 데이터 설계는 관측 범위, 해상도, 샘플 수 사이의 트레이드오프를 정하는 일입니다. 모든 것을 가장 넓고 깊게 측정하는 대신, 먼저 답할 질문을 정하고 필요한 데이터만 선택합니다.

> **이 수업의 질문**: 제한된 시료와 비용으로 어떤 범위와 해상도의 데이터를 만들 것인가?

| 선택 축 | 넓게 측정 | 깊고 세밀하게 측정 |
| --- | --- | --- |
| DNA 범위 | 유전체 전체 탐색 | 일부 유전자를 반복해서 깊게 판독 |
| RNA 단위 | 조직(tissue) 전체의 평균 | 세포별 또는 조직 위치별 발현 |
| 반복 | 한 샘플을 깊게 측정 | 여러 샘플·시점의 변동 측정 |

## 1. DNA를 얼마나 넓고 깊게 읽을 것인가

| 방법 | 읽는 범위 | 선택하는 이유 |
| --- | --- | --- |
| **유전자 패널** | 질병과 관련된 일부 유전자 | 좁은 범위를 매우 깊고 빠르게 읽음 |
| **WES(전장엑솜)** | 단백질을 만드는 엑손 전체 | 유전체의 약 1~2%에 분석을 집중 |
| **WGS(전장유전체)** | 약 32억 염기쌍 전체 | 비코딩 영역과 구조 변화까지 넓게 확인 |

패널과 WES는 프로브[^probe]를 이용해 필요한 구간만 골라 읽습니다. 데이터베이스의 전체 테이블을 스캔할지, 인덱스로 일부 열과 행을 집중 조회할지 정하는 것과 비슷합니다.

같은 위치를 여러 번 읽으면 우연한 판독 오류와 실제 변이를 구분하기 쉬워집니다. 한 위치를 평균 30번 읽었다면 **30x 뎁스(depth)** 라고 합니다. 범위가 좁은 패널은 같은 비용으로 더 깊게 읽어 종양 세포 일부에만 있는 저빈도 변이를 찾기 좋고, WGS는 유전체 전체의 변화를 탐색하기 좋습니다.

DNA read를 표준 유전체와 비교해 다른 지점을 찾는 작업은 **변이 콜링(variant calling)** 입니다.[^variant-calling]

![DPYD 변이에 따라 5-FU(플루오로우라실) 독성 위험이 갈린다](/images/lessons/first-class/dpyd-5fu.png)

*DPYD 변이를 미리 확인하면 플루오로우라실 독성 위험을 판단하는 데 도움이 된다.*

DPYD[^dpyd] 유전자의 특정 변이는 플루오로우라실 분해를 방해할 수 있습니다. 이처럼 이미 확인할 위치가 분명하면 좁고 깊은 검사가 유용하고, 원인을 넓게 탐색해야 한다면 WES나 WGS가 더 적합합니다.

종양·정상 DNA와 RNA를 함께 준비했을 때 각 데이터가 후보 선택에 어떤 역할을 하는지는 [Rosie 신항원 PoC의 세 증거 비교](/practice/rosie-neoantigen-poc/#세-증거가-막는-서로-다른-오류)에서 확인할 수 있습니다.

## 2. RNA를 어느 단위로 읽을 것인가

![벌크 RNA-seq(스무디) vs 싱글셀 RNA-seq(과일 하나씩)](/images/lessons/first-class/bulk-vs-singlecell.png)

*벌크는 여러 세포를 섞은 평균을 보고, 싱글셀은 세포별 차이를 본다.*

- **[벌크 RNA-seq](/lessons/rna-seq-pipeline/)**: 조직 전체의 RNA를 섞어 샘플 단위 발현량을 측정합니다.
- **[싱글셀 RNA-seq](/lessons/single-cell-rna-sequencing/)**: 세포마다 바코드를 붙여 발현량을 따로 측정합니다.
- **공간 전사체 분석**: 발현량과 조직 안의 위치를 함께 측정합니다.

로그를 서비스 전체로 집계하면 전체 경향은 잘 보이지만 특정 인스턴스의 이상은 묻힐 수 있습니다. 벌크 RNA-seq도 소수 세포의 신호가 조직 평균에 묻힐 수 있습니다. 싱글셀은 세포별 차이를 보존하지만 데이터가 희소하고 비용과 분석 복잡도가 커집니다.

벌크 RNA-seq의 실제 유전자×샘플 count 표는 [GSE251845 DEG 실습의 데이터 구조](/practice/colorectal-deg-gse251845/#분석할-데이터는-어떻게-생겼나)에서 볼 수 있습니다.

![싱글셀로 밝힌 폐암의 약물 내성 지속세포(persister)](/images/lessons/first-class/persister-scrna.jpeg)

*싱글셀 RNA-seq는 치료 후에도 살아남는 소수의 약물 내성 지속세포를 다른 세포와 분리해 관찰할 수 있다.*

측정 단위를 세포로 정했다면 [싱글셀 RNA 시퀀싱이란](/lessons/single-cell-rna-sequencing/)부터 이어지는 싱글셀 RNA-seq 1~8편에서 기본 원리, barcode·UMI, count matrix, QC, 군집, 주석과 조건 비교를 순서대로 볼 수 있습니다.

## 3. 비용은 범위뿐 아니라 샘플 수로 결정된다

측정 범위가 넓고, 같은 위치를 깊게 읽고, 시점을 여러 번 측정할수록 비용이 커집니다. 아래 금액은 한 프로젝트에서 국내 업체에 문의한 과거 견적이며 현재 가격표가 아닙니다.

| 항목 | 당시 견적 |
| --- | --- |
| 종양 WGS (100x) | 165만원/샘플 |
| 정상·혈액 WGS (30x) | 65만원/샘플 |
| WES (200x) | 30만원/샘플 |
| 벌크 RNA-seq | 35만원/샘플 |
| mRNA-seq | 30만원/샘플 |
| 생물정보학 분석 | 10만원/샘플 |
| 조직 RNA 추출·라이브러리 제작 | 약 50만원 (옵션) |

샘플 하나를 깊게 읽는 것과 여러 반복 샘플을 확보하는 것은 서로 대체되지 않습니다. 깊이는 한 샘플 안의 낮은 빈도 신호를 찾는 데 도움을 주고, 반복 샘플은 개인차와 조건 효과를 구분하게 해 줍니다.

조직 상태도 설계 제약입니다. 뼈처럼 세포 분리가 어려운 조직은 선택할 수 있는 측정법과 전처리가 달라질 수 있으므로, 채취 전에 분석 기관과 필요한 시료 상태를 확인해야 합니다.

:::caution[가격을 현재 시세로 사용하지 마세요]
업체, 측정 시점, 샘플 상태와 분석 범위에 따라 가격은 크게 달라집니다. 이 표는 구성 요소 사이의 규모 차이를 이해하기 위한 참고값입니다.
:::

## 정리

데이터 종류는 많을수록 좋은 것이 아니라 질문과 맞아야 합니다. 원인을 넓게 찾을지, 알려진 위치를 깊게 확인할지, 조직 평균을 볼지, 소수 세포를 분리할지 먼저 결정합니다.

다음 [벌크 RNA 시퀀싱이란](/lessons/rna-seq-pipeline/)에서는 조직의 RNA가 `gene × sample` 행렬로 바뀌는 전체 흐름을 따라갑니다.

---

### 출처

- 약물 내성 지속세포(DTP): [Drug-tolerant persister cells in cancer, *Nature Communications* (2025)](https://www.nature.com/articles/s41467-025-66376-6)

[^probe]: **프로브(probe)**: 읽고 싶은 특정 DNA 구간에만 상보적으로 달라붙도록 설계한 짧은 DNA 조각입니다. 유전체 전체에서 원하는 영역만 골라내는 필터 역할을 합니다.

[^variant-calling]: **변이 콜링(variant calling)**: read를 표준 유전체에 정렬해 비교한 뒤 염기가 바뀌거나 빠지고 들어간 위치를 찾는 분석입니다. 기준 파일과 diff를 계산해 달라진 지점을 뽑는 작업과 비슷합니다.

[^dpyd]: **DPYD**: 플루오로우라실(5-FU) 같은 약물을 분해하는 효소를 만드는 유전자입니다. 특정 변이는 같은 용량에서도 심각한 독성 위험을 높일 수 있습니다.