# GEO: 공개 유전자 발현 데이터 찾기

> NCBI GEO에서 Series와 Sample, accession을 읽고 분석 파일을 내려받는 방법.

GEO(Gene Expression Omnibus)는 연구자가 논문에 사용한 **유전자 발현 데이터와 실험 설명을 공개하는 NCBI 저장소**입니다. 코드 저장소에서 프로젝트를 찾듯이, GEO에서는 연구 단위의 accession으로 데이터와 metadata를 찾습니다.

> **GEO에서 먼저 할 일**: 연구 질문과 샘플 구성이 내 분석에 맞는지 확인한 다음, 내가 필요한 처리 단계에 맞는 파일을 고릅니다.

## accession은 데이터의 주소다

GEO 페이지마다 `GSE251845`처럼 변하지 않는 식별자가 있습니다. 이를 **accession**이라고 합니다. 논문 제목보다 정확하게 한 데이터셋을 가리키므로 검색, 코드, 분석 기록에는 accession을 남깁니다.

| 접두사 | 단위 | 개발자에게 익숙한 구조로 보면 |
| --- | --- | --- |
| `GSE` | 여러 샘플을 묶은 연구, Series | 프로젝트 |
| `GSM` | 샘플 하나 | 프로젝트 안의 데이터 객체 |
| `GPL` | 측정에 사용한 플랫폼 | 빌드 환경이나 장비 명세 |

한 GSE 안에는 여러 GSM이 들어 있습니다. GSE 페이지에서 전체 연구 설계를 읽고, GSM 페이지에서 특정 샘플의 조직(tissue)·처리 조건·파일을 확인합니다.

## 페이지에서 먼저 확인할 네 가지

1. **Summary와 Overall design**에서 연구 질문과 비교군을 확인합니다.
2. **Samples**에서 표본 수, 조직, 조건과 환자 대응 여부를 확인합니다.
3. **Supplementary file**에서 count matrix 같은 가공 파일이 있는지 확인합니다.
4. **SRA 링크**에서 FASTQ를 다시 받을 수 있는지 확인합니다.

파일이 공개되어 있다는 사실만으로 비교 가능한 데이터가 되지는 않습니다. 암 조직과 인접 정상조직인지, 서로 다른 사람의 조직인지, 같은 sequencing protocol과 genome build를 썼는지 함께 읽어야 합니다.

## count matrix와 FASTQ 중 무엇을 받을까

차등발현 통계가 학습 목표라면 연구자가 제공한 **[raw count matrix](/reference/htseq-counts/)** 에서 시작하는 편이 좋습니다. 다운로드가 작고 정렬·정량 단계를 건너뛸 수 있습니다.

QC, 정렬, 정량 파이프라인까지 재현하려면 **SRA의 FASTQ**에서 시작합니다. 대신 저장공간과 계산 시간이 훨씬 많이 들고, 모든 샘플에 같은 파이프라인을 적용해야 합니다. FASTQ 이후의 흐름은 [FASTQ 품질 확인과 트리밍](/lessons/rna-seq-to-matrix/)과 [RNA read를 게놈에 정렬하기](/lessons/rna-seq-alignment/)에서 이어집니다.

:::caution[processed라는 말만 믿지 않기]
`processed data`에는 raw count, TPM, 이미 통계 처리된 표가 모두 포함될 수 있습니다. 파일의 행·열 이름과 값의 범위를 열어 보고 분석 도구가 요구하는 입력인지 확인하세요.
:::

## 재현 기록에 남길 것

- GSE와 GSM accession
- 파일명과 다운로드 날짜
- 샘플 포함·제외 기준
- 조건과 환자 ID를 만든 규칙
- raw count인지 정규화된 값인지
- 논문과 GEO 페이지에서 확인한 genome build와 정량 방법

### 공식 문서

- [NCBI GEO 소개](https://www.ncbi.nlm.nih.gov/geo/info/overview.html)
- [GEO 데이터 구조와 accession](https://www.ncbi.nlm.nih.gov/geo/info/overview.html#DataOrganization)
- [GEO 검색과 다운로드 도움말](https://www.ncbi.nlm.nih.gov/geo/info/download.html)