GEO: 공개 유전자 발현 데이터 찾기
GEO(Gene Expression Omnibus)는 연구자가 논문에 사용한 유전자 발현 데이터와 실험 설명을 공개하는 NCBI 저장소입니다. 코드 저장소에서 프로젝트를 찾듯이, GEO에서는 연구 단위의 accession으로 데이터와 metadata를 찾습니다.
GEO에서 먼저 할 일: 연구 질문과 샘플 구성이 내 분석에 맞는지 확인한 다음, 내가 필요한 처리 단계에 맞는 파일을 고릅니다.
accession은 데이터의 주소다
섹션 제목: “accession은 데이터의 주소다”GEO 페이지마다 GSE251845처럼 변하지 않는 식별자가 있습니다. 이를 accession이라고 합니다. 논문 제목보다 정확하게 한 데이터셋을 가리키므로 검색, 코드, 분석 기록에는 accession을 남깁니다.
| 접두사 | 단위 | 개발자에게 익숙한 구조로 보면 |
|---|---|---|
GSE | 여러 샘플을 묶은 연구, Series | 프로젝트 |
GSM | 샘플 하나 | 프로젝트 안의 데이터 객체 |
GPL | 측정에 사용한 플랫폼 | 빌드 환경이나 장비 명세 |
한 GSE 안에는 여러 GSM이 들어 있습니다. GSE 페이지에서 전체 연구 설계를 읽고, GSM 페이지에서 특정 샘플의 조직(tissue)·처리 조건·파일을 확인합니다.
페이지에서 먼저 확인할 네 가지
섹션 제목: “페이지에서 먼저 확인할 네 가지”- Summary와 Overall design에서 연구 질문과 비교군을 확인합니다.
- Samples에서 표본 수, 조직, 조건과 환자 대응 여부를 확인합니다.
- Supplementary file에서 count matrix 같은 가공 파일이 있는지 확인합니다.
- SRA 링크에서 FASTQ를 다시 받을 수 있는지 확인합니다.
파일이 공개되어 있다는 사실만으로 비교 가능한 데이터가 되지는 않습니다. 암 조직과 인접 정상조직인지, 서로 다른 사람의 조직인지, 같은 sequencing protocol과 genome build를 썼는지 함께 읽어야 합니다.
count matrix와 FASTQ 중 무엇을 받을까
섹션 제목: “count matrix와 FASTQ 중 무엇을 받을까”차등발현 통계가 학습 목표라면 연구자가 제공한 raw count matrix 에서 시작하는 편이 좋습니다. 다운로드가 작고 정렬·정량 단계를 건너뛸 수 있습니다.
QC, 정렬, 정량 파이프라인까지 재현하려면 SRA의 FASTQ에서 시작합니다. 대신 저장공간과 계산 시간이 훨씬 많이 들고, 모든 샘플에 같은 파이프라인을 적용해야 합니다. FASTQ 이후의 흐름은 FASTQ 품질 확인과 트리밍과 RNA read를 게놈에 정렬하기에서 이어집니다.
재현 기록에 남길 것
섹션 제목: “재현 기록에 남길 것”- GSE와 GSM accession
- 파일명과 다운로드 날짜
- 샘플 포함·제외 기준
- 조건과 환자 ID를 만든 규칙
- raw count인지 정규화된 값인지
- 논문과 GEO 페이지에서 확인한 genome build와 정량 방법