소개
몇 해 전, 가족을 혈액암으로 떠나보냈습니다. 무엇이라도 해보고 싶어 자료를 찾아 헤맸지만, 정작 제가 할 수 있는 일은 없었습니다. 표준 치료에만 의지할 수밖에 없는 모습을 곁에서 지켜보는 일은 절망스러웠습니다. 분명 뭔가 더 있을 것 같은데 아무것도 하지 못했다는 사실이 오래 저를 괴롭혔습니다.
그러던 중 Sid Sijbrandij의 사례를 알게 됐습니다. GitLab 공동창업자 Sid Sijbrandij(이하 Sid)가 자신의 희귀암 데이터를 깊이 파고들고, 여러 전문가와 함께 치료 후보를 검토한 전 과정을 공개한 이야기였습니다. 그 사례에서 저는, 그때 제가 끝내 찾지 못했던 “할 수 있는 일”의 윤곽을 보았습니다.
유전체 분석은 어렵고, 그것을 통해 치료에 도움이 된다는 것은 솔직히 실패할 가능성이 훨씬 높은 일입니다. 어쩌면 끝내 누구에게도 실질적인 도움이 되지 못한 채 끝날지도 모릅니다. 그렇다고 안 하고 넘길 수 있는 일도 아니었습니다. 그래서 Sid의 사례를 함께 공부하고 정리해 공개하기로 했습니다. HomeGenomics는 그 기록입니다. 한국에는 문제를 풀어내는 데 익숙한 창업가와 개발자가 정말 많습니다. 그런 분들이 이 분야에 조금 더 익숙해지는 데 일조하는 것이 이 핸드북의 목표입니다.
이 핸드북은 저 혼자가 아니라, 현재 생물정보학·약학·컴퓨터과학 분야의 전문가들로 구성된 스터디가 함께 공부하며 정리하고 있습니다. 서로 다른 배경에서 같은 자료를 읽고, 코드와 해석을 함께 검토합니다.
HomeGenomics는 무엇인가
섹션 제목: “HomeGenomics는 무엇인가”HomeGenomics는 개발자가 자신과 가족의 유전체 데이터를 직접 분석하도록 돕는 핸드북입니다. 생물학 전공자가 아니어도, 코드를 다룰 줄 안다면 충분히 시작할 수 있습니다.
이 사이트에서 배우는 방법
섹션 제목: “이 사이트에서 배우는 방법”AI 에이전트가 코드를 작성하고 분석 도구를 실행하는 시대에는, 명령어와 옵션을 모두 외우는 것보다 무엇을 분석할지 구체적으로 요청하고, 나온 결과를 판단하는 역량이 더 중요합니다.
HomeGenomics는 에이전트에게 맡길 수 없는 세 가지에 집중합니다.
- 기본 원리를 이해한다: 입력 데이터가 어떤 가정과 계산을 거쳐 결과로 바뀌는지 이해합니다.
- 무엇을 볼지 정한다: 어떤 데이터를 비교하고, 어떤 신호를 찾으며, 무엇을 산출물로 받을지 구체적으로 정합니다.
- 결과를 해석한다: 표와 그림이 말해 주는 것, 말해 주지 못하는 것, 다음에 확인할 질문을 구분합니다.
환경 설정, 명령 실행과 Python 코드 작성은 단계별 에이전트 프롬프트로 위임합니다. 이 프롬프트는 정답을 주문하는 문장이 아니라, 입력·비교 기준·산출물·검증 조건을 담은 분석 명세서입니다.
독자의 역할은 코드를 받아 적는 것이 아닙니다. 에이전트가 만든 결과를 확인하고, 가정과 이상치를 질문하며, 다음 분석 방향을 결정하는 것입니다.
누구를 위한 것인가
섹션 제목: “누구를 위한 것인가”- 유전자 검사 결과(raw 데이터)를 받아봤지만, 요약 리포트 너머가 궁금한 사람
- 가족력이 있는 질환을 데이터로 이해하고 대비하고 싶은 사람
- 프로그래밍은 익숙하지만 생물정보학(bioinformatics)은 처음인 사람
- 정밀의료가 실제로 어떻게 이뤄지는지, 실제 사례를 알고 싶은 사람
무엇을 배우나
섹션 제목: “무엇을 배우나”Sid의 개인화 치료 후보를 좁히는 데 시퀀싱과 여러 진단 데이터가 중요하게 쓰였으므로, 우리도 가장 직관적인 데이터부터 차근차근 갑니다.
- 발현량 읽기, 벌크 RNA-seq, 공개 중: 유전자가 얼마나 켜져 있나. 가장 직관적인 출발점 (Sid의 MDM2 사례)
- 세포 단위로, 싱글셀 RNA-seq, 공개 중: 어떤 세포가 무슨 일을 하는지 (T세포 19%→89% 그 수치)
- 변이 찾기 (WES / WGS), 이후 예정: DNA에 생긴 변이를 읽고 근거 수준을 구분하기
- 데이터에서 후보까지: 공개 데이터베이스로 신호의 의미를 찾고, 다른 근거로 검증해 조사할 후보를 좁히기
각 데이터마다 무슨 의미인지 → 어떻게 만드는지 → 어떻게 분석하는지 → 무엇으로 검증하는지를 Sid 사례의 실제 예시와 함께 다룹니다.
주의사항
섹션 제목: “주의사항”HomeGenomics는 공개·합성 데이터를 중심으로 유전체·생체 데이터 분석과 결과 해석을 배우는 핸드북입니다. 여기서 얻은 표, 그림과 후보 목록은 진단이나 치료 지시가 아닙니다. 이 사이트나 AI 에이전트의 출력만으로 약물·검사·치료를 시작하거나 중단하거나 바꾸지 마세요. 사람이나 동물의 진단·치료, 의약품 제조·투여는 검증된 검사, 임상 맥락과 효과·위험을 함께 검토할 수 있는 자격 있는 전문가와 기관을 통해 판단해야 합니다.
본인이나 가족의 유전체 데이터는 비밀번호처럼 바꿀 수 없는 민감정보입니다. 처음에는 이 사이트가 지정한 공개·합성 데이터로 연습하고, 개인 데이터를 다루기 전에는 보관 위치와 공유 범위를 먼저 정하세요.
시작하기 전에
섹션 제목: “시작하기 전에”명령줄이나 Python 문법을 미리 익힐 필요는 없습니다. 실습에서는 로컬 파일과 터미널에 접근할 수 있는 AI 코딩 에이전트에게 이 사이트의 프롬프트를 단계별로 전달합니다. 필요한 도구와 Python 환경도 각 프롬프트에 따라 에이전트가 확인하고 준비합니다.
- 에이전트가 명령을 실행할 macOS·Linux 환경, Windows에서는 WSL을 권장합니다.
- Codex CLI나 Claude Code처럼 작업 폴더의 파일을 읽고 명령을 실행할 수 있는 코딩 에이전트가 필요합니다.
- 데이터와 분석 결과를 저장할 공간, 공개 데이터를 내려받을 인터넷 연결이 필요합니다.
프롬프트를 한꺼번에 모두 전달하지 말고, 한 단계의 표와 그림을 직접 확인한 뒤 다음 단계로 넘어가세요.
다음: 왜 직접 분석하나
문의·의견·오류 제보: [email protected]