문서

서비스

AURORA

Automated Unified Reproducible Omics Reporting & Analysis

서버에 올라온 FASTQ 원자료를 품질검사·정렬·변이 검출·발현 정량까지 처리하고 리포트로 내는 NGS 파이프라인.

AURORA 열기

무엇을 하는 서비스인가

AURORA(Automated Unified Reproducible Omics Reporting & Analysis)는 시퀀싱 원자료를 받아 사람이 바뀌어도 같은 결과가 나오는 형태로 처리합니다. 실행한 명령어를 한 줄도 빠짐없이 기록하고 도구 버전을 결과물에서 되읽어 적으므로, 몇 달 뒤에도 그때의 수치를 어떻게 냈는지 되짚을 수 있습니다.

시작하기 전에 알아야 할 것

원자료는 이미 서버에 있어야 합니다. 이 화면에는 FASTQ 업로드가 없습니다. 데이터를 서버의 지정된 데이터 폴더 아래 내 계정 폴더에 넣어 둔 뒤, 그 폴더를 화면에서 고르는 방식입니다. 올릴 수 있는 것은 시료 정보 CSV 한 가지뿐입니다.

참조 유전체는 hg38 로 고정입니다. 다른 빌드나 다른 종은 지금 고를 수 없습니다.

참조 파일과 도구는 서버에 미리 깔려 있어야 합니다. 실행 중에 무엇을 내려받는 일은 없습니다. 무엇이 있고 무엇이 없는지는 환경 점검 에 그대로 나옵니다.

화면에 보이는 선택지가 다 돌아가는 것은 아닙니다. 도구가 깔려 있지 않으면 고를 수는 있어도 실행에서 막힙니다. 프리셋을 고른 뒤 오른쪽 환경 점검 을 반드시 확인하십시오. 단계마다 어떤 프로그램을 쓰고 지금 무엇이 준비돼 있는지는 소프트웨어 설치 현황에 정리해 두었습니다.

쓰는 순서

화면은 왼쪽 사이드바의 네 갈래 — 새 분석 · 작업 현황 · 결과 · 리포트 · 관리자 (관리자는 권한이 있을 때만 보입니다) — 로 되어 있습니다.

  1. 원본 폴더 — 프로젝트 만들기 로 폴더를 만들거나 기존 프로젝트를 고릅니다. 폴더를 타고 들어가 원자료가 있는 곳을 지정합니다. 고르는 즉시 시료를 찾아 보여 줍니다
  2. 시료 정보 — 찾아낸 시료가 표로 나옵니다. 칸을 눌러 바로 고칩니다. CSV 내려받기 로 받아 채운 뒤 CSV 올리기 로 되돌려도 됩니다. 비교군(group)을 채워 두면 시료의 군간 비교에 활용할 수 있습니다
  3. 파이프라인 — 데이터 유형과 프리셋을 고릅니다. 프리셋이 고정하는 항목은 버튼이 잠기고, 나머지는 단계별로 직접 고릅니다
  4. 리포트 정보 — 의뢰자·기관·시퀀서 등을 적습니다. 비운 칸은 리포트에서 빠집니다
  5. 실행 계획과 환경 점검 — 오른쪽 기둥에서 무엇이 어떤 순서로 돌지, 필요한 도구가 깔려 있는지 실시간으로 확인합니다
  6. 분석 시작 — 오류가 하나라도 있으면 단추가 눌리지 않습니다
  7. 작업 현황 — 5초마다 갱신됩니다. 창을 닫아도 분석은 계속 돕니다. 행을 골라 열거나, 실행을 취소하거나, 지울 수 있습니다
  8. 결과 · 리포트 — 일곱 개 탭으로 결과를 봅니다

결과 화면의 일곱 탭

탭 보이는 것
진행 상황 진행률과 단계별 상태
결과 파일 단계별 산출물 목록, 파일 목록, 전체 내려받기 (zip)
실행 명령어 파이프라인이 실제로 실행한 셸 명령어 전부
실행 로그 표준 출력과 표준 오류
품질 검사 그림 4장(시퀀싱 깊이·GC 함량·트리밍 제거율·매핑률), FastQC 보고서, 모듈별 판정
리포트 정보를 고쳐 다시 만들고 HTML·PDF 로 받습니다

구현된 기능

받는 데이터 유형 — WGS(전장유전체) · WES(전장엑솜) · BarSEQ(cfDNA 바코드) · RNA-seq(전사체) · miRNA-seq(소형 RNA) · scRNA-seq(10x 단일세포).

파이프라인 프리셋 — GDC 표준, GATK 표준, 체세포 변이(BWA-MEM2 + Mutect2), BarSEQ(cfDNA), Tuxedo, STAR + featureCounts, miRSEQ, Cell Ranger. 데이터 유형에 맞는 것만 나옵니다 — 단일세포는 Cell Ranger 하나뿐입니다. 프리셋을 고르지 않고 전부 직접 지정할 수도 있습니다.

단계별로 고를 수 있는 도구

단계 선택지
품질 검사 FastQC
트리밍 Trim Galore · Cutadapt · 사용 안 함
정렬 BWA(mem · mem2 · aln) · STAR · TopHat2 · Bowtie2 · 사용 안 함
중복 제거 Picard MarkDuplicates · 바코드 기반 · 사용 안 함
재정렬 GATK IndelRealigner
변이 검출 GATK HaplotypeCaller · VarScan2 · MuTect2 · Mutect2(GATK4 체세포) · MuSE · SomaticSniper
변이 주석 ANNOVAR · VEP
발현 정량 HTSeq · Cufflinks · featureCounts
복제수 변이 Sequenza · CNVkit
단일세포 Cell Ranger count

명령어 미리보기 모드 — 실제로 돌리지 않고 실행될 명령어만 기록합니다. 설정을 확인하거나 다른 서버에서 돌릴 명령어를 얻을 때 씁니다.

재현성 기록 — 실행한 명령어 전부, 도구 버전(결과 파일에서 되읽고 없으면 설치본에 직접 물어봅니다), 24개 실행 설정이 리포트 부록에 들어갑니다.

리포트 — HTML 과 PDF. 여덟 개 절로 구성되고, 파이프라인이 실패해도 만들어집니다 — 어디까지 갔는지 보라는 뜻입니다.

관리자 기능 — 환경 점검 강제 재검사, 도구·참조 경로 덮어쓰기.

할 수 없는 것

FASTQ 를 업로드할 수 없습니다. 데이터를 서버에 옮기는 일은 화면 밖에서 해야 합니다.

내 계정 폴더 아래만 쓸 수 있습니다. 사용자 폴더 자체를 입력으로 지정하는 것도 막혀 있습니다 — 반드시 그 아래 프로젝트 폴더를 고릅니다.

심볼릭 링크 경로는 통하지 않습니다. 경로 검사가 실제 경로로 풀어 비교하므로 링크로 걸어 둔 폴더는 열리지 않습니다.

대기열이 없습니다. 분석 시작 을 누르면 바로 실행됩니다. 여러 개를 띄우면 그만큼 동시에 돕니다 — 자원 배분은 동시 실행 시료 와 스레드 수로 직접 조절해야 합니다.

hg38 말고는 없습니다. 참조 빌드도, 다른 종도 화면에서 바꿀 수 없습니다.

큰 파일은 브라우저로 받지 마십시오. 내려받기는 파일 전체를 서버 메모리에 올린 뒤 보내는 방식이라, 큰 BAM 은 파일시스템에서 직접 가져가는 편이 낫습니다.

영어로 바꿔도 대부분 한국어로 남습니다. 표의 머리글과 칸 값, 버튼, 알림은 한국어 고정입니다. 언어 전환은 서버가 만드는 메시지와 옵션 이름 정도에만 걸립니다.

화면에 없는 설정이 있습니다. Cufflinks 참조 GTF, 변이 depth 컷오프, Cell Ranger 의 코어·메모리 설정 등은 기본값으로만 돕니다. 바꾸려면 관리자가 경로 덮어쓰기로 넣어야 합니다.

실행 취소가 완전하지 않습니다. 러너와 그 직계 자식만 종료 신호를 받습니다. 이미 돌고 있는 STAR·BWA 같은 손자 프로세스는 남을 수 있습니다.

리포트 다시 만들기는 결과를 알려 주지 않습니다. 만들기 시작했다는 알림만 뜨고, 실패해도 조용합니다. 탭을 다시 열어 파일이 바뀌었는지 직접 확인하십시오.

자주 막히는 자리

FASTQ 를 찾지 못합니다. 파일명 규칙을 봅니다. read 1 은 .1.fastq · R1.fastq · _R1.fastq · _1.fq 같은 형태여야 하고 read 2 도 짝이 맞아야 합니다. 10x 단일세포는 <시료>_S1_L001_R1_001.fastq.gz 형식을 요구합니다 — 벤더가 준 ..._10X_RawData_Outs 폴더를 그대로 지정했는지 확인하십시오.

짝을 찾지 못한 시료가 있다고 나옵니다. 경고이지 오류는 아닙니다. 단일말단 데이터가 아니라면 파일명을 확인하십시오.

트리밍을 껐더니 정렬이 막힙니다. BWA·TopHat2·Bowtie2 는 트리밍 결과 폴더에서 입력을 읽습니다. 트리밍을 켜거나 STAR 를 쓰십시오. STAR 만 예외입니다.

품질 검사와 트리밍을 둘 다 끌 수 없습니다. 파이프라인이 입력 FASTQ 목록을 만들지 못합니다. 최소 하나는 켜야 합니다.

체세포 변이인데 짝을 못 찾습니다. 정상·종양 구분은 시료 이름에 든 태그로 합니다. 기본값은 정상 ASN, 종양 ASC 입니다. 이름에 그 글자가 없으면 짝이 지어지지 않습니다.

엑솜인데 BED 를 안 넣었습니다. Mutect2 가 전체 유전체를 뒤지고 CNVkit 참조의 잡음이 커집니다. 캡처 BED 를 넣으십시오.

시료 ID 를 고쳤더니 오류가 납니다. 시료 ID 는 단계마다 폴더 이름이 됩니다. 영문·숫자와 . _ - 만 씁니다. 중복이나 빈 칸도 실행을 막습니다.

작업이 orphaned 로 남습니다. 상태 파일은 실행 중이라 하는데 프로세스가 없는 경우입니다. 서버가 재기동됐을 때 생깁니다 — 지우고 다시 시작하십시오.

첫 요청이 느립니다. 설정을 읽는 데 7초쯤 걸립니다. 워커마다 한 번이면 이후로는 캐시에서 나옵니다. 참조 유전체를 내려받는 것이 아닙니다.

결과 읽기

QC 요약 → 정렬률 → 발현·변이 순으로 봅니다. 어떤 수치를 믿어도 되는지는 결과 해석에 정리해 두었습니다.

소프트웨어 설치 현황

AURORA 는 분석을 직접 계산하지 않습니다. 단계마다 바깥 프로그램을 불러다 씁니다 — 정렬은 BWA·STAR 가, 변이 검출은 GATK 가 합니다. 그래서 그 프로그램이 서버에 깔려 있지 않으면 그 단계는 돌지 않습니다.

AURORA 화면의 환경 점검 이 그것을 실행 전에 알려 줍니다. 이 절은 그 화면을 어떻게 읽는지와, 지금 무엇이 준비돼 있는지를 정리한 것입니다.

각 프로그램의 원 논문은 아래 레퍼런스에 모아 두었습니다.

화면에서 보는 곳

어디 무엇이 보이나
새 분석 오른쪽 기둥 지금 고른 파이프라인에 꼭 필요한 것만 추려 보여 줍니다
관리자 탭 도구 23개와 참조 파일 18개 전부. 관리자만 볼 수 있습니다

새 분석 쪽이 중요합니다. 필요한 것 중 하나라도 없음 이면 분석 시작 단추가 눌리지 않습니다. 반쯤 돌다 멈추는 대신 시작 전에 막는 쪽을 택한 것입니다 — 정렬을 몇 시간 돌린 뒤에 다음 도구가 없다는 걸 알게 되는 편이 훨씬 나쁩니다.

단계별로 무엇을 쓰나

아래 상태는 2026-08-24 기준입니다. 정본은 언제나 화면의 환경 점검 이니, 실행 직전에 그쪽을 확인하십시오. 도구가 새로 깔리면 이 표보다 그쪽이 먼저 바뀝니다.

단계 프로그램 상태
품질 검사 FastQC 사용 가능
트리밍 Trim Galore 사용 가능
트리밍 Cutadapt 사용 불가
정렬 BWA (mem · mem2 · aln) 사용 불가 — SAMtools 가 함께 필요합니다
정렬 STAR 사용 가능
정렬 TopHat2 사용 가능
정렬 Bowtie2 사용 불가
공통 SAMtools 사용 불가
중복 제거 Picard MarkDuplicates 사용 가능
재정렬 GATK 3 IndelRealigner 사용 가능
변이 검출 GATK 4 HaplotypeCaller 사용 가능
변이 검출 GATK MuTect2 · GATK4 Mutect2 사용 가능
변이 검출 VarScan2 사용 불가 — SAMtools 가 함께 필요합니다
변이 검출 MuSE 사용 불가
변이 검출 SomaticSniper 사용 불가
변이 주석 ANNOVAR 사용 가능
변이 주석 VEP 사용 가능
발현 정량 Cufflinks 사용 가능
발현 정량 HTSeq 사용 불가
발현 정량 featureCounts 사용 불가
복제수 변이 CNVkit 사용 가능
복제수 변이 Sequenza 사용 불가 — SAMtools 가 함께 필요합니다
단일세포 Cell Ranger 사용 불가
R 객체 생성 SEQprocess (R) 사용 가능 — 바깥 프로그램을 쓰지 않습니다

SAMtools 가 여러 줄에 걸쳐 있는 것에 주의하십시오. 정렬(BWA)·VarScan2·Sequenza 가 모두 그것을 함께 부릅니다. 그래서 하나가 빠졌는데 세 단계가 함께 막힙니다.

지금 끝까지 돌릴 수 있는 것

프리셋 아홉 가지 중 지금 실행되는 것은 Tuxedo(RNA-seq) 하나뿐입니다. Trim Galore → TopHat2 → Cufflinks 가 모두 준비돼 있습니다.

프리셋 지금 막는 것
Tuxedo (RNA-seq) 실행 가능 —
GDC 표준 (RNA-seq) 막힘 HTSeq
STAR + featureCounts 막힘 featureCounts
GDC 표준 (WGS/WES) 막힘 SAMtools, VarScan2
GATK 표준 막힘 SAMtools (BWA 정렬)
체세포 변이 (BWA-MEM2 + Mutect2) 막힘 SAMtools
BarSEQ (cfDNA) 막힘 SAMtools
miRSEQ 막힘 Cutadapt
Cell Ranger (10x) 막힘 Cell Ranger

사용자 지정으로 짜면 STAR 정렬 + Cufflinks 정량 조합도 돌아갑니다. 품질 검사만 돌리는 것도 됩니다.

명령어 미리보기 는 이 제약을 받지 않습니다. 실제로 실행하지 않고 명령어만 기록하는 모드라 도구가 없어도 끝까지 갑니다. 설정을 확인하거나, 다른 서버에서 돌릴 명령어를 뽑아 갈 때 쓰십시오.

참조 파일도 같이 봅니다

프로그램만이 아니라 참조 파일도 같은 표에 나옵니다 — 참조 유전체 FASTA, 정렬 인덱스, dbSNP·COSMIC·gnomAD 같은 VCF, ANNOVAR·VEP 데이터베이스 등 18가지입니다.

지금 확인된 것은 이렇습니다.

참조 상태
참조 유전체 FASTA (hg38) 준비됨
BWA 인덱스 준비됨
STAR 인덱스 준비됨
ANNOVAR 데이터베이스 준비됨
UCSC refFlat (CNVkit 유전자 주석) 없음

엑솜 캡처 BED 는 기본값이 비어 있습니다. 없다고 실행이 막히지는 않지만, 엑솜 데이터에서 Mutect2 나 CNVkit 을 쓸 때는 넣어야 합니다 — 없으면 Mutect2 가 전체 유전체를 뒤지고 CNVkit 참조의 잡음이 커집니다. 자세한 것은 데이터 준비를 보십시오.

막혔을 때 할 일

설치는 사용자가 할 수 없습니다. 프로그램과 참조 파일은 분석 서버에 있어야 하고, 그 서버를 만지는 것은 관리자입니다.

  1. 환경 점검 에서 무엇이 없음 인지 이름을 그대로 확인합니다
  2. 관리자에게 그 이름을 전달합니다
  3. 급하면 다른 도구로 우회할 수 있는지 보십시오 — 같은 일을 하는 선택지가 대개 둘 이상입니다. 발현 정량이 막혔으면 Cufflinks 로, 변이 주석이 막혔으면 ANNOVAR 대신 VEP 로 바꿔 보십시오
  4. 지금 당장 결과가 필요한 것이 아니라면 명령어 미리보기 로 설정을 확정해 두고, 도구가 갖춰진 뒤 같은 설정으로 다시 실행하면 됩니다

관리자에게: 실제 설치 경로와 덮어쓰기 방법은 운영 위키에 있습니다. 프로그램이 깔려 있는데도 없음 으로 나오는 경우가 있습니다 — 설정이 가리키는 자리와 실제로 깔린 자리가 다른 것이며, 그때는 새로 설치할 것이 아니라 관리자 탭의 경로 덮어쓰기 를 고치면 됩니다.

레퍼런스

AURORA 는 계산을 직접 하지 않고 단계마다 바깥 프로그램을 부릅니다. 아래는 그 프로그램과 참조 데이터의 원 논문입니다.

논문에 쓸 때는 실제로 돌아간 단계의 것만 인용하십시오. 무엇이 돌았는지는 결과 화면에 실행한 명령어가 그대로 남고, 도구 버전은 리포트에 되읽어 적힙니다. 단계별 설치 현황은 소프트웨어 설치 현황에 있습니다.

품질 검사 · 트리밍

  • FastQC — Andrews S. FastQC: a quality control tool for high throughput sequence data. Babraham Bioinformatics. bioinformatics.babraham.ac.uk
  • Trim Galore — Krueger F. Trim Galore: a wrapper around Cutadapt and FastQC. Babraham Bioinformatics. bioinformatics.babraham.ac.uk
  • Cutadapt — Martin M. Cutadapt removes adapter sequences from high-throughput sequencing reads. EMBnet J. 2011;17(1):10-12. doi:10.14806/ej.17.1.200

정렬

  • BWA (aln · bwasw) — Li H, Durbin R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 2009;25(14):1754-1760. doi:10.1093/bioinformatics/btp324
  • BWA-MEM — Li H. Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM. arXiv:1303.3997. 2013. arxiv.org/abs/1303.3997
  • BWA-MEM2 — Vasimuddin M, Misra S, Li H, Aluru S. Efficient architecture-aware acceleration of BWA-MEM for multicore systems. IEEE International Parallel and Distributed Processing Symposium (IPDPS). 2019. github.com/bwa-mem2
  • Bowtie2 — Langmead B, Salzberg SL. Fast gapped-read alignment with Bowtie 2. Nat Methods. 2012;9(4):357-359. doi:10.1038/nmeth.1923
  • STAR — Dobin A, Davis CA, Schlesinger F, et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 2013;29(1):15-21. doi:10.1093/bioinformatics/bts635
  • TopHat2 — Kim D, Pertea G, Trapnell C, et al. TopHat2: accurate alignment of transcriptomes in the presence of insertions, deletions and gene fusions. Genome Biol. 2013;14(4):R36. doi:10.1186/gb-2013-14-4-r36
  • SAMtools — Li H, Handsaker B, Wysoker A, et al. The Sequence Alignment/Map format and SAMtools. Bioinformatics. 2009;25(16):2078-2079. doi:10.1093/bioinformatics/btp352 · Danecek P, Bonfield JK, Liddle J, et al. Twelve years of SAMtools and BCFtools. Gigascience. 2021;10(2):giab008. doi:10.1093/gigascience/giab008

중복 제거 · 재정렬

  • Picard — Broad Institute. Picard toolkit. broadinstitute.github.io/picard
  • GATK — McKenna A, Hanna M, Banks E, et al. The Genome Analysis Toolkit: a MapReduce framework for analyzing next-generation DNA sequencing data. Genome Res. 2010;20(9):1297-1303. doi:10.1101/gr.107524.110

변이 검출

  • GATK4 HaplotypeCaller — Poplin R, Ruano-Rubio V, DePristo MA, et al. Scaling accurate genetic variant discovery to tens of thousands of samples. bioRxiv. 2018. doi:10.1101/201178
  • MuTect — Cibulskis K, Lawrence MS, Carter SL, et al. Sensitive detection of somatic point mutations in impure and heterogeneous cancer samples. Nat Biotechnol. 2013;31(3):213-219. doi:10.1038/nbt.2514
  • Mutect2 — Benjamin D, Sato T, Cibulskis K, Getz G, Stewart C, Lichtenstein L. Calling somatic SNVs and indels with Mutect2. bioRxiv. 2019. doi:10.1101/861054
  • VarScan2 — Koboldt DC, Zhang Q, Larson DE, et al. VarScan 2: somatic mutation and copy number alteration discovery in cancer by exome sequencing. Genome Res. 2012;22(3):568-576. doi:10.1101/gr.129684.111
  • MuSE — Fan Y, Xi L, Hughes DS, et al. MuSE: accounting for tumor heterogeneity using a sample-specific error model improves sensitivity and specificity in mutation calling from sequencing data. Genome Biol. 2016;17(1):178. doi:10.1186/s13059-016-1029-6
  • SomaticSniper — Larson DE, Harris CC, Chen K, et al. SomaticSniper: identification of somatic point mutations in whole genome sequencing data. Bioinformatics. 2012;28(3):311-317. doi:10.1093/bioinformatics/btr665

변이 주석

  • ANNOVAR — Wang K, Li M, Hakonarson H. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data. Nucleic Acids Res. 2010;38(16):e164. doi:10.1093/nar/gkq603
  • VEP — McLaren W, Gil L, Hunt SE, et al. The Ensembl Variant Effect Predictor. Genome Biol. 2016;17(1):122. doi:10.1186/s13059-016-0974-4

발현 정량 · 차등발현

  • Cufflinks — Trapnell C, Williams BA, Pertea G, et al. Transcript assembly and quantification by RNA-Seq reveals unannotated transcripts and isoform switching during cell differentiation. Nat Biotechnol. 2010;28(5):511-515. doi:10.1038/nbt.1621
  • HTSeq — Anders S, Pyl PT, Huber W. HTSeq — a Python framework to work with high-throughput sequencing data. Bioinformatics. 2015;31(2):166-169. doi:10.1093/bioinformatics/btu638
  • featureCounts — Liao Y, Smyth GK, Shi W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 2014;30(7):923-930. doi:10.1093/bioinformatics/btt656
  • DESeq2 — Love MI, Huber W, Anders S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 2014;15(12):550. doi:10.1186/s13059-014-0550-8

복제수 변이

  • CNVkit — Talevich E, Shain AH, Botton T, Bastian BC. CNVkit: genome-wide copy number detection and visualization from targeted DNA sequencing. PLoS Comput Biol. 2016;12(4):e1004873. doi:10.1371/journal.pcbi.1004873
  • Sequenza — Favero F, Joshi T, Marquard AM, et al. Sequenza: allele-specific copy number and mutation profiles from tumor sequencing data. Ann Oncol. 2015;26(1):64-70. doi:10.1093/annonc/mdu479

단일세포

  • Cell Ranger — 10x Genomics. Cell Ranger. 10xgenomics.com · Zheng GXY, Terry JM, Belgrader P, et al. Massively parallel digital transcriptional profiling of single cells. Nat Commun. 2017;8:14049. doi:10.1038/ncomms14049

파이프라인 골격 · 리포트

  • SEQprocess — Joo T, Choi JH, Lee JH, et al. SEQprocess: a modularized and customizable pipeline framework for NGS processing in R package. BMC Bioinformatics. 2019;20(1):90. doi:10.1186/s12859-019-2676-x · github.com/omicsCore/SEQprocess
  • R — R Core Team. R: a language and environment for statistical computing. R Foundation for Statistical Computing. r-project.org
  • Shiny — Chang W, Cheng J, Allaire JJ, et al. shiny: web application framework for R. shiny.posit.co
  • R Markdown — Xie Y, Allaire JJ, Grolemund G. R Markdown: the definitive guide. Chapman & Hall/CRC; 2018. rmarkdown.rstudio.com

참조 유전체 · 데이터베이스

  • GRCh38 (hg38) — Schneider VA, Graves-Lindsay T, Howe K, et al. Evaluation of GRCh38 and de novo haploid genome assemblies demonstrates the enduring quality of the reference assembly. Genome Res. 2017;27(5):849-864. doi:10.1101/gr.213611.116
  • dbSNP — Sherry ST, Ward MH, Kholodov M, et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 2001;29(1):308-311. doi:10.1093/nar/29.1.308
  • COSMIC — Sondka Z, Dhir NB, Carvalho-Silva D, et al. COSMIC: a curated database of somatic variants and clinical data for cancer. Nucleic Acids Res. 2024;52(D1):D1210-D1217. doi:10.1093/nar/gkad986
  • gnomAD — Karczewski KJ, Francioli LC, Tiao G, et al. The mutational constraint spectrum quantified from variation in 141,456 humans. Nature. 2020;581(7809):434-443. doi:10.1038/s41586-020-2308-7

마지막 수정 ·