서비스
AURORA
Automated Unified Reproducible Omics Reporting & Analysis
서버에 올라온 FASTQ 원자료를 품질검사·정렬·변이 검출·발현 정량까지 처리하고 리포트로 내는 NGS 파이프라인.
무엇을 하는 서비스인가
AURORA(Automated Unified Reproducible Omics Reporting & Analysis)는 시퀀싱 원자료를 받아 사람이 바뀌어도 같은 결과가 나오는 형태로 처리합니다. 실행한 명령어를 한 줄도 빠짐없이 기록하고 도구 버전을 결과물에서 되읽어 적으므로, 몇 달 뒤에도 그때의 수치를 어떻게 냈는지 되짚을 수 있습니다.
시작하기 전에 알아야 할 것
원자료는 이미 서버에 있어야 합니다. 이 화면에는 FASTQ 업로드가 없습니다. 데이터를 서버의 지정된 데이터 폴더 아래 내 계정 폴더에 넣어 둔 뒤, 그 폴더를 화면에서 고르는 방식입니다. 올릴 수 있는 것은 시료 정보 CSV 한 가지뿐입니다.
참조 유전체는 hg38 로 고정입니다. 다른 빌드나 다른 종은 지금 고를 수 없습니다.
참조 파일과 도구는 서버에 미리 깔려 있어야 합니다. 실행 중에 무엇을 내려받는 일은
없습니다. 무엇이 있고 무엇이 없는지는 환경 점검 에 그대로 나옵니다.
화면에 보이는 선택지가 다 돌아가는 것은 아닙니다. 도구가 깔려 있지 않으면 고를 수는
있어도 실행에서 막힙니다. 프리셋을 고른 뒤 오른쪽 환경 점검 을 반드시 확인하십시오.
단계마다 어떤 프로그램을 쓰고 지금 무엇이 준비돼 있는지는
소프트웨어 설치 현황에 정리해 두었습니다.
쓰는 순서
화면은 왼쪽 사이드바의 네 갈래 — 새 분석 · 작업 현황 · 결과 · 리포트 · 관리자
(관리자는 권한이 있을 때만 보입니다) — 로 되어 있습니다.
- 원본 폴더 —
프로젝트 만들기로 폴더를 만들거나 기존 프로젝트를 고릅니다. 폴더를 타고 들어가 원자료가 있는 곳을 지정합니다. 고르는 즉시 시료를 찾아 보여 줍니다 - 시료 정보 — 찾아낸 시료가 표로 나옵니다. 칸을 눌러 바로 고칩니다.
CSV 내려받기로 받아 채운 뒤CSV 올리기로 되돌려도 됩니다. 비교군(group)을 채워 두면 시료의 군간 비교에 활용할 수 있습니다 - 파이프라인 — 데이터 유형과 프리셋을 고릅니다. 프리셋이 고정하는 항목은 버튼이 잠기고, 나머지는 단계별로 직접 고릅니다
- 리포트 정보 — 의뢰자·기관·시퀀서 등을 적습니다. 비운 칸은 리포트에서 빠집니다
- 실행 계획과 환경 점검 — 오른쪽 기둥에서 무엇이 어떤 순서로 돌지, 필요한 도구가 깔려 있는지 실시간으로 확인합니다
- 분석 시작 — 오류가 하나라도 있으면 단추가 눌리지 않습니다
- 작업 현황 — 5초마다 갱신됩니다. 창을 닫아도 분석은 계속 돕니다. 행을 골라 열거나, 실행을 취소하거나, 지울 수 있습니다
- 결과 · 리포트 — 일곱 개 탭으로 결과를 봅니다
결과 화면의 일곱 탭
| 탭 | 보이는 것 |
|---|---|
| 진행 상황 | 진행률과 단계별 상태 |
| 결과 파일 | 단계별 산출물 목록, 파일 목록, 전체 내려받기 (zip) |
| 실행 명령어 | 파이프라인이 실제로 실행한 셸 명령어 전부 |
| 실행 로그 | 표준 출력과 표준 오류 |
| 품질 검사 | 그림 4장(시퀀싱 깊이·GC 함량·트리밍 제거율·매핑률), FastQC 보고서, 모듈별 판정 |
| 리포트 | 정보를 고쳐 다시 만들고 HTML·PDF 로 받습니다 |
구현된 기능
받는 데이터 유형 — WGS(전장유전체) · WES(전장엑솜) · BarSEQ(cfDNA 바코드) · RNA-seq(전사체) · miRNA-seq(소형 RNA) · scRNA-seq(10x 단일세포).
파이프라인 프리셋 — GDC 표준, GATK 표준, 체세포 변이(BWA-MEM2 + Mutect2), BarSEQ(cfDNA), Tuxedo, STAR + featureCounts, miRSEQ, Cell Ranger. 데이터 유형에 맞는 것만 나옵니다 — 단일세포는 Cell Ranger 하나뿐입니다. 프리셋을 고르지 않고 전부 직접 지정할 수도 있습니다.
단계별로 고를 수 있는 도구
| 단계 | 선택지 |
|---|---|
| 품질 검사 | FastQC |
| 트리밍 | Trim Galore · Cutadapt · 사용 안 함 |
| 정렬 | BWA(mem · mem2 · aln) · STAR · TopHat2 · Bowtie2 · 사용 안 함 |
| 중복 제거 | Picard MarkDuplicates · 바코드 기반 · 사용 안 함 |
| 재정렬 | GATK IndelRealigner |
| 변이 검출 | GATK HaplotypeCaller · VarScan2 · MuTect2 · Mutect2(GATK4 체세포) · MuSE · SomaticSniper |
| 변이 주석 | ANNOVAR · VEP |
| 발현 정량 | HTSeq · Cufflinks · featureCounts |
| 복제수 변이 | Sequenza · CNVkit |
| 단일세포 | Cell Ranger count |
명령어 미리보기 모드 — 실제로 돌리지 않고 실행될 명령어만 기록합니다. 설정을 확인하거나 다른 서버에서 돌릴 명령어를 얻을 때 씁니다.
재현성 기록 — 실행한 명령어 전부, 도구 버전(결과 파일에서 되읽고 없으면 설치본에 직접 물어봅니다), 24개 실행 설정이 리포트 부록에 들어갑니다.
리포트 — HTML 과 PDF. 여덟 개 절로 구성되고, 파이프라인이 실패해도 만들어집니다 — 어디까지 갔는지 보라는 뜻입니다.
관리자 기능 — 환경 점검 강제 재검사, 도구·참조 경로 덮어쓰기.
할 수 없는 것
FASTQ 를 업로드할 수 없습니다. 데이터를 서버에 옮기는 일은 화면 밖에서 해야 합니다.
내 계정 폴더 아래만 쓸 수 있습니다. 사용자 폴더 자체를 입력으로 지정하는 것도 막혀 있습니다 — 반드시 그 아래 프로젝트 폴더를 고릅니다.
심볼릭 링크 경로는 통하지 않습니다. 경로 검사가 실제 경로로 풀어 비교하므로 링크로 걸어 둔 폴더는 열리지 않습니다.
대기열이 없습니다. 분석 시작 을 누르면 바로 실행됩니다. 여러 개를 띄우면 그만큼
동시에 돕니다 — 자원 배분은 동시 실행 시료 와 스레드 수로 직접 조절해야 합니다.
hg38 말고는 없습니다. 참조 빌드도, 다른 종도 화면에서 바꿀 수 없습니다.
큰 파일은 브라우저로 받지 마십시오. 내려받기는 파일 전체를 서버 메모리에 올린 뒤 보내는 방식이라, 큰 BAM 은 파일시스템에서 직접 가져가는 편이 낫습니다.
영어로 바꿔도 대부분 한국어로 남습니다. 표의 머리글과 칸 값, 버튼, 알림은 한국어 고정입니다. 언어 전환은 서버가 만드는 메시지와 옵션 이름 정도에만 걸립니다.
화면에 없는 설정이 있습니다. Cufflinks 참조 GTF, 변이 depth 컷오프, Cell Ranger 의 코어·메모리 설정 등은 기본값으로만 돕니다. 바꾸려면 관리자가 경로 덮어쓰기로 넣어야 합니다.
실행 취소가 완전하지 않습니다. 러너와 그 직계 자식만 종료 신호를 받습니다. 이미 돌고 있는 STAR·BWA 같은 손자 프로세스는 남을 수 있습니다.
리포트 다시 만들기는 결과를 알려 주지 않습니다. 만들기 시작했다는 알림만 뜨고, 실패해도 조용합니다. 탭을 다시 열어 파일이 바뀌었는지 직접 확인하십시오.
자주 막히는 자리
FASTQ 를 찾지 못합니다. 파일명 규칙을 봅니다. read 1 은 .1.fastq · R1.fastq ·
_R1.fastq · _1.fq 같은 형태여야 하고 read 2 도 짝이 맞아야 합니다.
10x 단일세포는 <시료>_S1_L001_R1_001.fastq.gz 형식을 요구합니다 — 벤더가 준
..._10X_RawData_Outs 폴더를 그대로 지정했는지 확인하십시오.
짝을 찾지 못한 시료가 있다고 나옵니다. 경고이지 오류는 아닙니다. 단일말단 데이터가 아니라면 파일명을 확인하십시오.
트리밍을 껐더니 정렬이 막힙니다. BWA·TopHat2·Bowtie2 는 트리밍 결과 폴더에서 입력을 읽습니다. 트리밍을 켜거나 STAR 를 쓰십시오. STAR 만 예외입니다.
품질 검사와 트리밍을 둘 다 끌 수 없습니다. 파이프라인이 입력 FASTQ 목록을 만들지 못합니다. 최소 하나는 켜야 합니다.
체세포 변이인데 짝을 못 찾습니다. 정상·종양 구분은 시료 이름에 든 태그로 합니다.
기본값은 정상 ASN, 종양 ASC 입니다. 이름에 그 글자가 없으면 짝이 지어지지 않습니다.
엑솜인데 BED 를 안 넣었습니다. Mutect2 가 전체 유전체를 뒤지고 CNVkit 참조의 잡음이 커집니다. 캡처 BED 를 넣으십시오.
시료 ID 를 고쳤더니 오류가 납니다. 시료 ID 는 단계마다 폴더 이름이 됩니다.
영문·숫자와 . _ - 만 씁니다. 중복이나 빈 칸도 실행을 막습니다.
작업이 orphaned 로 남습니다. 상태 파일은 실행 중이라 하는데 프로세스가 없는
경우입니다. 서버가 재기동됐을 때 생깁니다 — 지우고 다시 시작하십시오.
첫 요청이 느립니다. 설정을 읽는 데 7초쯤 걸립니다. 워커마다 한 번이면 이후로는 캐시에서 나옵니다. 참조 유전체를 내려받는 것이 아닙니다.
결과 읽기
QC 요약 → 정렬률 → 발현·변이 순으로 봅니다. 어떤 수치를 믿어도 되는지는 결과 해석에 정리해 두었습니다.
소프트웨어 설치 현황
AURORA 는 분석을 직접 계산하지 않습니다. 단계마다 바깥 프로그램을 불러다 씁니다 — 정렬은 BWA·STAR 가, 변이 검출은 GATK 가 합니다. 그래서 그 프로그램이 서버에 깔려 있지 않으면 그 단계는 돌지 않습니다.
AURORA 화면의 환경 점검 이 그것을 실행 전에 알려 줍니다. 이 절은 그 화면을 어떻게
읽는지와, 지금 무엇이 준비돼 있는지를 정리한 것입니다.
각 프로그램의 원 논문은 아래 레퍼런스에 모아 두었습니다.
화면에서 보는 곳
| 어디 | 무엇이 보이나 |
|---|---|
새 분석 오른쪽 기둥 |
지금 고른 파이프라인에 꼭 필요한 것만 추려 보여 줍니다 |
관리자 탭 |
도구 23개와 참조 파일 18개 전부. 관리자만 볼 수 있습니다 |
새 분석 쪽이 중요합니다. 필요한 것 중 하나라도 없음 이면 분석 시작 단추가
눌리지 않습니다. 반쯤 돌다 멈추는 대신 시작 전에 막는 쪽을 택한 것입니다 —
정렬을 몇 시간 돌린 뒤에 다음 도구가 없다는 걸 알게 되는 편이 훨씬 나쁩니다.
단계별로 무엇을 쓰나
아래 상태는 2026-08-24 기준입니다. 정본은 언제나 화면의
환경 점검이니, 실행 직전에 그쪽을 확인하십시오. 도구가 새로 깔리면 이 표보다 그쪽이 먼저 바뀝니다.
| 단계 | 프로그램 | 상태 |
|---|---|---|
| 품질 검사 | FastQC | 사용 가능 |
| 트리밍 | Trim Galore | 사용 가능 |
| 트리밍 | Cutadapt | 사용 불가 |
| 정렬 | BWA (mem · mem2 · aln) | 사용 불가 — SAMtools 가 함께 필요합니다 |
| 정렬 | STAR | 사용 가능 |
| 정렬 | TopHat2 | 사용 가능 |
| 정렬 | Bowtie2 | 사용 불가 |
| 공통 | SAMtools | 사용 불가 |
| 중복 제거 | Picard MarkDuplicates | 사용 가능 |
| 재정렬 | GATK 3 IndelRealigner | 사용 가능 |
| 변이 검출 | GATK 4 HaplotypeCaller | 사용 가능 |
| 변이 검출 | GATK MuTect2 · GATK4 Mutect2 | 사용 가능 |
| 변이 검출 | VarScan2 | 사용 불가 — SAMtools 가 함께 필요합니다 |
| 변이 검출 | MuSE | 사용 불가 |
| 변이 검출 | SomaticSniper | 사용 불가 |
| 변이 주석 | ANNOVAR | 사용 가능 |
| 변이 주석 | VEP | 사용 가능 |
| 발현 정량 | Cufflinks | 사용 가능 |
| 발현 정량 | HTSeq | 사용 불가 |
| 발현 정량 | featureCounts | 사용 불가 |
| 복제수 변이 | CNVkit | 사용 가능 |
| 복제수 변이 | Sequenza | 사용 불가 — SAMtools 가 함께 필요합니다 |
| 단일세포 | Cell Ranger | 사용 불가 |
| R 객체 생성 | SEQprocess (R) | 사용 가능 — 바깥 프로그램을 쓰지 않습니다 |
SAMtools 가 여러 줄에 걸쳐 있는 것에 주의하십시오. 정렬(BWA)·VarScan2·Sequenza 가 모두 그것을 함께 부릅니다. 그래서 하나가 빠졌는데 세 단계가 함께 막힙니다.
지금 끝까지 돌릴 수 있는 것
프리셋 아홉 가지 중 지금 실행되는 것은 Tuxedo(RNA-seq) 하나뿐입니다. Trim Galore → TopHat2 → Cufflinks 가 모두 준비돼 있습니다.
| 프리셋 | 지금 | 막는 것 |
|---|---|---|
| Tuxedo (RNA-seq) | 실행 가능 | — |
| GDC 표준 (RNA-seq) | 막힘 | HTSeq |
| STAR + featureCounts | 막힘 | featureCounts |
| GDC 표준 (WGS/WES) | 막힘 | SAMtools, VarScan2 |
| GATK 표준 | 막힘 | SAMtools (BWA 정렬) |
| 체세포 변이 (BWA-MEM2 + Mutect2) | 막힘 | SAMtools |
| BarSEQ (cfDNA) | 막힘 | SAMtools |
| miRSEQ | 막힘 | Cutadapt |
| Cell Ranger (10x) | 막힘 | Cell Ranger |
사용자 지정으로 짜면 STAR 정렬 + Cufflinks 정량 조합도 돌아갑니다. 품질 검사만 돌리는 것도 됩니다.
명령어 미리보기는 이 제약을 받지 않습니다. 실제로 실행하지 않고 명령어만 기록하는 모드라 도구가 없어도 끝까지 갑니다. 설정을 확인하거나, 다른 서버에서 돌릴 명령어를 뽑아 갈 때 쓰십시오.
참조 파일도 같이 봅니다
프로그램만이 아니라 참조 파일도 같은 표에 나옵니다 — 참조 유전체 FASTA, 정렬 인덱스, dbSNP·COSMIC·gnomAD 같은 VCF, ANNOVAR·VEP 데이터베이스 등 18가지입니다.
지금 확인된 것은 이렇습니다.
| 참조 | 상태 |
|---|---|
| 참조 유전체 FASTA (hg38) | 준비됨 |
| BWA 인덱스 | 준비됨 |
| STAR 인덱스 | 준비됨 |
| ANNOVAR 데이터베이스 | 준비됨 |
| UCSC refFlat (CNVkit 유전자 주석) | 없음 |
엑솜 캡처 BED 는 기본값이 비어 있습니다. 없다고 실행이 막히지는 않지만, 엑솜 데이터에서 Mutect2 나 CNVkit 을 쓸 때는 넣어야 합니다 — 없으면 Mutect2 가 전체 유전체를 뒤지고 CNVkit 참조의 잡음이 커집니다. 자세한 것은 데이터 준비를 보십시오.
막혔을 때 할 일
설치는 사용자가 할 수 없습니다. 프로그램과 참조 파일은 분석 서버에 있어야 하고, 그 서버를 만지는 것은 관리자입니다.
환경 점검에서 무엇이없음인지 이름을 그대로 확인합니다- 관리자에게 그 이름을 전달합니다
- 급하면 다른 도구로 우회할 수 있는지 보십시오 — 같은 일을 하는 선택지가 대개 둘 이상입니다. 발현 정량이 막혔으면 Cufflinks 로, 변이 주석이 막혔으면 ANNOVAR 대신 VEP 로 바꿔 보십시오
- 지금 당장 결과가 필요한 것이 아니라면
명령어 미리보기로 설정을 확정해 두고, 도구가 갖춰진 뒤 같은 설정으로 다시 실행하면 됩니다
관리자에게: 실제 설치 경로와 덮어쓰기 방법은 운영 위키에 있습니다.
프로그램이 깔려 있는데도 없음 으로 나오는 경우가 있습니다 — 설정이 가리키는 자리와
실제로 깔린 자리가 다른 것이며, 그때는 새로 설치할 것이 아니라 관리자 탭의
경로 덮어쓰기 를 고치면 됩니다.
레퍼런스
AURORA 는 계산을 직접 하지 않고 단계마다 바깥 프로그램을 부릅니다. 아래는 그 프로그램과 참조 데이터의 원 논문입니다.
논문에 쓸 때는 실제로 돌아간 단계의 것만 인용하십시오. 무엇이 돌았는지는 결과 화면에 실행한 명령어가 그대로 남고, 도구 버전은 리포트에 되읽어 적힙니다. 단계별 설치 현황은 소프트웨어 설치 현황에 있습니다.
품질 검사 · 트리밍
- FastQC — Andrews S. FastQC: a quality control tool for high throughput sequence data. Babraham Bioinformatics. bioinformatics.babraham.ac.uk
- Trim Galore — Krueger F. Trim Galore: a wrapper around Cutadapt and FastQC. Babraham Bioinformatics. bioinformatics.babraham.ac.uk
- Cutadapt — Martin M. Cutadapt removes adapter sequences from high-throughput sequencing reads. EMBnet J. 2011;17(1):10-12. doi:10.14806/ej.17.1.200
정렬
- BWA (aln · bwasw) — Li H, Durbin R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 2009;25(14):1754-1760. doi:10.1093/bioinformatics/btp324
- BWA-MEM — Li H. Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM. arXiv:1303.3997. 2013. arxiv.org/abs/1303.3997
- BWA-MEM2 — Vasimuddin M, Misra S, Li H, Aluru S. Efficient architecture-aware acceleration of BWA-MEM for multicore systems. IEEE International Parallel and Distributed Processing Symposium (IPDPS). 2019. github.com/bwa-mem2
- Bowtie2 — Langmead B, Salzberg SL. Fast gapped-read alignment with Bowtie 2. Nat Methods. 2012;9(4):357-359. doi:10.1038/nmeth.1923
- STAR — Dobin A, Davis CA, Schlesinger F, et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 2013;29(1):15-21. doi:10.1093/bioinformatics/bts635
- TopHat2 — Kim D, Pertea G, Trapnell C, et al. TopHat2: accurate alignment of transcriptomes in the presence of insertions, deletions and gene fusions. Genome Biol. 2013;14(4):R36. doi:10.1186/gb-2013-14-4-r36
- SAMtools — Li H, Handsaker B, Wysoker A, et al. The Sequence Alignment/Map format and SAMtools. Bioinformatics. 2009;25(16):2078-2079. doi:10.1093/bioinformatics/btp352 · Danecek P, Bonfield JK, Liddle J, et al. Twelve years of SAMtools and BCFtools. Gigascience. 2021;10(2):giab008. doi:10.1093/gigascience/giab008
중복 제거 · 재정렬
- Picard — Broad Institute. Picard toolkit. broadinstitute.github.io/picard
- GATK — McKenna A, Hanna M, Banks E, et al. The Genome Analysis Toolkit: a MapReduce framework for analyzing next-generation DNA sequencing data. Genome Res. 2010;20(9):1297-1303. doi:10.1101/gr.107524.110
변이 검출
- GATK4 HaplotypeCaller — Poplin R, Ruano-Rubio V, DePristo MA, et al. Scaling accurate genetic variant discovery to tens of thousands of samples. bioRxiv. 2018. doi:10.1101/201178
- MuTect — Cibulskis K, Lawrence MS, Carter SL, et al. Sensitive detection of somatic point mutations in impure and heterogeneous cancer samples. Nat Biotechnol. 2013;31(3):213-219. doi:10.1038/nbt.2514
- Mutect2 — Benjamin D, Sato T, Cibulskis K, Getz G, Stewart C, Lichtenstein L. Calling somatic SNVs and indels with Mutect2. bioRxiv. 2019. doi:10.1101/861054
- VarScan2 — Koboldt DC, Zhang Q, Larson DE, et al. VarScan 2: somatic mutation and copy number alteration discovery in cancer by exome sequencing. Genome Res. 2012;22(3):568-576. doi:10.1101/gr.129684.111
- MuSE — Fan Y, Xi L, Hughes DS, et al. MuSE: accounting for tumor heterogeneity using a sample-specific error model improves sensitivity and specificity in mutation calling from sequencing data. Genome Biol. 2016;17(1):178. doi:10.1186/s13059-016-1029-6
- SomaticSniper — Larson DE, Harris CC, Chen K, et al. SomaticSniper: identification of somatic point mutations in whole genome sequencing data. Bioinformatics. 2012;28(3):311-317. doi:10.1093/bioinformatics/btr665
변이 주석
- ANNOVAR — Wang K, Li M, Hakonarson H. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data. Nucleic Acids Res. 2010;38(16):e164. doi:10.1093/nar/gkq603
- VEP — McLaren W, Gil L, Hunt SE, et al. The Ensembl Variant Effect Predictor. Genome Biol. 2016;17(1):122. doi:10.1186/s13059-016-0974-4
발현 정량 · 차등발현
- Cufflinks — Trapnell C, Williams BA, Pertea G, et al. Transcript assembly and quantification by RNA-Seq reveals unannotated transcripts and isoform switching during cell differentiation. Nat Biotechnol. 2010;28(5):511-515. doi:10.1038/nbt.1621
- HTSeq — Anders S, Pyl PT, Huber W. HTSeq — a Python framework to work with high-throughput sequencing data. Bioinformatics. 2015;31(2):166-169. doi:10.1093/bioinformatics/btu638
- featureCounts — Liao Y, Smyth GK, Shi W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 2014;30(7):923-930. doi:10.1093/bioinformatics/btt656
- DESeq2 — Love MI, Huber W, Anders S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 2014;15(12):550. doi:10.1186/s13059-014-0550-8
복제수 변이
- CNVkit — Talevich E, Shain AH, Botton T, Bastian BC. CNVkit: genome-wide copy number detection and visualization from targeted DNA sequencing. PLoS Comput Biol. 2016;12(4):e1004873. doi:10.1371/journal.pcbi.1004873
- Sequenza — Favero F, Joshi T, Marquard AM, et al. Sequenza: allele-specific copy number and mutation profiles from tumor sequencing data. Ann Oncol. 2015;26(1):64-70. doi:10.1093/annonc/mdu479
단일세포
- Cell Ranger — 10x Genomics. Cell Ranger. 10xgenomics.com · Zheng GXY, Terry JM, Belgrader P, et al. Massively parallel digital transcriptional profiling of single cells. Nat Commun. 2017;8:14049. doi:10.1038/ncomms14049
파이프라인 골격 · 리포트
- SEQprocess — Joo T, Choi JH, Lee JH, et al. SEQprocess: a modularized and customizable pipeline framework for NGS processing in R package. BMC Bioinformatics. 2019;20(1):90. doi:10.1186/s12859-019-2676-x · github.com/omicsCore/SEQprocess
- R — R Core Team. R: a language and environment for statistical computing. R Foundation for Statistical Computing. r-project.org
- Shiny — Chang W, Cheng J, Allaire JJ, et al. shiny: web application framework for R. shiny.posit.co
- R Markdown — Xie Y, Allaire JJ, Grolemund G. R Markdown: the definitive guide. Chapman & Hall/CRC; 2018. rmarkdown.rstudio.com
참조 유전체 · 데이터베이스
- GRCh38 (hg38) — Schneider VA, Graves-Lindsay T, Howe K, et al. Evaluation of GRCh38 and de novo haploid genome assemblies demonstrates the enduring quality of the reference assembly. Genome Res. 2017;27(5):849-864. doi:10.1101/gr.213611.116
- dbSNP — Sherry ST, Ward MH, Kholodov M, et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 2001;29(1):308-311. doi:10.1093/nar/29.1.308
- COSMIC — Sondka Z, Dhir NB, Carvalho-Silva D, et al. COSMIC: a curated database of somatic variants and clinical data for cancer. Nucleic Acids Res. 2024;52(D1):D1210-D1217. doi:10.1093/nar/gkad986
- gnomAD — Karczewski KJ, Francioli LC, Tiao G, et al. The mutational constraint spectrum quantified from variation in 141,456 humans. Nature. 2020;581(7809):434-443. doi:10.1038/s41586-020-2308-7
마지막 수정 ·
문서