문서

분석 가이드

데이터 준비

분석이 실패하는 이유의 대부분은 데이터가 들어오기 전에 정해집니다.

파일 형식

데이터 받는 형식 비고
시퀀싱 원자료 FASTQ (gzip 가능) 파일명 규칙은 아래를 보십시오
발현 매트릭스 CSV / TSV 1열 유전자명, 이후 열이 샘플
시료 정보 CSV 첫 열이 시료 ID — 매트릭스의 열 이름과 정확히 같아야 합니다

원자료를 두는 곳

AURORA 는 화면에서 FASTQ 를 받지 않습니다. 원자료는 서버의 AURORA 데이터 폴더 아래 내 계정 폴더에, 그 안의 프로젝트 폴더까지 만들어 두어야 합니다. 계정 폴더 자체를 입력으로 지정하는 것은 막혀 있습니다.

폴더 이름은 영문·숫자로 시작하고 . _ - 만 씁니다. 심볼릭 링크로 걸어 둔 경로는 열리지 않습니다 — 실제 경로여야 합니다.

FASTQ 파일명

짝을 맞추는 규칙이 정해져 있습니다. read 1 이 아래 중 하나여야 하고 read 2 도 같은 형태로 짝이 맞아야 합니다.

.1.fastq    R1.fastq    _R1.fastq    _1.fq    .1_val_1.fq    .R1_val_1.fq

.gz 가 붙어도 됩니다.

10x 단일세포는 규칙이 다릅니다. Cell Ranger 가 요구하는 형식을 그대로 씁니다:

<시료>_S1_L001_R1_001.fastq.gz

벤더가 준 ..._10X_RawData_Outs 폴더를 통째로 지정하는 것이 보통 맞습니다. 여러 플로우셀로 나뉘어 있어도 하나로 합쳐 처리합니다.

규칙이 빡빡한 데는 이유가 있습니다. 느슨하게 잡으면 NT_cDC1_1 과 NT_cDC1_2 처럼 생물학적으로 다른 시료가 한 시료의 read 1·read 2 로 합쳐지고, 오류 없이 평균값이 나옵니다. 조용히 틀리는 것보다 걸리는 편이 낫습니다.

시료 정보 표

AURORA 는 찾아낸 시료로 표를 만들어 줍니다. 채워 넣을 칸은 이렇습니다.

칸 뜻
sample_id 시료 이름. 단계마다 폴더 이름이 됩니다
fastq_sample 스캔에서 나온 값 — 고칠 수 없습니다
patient_id 환자·개체 식별자
group 비교군. 시료의 군간 비교에 사용할 그룹을 기록합니다
tissue_type 조직
batch 배치

sample_id 는 폴더 이름이 되므로 영문·숫자와 . _ - 만 씁니다. 비어 있거나 중복이면 실행이 막힙니다.

체세포 변이는 이름으로 짝을 짓습니다

정상·종양 구분은 별도 칸이 아니라 시료 이름에 든 글자로 합니다. 기본값은 정상 ASN, 종양 ASC 이고 화면에서 바꿀 수 있습니다. 이름에 그 글자가 없으면 짝이 지어지지 않고 체세포 변이 검출이 돌지 않습니다.

자주 막히는 자리

시료 이름이 어긋납니다. 매트릭스의 열 이름과 시료 정보의 ID 가 한 글자라도 다르면 그 시료는 조용히 빠집니다. 공백·대소문자·- 와 _ 를 확인하십시오.

그룹이 하나뿐입니다. 비교할 그룹이 둘 이상이어야 차등발현을 계산합니다.

반복이 없습니다. 그룹당 하나면 통계를 낼 수 없습니다. 최소 둘, 가능하면 셋 이상을 권합니다.

엑솜인데 캡처 BED 가 없습니다. Mutect2 가 전체 유전체를 뒤지고 CNVkit 참조의 잡음이 커집니다. 있으면 반드시 넣으십시오.

CNVkit 을 켰는데 정상 시료가 적습니다. CNVkit 은 정상 시료를 모아 참조를 만듭니다. 5건 이상을 권합니다. 0건이면 실행이 막힙니다.

넣기 전에 확인할 것

  • 파일이 열리는가 (압축이 깨지지 않았는가)
  • 시료 수가 기대한 수와 같은가
  • 짝이 다 맞는가 — 짝을 못 찾은 시료는 경고로만 지나갑니다
  • 결측이 얼마나 되는가 — 절반을 넘으면 그 시료는 빼는 편이 낫습니다

마지막 수정 ·