분석 가이드
데이터 준비
분석이 실패하는 이유의 대부분은 데이터가 들어오기 전에 정해집니다.
파일 형식
| 데이터 | 받는 형식 | 비고 |
|---|---|---|
| 시퀀싱 원자료 | FASTQ (gzip 가능) | 파일명 규칙은 아래를 보십시오 |
| 발현 매트릭스 | CSV / TSV | 1열 유전자명, 이후 열이 샘플 |
| 시료 정보 | CSV | 첫 열이 시료 ID — 매트릭스의 열 이름과 정확히 같아야 합니다 |
원자료를 두는 곳
AURORA 는 화면에서 FASTQ 를 받지 않습니다. 원자료는 서버의 AURORA 데이터 폴더 아래 내 계정 폴더에, 그 안의 프로젝트 폴더까지 만들어 두어야 합니다. 계정 폴더 자체를 입력으로 지정하는 것은 막혀 있습니다.
폴더 이름은 영문·숫자로 시작하고 . _ - 만 씁니다. 심볼릭 링크로 걸어 둔
경로는 열리지 않습니다 — 실제 경로여야 합니다.
FASTQ 파일명
짝을 맞추는 규칙이 정해져 있습니다. read 1 이 아래 중 하나여야 하고 read 2 도 같은 형태로 짝이 맞아야 합니다.
.1.fastq R1.fastq _R1.fastq _1.fq .1_val_1.fq .R1_val_1.fq
.gz 가 붙어도 됩니다.
10x 단일세포는 규칙이 다릅니다. Cell Ranger 가 요구하는 형식을 그대로 씁니다:
<시료>_S1_L001_R1_001.fastq.gz
벤더가 준 ..._10X_RawData_Outs 폴더를 통째로 지정하는 것이 보통 맞습니다.
여러 플로우셀로 나뉘어 있어도 하나로 합쳐 처리합니다.
규칙이 빡빡한 데는 이유가 있습니다. 느슨하게 잡으면
NT_cDC1_1과NT_cDC1_2처럼 생물학적으로 다른 시료가 한 시료의 read 1·read 2 로 합쳐지고, 오류 없이 평균값이 나옵니다. 조용히 틀리는 것보다 걸리는 편이 낫습니다.
시료 정보 표
AURORA 는 찾아낸 시료로 표를 만들어 줍니다. 채워 넣을 칸은 이렇습니다.
| 칸 | 뜻 |
|---|---|
sample_id |
시료 이름. 단계마다 폴더 이름이 됩니다 |
fastq_sample |
스캔에서 나온 값 — 고칠 수 없습니다 |
patient_id |
환자·개체 식별자 |
group |
비교군. 시료의 군간 비교에 사용할 그룹을 기록합니다 |
tissue_type |
조직 |
batch |
배치 |
sample_id 는 폴더 이름이 되므로 영문·숫자와 . _ - 만 씁니다.
비어 있거나 중복이면 실행이 막힙니다.
체세포 변이는 이름으로 짝을 짓습니다
정상·종양 구분은 별도 칸이 아니라 시료 이름에 든 글자로 합니다.
기본값은 정상 ASN, 종양 ASC 이고 화면에서 바꿀 수 있습니다.
이름에 그 글자가 없으면 짝이 지어지지 않고 체세포 변이 검출이 돌지 않습니다.
자주 막히는 자리
시료 이름이 어긋납니다. 매트릭스의 열 이름과 시료 정보의 ID 가 한 글자라도 다르면
그 시료는 조용히 빠집니다. 공백·대소문자·- 와 _ 를 확인하십시오.
그룹이 하나뿐입니다. 비교할 그룹이 둘 이상이어야 차등발현을 계산합니다.
반복이 없습니다. 그룹당 하나면 통계를 낼 수 없습니다. 최소 둘, 가능하면 셋 이상을 권합니다.
엑솜인데 캡처 BED 가 없습니다. Mutect2 가 전체 유전체를 뒤지고 CNVkit 참조의 잡음이 커집니다. 있으면 반드시 넣으십시오.
CNVkit 을 켰는데 정상 시료가 적습니다. CNVkit 은 정상 시료를 모아 참조를 만듭니다. 5건 이상을 권합니다. 0건이면 실행이 막힙니다.
넣기 전에 확인할 것
- 파일이 열리는가 (압축이 깨지지 않았는가)
- 시료 수가 기대한 수와 같은가
- 짝이 다 맞는가 — 짝을 못 찾은 시료는 경고로만 지나갑니다
- 결측이 얼마나 되는가 — 절반을 넘으면 그 시료는 빼는 편이 낫습니다
마지막 수정 ·
문서