분석 가이드
데이터 준비
분석이 실패하는 이유의 대부분은 데이터가 들어오기 전에 정해집니다.
파일 형식
| 데이터 | 받는 형식 | 비고 |
|---|---|---|
| 시퀀싱 원자료 | FASTQ (gzip 가능) | paired-end 는 _R1/_R2 로 짝을 맞춥니다 |
| 발현 매트릭스 | CSV / TSV | 1열 유전자명, 이후 열이 샘플 |
| 샘플 정보 | CSV | 첫 열이 샘플 ID — 매트릭스의 열 이름과 정확히 같아야 합니다 |
자주 막히는 자리
샘플 이름이 어긋납니다. 매트릭스의 열 이름과 샘플 정보의 ID 가 한 글자라도 다르면
그 샘플은 조용히 빠집니다. 공백·대소문자·- 와 _ 를 확인하십시오.
그룹이 하나뿐입니다. 비교할 그룹이 둘 이상이어야 차등발현을 계산합니다. 샘플 정보에 그룹 열이 있는지 보십시오.
반복이 없습니다. 그룹당 하나면 통계를 낼 수 없습니다. 최소 둘, 가능하면 셋 이상을 권합니다.
넣기 전에 확인할 것
- 파일이 열리는가 (압축이 깨지지 않았는가)
- 샘플 수가 기대한 수와 같은가
- 결측이 얼마나 되는가 — 절반을 넘으면 그 샘플은 빼는 편이 낫습니다