[판독노트 #1] 3bCNV: WES와 패널 검출 기준

자주 묻는 질문 (FAQ)
Q1. 3bCNV는 왜 WES에서 1 exon deletion을 검출하지 않나요?
A. 균 Depth가 약 100x 인 WES 환경에서는 단일 Exon의 Read Depth 감소가 실제 변이인지 단순 sequencing fluctuation(노이즈)인지 구별하기 어렵기 때문입니다. (단, Read가 아예 없는 Homozygous Deletion은 예외적으로 검출 가능)
Q2. 3bCNV로 정확한 Breakpoint(염기 위치)를 알 수 있나요?
A. 없습니다. Depth of Coverage 변화를 기반으로 구역을 추론하는 방식이므로 염기 단위의 정확한 시작점과 끝점은 파악할 수 없으며, 1 kb 미만의 아주 작은 변이는 기본 제외됩니다.
1. CNV 검출의 두가지 접근법
NGS 데이터에서 CNV(Copy Number Variant)를 검출하는 기술적 방법은 분석 대상에 따라 크게 두 가지로 나뉩니다.

CNV는 분석 알고리즘에 따라 검출 원리가 다릅니다. 일부 알고리즘은 split read와 discordant paired-end read를 이용해 breakpoint를 직접 탐지하는 반면(Manta 등), 3bCNV는 breakpoint 정보를 이용하지 않고, sequencing depth의 상대적인 변화를 분석하는 read-depth 기반 알고리즘입니다.

2. 3bCNV의 작동 원리 (Read-depth 기반)
3bCNV는 Read-depth 방식을 채택하여 다음과 같은 절차로 변이를 검출합니다:
- Depth 비교 및 정규화 (Normalization): Reference 샘플 코호트의 Exon별 평균 Coverage Depth를 계산하고, 개별 샘플의 Coverage 값을 정규화하여 샘플/실험 간 변동성을 최소화합니다.
- 변이 추론: 정상 대비 Read 수가 정량적으로 적으면 Deletion, 많으면 Duplication으로 판정합니다.
3. Coverage는 왜 항상 일정하지 않을까?
NGS 데이터를 분석할 때 가장 주의해야 할 점은 모든 exon의 Coverage가 동일하지 않다는 사실입니다.
Read-depth 방식을 사용하는 알고리즘에서는 기술적 한계 및 생물학적 요인으로 인한 Depth 변동을 노이즈와 구분하는 것이 핵심 과제입니다.
- GC content가 지나치게 높은 영역
- Capture efficiency가 떨어지는 구간
- 게놈 내 반복서열(Repeats)의 존재
- Short-read Mapping이 어려운 영역
따라서 단 하나의 Exon에서 Z-score 감소가 관측되었다 하더라도, 이것이 기술적 노이즈(Fluctuation)일 수 있으므로 신중한 접근 기준이 필요합니다.
4. WES에서 ≥ 3 Consecutive Exons 기준을 쓰는 이유
WES(Whole Exome Sequencing) 분석 환경은 평균 Depth가 약 100x 수준입니다. 이 정도 깊이에서는 DOC 기반 알고리즘이 단일 exon의 Read 수 감소만 보고 실제 Heterozygous deletion인지, 단순 sequencing 노이즈인지 판단하기에 통계적 신뢰도가 부족할 수 있습니다.
이를 극복하기 위해 3bCNV는 연속적인 패턴(Consecutive Pattern)을 확인합니다.
[노이즈 패턴 예시]
Exon 8 (정상) -> Exon 9 (낮음) -> Exon 10 (정상)
=> 단순 Capture variation (노이즈) 가능성 높음
[실제 CNV 패턴 예시]
Exon 8 (정상) -> Exon 9 (낮음) -> Exon 10 (낮음) -> Exon 11 (낮음) -> Exon 12 (정상)
=> 3개 이상 연속 감소로 실제 Deletion 변이일 가능성 올라감

3bCNV는 민감도(Sensitivity)를 일부 내주더라도 위양성(False Positive)을 대폭 줄이고 데이터 해석의 신뢰도를 확보하기 위해 WES 분석 시 3개 이상의 연속된 Exon (≥ 3 consecutive exons) 기준을 적용합니다.
5. Z-score를 이용한 CNV 정량적 판별 기준
3bCNV는 단순히 특정 구간의 Read depth가 높거나 낮은지만 시각적으로 확인하는 것이 아닙니다. 정제된 normalized read depth가 정상(Reference) 샘플들의 평균 분포에서 얼마나 벗어나는지를 통계적인 Z-score 로 정량화하여 판별합니다.
Z-score 는 특정 Exon의 normalized read depth가 정상 샘플들의 평균으로부터 몇 표준편차(Standard Deviation, SD)만큼 떨어져 있는지를 나타내는 정밀 지표입니다.

즉, Z-score가 음수로 크게 감소할수록 해당 Exon의 Read depth가 정상 기준보다 뚜렷하게 낮아 Deletion 가능성이 급격히 올라가며, 반대로 양수로 크게 증가할수록 Read depth가 높아 Duplication 신호로서 확실한 통계적 근거를 제공하게 됩니다.
6. WES vs Gene Panel: CNV 분석 해상도 비교
반면 Gene Panel 분석 환경은 상황이 크게 다릅니다. 평균 Coverage가 300x 이상으로 훨씬 깊게 시퀀싱 됩니다.

Read-depth 기반 분석에서도 Depth가 대폭 높아지면 기술적 노이즈에 의한 변동폭은 줄어들고, 진짜 Deletion/Duplication 신호는 훨씬 선명해집니다. 따라서 Gene Panel 환경에서는 Single Exon CNV도 높은 신뢰도로 검출이 가능합니다.

7. Read-depth 기반 알고리즘의 한계점
Depth of Coverage 방식을 이용하는 3bCNV 알고리즘 특성상 아래와 같은 기술적 한계가 존재합니다.
- Breakpoint(정확한 염기 위치) 확인 불가능 염기 단위로 직접 단절 지점을 읽는 것이 아니기 때문에 chr1:123456-123987처럼 정확한 시작점과 끝점을 측정하지 못하고, coverage가 변하는 구간을 통해 범위를 추정합니다.
- 미세한 크기의 CNV 필터링 1 kb 미만의 크기, Exon보다 작은 Deletion, 매우 작은 Duplication은 단순 노이즈와 구별하기 어렵고 정확한 Breakpoint 정의가 불가능하므로 기본적으로 분석 대상에서 필터링하여 제외합니다.
데이터의 특성을 이해하는 정확한 CNV 해석
3bCNV가 WES에서 단일 Exon 검출 대신 연속 3개 이상의 Exon 기준과 Z-score ≤ -3 / ≥ +3이라는 정밀한 통계적 임계값을 사용하는 것은 기술적 한계가 아닌, 진단 데이터의 신뢰도와 정확도를 극대화하기 위한 전략적 선택입니다.
반면, 시퀀싱 깊이가 충분한 Gene Panel 환경이나 Read가 완전히 소실되는 Homozygous Deletion에서는 단일 Exon 수준까지 세밀하게 잡아낼 수 있습니다.
이처럼 Read-depth 기반 알고리즘의 분석 원리와 데이터별 Depth 특성을 정확히 이해한다면, 임상 및 연구 현장에서 CNV 결과를 훨씬 더 타당하고 신뢰도 높게 해석할 수 있을 것입니다.
💡 “WES부터 Gene Panel까지, CNV 판독의 신뢰도를 직접 확인해 보세요.”
복잡한 변이 해석 고민은 줄이고, GEBRA 플랫폼으로 더 빠르고 정확한 임상 의사결정을 시작하세요.
3billion 뉴스레터 구독자만을 위한
희귀질환 진단 최신 정보를 받아보세요.

3billion Inc.
희귀질환 환자들이 진단과 치료에서 외면받지 않는 세상을 만들기 위해 쓰리빌리언은 하나의 미션을 바라봅니다.





