Comparability of PD‐L1 immunohistochemistry assays for non‐small‐cell lung cancer a systematic review 🆕 최근 업데이트
한 줄 요약
이 systematic review는 advanced non-small-cell lung cancer (NSCLC) 환자에서 PD-L1 inhibitors 치료 결정을 위한 PD-L1 immunohistochemistry (IHC) assays의 상호 비교 가능성(comparability)을 평가했다. PubMed, Embase, Cochrane Library를 통해 검색된 4294편 중 방법론적 질이 충분한 27편의 연구를 최종 포함하여 interassay, interobserver, 및 interlaboratory concordance를 분석했다. 표준화된 assays인 22C3, 28-8, SP263 간에는 높은 일치도를 보였으나, SP142는 다른 assays와 비교했을 때 상대적으로 낮은 concordance를 나타냈다. Laboratory-developed tests (LDTs)는 적절한 protocol을 사용할 경우 reference assay와 높은 상관관계를 보일 수 있었으며, 동일한 antibody를 다른 platform에서 사용한 경우보다 서로 다른 antibodies 간 차이가 더 컸다. 그러나 clinical practice에서 중요한 cut-off 값(특히 1%)을 적용할 때 concordance가 현저히 감소하여, assays 간의 완전한 상호 교환성(interchangeability)은 제한적임을 시사한다.
방법
이 연구는 PRISMA 가이드라인에 따라 수행된 systematic review이다. 검색 전략은 'lung cancer'와 'PD-L1' 및 관련 동의어를 사용하여 PubMed, Embase, Cochrane Library에서 문헌을 수집했다. 중복 제거 후 4294편의 고유한 기록이 확인되었으며, 두 명의 연구자(B.K., S.B.)가 독립적으로 제목과 abstract를 screening하여 포함/제외 기준에 부합하는 연구를 선별했다. 최종적으로 full text를 평가한 58편 중 41편이 inclusion criteria를 충족했고, 이 중 방법론적 질 평가를 위해 수정된 QUADAS-2 (Quality Assessment of Diagnostic Accuracy Studies 2) 도구를 사용했다. 기존 QUADAS-2의 reference standard domain은 제외하고, QUIPS (Quality in Prognosis Studies) tool에서 유래한 statistical analysis and reporting domain을 추가하여 bias risk를 low, moderate, high로 분류했다. High risk of bias로 판단된 14편은 제외하고, 최종 27편의 연구에서 data extraction을 수행했다.
포함 기준은 NSCLC 환자의 조직학적 표본(histological tissue)을 사용하여 PD-L1 IHC assays 또는 LDTs 간의 interassay, interobserver, interlaboratory concordance를 평가한 연구였다. 세포학적 표본(cytological specimens)만 사용한 연구, 적절한 통계 분석(최소한 overall percentage of agreement 제공)이 없는 연구, 영어가 아닌 논문은 제외되었다. Data extraction 항목에는 first author, publication year, sample size, cancer subtype, material type, assay/LDT type, scoring method, cut-off values, observer 수, statistical analysis 방법 및 결과 등이 포함되었다. 본 review는 주로 tumour cell (TC) staining과 scoring의 concordance에 초점을 맞추었으나, immune cell (IC) staining 데이터도 부록으로 정리했다. 연구 간 heterogeneity(antibody 종류, pathologist 수, 통계 방법 등)로 인해 meta-analysis는 수행하지 않았으며, 질적 종합(qualitative synthesis)을 통해 결과를 해석했다.
주요 결과
Interassay Concordance: 22C3, 28-8, SP263 세 가지 표준화된 assays 간에는 moderate to strong concordance가 관찰되었다. 특히 22C3와 28-8 간의 일치도가 가장 높았으며, Brunnström et al. 연구에서는 weighted kappa ($\kappa$) 값이 0.891 (95% CI: 0.82–0.96)로 보고되었다. 반면, SP142는 다른 assays와 비교했을 때 consistently lower concordance를 보였다. LDTs와 reference assay 간 비교에서, Adam et al. 연구에서는 27개 LDT 중 14개가 weighted $\kappa \ge 0.75$ 기준을 충족하여 concordant로 판정되었으나, SP142 LDT와 SP263 reference assay 간에는 가장 낮은 $\kappa$ 값 (0.38)이 기록되었다. 일부 연구에서는 22C3 LDT와 22C3 standardised assay 간 상관관계가 서로 다른 표준 assays 간 상관관계보다 더 높게 나타났으며, 이는 antibody 자체의 차이보다 platform이나 protocol의 영향이 클 수 있음을 시사한다.
Cut-off 적용 시 Concordance 감소: 연속형 변수(continuous scale)로 PD-L1 expression을 평가할 때는 높은 일치도 (ICC range 0.726–0.812)를 보였으나, clinical decision-making에 사용되는 cut-off 값을 적용하면 concordance가 현저히 떨어졌다. Blueprint Phase 1 study에서는 22C3, 28-8, SP263 간 agreement가 cut-off 사용 시 86.8%에서 94.7%로 감소했으며, 이는 약 15%의 환자가 다른 assay를 사용했다면 치료 배정에서 제외될 수 있음을 의미한다. 특히 1% cut-off에서의 agreement는 50% cut-off보다 낮게 보고되었으며 (Hendry et al., Cohen’s $\kappa$ range 0.433–0.631), 이는 low expression level에서의 scoring variability이 임상적 중요성을 가진다.
Interobserver 및 Interlaboratory Concordance: 16편의 연구가 interobserver concordance를 평가했으며, 대부분의 assays에서 moderate to almost perfect agreement를 보였다. 그러나 1% cut-off를 사용할 때 observer 간 일치도가 50%, 5%, 10%, 25% cut-off에 비해 낮게 나타났다. Blueprint Phase 2 study에서는 80% cut-off에서도 agreement가 다소 감소했다. Cooper et al. 연구에서는 22C3 assay에서 50% cut-off의 concordance (OPA 81.9%, $\kappa$=0.58)가 1% cut-off (OPA 84.2%, $\kappa$=0.69)보다 낮았으나, 이는 prevalence bias의 영향일 수 있다고 해석했다.
5편의 연구가 interlaboratory concordance를 평가했으며, 표준화된 assays (22C3, 28-8, SP263)는 site 간 substantial to near-perfect concordance를 보였다. Scheel et al. 연구에서 10개 site에서 수행된 테스트 결과, standardised assays의 $\kappa$ 값은 0.73–0.89 (1% 및 50% cut-off 사용 시)로 높았으나, LDTs는 $\kappa$=0.5로 moderate concordance에 그쳤다. 이는 LDTs의 protocol 표준화 부족이 site 간 변이를 초래할 수 있음을 시사한다.
강점
본 연구는 PD-L1 IHC assays의 comparability에 관한 기존 문헌을 체계적으로 수집하고 평가한 최초의 comprehensive systematic review 중 하나이다. 단순한 assay 비교를 넘어 interobserver 및 interlaboratory variation까지 포괄적으로 분석하여, 실제 clinical setting에서의 적용 가능성을 다각도로 검증했다. 수정된 QUADAS-2 tool을 사용하여 방법론적 질을 엄격히 평가함으로써, high risk of bias인 연구를 배제하고 신뢰도 높은 27편의 연구만을 최종 분석에 포함시켰다. 또한, 연속형 데이터와 cut-off 기반 데이터의 concordance 차이를 명확히 구분하여 보고함으로써, assay 간 기술적 유사성과 clinical utility 간의 괴리를 정량적으로 제시했다.
한계
포함된 연구들 간 heterogeneity가 심하여 meta-analysis를 수행할 수 없었으며, 이는 결과의 정량적 통합을 제한한다. 대부분의 연구가 retrospective design이거나 small sample size (15~713 specimens)를 가지고 있어, generalizability에 제약이 있을 수 있다. Interlaboratory concordance를 평가한 연구는 단 5편으로, real-world clinical pathology data를 기반으로 한 대규모 다기관 연구가 부족하다. 또한, 본 review는 주로 tumour cell (TC) staining에 초점을 맞추었으며, immune cell (IC) scoring의 concordance는 부차적으로만 다루어졌다. 일부 연구에서 reporting bias나 prevalence bias가 결과 해석에 영향을 미칠 가능성이 지적되었다.
해석
이 결과는 NSCLC 치료에서 PD-L1 IHC assays가 완전히 interchangeable하지 않음을 강조한다. 특히 22C3, 28-8, SP263 간에는 높은 기술적 일치도가 있으나, clinical decision-making의 핵심인 low cut-off (1%)에서의 variability은 treatment eligibility에 직접적인 영향을 미칠 수 있다. SP142 assay는 다른 assays와 낮은 concordance를 보였으므로, atezolizumab 치료 결정 시 주의가 필요하다. LDTs는 protocol이 잘 표준화될 경우 reference assay와 유사한 성능을 낼 수 있으나, site 간 변이가 크므로 rigorous quality control이 필수적이다. 향후 clinical practice에서는 assay 선택 시 drug-specific companion diagnostic의 중요성을 재확인해야 하며, low PD-L1 expression 환자군에서의 scoring variability을 줄이기 위한 pathologist training 및 protocol harmonization이 필요하다. 이 연구는 oncology와 pathology 분야에서 biomarker testing의 표준화 필요성을 다시 한번 입증하는 근거가 된다.