Relaxing the Rule of Ten Events per Variable in Logistic and Cox Regression 🆕 최근 업데이트

authors
Vittinghoff and McCulloch
year
2007
category
other
pdf
PDF
source
Source
업데이트
2026-09-06

이 논문의 관계도

List view

요약

이 논문은 logistic regression과 Cox regression에서 널리 쓰이는 "predictor variable당 최소 10개의 event (EPV)"라는 규칙이 지나치게 보수적일 수 있음을 large-scale simulation study를 통해 입증한다. 저자들은 EPV 외에도 sample size, number of predictors, predictor prevalence, 그리고 correlation between predictors가 model performance에 미치는 영향을 체계적으로 분석했다. 주요 발견은 EPV가 5-9인 경우 confidence interval coverage와 type I error rate가 nominal level 근처에서 유지되며, relative bias도 일반적으로 허용 가능한 범위 내에 있다는 것이다. 반면 EPV가 2-4인 경우 convergence failure와 substantial bias가 빈번하게 발생하여 해석에 주의가 필요하다. 특히 confounding control을 위해 많은 covariate를 조정해야 하는 observational study에서는 이 규칙의 완화로 인해 더 정확한 causal inference가 가능해질 수 있음을 시사한다.

방법

이 연구는 binary endpoint (logistic regression)와 failure time endpoint (Cox regression)를 대상으로 한 factorial simulation study이다. Primary predictor는 binary 또는 continuous로 설정되었으며, covariates는 adjustment variables로 고려되었다. EPV는 2부터 16까지의 값을 가지며, predictor variable의 수는 2, 4, 8, 16개로 다양하게 설정했다. Sample size는 128, 256, 512, 1,024로 구성되었고, primary predictor의 regression coefficient ($\beta_1$)는 0, $\log(1.5)$, $\log(2)$, $\log(4)$로 설정하여 effect size의 영향을 평가했다.

Binary primary predictor의 경우, 다른 predictors는 pairwise correlation이 0.25인 multivariate normal distribution을 따랐으며, primary predictor의 prevalence는 0.1, 0.25, 0.5로 설정하고 covariates와의 multiple correlation은 0, 0.25, 0.5, 0.75로 변화시켰다. Continuous primary predictor의 경우 모든 predictors가 equally intercorrelated한 multivariate normal distribution을 따랐으며, variance는 0.16으로 고정하고 multiple correlation은 0, 0.1, 0.25, 0.5, 0.9로 설정했다. 각 parameter 조합별로 500개의 data set을 생성하여 SAS version 9.13 software로 분석했으며, model convergence가 실패한 경우 summary statistics 계산에서 제외되었다.

Primary endpoint는 Wald 95% confidence interval coverage (true value 포함 비율), type I error rate ($H_0: \beta_1 = 0$ 검정에서 $p < 0.05$인 비율), 그리고 relative bias (estimate와 true value의 차이 퍼센트)로 정의되었다. Problematic scenario는 confidence interval coverage가 93% 미만, type I error rate가 7% 초과, 또는 relative bias가 15% 초과인 경우로 규정했다.

주요 결과

Logistic regression with binary primary predictor에서 average confidence interval coverage는 nominal level 이상으로 유지되었으며, EPV가 5-9인 경우 coverage가 93% 미만인 scenario는 전체의 1.7%, type I error rate가 7% 초과인 경우는 0.9%였다. Relative bias는 주로 EPV 2-4에서 두드러졌으며, EPV 5-9에서는 7.4%의 scenario에서 15%를 초과했지만 root mean squared error의 10% 미만을 차지했다. Power는 대부분의 scenario (80%)에서 80% 미만이었으나, event 수와 sample size가 증가할수록 향상되었다.

Logistic regression with continuous primary predictor에서는 confidence interval coverage가 EPV $\ge$ 5일 때 거의 일정하게 nominal level 근처를 유지했으며, number of variables와 number of events의 영향이 EPV보다 컸다. Type I error rate는 1.7%에서 7%를 초과했고, relative bias는 sample size에 더 민감하게 반응했다. Cox regression with binary primary predictor에서는 liberal confidence intervals가 16 predictors 모델에서만 관찰되었고, conservatism은 small number of predictors (2, 4)와 low EPV에서 두드러졌다. EPV 5-9에서 coverage < 93%는 5.8%, type I error > 7%는 3.4%였다.

Cox regression with continuous primary predictor에서는 confidence interval coverage가 slightly conservative (2 predictors) 또는 slightly liberal (4+ predictors)였으며, EPV의 영향은 미미했다. Relative bias는 small sample size (128, 256)와 low EPV (≤4)에서 증가했으나, EPV 5-9에서는 2%의 scenario에서만 15%를 초과했다. 전반적으로 EPV 5-9에서 problematic scenario 비율은 logistic binary (7.2%), logistic continuous (6.9%), Cox binary (10.4%), Cox continuous (8.6%)로 나타났으며, 이는 EPV 10-16 그룹과 큰 차이가 없었으나 EPV 2-4 그룹보다 현저히 낮았다.

강점

이 연구는 기존 Peduzzi et al.의 제한된 simulation study를 확장하여, EPV 외에도 sample size, number of predictors, predictor prevalence, correlation 등 다양한 요인이 model performance에 미치는 영향을 체계적으로 평가했다. Factorial design을 통해 9,328 (binary) 및 3,392 (continuous)개의 scenario를 분석함으로써 광범위한 조건에서의 robustness를 입증했다. Confidence interval coverage와 type I error rate를 주요 지표로 삼아, bias가 존재하더라도 inference의 validity가 유지될 수 있음을 보여주었다. 또한 bootstrap method를 이용한 sensitivity analysis를 포함하여 modern resampling tools의 유용성을 제시했다.

한계

Simulation study의 특성상 실제 clinical data의 complexity (예: missing data, non-linear relationships, time-varying covariates)를 완전히 반영하지 못한다. Graphical summaries가 average over parameters를 사용하므로, 특정 극단적인 scenario에서 coverage나 bias가 평균보다 훨씬 나쁠 수 있음을 간과할 위험이 있다. 또한 power analysis가 secondary consideration으로 처리되어, low EPV에서의 type II error risk에 대한 논의가 제한적이다. 마지막으로, 이 연구는 주로 causal inference (confounding control) 맥락에 초점을 맞추었으며, prediction model development (예: Harrell의 20 EPV 규칙)에는 직접적으로 적용하기 어렵다.

해석

이 결과는 observational epidemiology와 clinical research에서 confounding variable을 충분히 조정하기 위해 많은 covariate를 포함해야 할 때, EPV < 10인 모델을 무조건 배제하지 말아야 함을 시사한다. 특히 EPV가 5-9인 경우 confidence interval coverage와 type I error rate가 nominal level 근처를 유지하므로, statistically significant association이 발견될 경우 cautious interpretation 하에 신뢰할 수 있는 inference가 가능하다. 그러나 EPV < 5인 경우 convergence failure와 substantial bias 위험이 높으므로, bootstrap 등 resampling method를 통해 model stability를 검증하는 것이 권장된다. 이 연구는 LLM Wiki의 biostatistics 및 epidemiology 문헌에서 sample size calculation과 regression model adequacy 평가에 중요한 근거로 활용될 수 있으며, 특히 confounding control의 중요성을 강조하는 Greenland (1989) 등의 논의와 연결된다.