arXiv 2306.10193 — Conformal Language Modeling¶
제목: Conformal Language Modeling
저자: Quach et al.
베뉴: ICLR 2024
핵심 메커니즘¶
Quality function¶
Length normalization 적용 (짧은 시퀀스 편향 방지):
lp(y) = (5 + |y|)^0.6 / (5 + 1)^0.6
normalized_logprob = log p_θ(y_k | x) / lp(y_k)
Q(x, y) = exp(normalized_logprob)
Set-level scoring functions¶
| 함수 | 정의 |
|---|---|
| F_Max(C) | max{ Q(y) : y ∈ C } |
| F_Sum(C) | Σ Q(y) for y ∈ C |
| F_First-K(C) | |C| (uniform baseline) |
실증: Max/Sum 방법의 AUC < First-K baseline의 50% (open-domain QA 기준) → likelihood-based scoring이 First-K보다 효율적
Coverage Guarantee¶
Formal statement (Theorem 4.2)¶
- ε: 허용 오류율 (acceptable answer missing 확률)
- δ: calibration data 민감도
- A(y): binary admissibility function (정답 판별기)
- 조건부 보장: D_cal에 대한 조건부 (marginal과 구분)
Marginal vs Conditional Coverage — 핵심 제약¶
| 구분 | 보장 내용 |
|---|---|
| Marginal coverage (표준 conformal) | 모든 프롬프트 평균으로 1−α 달성 |
| Conditional coverage (원하는 것) | 각 프롬프트 x에 대해 개별 1−α 보장 |
문제: Marginal coverage만으로는 "쉬운 쿼리 98% + 어려운 쿼리 75%" 상황이 가능.
안전 중요 시스템에서는 conditional coverage가 필요하나, 분포 가정 없이 conditional coverage는 수학적으로 불가능함이 증명됨.
Exchangeability 가정 위반¶
Conformal prediction의 전제: 캘리브레이션 데이터 = 테스트 데이터 분포 (교환가능).
위반 시나리오: - 모델은 과거 데이터로 학습 → 미래 데이터로 테스트 - 한 도메인에서 캘리브레이션 → 다른 도메인에서 배포 - Dynamic RAG: 검색 문서 풀이 실시간 변동
결과: "marginal shifts can cause conformal methods to catastrophically fail to provide valid marginal coverage"
해결 방향 (2024–2026 후속 연구)¶
- Adaptive Conformal Prediction: 쿼리별 threshold 조정
- ConU (arXiv 2407.00499): correctness coverage guarantee
- TECP (arXiv 2509.00461): token entropy + split conformal
- Domain-shift-aware variants: arXiv 2510.05566, 2603.27403
전통 방법 vs LLM 적용¶
Conformal prediction의 nonconformity score = −log p_θ(y|x) → classical statistical measure 그대로 사용
이론 수정 없이 LLM에 직접 적용 가능함 → "traditional methods inadequate" 주장을 반박하는 evidence