콘텐츠로 이동

arXiv 2306.10193 — Conformal Language Modeling

제목: Conformal Language Modeling
저자: Quach et al.
베뉴: ICLR 2024


핵심 메커니즘

Quality function

Q(x, y) = p_θ(y|x)   ← likelihood (NOT log-probability)

Length normalization 적용 (짧은 시퀀스 편향 방지):

lp(y) = (5 + |y|)^0.6 / (5 + 1)^0.6
normalized_logprob = log p_θ(y_k | x) / lp(y_k)
Q(x, y) = exp(normalized_logprob)

Set-level scoring functions

함수 정의
F_Max(C) max{ Q(y) : y ∈ C }
F_Sum(C) Σ Q(y) for y ∈ C
F_First-K(C) |C| (uniform baseline)

실증: Max/Sum 방법의 AUC < First-K baseline의 50% (open-domain QA 기준) → likelihood-based scoring이 First-K보다 효율적


Coverage Guarantee

Formal statement (Theorem 4.2)

ℙ( ℙ(∃y ∈ C_λ : A_test(y) = 1 | D_cal) ≥ 1−ε ) ≥ 1−δ
  • ε: 허용 오류율 (acceptable answer missing 확률)
  • δ: calibration data 민감도
  • A(y): binary admissibility function (정답 판별기)
  • 조건부 보장: D_cal에 대한 조건부 (marginal과 구분)

Marginal vs Conditional Coverage — 핵심 제약

구분 보장 내용
Marginal coverage (표준 conformal) 모든 프롬프트 평균으로 1−α 달성
Conditional coverage (원하는 것) 각 프롬프트 x에 대해 개별 1−α 보장

문제: Marginal coverage만으로는 "쉬운 쿼리 98% + 어려운 쿼리 75%" 상황이 가능.
안전 중요 시스템에서는 conditional coverage가 필요하나, 분포 가정 없이 conditional coverage는 수학적으로 불가능함이 증명됨.


Exchangeability 가정 위반

Conformal prediction의 전제: 캘리브레이션 데이터 = 테스트 데이터 분포 (교환가능).

위반 시나리오: - 모델은 과거 데이터로 학습 → 미래 데이터로 테스트 - 한 도메인에서 캘리브레이션 → 다른 도메인에서 배포 - Dynamic RAG: 검색 문서 풀이 실시간 변동

결과: "marginal shifts can cause conformal methods to catastrophically fail to provide valid marginal coverage"


해결 방향 (2024–2026 후속 연구)

  • Adaptive Conformal Prediction: 쿼리별 threshold 조정
  • ConU (arXiv 2407.00499): correctness coverage guarantee
  • TECP (arXiv 2509.00461): token entropy + split conformal
  • Domain-shift-aware variants: arXiv 2510.05566, 2603.27403

전통 방법 vs LLM 적용

Conformal prediction의 nonconformity score = −log p_θ(y|x) → classical statistical measure 그대로 사용
이론 수정 없이 LLM에 직접 적용 가능함 → "traditional methods inadequate" 주장을 반박하는 evidence