콘텐츠로 이동

arXiv 2603.06604 — Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

제목: Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection 베뉴: arXiv (2026.03) 한 줄: 학습 목표(SFT/RL/DPO)가 calibration을 결정한다 — RL 정렬이 logprob을 이진화시켜 신뢰도 신호를 망친다는 근본 원인 규명 + 해결책(post-RL SFT) 제시.


해결하려는 문제

  • LLM이 틀린 출력을 확신을 갖고 제시(confident hallucination). 의료·금융 등 고위험 도메인에서 치명적.
  • 기존 대응(self-consistency 샘플링, Chain-of-Verification)은 다중 생성 필요 → 비용 높아 실용성 낮음.

핵심 발견 — 학습 목표가 calibration을 결정한다

학습 방식 손실/목표 calibration 결과
SFT cross-entropy (MLE로 데이터 분포 직접 학습) 자연스럽게 calibrated
RL (PPO/GRPO) reward 최적화, advantage 가중으로 확률 집중 과신 (분포 sharpening)
DPO 선호 기반, 상대적 개선만 학습 miscalibrated

→ "logprob 높음 ≠ 정답"의 근본 원인: RL 정렬이 출력 분포를 뾰족하게(sharpening) 만들어 confidence가 0/1로 이진화됨. 상대적 불확실성 구분 불가.

해결책: RL 이후 self-distillation으로 SFT (post-RL SFT)로 calibration 회복.


Confidence 신호

분류 작업 — 정규화된 신뢰도:

ĉ(y|x) = c(y|x) / Σ_y' c(y'|x)
c = 토큰 확률의 곱, 분모 = 모든 후보 답지에 대한 합

생성 작업 — self-evaluation을 이진 분류로 변환:

답 생성 후 → "이 답이 맞나요? Yes/No" → Yes/No 토큰 확률 추출 = P(True)


실험 결과

기준 Qwen3-4B-Instruct → SFT 미세조정 후:

지표 기준 SFT 후 변화
AUROC (평균) 0.806 0.879 +9.0%
ECE (보정오류) 0.163 0.034 −79%

7개 벤치마크(BoolQ, CommonsenseQA, AG News, HellaSwag, GSM8K, TriviaQA, TriviaQA-RC) × 5개 모델군(Qwen3, Gemma3, GLM4)에서 검증.


logprob 한계 대응 (우리 설계에 직접 적용)

한계 대응
RL 모델 분포 sharpening → confidence 이진화 정규화로 출력 공간 제약 고려 → AUROC 최대 +33.1%
외부 API 환경에서 적용 불가 self-eval(P(True))은 토큰 확률만 필요
무차별 검색 비효율 적응형 RAG: 낮은 신뢰도 쿼리 20%에만 검색 → 최대 성능의 95% 달성 (Gain/Ret 0.36 → 0.43)

본 프로젝트(logprob confidence 게이팅 설계)와의 연결

  • 전제 검증: 우리가 "logprob 높음 ≠ 정답"이라 한 이유를 RL sharpening으로 정량화.
  • length-normalize 정당화: 정규화가 AUROC +33%라는 직접 증거.
  • ③ 검증 강도 배분 정당화: "20%만 검색해도 95% 성능" = 자원 배분이 실제로 효율적.
  • 경고: 우리가 쓰는 모델이 RLHF/GRPO 정렬이면 raw logprob이 이진화돼 "낮음/높음" 구분 자체가 약함 → P(True) 병용 또는 정규화 필수.