arXiv 2603.06604 — Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection¶
제목: Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection 베뉴: arXiv (2026.03) 한 줄: 학습 목표(SFT/RL/DPO)가 calibration을 결정한다 — RL 정렬이 logprob을 이진화시켜 신뢰도 신호를 망친다는 근본 원인 규명 + 해결책(post-RL SFT) 제시.
해결하려는 문제¶
- LLM이 틀린 출력을 확신을 갖고 제시(confident hallucination). 의료·금융 등 고위험 도메인에서 치명적.
- 기존 대응(self-consistency 샘플링, Chain-of-Verification)은 다중 생성 필요 → 비용 높아 실용성 낮음.
핵심 발견 — 학습 목표가 calibration을 결정한다¶
| 학습 방식 | 손실/목표 | calibration 결과 |
|---|---|---|
| SFT | cross-entropy (MLE로 데이터 분포 직접 학습) | 자연스럽게 calibrated |
| RL (PPO/GRPO) | reward 최적화, advantage 가중으로 확률 집중 | 과신 (분포 sharpening) |
| DPO | 선호 기반, 상대적 개선만 학습 | miscalibrated |
→ "logprob 높음 ≠ 정답"의 근본 원인: RL 정렬이 출력 분포를 뾰족하게(sharpening) 만들어 confidence가 0/1로 이진화됨. 상대적 불확실성 구분 불가.
해결책: RL 이후 self-distillation으로 SFT (post-RL SFT)로 calibration 회복.
Confidence 신호¶
분류 작업 — 정규화된 신뢰도:
생성 작업 — self-evaluation을 이진 분류로 변환:
실험 결과¶
기준 Qwen3-4B-Instruct → SFT 미세조정 후:
| 지표 | 기준 | SFT 후 | 변화 |
|---|---|---|---|
| AUROC (평균) | 0.806 | 0.879 | +9.0% |
| ECE (보정오류) | 0.163 | 0.034 | −79% |
7개 벤치마크(BoolQ, CommonsenseQA, AG News, HellaSwag, GSM8K, TriviaQA, TriviaQA-RC) × 5개 모델군(Qwen3, Gemma3, GLM4)에서 검증.
logprob 한계 대응 (우리 설계에 직접 적용)¶
| 한계 | 대응 |
|---|---|
| RL 모델 분포 sharpening → confidence 이진화 | 정규화로 출력 공간 제약 고려 → AUROC 최대 +33.1% |
| 외부 API 환경에서 적용 불가 | self-eval(P(True))은 토큰 확률만 필요 |
| 무차별 검색 비효율 | 적응형 RAG: 낮은 신뢰도 쿼리 20%에만 검색 → 최대 성능의 95% 달성 (Gain/Ret 0.36 → 0.43) |
본 프로젝트(logprob confidence 게이팅 설계)와의 연결¶
- 전제 검증: 우리가 "logprob 높음 ≠ 정답"이라 한 이유를 RL sharpening으로 정량화.
- length-normalize 정당화: 정규화가 AUROC +33%라는 직접 증거.
- ③ 검증 강도 배분 정당화: "20%만 검색해도 95% 성능" = 자원 배분이 실제로 효율적.
- 경고: 우리가 쓰는 모델이 RLHF/GRPO 정렬이면 raw logprob이 이진화돼 "낮음/높음" 구분 자체가 약함 → P(True) 병용 또는 정규화 필수.