arXiv 2601.02574 — Fact-Checking with LLMs via Probabilistic Certainty and Consistency (PCC)¶
제목: Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency 베뉴: arXiv (2026.01.05) 한 줄: confidence/consistency로 검색 강도를 적응 조절 — confident면 직답, uncertain이면 타깃 검색, ambiguous면 딥서치. ⚠️ 본 노트는 abstract 기반. 본문 수치·정확한 신호 정의는 미확인 (PDF 확인 필요).
문제의식¶
기존 fact-checking은 외부 증거를 무분별하게(indiscriminately) 검색해서 모델 내부 지식을 무시하고 관련 없는 노이즈를 끌어온다.
또한 모델 추론의 특정 불확실성을 타깃해서 해소하는 메커니즘이 없다.
PCC — 두 신호 결합¶
- Probabilistic Certainty: 모델의 확률적 확신도 (정확한 계산식은 abstract 미명시. "verbalized confidence보다 나은 UQ"라고만 기술)
- Consistency: 추론 일관성
- 둘을 공동 모델링해 factual confidence 추정
Adaptive Verification 전략 (3단)¶
confident → 내부 지식으로 직답 (검색 X)
uncertain/inconsistent → 타깃 검색 (missing info를 명시한 query 생성)
high ambiguity → 딥 서치로 확대
- uncertain 감지 시 self-reflection으로 불확실성의 정체를 파악하고, 그걸 명시한 검색 쿼리를 생성 → 고정밀 증거 회수.
- 인간의 fact-check 방식(아는 건 바로 답, 모르면 찾아봄)에서 착안.
결과 (abstract 수준)¶
- 3개 도전적 벤치마크에서 우수한 성능
- 다양한 LLM에 일반화
본 프로젝트와의 연결¶
- ③ 검증 강도 배분의 직접 근거: "낮으면 검색 깊게, 높으면 가볍게"가 PCC의 3단 적응 전략과 동일 구조.
- 무차별 검색 = 노이즈 지적이 ③을 권한 이유와 일치.
- ⚠️ 충돌 지점: PCC는 confident면 검색을 아예 생략한다 (우리 설계의 ① "생략은 위험"과 배치). 단 PCC는 verbalized보다 나은 UQ를 전제하므로, confidence가 calibrated일 때만 생략이 안전하다는 조건부 결론으로 화해 가능.
- TODO: PDF로 (1) 정확한 certainty 신호(logprob인지 P(True)인지) (2) confident/uncertain/ambiguous 임계 기준 확인.