콘텐츠로 이동

arXiv 2511.09803 — TARG: Training-Free Adaptive Retrieval Gating

제목: TARG: Training-Free Adaptive Retrieval Gating for Efficient Retrieval-Augmented Generation
베뉴: arXiv (Nov 2025, preprint)
평가 범위: English open-domain QA (NQ-Open, TriviaQA, PopQA, MuSiQue, ASQA) — Wikipedia 기반


핵심 아이디어

RAG에서 매 쿼리마다 retrieval을 실행하는 것은 과도하다. 모델의 logit 신호로 "이미 아는 것"을 걸러내 retrieval call을 대폭 줄이자.

동작 방식

1. 20-token prefix를 retrieval 없이 생성
2. prefix에 대한 uncertainty score 계산
3. score > threshold τ → retrieval 실행
   score ≤ threshold τ → retrieval 생략 (모델 자체 지식 사용)

세 가지 Uncertainty Signal 비교

Signal 정의 주요 특성
Margin (top-1/top-2 gap) p_1 - p_2 instruction-tuned 모델에서 판별력 유지
Entropy −Σ p_i log p_i instruction tuning 후 압축되어 판별력 저하
Small-N variance N=5 prefix 샘플 간 분산 margin 대비 계산 비용 높음, 예산 극히 제한 시

핵심 실험 결과 (Llama-3.1-8B, TriviaQA): - Margin: retrieval 0.1% 유발 (동일 품질) - Entropy: retrieval 52.4% 유발 (동일 품질) → Margin이 entropy보다 ~524× 효율적


Adversarial Fact-Check 결과

1. "Training-free" 레이블 — 오해 소지 있음

논문에서 "학습 불필요"라고 하지만, threshold τ 결정에 dev set 캘리브레이션이 필요. empirical CDF tuning을 통해 τ를 per-dataset으로 설정해야 한다. → deployment domain마다 레이블된 캘리브레이션 데이터 필요

2. "70–90% retrieval reduction" 범위 — cherry-picked

Dataset 실제 reduction
TriviaQA 66.2% (70% 미만)
NQ-Open 69.6% (70% 미만)
MuSiQue 98.4% (90% 초과)
ASQA 94% (90% 초과)

논문 abstract: "up to 90%"라는 표현 사용 (aspirational max, not typical range)

3. "small-NN variance" 명칭 오류

논문 원문: small-N variance (N=5 stochastic prefix samples)
NN이 아니라 sample count N=5 의미. Neural network 컴포넌트 없음.


핵심 제약 (논문 내 인정)

  1. OOD query에서 hallucination 위험 증가 — retrieval을 억제할 때
  2. 평가 범위: English open-domain QA (Wikipedia), Qwen2.5-7B / Llama-3.1-8B만 테스트
  3. Logit method + OOD shift: OOD 데이터의 entropy/margin 분포가 ID와 통계적으로 구분 불가한 케이스 존재

비교 baseline

TARG가 비교 우위를 보인 adaptive RAG 방법들: - Self-RAG - FLARE
- CRAG-lite - SKR


메모

Margin > Entropy 주장에 반박하는 2024–2025 논문은 체계적 검색에서 발견되지 않음.
단, 주장의 일반화 범위는 instruction-tuned 7–8B 모델 + English Wikipedia QA로 한정해야 안전.