Cache-to-Cache: 모델끼리 텍스트 말고 KV 캐시로 대화하기¶
- 논문: Cache-to-Cache: Direct Semantic Communication Between Large Language Models
- 저자: Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang, Yu Wang (7명)
- 발표: ICLR 2026
- arXiv: 2510.03215 [cs.CL], 2025-10-03 제출, v2 2026-03-02
- 코드: thu-nics/C2C
- 읽은 날짜: 2026-09-18
- 태그: #MultiLLM #KVCache #ModelCommunication #ICLR2026 #Inference #Fusion
한 줄 요약¶
멀티 LLM 시스템에서 모델끼리 텍스트로 주고받는 대신 KV 캐시를 직접 섞는다. 중간 텍스트 생성이 사라져 평균 2.5배 빨라지고, 텍스트 통신보다 정확도가 3.1~5.4%p 높다.
읽는 방식¶
원문 목차를 그대로 따라간다. 절 번호와 제목이 원문과 같다. 마지막 두 절만 읽는 쪽에서 덧붙인 것이다.
1. Introduction¶
문제 제기가 단순하다. 멀티 LLM 시스템에서 모델들은 텍스트로 통신한다. 내부 표현을 출력 토큰 시퀀스로 바꿔야 한다는 뜻이고, 여기서 두 가지를 잃는다.
- 의미 손실: 풍부한 내부 표현이 토큰으로 눌린다
- 지연: 토큰을 하나씩 생성해야 한다
그래서 묻는다. LLM이 텍스트 너머로 통신할 수 있는가.
2. Related Work¶
2.1 KV-Cache Sharing and Reuse, 2.2 Multi-LLM Systems로 나뉜다.
3. Method¶
3.2 Oracles for Cache-to-Cache Communication¶
본론에 들어가기 전에 두 가지를 먼저 확인한다. 이 설계가 이 논문의 가장 단단한 부분이다.
| 오라클 | 묻는 것 |
|---|---|
| Benefit | 시퀀스 길이를 늘리지 않고 KV 캐시의 의미를 풍부하게 만들어 능력을 올릴 수 있는가 |
| Convertibility | 한 모델의 KV 캐시를 다른 모델이 쓸 수 있는가 |
3.2.1 Cache Enrichment Oracle¶
few-shot 프롬프팅이 정확도를 올리는 이유를 가른다. 토큰을 더 많이 봐서인가, 아니면 질문이 캐시에 더 좋게 임베딩돼서인가.
설정 셋을 비교한다.
| 설정 | 방식 | 캐시 길이 | 정확도 |
|---|---|---|---|
| Direct | 질문만 prefill | 질문 길이 | 58.42% |
| Few-shot | 예시와 질문을 함께 prefill | 더 김 | 63.39% |
| Oracle | 예시와 함께 prefill한 뒤 예시 부분을 버리고 질문 부분만 남김 | 질문 길이 | 62.34% |
Oracle이 Direct보다 4%p 가까이 높다. 캐시 길이는 같다. 추가 토큰을 봐서가 아니라 질문 임베딩 자체가 좋아져서 오른 것이다.
레이어별 분석이 더 중요하다. 어떤 레이어는 캐시 강화로 좋아지고 어떤 레이어는 나빠진다. 성능이 좋은 상위 5개 레이어에만 적용하면 전체에 적용하는 것보다 약간 더 높고, 나쁜 레이어를 고르면 정확도가 떨어진다. 이 발견이 뒤의 게이팅 설계 근거가 된다.
3.2.2 Cache Transformation Oracle¶
Qwen3-4B의 KV 캐시를 Qwen3-0.6B로 옮기는 3층 MLP를 학습한다. t-SNE로 보면 원래 두 캐시는 표현 공간에서 멀리 떨어져 있는데, 변환 후에는 타깃 모델의 공간 안으로 들어간다.
여기서 저자들이 짚은 관찰이 날카롭다. 변환된 캐시가 타깃 공간의 더 작은 부분집합만 차지한다. 소스가 더 큰 모델인데도 그렇다. 각 모델이 맥락을 인코딩하는 방식이 본질적으로 다르다는 뜻이다.
이를 뒷받침하는 근거를 하나 더 든다. 모델들의 정답 집합이 겹치는 부분이 제한적이다. 전체 정확도는 비슷한데도 그렇다. 그래서 서로 다른 모델의 특화된 맥락 이해를 투영하고 융합하면 상보적 강점을 끌어낼 수 있다는 논리로 이어진다.
3.3 C2C Design¶
3.3.2 Fuser Structure¶
잔차 통합 원칙으로 설계했다. Receiver의 캐시를 파괴적으로 덮어쓰지 않는다.
| 모듈 | 역할 |
|---|---|
| Projection | Receiver 캐시와 Sharer 캐시를 이어 붙이고, 투영 층 다음 특징 융합 층을 통과시킨다 |
| Dynamic weighting | 입력을 보고 헤드별 가중치를 다시 매긴다 |
| Learnable gate | 레이어마다 학습 가능한 게이트 값을 두어 Sharer 맥락을 주입할지 말지 결정한다 |
게이트는 Gumbel-sigmoid에 온도 어닐링을 건다. 학습할 때는 미분 가능하고 추론할 때는 이진이 되도록 부드럽게 넘어간다.
3.3.3 Model Alignment¶
모델 계열과 크기가 다른 캐시를 섞으려면 두 층위를 맞춰야 한다.
- 토큰 정렬: 토크나이저가 다르면 같은 입력에서 다른 토큰 시퀀스가 나온다. Receiver 토큰을 문자열로 디코딩한 뒤 Sharer 토크나이저로 다시 인코딩한다. 일대다 대응이 생기면 문자열 커버리지가 가장 큰 Sharer 토큰을 고른다
- 레이어 정렬: 끝에서부터 맞춘다. 두 모델의 마지막 레이어를 먼저 짝짓고, 그다음 끝에서 두 번째를 짝짓고, 얕은 쪽 모델의 첫 레이어에 닿을 때까지 역순으로 간다
3.3.4 Training Scheme¶
Sharer와 Receiver는 둘 다 얼린다. C2C 모듈만 학습한다. 손실은 Receiver 응답에 대한 표준 next-token prediction이라 SFT와 같다. 다른 점은 Receiver가 자기 캐시가 아니라 융합된 캐시를 조건으로 예측한다는 것이다.
1. Forward 두 모델이 입력을 인코딩해 각자 KV 캐시를 만든다
2. Fusion C2C 모듈이 둘을 융합해 Receiver 캐시를 대체한다
3. Supervision Receiver가 융합 캐시로 응답을 prefill하고
그래디언트가 C2C 를 통해 역전파된다
4. Experiment¶
4.1 Setup¶
| 항목 | 내용 |
|---|---|
| 모델 계열 | Qwen2.5, Qwen3, Llama3.2, Gemma3 |
| 조합 다양성 | 세대, 계열, 크기(0.6B~14B), 특화(일반·코드·수학), 학습 단계(사전학습·명령 튜닝) |
| 베이스라인 | Text-to-Text 통신, 질의 단위 라우팅, 개별 모델 |
| 벤치마크 | OpenBookQA, MMLU-Redux, ARC-Challenge, C-Eval |
| 학습 데이터 | OpenHermes2.5 앞 50만 샘플 |
| 평가 | zero-shot, temperature 0, 최대 생성 64 토큰 |
| 지연 측정 | A100 1장, 배치 1 |
T2T 베이스라인은 분석 후 응답 방식이다. Sharer가 핵심 정보를 분석한 텍스트를 만들고, 그 텍스트를 원 질문에 이어 붙여 Receiver에 넣는다.
4.2 Main Results¶
| 비교 대상 | C2C의 우위 |
|---|---|
| Receiver 단독 | 평균 11.00% / 9.64% / 11.88% (Sharer 셋 각각) |
| Text-to-Text | 평균 5.36% / 4.15% / 3.06% |
| 질의 단위 라우팅 | 라우팅은 두 원본 모델 중 나은 쪽이 상한이라 구조적으로 불리 |
지연 표에서 눈에 띄는 대목이 있다. Qwen3-4B-Base를 Sharer로 쓸 때 T2T는 3.59초에서 7.54초가 걸리는데 C2C는 0.34초에서 0.49초다. Base 모델이라 분석 텍스트 생성이 길어져서다.
4.3 Scaling Behavior¶
시퀀스 길이 확장 (LongBenchV1, Qwen3-0.6B Receiver + Qwen2.5-0.5B Sharer)
| 길이 | Receiver | Sharer | T2T | C2C |
|---|---|---|---|---|
| 0-4k | 30.52 | 24.94 | 33.46 | 37.31 |
| 4-8k | 26.03 | 23.18 | 29.70 | 34.01 |
| 8k+ | 25.99 | 16.44 | 25.64 | 30.72 |
8k 이상에서 T2T가 Receiver 단독보다 나빠진다(25.64 대 25.99)는 점이 눈에 띈다. 긴 입력에서는 중간 텍스트를 끼워 넣는 것이 오히려 해가 되는데, C2C는 계속 이득을 낸다.
모델 크기 확장: Sharer가 커질수록 C2C의 이득이 T2T보다 빠르게 는다. 다만 Receiver가 크면 상대적 이득이 줄어든다. 베이스라인이 이미 강하고 Sharer와 지식이 많이 겹치기 때문이다.
4.4 Ablation Study¶
개선이 어디서 오는지 가른다.
| 설정 | 파라미터 | OpenBook | ARC-C | MMLU | C-Eval |
|---|---|---|---|---|---|
| Single (Sharer 없이 Receiver만 파인튜닝) | 596M | 45.80 | 47.65 | 36.81 | 35.81 |
| Identical (같은 모델을 Sharer와 Receiver로) | 529M | 50.60 | 52.52 | 42.17 | 40.34 |
| C2C (다른 모델) | 478M | 52.60 | 54.52 | 42.92 | 41.77 |
Identical만으로도 Single보다 크게 오른다. 융합 구조 자체가 이득이라는 뜻이다. 거기에 다른 모델을 쓰면 추가 이득이 붙는다. 파라미터는 오히려 C2C가 가장 적다.
모델 조합을 바꿔가며 다섯 가지를 시험했고 모두 T2T를 이겼다. MMLU-Redux에서 평균 8.59% 차이다.
5. Discussion¶
향후 방향 넷을 든다.
- 멀티 에이전트 시스템의 통신 기본 단위로 쓰기
- 교차 모달 협업: VLM, VLA 사이의 캐시 융합
- 추론 가속: speculative decoding 강화, 이종 모델 간 토큰 단위 라우팅
- 프라이버시: 명시적 텍스트 없이 캐시 조각만 전송하므로 내용 노출이 줄어든다
한계도 둘 적었다.
- 훨씬 약한 Sharer가 잡음을 주면 강한 Receiver의 성능이 떨어진다. T2T도 같은 문제를 가지며, Sharer의 의미 품질이 Receiver 성능에 직결된다
- 통신하는 LLM 수를 늘릴 때 학습 비용이 문제다. 쌍 단위 통신은 되지만 확장은 열린 문제다
6. Conclusion¶
LLM이 텍스트 너머로 통신할 수 있다는 것이 이 논문의 주장이다. KV 캐시를 변환하고 융합해 직접 의미 통신을 하는 일반 패러다임을 제시했고, 다양한 과제와 모델 구성에서 텍스트 통신보다 성능과 효율이 모두 나았다.
읽을 때 감안할 것¶
- 벤치마크가 전부 객관식이다. OpenBookQA, MMLU-Redux, ARC-C, C-Eval은 모두 선택지에서 고르는 과제이고 최대 생성 길이가 64토큰이다. 긴 생성이나 열린 응답에서 어떻게 되는지는 이 결과로 알 수 없다. LongBench 실험이 있지만 그쪽도 정확도 지표다.
- Receiver가 작은 모델일 때의 결과가 대부분이다. 주요 실험에서 Receiver는 Qwen3-0.6B급이다. 저자들도 Receiver가 크면 상대 이득이 준다고 인정한다. 큰 모델끼리의 협업에서 같은 이득이 나온다는 근거는 없다.
- 쌍 단위에 묶여 있다. 모델 두 개 사이의 통신이고, 셋 이상으로 늘릴 때의 학습 비용이 열린 문제라고 저자들이 직접 밝힌다. 실제 멀티 에이전트 시스템은 대개 셋 이상이다.
- 조합마다 fuser를 새로 학습해야 한다. Sharer와 Receiver 쌍이 정해져야 학습이 되므로, 모델을 바꾸면 다시 학습해야 한다. 텍스트 통신의 최대 장점인 무학습 조합 가능성을 잃는다.
- 2.5배 속도는 T2T 대비다. Receiver 단독 대비가 아니다. 두 모델을 다 돌려 캐시를 만들어야 하므로 단일 모델보다는 느리다. 표의 Time 열을 보면 C2C가 Receiver 단독보다 대체로 느리다.
- 약한 Sharer가 해가 된다는 한계가 실무에서 크다. 어떤 Sharer를 붙일지 사전에 판단할 방법이 없으면, 조합에 따라 성능이 떨어질 수 있다.
- 토큰 정렬이 근사다. 디코딩 후 재인코딩하고 일대다 대응에서 커버리지가 큰 것을 고르는 방식이라, 토크나이저 차이가 클수록 정보가 샐 여지가 있다.
가져갈 지점¶
- few-shot의 이득을 두 갈래로 쪼갠 실험 설계
"토큰을 더 봐서인가, 임베딩이 좋아져서인가"를 가르려고 예시와 함께 prefill한 뒤 예시 구간을 버리는 오라클을 만든 것이 깔끔하다. 같은 캐시 길이에서 비교하므로 원인이 하나로 좁혀진다. 어떤 개선이 왜 생기는지 물을 때 쓸 수 있는 설계 패턴이다.
- 레이어마다 효과의 부호가 다르다
캐시 강화가 어떤 레이어에서는 도움이 되고 어떤 레이어에서는 해가 된다는 발견, 그리고 상위 5개만 고르는 편이 전체에 적용하는 것보다 낫다는 결과가 중요하다. 개입을 전 구간에 균일하게 걸면 좋은 곳의 이득이 나쁜 곳의 손해로 상쇄된다. 그래서 학습 가능한 게이트를 둔 것이다.
- 모델마다 정답 집합이 별로 안 겹친다
전체 정확도가 비슷해도 맞히는 문제가 서로 다르다는 관찰이 멀티 모델 시스템의 존재 이유다. Agentic AI: Single vs Multi-Agent Systems 노트가 다룬 판단과 같은 자리를 정량으로 짚는다.
- KV 캐시를 통신 매체로 보는 관점
DeepSeek-V4.1-Flash 노트가 KV 캐시를 줄여야 할 비용으로 다뤘다면, 이 논문은 실어 나를 정보로 다룬다. 같은 대상을 정반대 방향에서 본다. 캐시를 압축하면 통신에 실을 의미도 줄어들 텐데, 두 방향이 만나는 지점은 아직 아무도 다루지 않았다.
- 잔차 통합과 부드러운 이진 게이트
기존 표현을 덮어쓰지 않고 더하는 방식, 그리고 Gumbel-sigmoid 온도 어닐링으로 학습 때는 미분 가능하고 추론 때는 이진이 되게 하는 장치는 다른 주입 구조에도 그대로 옮길 수 있다.
결론¶
"모델끼리 왜 꼭 텍스트로 말해야 하는가" 라는 질문이 이 논문의 값어치다. 멀티 LLM 시스템에서 텍스트를 중간 매체로 쓰는 것이 관행이었는데, 그 관행이 의미를 잃고 지연을 만든다는 점을 지적하고 대안을 실제로 만들었다.
설계에서 배울 것은 오라클 두 개를 먼저 세운 순서다. "이득이 있는가"와 "변환이 되는가"를 각각 확인한 뒤에 본 방법을 만들었다. 둘 중 하나라도 아니었으면 방법 자체가 성립하지 않는다.
다만 객관식 벤치마크, 작은 Receiver, 쌍 단위 한정, 조합마다 재학습이라는 조건이 붙는다. 텍스트 통신의 무학습 조합 가능성을 포기하고 얻은 결과라는 점을 함께 봐야 한다.