NVIDIA가 AI 모델 간 KV 캐시 전송 기술 개발
NVIDIA의 연구팀이 여러 AI 모델을 조합한 시스템에서 모델을 전환할 때 발생하는 비용과 지연을 줄이는 '크로스모델 KV 캐시 전송' 기술을 발표했다. 선형 변환이라는 비교적 단순한 수학 처리를 사용하여 대응하는 모델 간에는 기존 재계산 방식보다 2.7배에서 25배 빠르게 처리할 수 있으며, 정확도도 대상 모델 단독 사용 시 최대 98%를 유지할 수 있음이 실험으로 확인되었다.

NVIDIA의 연구팀이 여러 AI 모델을 조합한 시스템에서 비용과 지연을 대폭 줄일 수 있는 기술을 개발했다. '크로스모델 KV 캐시 전송'이라고 불리는 이 기법은 한 모델이 보유한 대화 기록의 기억 데이터를 다른 모델이 사용할 수 있는 형식으로 변환하여 인수받을 수 있게 해준다. 실험에서는 대응하는 모델의 조합에서 기존 방식과 비교하여 2.7배에서 25배의 고속화를 달성했으며, 정확도도 대상 모델 단독 사용 시 최대 98%를 유지할 수 있음이 확인되었다.
이 기술이 해결하려는 과제를 이해하려면 LLM(대규모 언어모델)이 어떻게 대화를 처리하는지 알아야 한다. LLM은 입력을 받으면 먼저 '프리필'이라고 불리는 처리를 수행하여 지금까지의 대화 내용을 모두 읽어 들인 후 KV 캐시(키-값 캐시)라고 불리는 기억 영역에 저장한다. 그 이후의 '디코드' 단계에서는 이 캐시를 참조하면서 다음의 토큰(단어의 뭉치)을 순차적으로 생성해 나간다. 캐시가 있음으로써 과거의 대화 내용을 매번 처음부터 다시 계산할 필요가 없어지므로 처리가 효율화되는 구조다.
문제가 발생하는 것은 대화 중간에 모델을 전환하려고 할 때다. 예를 들어 AI 에이전트 시스템에서는 가벼운 처리는 작은 모델에 맡기고, 복잡한 추론이 필요한 단계에서 더 큰 모델로 인수받는 식의 설계가 있다. 하지만 모델이 다르면 내부 구조도 다르기 때문에 KV 캐시의 데이터 형식에 호환성이 없다. 이 때문에 전환을 할 때마다 인수받는 모델은 지금까지의 대화를 처음부터 다시 계산해야 하며, 이는 처리 비용과 응답 시간의 증가로 이어진다. 대화가 길어질수록, 모델이 클수록 이 재계산 비용은 커진다.
NVIDIA가 개발한 기법은 이 문제를 '선형 변환'이라는 비교적 단순한 수학적 처리로 해결한다. 송신 측 모델의 KV 캐시를 수신 측 모델이 기대하는 형식으로 변환하는 매핑을 수행함으로써 프리필 처리를 다시 실행하지 않고도 기억 데이터를 인수받을 수 있도록 했다. 심층 학습 모델과 같은 계산 비용이 높은 메커니즘을 사용하지 않는 것도 이 기법의 특징 중 하나다.
이 기술이 가지는 의의는 단순한 처리 속도 개선에만 머물지 않는다. 여러 LLM을 조합한 '멀티모델 워크플로우'는 비용 효율성과 능력의 최적화를 도모하는 데 있어 유망한 접근법으로 위치 지어지지만, 모델 전환마다 발생하는 재계산 비용이 병목이 되어 실용화의 장애물이 되어 온 측면이 있다. 크로스모델 KV 캐시 전송은 이 장애물을 낮출 가능성이 있으며, 장기적인 작업을 다루는 엔터프라이즈급 AI 시스템의 설계에 선택지를 제공한다는 관점에서 볼 수 있다.
한편, 실험의 결과는 어디까지나 '호환성이 있는 모델의 조합'에 있어서의 수치이며, 모든 모델 쌍에서 동일한 효과를 얻을 수 있는지는 현 시점에서 명확하지 않다. 아키텍처 차이가 큰 모델 간의 전송 정확도나 실제 프로덕션 환경에서의 동작에 대해서는 향후 검증이 필요한 영역으로 남아 있다. 이 기술이 어떤 모델·프레임워크에서 이용 가능하게 될지, 또 어떤 조건 하에서 효과를 발휘하기 쉬운지가 향후의 관심사가 될 것이다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.