오픈 LLM 아키텍처의 긴 컨텍스트 최적화

추론 모델과 에이전트 워크플로우의 확산으로 긴 컨텍스트 유지 비용이 핵심 병목으로 떠오르면서, 오픈 가중치 LLM들이 KV 캐시와 어텐션 연산을 대폭 줄이는 새로운 아키텍처를 도입하고 있습니다. 구글 젬마 4는 레이어 간 KV 공유를 통해 128K 컨텍스트에서 최대 6GB의 메모리를 절감하고, 레이어별 임베딩(PLE)으로 연산 비용 상승 없이 표현 용량을 확장했습니다. 최근 테크니컬 리포트의 정보 제한 속에서 모델 구성 파일(config.json)과 레퍼런스 구현 코드를 직접 분석하는 엔지니어링 접근법이 필수적인 분석 방식으로 자리 잡고 있습니다.

추론 모델과 에이전트 시대, 왜 롱컨텍스트 효율화인가

최근 오픈 가중치(Open-weight) 대형 언어 모델(LLM) 생태계의 주요 설계 흐름은 롱컨텍스트 효율성(Long-Context Efficiency)에 집중되고 있습니다. 복잡한 문제를 단계별로 풀어나가는 추론(Reasoning) 모델과 다단계 도구 사용을 수행하는 에이전트(Agent) 워크플로우가 대중화되면서, 모델이 더 많은 토큰을 더 오랫동안 활성 상태로 유지해야 하는 구조적 요구가 발생했기 때문입니다.

이러한 환경에서는 키-값 캐시(KV Cache) 크기, 메모리 트래픽, 어텐션 연산 비용이 전체 시스템의 주된 제약 조건으로 작용합니다. 이에 따라 최근 공개된 구글의 젬마 4(Gemma 4), 풀사이드(Poolside)의 라구나 XS.2(Laguna XS.2), ZAYA1-8B, 그리고 출시를 앞둔 딥시크 V4(DeepSeek V4) 등은 트랜스포머 블록 내부 구조와 어텐션 연산을 직접 수정하여 메모리 및 연산 비용을 절감하는 방식을 취하고 있습니다.

---

젬마 4(Gemma 4)의 크로스 레이어 KV 공유 메커니즘

구글이 공개한 젬마 4 제품군은 모바일 및 임베디드 장치를 위한 E2B와 E4B, 로컬 추론에 최적화된 26B MoE(Mixture-of-Experts), 그리고 고품질 및 사후 학습(Post-training) 편의성을 위한 31B Dense 모델로 구성됩니다. 이 중 임베디드 및 모바일 타깃의 E2B 및 E4B 모델에는 이전 레이어의 키-값 상태를 후속 레이어가 재사용하는 KV 공유(KV Sharing, 또는 Cross-Layer Attention) 기법이 적용되었습니다.

기존의 그룹 쿼리 어텐션(GQA)이 동일한 레이어 안에서 여러 쿼리(Query) 헤드가 키-값 헤드를 공유하는 방식이었다면, 젬마 4는 레이어 간에도 KV 프로젝션을 공유합니다. 후속 레이어는 자체적인 키·값 프로젝션을 계산하지 않고, 동일한 어텐션 유형(슬라이딩 윈도우 또는 풀 어텐션)을 가진 직전 비공유 레이어의 KV 텐서를 그대로 재사용합니다. 각 레이어는 고유한 쿼리 프로젝션을 유지하므로 독립적인 어텐션 패턴을 형성할 수 있으면서도 메모리 점유율을 대폭 낮춥니다.

모델명총 레이어 수독립 연산 레이어KV 공유 레이어128K 컨텍스트 KV 캐시 절감량(bfloat16)
Gemma 4 E2B35개15개20개약 2.7 GB
Gemma 4 E4B42개24개18개약 6.0 GB

젬마 4 E2B는 MQA(Multi-Query Attention)와 슬라이딩 윈도우 어텐션을 4:1 비율로 조합하여 사용합니다. 전체 35개 레이어 중 초기 15개 레이어만 자체 KV를 연산하고 나머지 20개 레이어는 이전 상태를 공유받아 재사용함으로써, 전체 KV 캐시 크기를 약 절반 수준으로 줄여 128K 컨텍스트 기준 2.7 GB의 메모리를 절감합니다. E4B 모델 역시 총 42개 레이어 중 18개 레이어에서 KV를 공유하여 동일 컨텍스트에서 약 6 GB의 메모리를 절감합니다.

---

레이어별 임베딩(PLE)을 통한 표현 용량 확장

젬마 4 E2B와 E4B 모델에 적용된 또 다른 설계는 레이어별 임베딩(Per-Layer Embeddings, PLE)입니다. 모델명의 접두사 'E'는 유효 파라미터(Effective parameters)를 의미합니다.

일반적으로 모델 용량을 줄이기 위해 레이어 수를 줄이거나 은닉 차원(Hidden Dimension)을 좁히면 주요 연산부의 표현력이 함께 손실됩니다. 반면 PLE 구조는 주요 트랜스포머 블록 연산을 유효 파라미터 크기 수준으로 유지하면서, 룩업(Lookup) 기반 파라미터인 레이어별 임베딩 테이블을 통해 표현력을 보충합니다.

  1. 입력 토큰 ID 룩업 및 토큰 임베딩 선형 투영
  2. 결합 및 레이어별 슬라이스 분할
  3. 트랜스포머 FFN 출력과의 게이팅 연산
  4. 은닉 차원 투영 및 정규화 후 잔차 추가

토큰 ID 룩업 결과와 일반 토큰 임베딩의 선형 투영값은 결합된 후 레이어별 슬라이스로 분할됩니다. 트랜스포머 블록 내부에서 어텐션 및 피드포워드(FFN) 잔차 업데이트가 완료된 후, 출력 은닉 상태는 해당 레이어의 PLE 슬라이스를 게이팅(Gating)하는 데 사용됩니다. 게이팅된 PLE 벡터는 다시 모델 은닉 크기로 투영되고 정규화(Normalize) 과정을 거쳐 추가 잔차(Residual)로 결합됩니다.

---

오픈 LLM 진영의 다각화된 어텐션 압축 흐름

긴 컨텍스트 연산 병목을 해결하기 위한 아키텍처 개편은 젬마 4 외에도 여러 오픈 가중치 모델에서 다양한 형태로 시도되고 있습니다.

이러한 흐름은 단순히 파라미터 수를 늘리는 방식에서 벗어나, 메모리 I/O와 KV 캐시 용량을 줄이면서도 긴 입력 시퀀스를 효율적으로 처리하는 아키텍처 최적화가 모델 설계의 중심축이 되었음을 보여줍니다.

---

기술 보고서의 한계와 소스코드 기반 분석 워크플로우

최근 주요 AI 연구소들이 공개하는 테크니컬 리포트는 과거에 비해 구체적인 아키텍처 세부 사항을 상세히 기술하지 않는 경향이 있습니다. 이에 따라 오픈 가중치 모델의 실제 구조적 변화를 정확히 파악하기 위한 엔지니어링 접근법의 중요성이 커지고 있습니다.

"공식 테크니컬 리포트로 시작하지만, 최근 기업 연구소의 오픈 가중치 모델 논문들은 과거보다 세부 정보가 부족한 경우가 많습니다. 다행히 허깅페이스 모델 허브(Hugging Face Model Hub)에 가중치가 공개되고 트랜스포머 라이브러리에서 지원된다면, 설정 파일(config.json)과 레퍼런스 구현 코드를 직접 검사하여 아키텍처 세부 사항을 파악할 수 있습니다. 작동하는 코드는 거짓말을 하지 않습니다."

허깅페이스의 `config.json`과 모델의 파이썬 레퍼런스 코드를 직접 교차 검증하는 수작업 분석은 논문에 생략된 레이어 연결 방식, 잔차 스트림(Residual stream) 변경점, 어텐션 헤드 공유 패턴 등의 상세 메커니즘을 명확히 규명하는 핵심 워크플로우로 활용되고 있습니다.

確認された数値

編集部の見解

LLM 아키텍처 경쟁은 이제 단순한 매개변수 스케일링을 넘어 KV 캐시 메모리 병목을 극복하는 고효율 연산 설계로 전환되었습니다. 특히 젬마 4의 PLE와 레이어 간 KV 공유는 제한된 하드웨어 리소스 환경에서 긴 컨텍스트 에이전트를 실현하기 위한 핵심 표준 패턴으로 자리잡을 가능성이 높습니다. 기술 보고서의 정보 은닉이 심화됨에 따라 오픈소스 레퍼런스 코드를 직접 분석하는 역량이 AI 엔지니어링 팀의 핵심 경쟁력이 될 것입니다.

未確認の点

出典

カタログへ