롱컨텍스트 시대의 병목과 구조적 전환
복합 추론 모델과 자율 에이전트 워크플로우의 확산으로 거대언어모델(LLM)이 단일 세션에서 유지해야 하는 토큰의 양이 급격히 증가하고 있습니다. 문맥 길이가 수만에서 수십만 토큰으로 확장됨에 따라 어텐션 연산 비용과 메모리 트래픽, 특히 KV 캐시(Key-Value Cache) 용량이 추론 인프라의 주요 한계로 대두되었습니다. 과거의 오픈소스 모델들이 주로 사전 학습 데이터 확장과 사후 정렬 기법에 집중했다면, 최근 공개되는 오픈 가중치(Open-weight) 모델들은 트랜스포머 블록 내부의 메모리 효율을 극대화하는 아키텍처 수준의 세부 설계를 도입하고 있습니다.
이러한 아키텍처 전환의 대표적인 흐름은 구글의 젬마 4(Gemma 4) 제품군을 비롯하여 풀사이드(Poolside)의 라구나 XS.2(Laguna XS.2), ZAYA1-8B, 딥시크 V4(DeepSeek V4) 등에서 뚜렷하게 관찰됩니다. 이들 모델은 단순한 어텐션 헤드 압축을 넘어, 레이어 간 상태 공유, 잔차 연결(Residual Stream) 내부의 임베딩 주입, 동적 어텐션 예산 할당 등 복합적인 엔지니어링을 결합하고 있습니다.
---
젬마 4의 효율화 핵심: 계층 간 KV 캐시 공유(Cross-Layer Attention)
구글이 공개한 젬마 4 제품군은 소형 임베디드 및 모바일용 'E2B'와 'E4B', 로컬 추론에 최적화된 26B MoE(Mixture of Experts), 사후 학습 편의성과 품질을 확보한 31B 덴스(Dense) 모델로 구성됩니다. 이 가운데 E2B와 E4B 모델은 메모리 제약이 극심한 엣지 환경을 겨냥해 KV 공유(KV-sharing, Cross-Layer Attention) 기법을 적용했습니다.
기존 트랜스포머는 각 레이어마다 독립적인 Key와 Value 프로젝션을 계산하여 캐시에 적재했습니다. 반면 젬마 4의 E 시리즈 모델은 특정 레이어 이후부터 선행 레이어에서 계산된 KV 텐서를 그대로 재사용합니다. 각 레이어는 자신만의 Query 프로젝션은 독립적으로 계산하여 고유한 어텐션 패턴을 형성하지만, 메모리를 많이 점유하는 KV 캐시는 공유된 텐서를 참조하는 방식입니다.
- 입력 토큰 임베딩
- 선행 레이어 독립 KV 생성
- 후속 레이어 KV 재사용 및 Query 독립 연산
- 메모리 절감 출력
이러한 아키텍처 설계는 슬라이딩 윈도우 어텐션(Sliding Window Attention)과 정규 GQA(Grouped Query Attention)의 4:1 패턴 구조와 결합하여 동작합니다. 슬라이딩 윈도우 레이어는 직전 비공유 슬라이딩 윈도우 레이어의 KV를, 풀 어텐션 레이어는 직전 비공유 풀 어텐션 레이어의 KV를 공유받습니다.
- Gemma 4 E2B 레이어 분할: 전체 35개 트랜스포머 레이어 중 초기 15개 레이어만 독립적인 KV 프로젝션을 계산하며, 나머지 20개 레이어는 선행 레이어의 KV 텐서를 공유합니다.
- Gemma 4 E4B 레이어 분할: 전체 42개 레이어 중 24개 레이어가 독립 KV를 계산하고, 나머지 18개 레이어는 KV를 공유하여 연산 및 메모리를 절감합니다.
| 모델명 | 전체 레이어 수 | 독립 KV 계산 레이어 | KV 공유 레이어 | 128K 컨텍스트 KV 캐시 절감량(bf16) |
|---|---|---|---|---|
| Gemma 4 E2B | 35개 | 15개 | 20개 | 약 2.7 GB |
| Gemma 4 E4B | 42개 | 24개 | 18개 | 약 6.0 GB |
전체 레이어의 약 절반에서 KV 캐시를 공유함으로써, 128K 롱컨텍스트 환경에서 bfloat16 정밀도 기준 수 기가바이트 단위의 VRAM을 즉각적으로 확보할 수 있습니다.
---
레이어별 임베딩(PLE)을 통한 파라미터 효율성 극대화
젬마 4 E 시리즈 모델에 적용된 또 다른 주요 메커니즘은 레이어별 임베딩(Per-Layer Embeddings, PLE)입니다. 모델 이름의 접두사 'E'는 'Effective(유효)' 파라미터를 의미하며, 모델의 주 연산 블록과 임베딩 테이블의 용량을 분리 설계한 구조를 나타냅니다.
- Gemma 4 E2B 파라미터 구성: 주 트랜스포머 연산 스택 기준 유효 파라미터는 2.3B, 임베딩 테이블을 포함한 총 파라미터는 5.1B입니다.
- Gemma 4 E4B 파라미터 구성: 주 트랜스포머 연산 스택 기준 유효 파라미터는 4.5B, 임베딩 테이블을 포함한 총 파라미터는 8.0B입니다.
| E2B 유효 파라미터(B) | 2.3 |
| E2B 전체 파라미터(B) | 5.1 |
| E4B 유효 파라미터(B) | 4.5 |
| E4B 전체 파라미터(B) | 8.0 |
PLE의 내부 동작 방식
PLE는 각 트랜스포머 블록에 독립적인 대형 임베딩 테이블을 복제해 두는 방식이 아닙니다. 연산 오버헤드를 제어하기 위해 단일 준비 단계와 계층별 슬라이싱 방식을 사용합니다.
1. 입력 토큰 ID가 레이어별 임베딩 룩업 테이블을 거칩니다. 2. 일반 토큰 임베딩이 동일한 패킹 PLE 공간으로 선형 투영(Linear Projection)됩니다. 3. 두 벡터가 합산, 스케일링, 리셰이프되어 레이어당 하나의 슬라이스를 갖는 텐서로 패킹됩니다. 4. 트랜스포머 블록 내부에서 어텐션 잔차 업데이트와 피드포워드(FFN) 잔차 업데이트가 순차적으로 수행됩니다. 5. FFN 이후의 히든 스테이트가 해당 레이어 전용 PLE 슬라이스 벡터를 게이팅(Gating)합니다. 6. 게이트된 PLE 벡터가 모델의 히든 차원으로 재투영되고 정규화된 후, 추가 잔차 업데이트(Residual Add)로 최종 결합됩니다.
이 구조를 통해 트랜스포머 스택 자체의 연산량을 낮게 유지하면서도, 메모리 룩업 및 캐싱이 용이한 임베딩 파라미터를 통해 모델의 표현 용량을 대폭 확장합니다.
---
롱컨텍스트 최적화를 위한 최신 아키텍처 다변화 흐름
KV 캐시 공유 외에도 최신 오픈 가중치 모델들은 어텐션 연산 자체를 경량화하기 위한 독자적인 아키텍처를 도입하고 있습니다.
- ZAYA1-8B의 압축 합성곱 어텐션(Compressed Convolutional Attention): 합성곱 연산을 결합하여 시퀀스 축의 정보를 압축하고 어텐션 맵 계산의 메모리 점유율을 제어합니다.
- Laguna XS.2의 계층별 어텐션 예산 배분(Layer-wise Attention Budgeting): 코딩 전문 LLM 개발사인 풀사이드(Poolside)가 공개한 모델로, 모든 레이어에 일괄적인 어텐션을 적용하지 않고 계층의 역할에 따라 연산 자원을 차등 배분합니다.
- DeepSeek V4의 mHC 및 압축 어텐션: 다중 헤드 잠재 어텐션(MLA)과 희소 어텐션(DeepSeek Sparse Attention) 설계에 이어 mHC(Manifold-constrained Hidden Compression) 기반의 압축 기법을 고도화하고 있습니다.
---
오픈 모델 아키텍처 분석 워크플로우의 변화
최근 주요 AI 연구소들의 기술 보고서가 상세 아키텍처 수치와 구체적인 수식을 생략하는 경향을 보이면서, 모델의 실제 구조를 파악하기 위한 엔지니어링 분석 워크플로우가 변화하고 있습니다.
"기술 보고서의 설명이 과거보다 간소화되는 추세이지만, 허깅페이스 모델 허브(Hugging Face Model Hub)에 가중치가 공개되고 transformers 라이브러리에서 지원된다면 설정 파일(config.json)과 참조 구현 코드를 직접 검사할 수 있습니다. 작동하는 코드는 거짓말을 하지 않습니다."
기술 보고서의 텍스트에만 의존하지 않고, 모델 저장소의 `config.json` 파라미터 구조와 실제 실행되는 파이썬 참조 코드를 역분석(Inspection)하여 레이어 간 텐서 공유 여부, 슬라이스 차원, 잔차 연결 방식을 직접 확인하는 분석 방식이 오픈 모델 연구의 표준 절차로 자리잡고 있습니다.