긴 문맥 연산 병목과 아키텍처 진화의 배경
최근 오픈웨이트 대규모 언어 모델(LLM) 아키텍처 설계의 중심축은 긴 문맥(Long-Context) 효율성 극대화로 명확하게 이동하고 있습니다. 자율 에이전트(Agent) 워크플로우와 다단계 추론(Reasoning) 모델이 확산되면서, 모델이 장시간 기억하고 다루어야 하는 토큰의 양이 기하급수적으로 늘어났기 때문입니다.
이러한 환경에서 모델의 처리 한계를 결정짓는 주요 병목은 연산량 자체보다 KV 캐시(Key-Value Cache)의 크기, 메모리 대역폭 트래픽, 그리고 어텐션(Attention) 연산 비용입니다. 이에 따라 오픈소스 진영의 주요 연구진들은 트랜스포머 블록, 잔차 스트림(Residual Stream), KV 캐시 구조를 재설계하여 이 병목을 해소하려는 시도를 이어가고 있습니다.
Gemma 4의 혁신: 레이어 간 KV 캐시 공유(Cross-Layer Attention)
구글이 공개한 오픈웨이트 모델군 Gemma 4는 모바일 및 임베디드 기기를 위한 E2B/E4B, 로컬 추론에 최적화된 26B MoE(Mixture-of-Experts), 고품질 dense 모델인 31B 등 다양한 제품군으로 구성되어 있습니다. 이 중 소형 모델인 Gemma 4 E2B 및 E4B에 적용된 가장 주목할 만한 구조적 변화는 레이어 간 KV 캐시 공유(Shared KV Cache) 방식입니다.
과거 NeurIPS 2024에서 발표된 Cross-Layer Attention 연구를 기반으로 상용 오픈 모델에 본격 적용된 이 구조는, 상위 레이어가 하위 레이어에서 이미 계산된 Key-Value 상태를 재사용하도록 설계되었습니다.
- Gemma 4 E2B 구조: 총 35개 트랜스포머 레이어 중 초기 15개 레이어만 자체 KV 프로젝션을 계산하며, 나머지 20개 레이어는 이전 레이어의 KV 텐서를 재사용합니다.
- Gemma 4 E4B 구조: 총 42개 레이어 중 24개 레이어가 독립 KV를 계산하고, 후속 18개 레이어는 이를 공유합니다.
- 어텐션 매핑 방식: 정규 GQA(Grouped Query Attention, E2B의 경우 1개의 KV 헤드를 사용하는 MQA 특수 형태)와 슬라이딩 윈도우 어텐션이 4:1 패턴으로 결합되어 있으며, 공유 레이어는 동일한 어텐션 유형을 가진 직전 비공유 레이어의 KV 텐서만을 참조합니다.
| 모델명 | 전체 레이어 수 | 독립 계산 레이어 | KV 공유 레이어 | 128K 문맥 시 절감량 (bfloat16) |
|---|---|---|---|---|
| Gemma 4 E2B | 35개 | 15개 | 20개 | 약 2.7 GB |
| Gemma 4 E4B | 42개 | 24개 | 18개 | 약 6.0 GB |
각 레이어는 쿼리(Query) 프로젝션을 독자적으로 계산하여 고유한 어텐션 패턴을 형성할 수 있는 표현력을 유지하면서도, 메모리를 과도하게 점유하는 KV 캐시 용량을 절반 수준으로 줄여 장기 문맥 구동 환경의 오버헤드를 대폭 낮췄습니다.
파라미터 용량을 확장하는 레이어별 임베딩(PLE)
Gemma 4 E 시리즈 모델명에 포함된 'E'는 실효 파라미터(Effective Parameters)를 의미합니다. 연산 집약적인 메인 트랜스포머 블록의 크기는 작게 유지하면서 표현 용량을 확장하기 위해 레이어별 임베딩(Per-Layer Embeddings, PLE) 기법이 도입되었습니다.
- Gemma 4 E2B: 실효 파라미터는 2.3B이나, 임베딩 레이어를 포함한 총 파라미터는 5.1B입니다.
- Gemma 4 E4B: 실효 파라미터는 4.5B이나, 총 파라미터는 8B에 달합니다.
- 토큰 ID 조회 및 기본 임베딩 선형 투영
- 레이어별 슬라이스(ple_l) 패킹
- FFN 잔차 출력 기반 게이팅
- 정규화 후 추가 잔차 연결
PLE의 동작 메커니즘은 트랜스포머 반복 블록 외부에서 먼저 구성됩니다. 입력 토큰 ID를 통한 레이어별 임베딩 룩업 결과와 일반 토큰 임베딩의 선형 투영 결과가 결합된 후 레이어별 슬라이스로 분할됩니다. 트랜스포머 내부에서는 어텐션 및 피드포워드(FFN) 잔차 연산이 완료된 후 생성된 은닉 상태(Hidden State)를 활용해 해당 레이어의 PLE 벡터를 게이팅(Gating)합니다. 이후 모델 은닉 차원으로 역투영되어 정규화를 거친 뒤 추가 잔차로 더해집니다.
이는 무거운 어텐션이나 FFN 가중치를 확장하지 않고 캐싱 가능한 룩업 스타일의 파라미터 테이블을 활용함으로써, 연산 지연 시간을 최소화하면서 모델 용량을 확장하는 설계입니다.
어텐션 압축과 예산 할당 기법의 다변화
긴 문맥 처리 효율을 높이기 위한 아키텍처 개편은 다양한 모델군에서 동시다발적으로 전개되고 있습니다.
- Laguna XS.2: 유럽 기반 코딩 전용 LLM 기업인 Poolside에서 개발한 첫 오픈웨이트 모델로, 레이어 단위로 어텐션 자원을 차등 배분하는 레이어별 어텐션 예산 할당(Layer-wise Attention Budgeting) 기법을 적용했습니다.
- ZAYA1-8B: 합성곱 기반의 축소 메커니즘을 통합한 압축 합성곱 어텐션(Compressed Convolutional Attention)을 채택하여 토큰 간 상호작용 계산량을 최적화했습니다.
- DeepSeek V4: 다양체 제약 하이퍼 커넥션(mHC) 및 압축 어텐션(Compressed Attention) 설계를 채택하여 긴 문맥 추론 비용을 구조적으로 낮추었습니다.
이러한 최신 모델들은 기존의 MHA, GQA, MLA, 슬라이딩 윈도우 구조를 넘어 레이어 간 메모리 공유와 연산 압축을 결합하는 방향으로 진화하고 있습니다.
기술 문서 축소 시대의 오픈웨이트 아키텍처 검증법
최근 주요 기업 연구소들이 공개하는 오픈웨이트 모델의 공식 기술 보고서(Technical Report)는 과거에 비해 세부 아키텍처 사양을 상세히 기술하지 않는 경향이 짙어지고 있습니다.
"공식 논문이 예전보다 덜 상세해진 상황에서, Hugging Face Model Hub에 가중치가 공개되고 transformers 라이브러리가 지원된다면 설정 파일과 참조 코드를 직접 분석하는 것이 가장 정확합니다. 작동하는 코드는 거짓말을 하지 않습니다."
정확한 구조적 메커니즘을 파악하기 위해서는 공식 문서에만 의존하지 않고, 모델의 `config.json` 명세와 실제 파이썬 구현 코드를 직접 분석하여 잔차 경로의 변경점, 어텐션 헤드 할당 규칙, 캐시 텐서 공유 여부를 직접 확인하는 분석 작업이 필수적입니다.