Gemma 4와 오픈 LLM 아키텍처의 긴 문맥 비용 절감 전략

최신 오픈 웨이트 거대언어모델(LLM)들은 추론 모델과 에이전트 워크플로우의 확산에 발맞춰 롱 컨텍스트 처리 효율성을 극대화하는 방향으로 진화하고 있습니다. 구글이 공개한 Gemma 4 제품군은 레이어 간 키-값(KV) 캐시를 공유하는 크로스 레이어 어텐션과 레이어별 임베딩(PLE) 기법을 도입해 메모리 점유율을 대폭 낮췄습니다. 본 리포트는 Gemma 4의 내부 블록 설계와 오픈 웨이트 모델 분석 프레임워크를 기반으로 효율 중심의 최신 LLM 아키텍처 동향을 분석합니다.

롱 컨텍스트 연산 병목과 새로운 아키텍처 설계 흐름

최근 오픈 웨이트 LLM 생태계의 주요 설계 과제는 롱 컨텍스트(Long-Context) 효율성 확보로 수렴하고 있습니다. 다단계 추론(Reasoning) 모델과 복잡한 자율 에이전트 워크플로우가 점차 더 많은 토큰을 오랫동안 메모리에 유지함에 따라, KV 캐시(Key-Value Cache) 크기, 메모리 트래픽, 어텐션 연산 비용이 전체 시스템의 주요 제약 조건으로 부상했습니다.

이에 따라 최신 오픈 모델들은 트랜스포머 블록 내부 구조, 레지듀얼 스트림(Residual Stream), 어텐션 연산 방식을 근본적으로 재설계하고 있습니다. 대표적인 사례로 구글의 Gemma 4가 도입한 KV 공유(KV Sharing) 및 레이어별 임베딩(PLE, Per-Layer Embeddings), 풀사이드(Poolside)의 코딩 특화 모델 Laguna XS.2의 레이어별 어텐션 예산 배분, ZAYA1-8B의 압축 합성곱 어텐션, 그리고 DeepSeek V4의 mHC 및 압축 어텐션 기법 등이 주목받고 있습니다.

Gemma 4 제품군 구성과 크로스 레이어 KV 공유

구글이 공개한 Gemma 4 스위트는 크게 세 가지 범주로 구성됩니다.

소형 모델인 E2B와 E4B의 핵심 아키텍처 변화는 레이어 간 KV 캐시를 공유하는 크로스 레이어 어텐션(Cross-Layer Attention)의 적용입니다. 기존 GQA(Grouped Query Attention)나 MQA(Multi-Query Attention)가 동일 레이어 내에서 쿼리 헤드 간에 KV 헤드를 공유했다면, Gemma 4는 후속 레이어가 이전 레이어에서 계산된 KV 텐서를 직접 재사용합니다.

  1. 토큰 입력
  2. 초기 비공유 레이어 KV 계산
  3. 후속 레이어에서 이전 레이어 KV 재사용
  4. 독립 Query 계산 후 결합

Gemma 4 E2B는 MQA와 슬라이딩 윈도우 어텐션(Sliding Window Attention)을 4:1 패턴으로 혼합 적용하며, 슬라이딩 윈도우 레이어는 직전 슬라이딩 윈도우 레이어의 KV를, 풀 어텐션 레이어는 직전 풀 어텐션 레이어의 KV를 재사용합니다. 각 레이어는 자체 쿼리(Query) 프로젝션을 독립적으로 계산하므로 고유한 어텐션 패턴을 형성할 수 있지만, 메모리 부담이 큰 KV 캐시는 상당 부분 재활용됩니다.

모델전체 레이어 수독립 KV 계산 레이어KV 공유 레이어128K 컨텍스트 캐시 절감량(bf16)
Gemma 4 E2B35개15개20개약 2.7 GB
Gemma 4 E4B42개24개18개약 6.0 GB

파라미터 효율성을 높이는 레이어별 임베딩(PLE)

Gemma 4 E2B 및 E4B 모델명에 붙은 'E'는 유효 파라미터(Effective Parameters)를 의미합니다. 전체 트랜스포머 블록의 연산 비용은 유효 파라미터 수준으로 유지하면서, 토큰별 표현력을 높이기 위해 레이어별 임베딩(PLE) 기술을 채택했습니다.

PLE 연산 과정은 트랜스포머 블록 외부에서 먼저 구성됩니다. 입력 토큰 ID는 레이어별 임베딩 룩업을 거치고, 일반 토큰 임베딩은 동일한 패킹 PLE 공간으로 선형 투영(Linear Projection)된 후 두 값이 합산·스케일링·재구성되어 각 레이어별 슬라이스로 분할됩니다.

트랜스포머 블록 내부에서는 어텐션 레지듀얼 업데이트와 피드포워드(FFN) 레지듀얼 업데이트가 정상적으로 수행됩니다. 이후 FFN 연산 결과로 도출된 은닉 상태(Hidden State)를 사용하여 해당 레이어 전용 PLE 벡터를 게이팅(Gating)합니다. 게이팅된 PLE 벡터는 다시 모델 은닉 차원으로 투영되고 정규화(Normalization)를 거쳐 추가적인 레지듀얼 업데이트로 더해집니다. 이 방식은 FFN이나 어텐션 가중치를 키우지 않고도 룩업 파라미터를 통해 모델 용량을 확보하는 구조적 대안을 제공합니다.

오픈 웨이트 모델 분석을 위한 실무 프레임워크

최근 산업계 연구소에서 공개하는 오픈 웨이트 모델의 공식 테크니컬 리포트는 과거에 비해 구체적인 아키텍처 설명이 축소되는 경향을 보입니다. 이에 따라 오픈 모델의 실제 동작 구조를 파악하기 위한 분석 워크플로우가 요구됩니다.

"작동하는 코드는 거짓말을 하지 않습니다(Working code doesn't lie)."

Hugging Face Model Hub에 가중치가 공개되고 `transformers` 라이브러리에서 지원되는 모델의 경우, 설정 파일(`config.json`)과 레퍼런스 구현 코드를 직접 검증하는 수동 분석 방식이 구조적 세부 사항을 파악하는 실질적인 접근법으로 활용됩니다. proprietary 모델(ChatGPT, Claude 등)과 달리 오픈 웨이트 모델은 내부 블록의 레지듀얼 결합 방식과 텐서 셰이프(Shape) 변화를 직접 코드로 확인할 수 있어, 실제 모델 배포 및 커스텀 서빙 인프라 최적화에 기여합니다.

Belegte Zahlen

Unsere Einschätzung

단순한 파라미터 스케일링을 넘어 KV 캐시 공유와 레이어별 임베딩 같은 미세 아키텍처 튜닝이 온디바이스 및 고효율 추론의 핵심 승부처가 되고 있습니다. 향후 롱 컨텍스트 에이전트 시스템이 보편화됨에 따라 메모리 병목을 극복하는 하이브리드 어텐션 설계가 오픈 모델의 표준으로 자리잡을 것으로 평가됩니다.

Offene Fragen

Erwähnte Modelle

AnbieterEingabeAusgabeKontextfenster
Google: Gemma 4 31B · Google$0.09$0.34262,144

Quelle

Zurück zum Katalog