AI 해고설의 허상과 'AI 워싱'의 실체
최근 빅테크 기업들을 중심으로 AI 기술 도입에 따른 대규모 정리해고 소식이 잇따라 전해졌으나, 실증적 데이터는 이러한 발표의 이면에 다른 현실이 존재함을 보여줍니다. 핀테크 기업 블록(Block)은 AI 도입에 따른 조직 효율화를 명분으로 4,000명의 인력을 감축했다고 발표했으나, 이는 팬데믹 기간 동안 인력을 3배 이상 확장한 데 따른 재무적 압박이 주원인이었습니다. 내부 엔지니어들의 증언에 따르면 인위적인 AI 도구 도입에도 불구하고 생산성 향상은 매우 제한적이었습니다.
이러한 현상은 다른 빅테크 기업에서도 유사하게 관측됩니다.
- 스냅(Snap): 에반 스피겔 CEO는 신규 코드의 65%를 AI가 작성하고 있다고 발표하며 1,000명을 해고했으나, 실제로는 행동주의 투자자의 비용 절감 요구와 장기적 적자가 원인이었으며 감축은 증강현실(AR) 조직 등 특정 부서(150명)에 집중되었습니다.
- 인투이트(Intuit): 3,000명의 구조조정 발표 당시 앤스로픽 및 오픈AI와의 파트너십이 부각되었으나, 경영진은 감축 사유가 AI가 아닌 과도한 중간 관리 계층 및 조율 업무 축소라고 해명했습니다.
설문 조사에 따르면 미국 채용 담당자의 59%가 재무적 한계보다 AI 도입을 채용 동결이나 해고의 명분으로 내세우는 것이 대외적으로 유리하다고 응답했습니다. 뉴욕주의 대량 해고 통보 규제인 WARN Act 데이터에서도 신고된 25,000여 명의 해고 인력 중 AI 관련 체크박스가 표시된 인원은 네스프레소의 46명(약 0.2%)에 불과했습니다.
연방준비제도(FRB) 연구에 따르면 ChatGPT 출시 이후 소프트웨어 엔지니어 고용 증가율은 연간 약 3%포인트 둔화되었으나 전체 고용은 여전히 성장세를 유지하고 있습니다. 마이크로소프트의 6,000명 엔지니어 조사에서도 개발자가 실제 코드 작성에 투입하는 시간은 전체의 9%에서 61% 수준에 불과한 것으로 확인되었습니다. 소프트웨어 개발은 단순 구현(Execute) 외에 요구사항 결정(Decide)과 프로덕션 배포(Deliver) 단계가 공존하는 구조이기 때문에, 코드 생성 자동화만으로 직무 전체가 대체되지 않습니다.
세션 분절을 극복하는 영구 메모리 계층: funes
코딩 에이전트의 실질적 한계는 세션이 종료될 때마다 이전 작업의 맥락과 결정 배경이 사라지는 '세션 망각' 현상에서 기인합니다. 에이전트가 단일 머신이나 호스트를 이동할 때마다 초기 상태로 돌아가는 문제를 해결하기 위해 허깅페이스는 오픈소스 지속 메모리 도구인 funes를 공개했습니다.
- 세션 로그 수집
- 로컬 바이너리 증분 인덱싱
- Lance DB 하이브리드 검색
- Cross-Encoder 재순위화
- 세션 간 지속적 회상
`funes`는 클로드 코드(Claude Code), 코덱스(Codex), 파이(pi), 에르메스(Hermes) 등 다양한 코딩 에이전트의 실행 로그를 표준화된 턴(Turn) 단위 데이터로 파싱합니다. 머신러닝 런타임 종속성 없이 단일 바이너리로 동작하며, 로컬 환경에서 Lance 데이터셋에 증분 방식으로 기록됩니다.
검색 단계에서는 BM25 키워드 검색과 벡터 검색을 결합한 뒤 크로스 인코더(Cross-Encoder)로 후보군을 재순위화하고 최근성(Recency) 가중치를 적용합니다. 원본 데이터를 요약(Compaction)하지 않고 추출된 컨텍스트를 그대로 반환하기 때문에 세션 압축 시 발생하는 중요 정보 누락 문제를 원천 차단합니다.
벤치마크 평가 결과, 세션 간 인계 문서를 직접 작성하는 핸드오프(Handoff) 방식 대비 질의 비용이 과제에 따라 4배에서 8배 저렴한 것으로 나타났습니다. 또한 개인 저장소 단위로 허깅페이스 Hub와 동기화할 수 있으며, 인덱싱 및 업로드 과정에서 비밀번호나 인증 토큰 등 민감 정보를 자동 마스킹하는 보안 메커니즘을 내장하고 있습니다.
| 기억 유지 방식 | 실패율 및 정보 손실 | 상대적 토큰 비용 | 지원 구조 |
|---|---|---|---|
| 기본 세션 압축 (Compaction) | 요약 과정에서 중요 맥락 유실 발생 | 기준치 | 에이전트 내장 기본값 |
| 수동 인계 문서 (Handoff) | 문서 작성 누락 위험 존재 | 4x ~ 8x 고비용 | 개발자 직접 작성 |
| 증분 메모리 검색 (funes Recall) | 원본 턴 보존으로 맥락 무결성 유지 | 최저 비용 (1x) | 로컬 Lance + 하이브리드 인덱스 |
로컬 오픈웨이트 모델 기반 하네스 환경 구축
상용 API 서비스의 사용량 제한, 가격 정책 변경, 데이터 유출 위험에 대응하여 로컬 머신에서 오픈웨이트 LLM을 구동하는 에이전트 환경이 정착되고 있습니다. 세바스찬 라슈카(Sebastian Raschka)의 연구에 따르면, 국소 환경에서의 에이전트 구축은 하드웨어 전력 비용만으로 지속 운용이 가능하며 예측 불가능한 API 업데이트로 인한 파이프라인 중단을 방지할 수 있습니다.
로컬 에이전트 스택의 핵심 엔진으로는 Qwen3.6 35B-A3B 및 코히어(Cohere)의 North Mini Code가 주요 대안으로 활용됩니다. Qwen3.6 35B-A3B 모델의 경우 다운로드 크기는 약 22 GB이며, 구동 시 30~40 GB RAM이 요구됩니다. Mac 환경에서는 Metal 성능 셰이더를 활용하는 MLX 버전(`qwen3.6:35b-mlx`)을 통해 M4 칩셋 및 Linux 환경(DGX Spark)에서 안정적인 실행 속도를 제공합니다.
로컬 환경 구축 시 엔지니어링 고려 사항은 다음과 같습니다.
- 하네스(Harness) 결합성: 엔비디아의 'Polar: Agentic RL on Any Harness at Scale' 논문에 따르면, Qwen3.5 계열 모델은 범용 환경보다 전용 클라이언트인 Qwen-Code 하네스에서 가장 높은 코딩 벤치마크 성능을 기록했습니다.
- 서빙 프레임워크 선택: Ollama, vLLM, SGLang, MLX 등이 활용되며, 장기 컨텍스트(50,000 토큰 이상) 처리 시 프리필(Prefill) 속도 및 토큰 생성 안정성을 평가하는 벤치마크 수행이 권장됩니다.
- 자원 제약 환경: 30GB 미만의 메모리 환경에서는 `gemma4:e2b`(약 8GB RAM 점유)와 같은 소형 모델이 대안으로 사용될 수 있으나 복잡한 에이전트 추론 성능에는 한계가 존재합니다.
오픈 모델 진영의 경제학과 토큰 패권 다툼
개방형 에이전트 기술의 확산 이면에는 반도체 제조사와 빅테크 간의 치열한 플랫폼 전쟁이 존재합니다. 엔비디아(Nvidia)는 독점적인 폐쇄형 모델 생태계(OpenAI, Anthropic 등)에 대항하여 기업들이 자체 토큰 생성 파이프라인을 구축하도록 유도하고 있습니다. 이를 위해 데이터와 학습 레시피를 포함하는 네모트론(Nemotron) 등 개방형 모델 연구에 약 260억 달러를 투입하고 있습니다.
"엔비디아는 지능이 소수에게 독점되지 않고 누구나 토큰 기계를 구축할 수 있는 세상을 원합니다. 이는 엔비디아 제품을 구매하려는 막대한 추론 수요로 이어집니다."
오픈 생태계의 비즈니스 모델은 두 가지 양상으로 분화되고 있습니다.
- 인프라 수익 극대화: 엔비디아처럼 오픈 모델 확산을 통해 하드웨어 칩셋 판매를 견인하는 전략입니다.
- 보완재의 상품화(Commoditizing Complements): 메타(Meta)와 같은 하이퍼스케일러가 고성능 오픈 모델(Muse Spark 1.2 등)을 공개하여 경쟁사의 토큰 판매 수익 모델을 압박하고 자사 플랫폼 생태계를 확장하는 구조입니다.
최근 오픈 모델 진영에서는 기본 모델(Base Model)의 대규모 사전 학습보다 DeepSeek V4 Flash, GLM 5.X 등을 기반으로 특정 에이전트 작업에 맞게 파인튜닝하는 사후 학습(Post-training) 및 추론 특화 튜닝(Tinker 등 활용) 중심의 생태계가 급격히 형성되고 있습니다.
엔지니어링 패러다임의 변화
AI 코딩 에이전트는 엔지니어를 대체하는 것이 아니라, 세션 단위 도구에서 독립적인 인프라 자산으로 진화하고 있습니다. 로컬 하네스 기술과 지속성 메모리(`funes`)의 결합은 개발자가 특정 상용 플랫폼에 종속되지 않고 영구적인 프로젝트 컨텍스트를 유지할 수 있는 기반을 제공합니다.
향후 기업의 경쟁력은 단순히 상용 AI API를 연동하는 수준을 넘어, 사내 코드베이스의 결정 이력을 벡터와 텍스트 데이터셋으로 자산화하고 온프레미스 또는 로컬 하드웨어에서 이를 최적의 비용으로 인출하는 아키텍처 구축 여부에 좌우될 것입니다.