AI 대량 해고 담론의 허상과 'AI 워싱'의 실체
최근 빅테크 및 IT 기업들의 대규모 감원 소식에서 AI 도입이 주된 원인으로 지목되는 경우가 빈번합니다. 하지만 실제 데이터를 심층 분석해보면, 이는 재무적 구조조정을 포장하기 위한 AI 워싱(AI washing) 현상에 가깝다는 증거들이 확인됩니다.
"경영진은 빠른 프로토타입을 만들 수 있기 때문에 AI의 유용성에 대한 착각에 빠지기 쉽지만, 이를 완제품으로 만드는 데 필요한 90%의 작업은 보지 못합니다."
- Block의 4,000명 감원: 창업자 잭 도시는 2025년 말 모델 성능 향상과 더 작고 평평한 조직 구조를 이유로 들었으나, 팬데믹 기간 인력을 3배 이상 늘린 후 발생한 막대한 재무적 압박이 주원인으로 지목되었습니다. 내부 데이터 사이언티스트는 생산성 향상이 극히 제한적이었다고 밝혔습니다.
- Snap의 1,000명 감원: CEO 에반 스피겔은 AI가 신규 코드의 65%를 생성한다고 언급하며 AI를 감원 사유로 내세웠으나, 실제로는 2017년 상장 이후 매년 순손실을 기록하고 주가가 30% 이상 하락한 가운데 행동주의 투자자의 비용 절감 요구에 따른 결과였습니다.
- Intuit의 3,000명 감원: 언론은 Anthropic 및 OpenAI와의 제휴를 이유로 AI 구조조정이라 보도했으나, CEO는 AI와 무관하며 관리 계층 축소와 조율 중심 직무 대상의 감원임을 밝혔습니다.
이러한 현상은 설문과 행정 데이터에서도 명확히 드러납니다.
- 미국 채용 담당자의 59%는 재무적 제약보다 AI를 채용 동결이나 해고 사유로 내세우는 것이 이해관계자들에게 더 유리하기 때문이라고 응답했습니다.
- 하버드 비즈니스 리뷰(HBR)의 경영진 1,000명 대상 조사에서, AI 도입 '예상'으로 인력을 감축한 비율은 21%였으나, 실제 AI 구현으로 인한 대규모 감축은 2%에 불과했습니다.
- 2025년 3월 뉴욕주 WARN Act(대량 해고 통보법)에 AI 사유 체크박스가 신설된 후 첫해 160건 이상의 신고 중 AI 항목을 체크한 기업은 단 1곳(Nespresso, 46명)뿐이었습니다.
연방준비제도(FRB) 경제학자들의 연구에 따르면, 소프트웨어 엔지니어 고용은 ChatGPT 출시 이후에도 계속 성장하고 있으며, 비-AI 가정 대비 연간 성장률이 약 3%포인트 둔화된 것에 그쳤습니다.
엔지니어링의 본질: '결정-실행-전달' 샌드위치 구조
AI가 개발자를 대체하지 못하는 근본적인 이유는 지식 작업의 구조에 있습니다. 소프트웨어 개발은 '결정(Decide) - 실행(Execute) - 전달(Deliver)'의 3단계 샌드위치 구조로 구성됩니다.
- 1. 의사결정 (요구사항 정의/설계)
- 2. 실행 (코드 작성/구현)
- 3. 전달 (통합/배포/조율)
AI 코딩 에이전트는 중간 단계인 '실행(코드 작성)'을 크게 압축하지만, 앞뒤의 의사결정과 전달 단계는 자동화에 강하게 저항합니다. 2019년 연구 및 마이크로소프트 개발자 6,000명 대상 조사에 따르면 개발자가 순수 코딩에 소비하는 시간은 9%에서 61% 수준에 불과합니다. 따라서 AI가 작성하는 코드 비율이 높아지더라도 전체 노동 대체율과는 직접적인 상관관계가 성립하지 않습니다.
로컬 코딩 에이전트 스택의 부상과 경제성
클라우드 기반 전용 서비스의 사용량 제한, API 비용 변동, 데이터 프라이버시 문제 및 벤더의 모델 스로틀링 위험에 대응하기 위해 오픈웨이트 모델 기반의 로컬 코딩 하네스(Local Coding Harness) 구축이 주목받고 있습니다.
로컬 에이전트 환경은 추론 엔진(Ollama, MLX, vLLM 등)과 코딩 작업을 수행하는 하네스(Qwen-Code, Codex, Claude Code, Pi 등)로 구성됩니다.
| 모델명 | 다운로드 크기 | 권장 RAM 사양 | 특징 및 성능 |
|---|---|---|---|
| Qwen3.6 35B-A3B | 약 22 GB | 30~40 GB | 하이브리드 어텐션, Qwen-Code 최적화, 50k 컨텍스트 구동 |
| Cohere North Mini Code 1.0 | 동급 크기 | 최대 30 GB | 동급 체급 내 강력한 대체 모델 |
| Gemma 4 e2b | 소형 | 약 8 GB | 30GB 미만 RAM 환경용 경량 모델 |
Nvidia의 Polar 논문(2026년 5월) 벤치마크에 따르면 베이스 모델은 전용으로 최적화된 하네스(Qwen 모델의 경우 Qwen-Code)에서 가장 우수한 코딩 성능을 발휘합니다. Apple Silicon Mac 환경에서는 Metal 성능 셰이더를 활용하는 `*-mlx` 모델을 사용할 때 메모리 관리와 토큰 생성 속도 측면에서 효율적입니다.
에이전트의 단절된 기억을 연결하는 영구 메모리 계층: funes
코딩 에이전트의 주요 한계 중 하나는 세션이 종료되면 이전 추론 맥락과 결정 배경이 사라지는 '세션 단절' 문제입니다. Hugging Face의 오픈소스 프로젝트 funes는 머신에 남아 있는 세션 기록을 에이전트가 탐색 가능한 영구 메모리로 전환합니다.
- 세션 로그 파싱
- 청킹 및 로컬 임베딩
- Lance 데이터셋 저장
- 하이브리드 검색 및 Cross-Encoder 재순위화
- 단일 파이프라인 구조: Claude Code, Codex, pi, Hermes 등 서로 다른 에이전트의 세션 로그를 동일한 턴/블록 형태로 정규화하여 로컬 Lance 데이터셋에 저장합니다.
- 하이브리드 검색: BM25와 벡터 검색을 결합한 후 크로스 인코더로 재순위화(Rerank)하고 최신성 가중치를 부여합니다.
- 원문 보존 및 투명성: 요약문으로 압축하지 않고 원본 턴과 에이전트 출처, 타임스탬프를 그대로 반환합니다.
- 저장소 바인딩: 개인 Hugging Face 데이터셋에 바인딩하여 머신 간 동기화가 가능하며, 크레덴셜 자동 마스킹 및 보안 스캐너를 거쳐 안전하게 관리됩니다.
컨텍스트 압축 vs 핸드오프 vs 리콜(Recall) 비용 비교
컨텍스트가 길어질 때 비용과 정확도를 비교한 벤치마크 결과는 다음과 같습니다.
- Compaction(요약 압축): 기본 에이전트 방식으로, 한 작업에서는 성공했으나 다른 작업에서는 중요 정보가 누락되어 정답 도출에 실패했습니다.
- Recall(funes 방식): 요약 없이 원문 패시지를 반환하여 두 가지 테스트 작업 모두에서 서면 핸드오프(Handoff) 대비 각각 8배, 4배 저렴한 비용으로 문제를 해결했습니다.
실제 디스크 내 19,195개 세션(LongMemEval 기반 308k 청크)을 대상으로 한 인덱싱 테스트에서 M4 Pro 랩톱 기준 2시간 3분이 소요되었으며, 30일 최신성 반감기 설정을 해제(`--half-life 0`)했을 때 Hit@1 19%, Hit@5 46%, Found@50 71%의 검색 성능을 기록했습니다.