AI 스웜 스케일링·생물학 워터마킹·자동화 실험실 벤치마크 심층 분석

토비 오드는 스웜 스케일링이 순차 추론 대비 월클락 타임을 절반으로 단축하나 토큰 소모는 2배, '스테핑 온 토즈' 파라미터로 규모 확대 시 수익 체감이 발생한다고 분석했습니다. 미국인 61%가 기업 자율 규제에 불신하며 정부 개입을 요구하는 여론조사 결과가 나왔습니다. 구글 딥마인드는 합성 생물학 전용 워터마킹 '신스아이디 바이오'를 개발해 VEGF-A 등 3개 단백질 실험에서 성능 저하 없이 탐지 신호를 심는 데 성공했습니다. C5R의 사이언스유니버스 벤치마크에서 클로드 페이블 5.1이 45.3% 패스율로 선두를 기록하며 AI 자동화 과학 실험의 현주소를 보여주었습니다.

스웜 스케일링: 병렬 추론의 새로운 스케일링 법칙과 한계 토비 오드(Toby Ord)는 최근 블로그 포스트에서 스웜 스케일링(Swarm Scaling)을 '새로운 형태의 추론 스케일링(inference-scaling)'으로 정의했습니다. 단일 에이전트가 긴 사고 사슬(Chain-of-Thought)을 생성하는 기존 방식과 달리, 여러 에이전트를 병렬로 투입해 월클락 타임(Wall-clock time)을 단축하는 접근입니다. 오드는 4-에이전트 스웜이 단일 에이전트와 동등한 성능을 내기 위해 총 토큰 수의 약 2배를 소모했으나, 에이전트당 토큰 수는 절반에 불과했다고 보고했습니다. 병렬 실행 덕분에 이론상 작업 완료 시간을 절반으로 줄일 수 있다는 것이 핵심입니다. ### '스테핑 온 토즈' 파라미터와 수익 체감 그러나 스웜 확장이 선형적으로 이뤄지지는 않습니다. 오드는 경제학에서 대규모 그룹 조정 시 관찰되는 '스테핑 온 토즈(Stepping on Toes) 파라미터 λ'를 도입했습니다. 에이전트 수를 10배 늘릴 때 단일 에이전트가 10배 토큰을 쓰는 것과 비교해 3배~5배 성능 향상(10^λ)에 그친다는 분석입니다. 이 격차는 규모가 커질수록 누적돼 스웜이 단일 에이전트 대비 점점 더 뒤처지는 양상을 보입니다. > 인용: “This means that scaling up the number of agents in the swarm by 10x doesn’t get as much performance as using 10x as many tokens with one agent. Instead it gets 10^λ x as much — which is 3x to 5x.” ### RSI 지능 폭발 가능성에 대한 시사점 오드는 당초 AI 에이전트의 λ 값이 낮아 재귀적 자기 개선(RSI) 기반 지능 폭발 가능성이 낮아지길 기대했으나, 관측된 λ 값이 이를 지지하지 않는다고 밝혔습니다. 스웜 스케일링이 지능 폭발 확률을 낮추기보다 높일 수 있다는 우려를 제기한 셈입니다. 이는 향후 AI 능력 예측 모델에 에이전트 수·조정 비용·병렬 효율이라는 새로운 변수를 추가해야 함을 의미합니다. ## 미국 여론: 기업 자율 규제 불신, 정부 개입 요구 미국 공동 AI 번영 센터(Center for Shared AI Prosperity, CSAIP)가 2,498명을 대상으로 실시한 여론조사에서 응답자의 61%가 주요 AI 기업들의 자발적 준수 약속을 '충분하지 않다'고 평가했습니다. 트럼프 지지층에서도 53%가 동일하게 응답해 정당을 초월한 불신 정서가 확인됐습니다. 또한 유권자 54%(해리스 지지 61%, 트럼프 지지 48%)가 '정부가 AI 규칙을 제정·집행해야 한다'고 답했습니다. ### 정치적 비대칭성과 규제 압력 이 같은 여론은 현 워싱턴 정치권의 느슨한 규제 기조와 정면으로 배치됩니다. CSAIP는 '유권자 선호와 정치적 행동 사이의 비대칭성이 본질적으로 불안정하다'고 진단하며, '정치 시스템에 에너지가 축적되고 있으며, 이것이 임계점에 달했을 때 어떤 결과가 나타날지 주목해야 한다'고 경고했습니다. ## 구글 딥마인드 '신스아이디 바이오': 합성 생물학 워터마킹 실증 구글 딥마인드는 합성 생물학 데이터 전용 워터마킹 제품군 '신스아이디 바이오(SynthID Bio)'를 공개했습니다. 아미노산 서열 선택적 치환과 예측 3D 구조의 원자 좌표 미세 조정을 통해 탐지 가능한 신호를 삽입하는 방식입니다. 데이터 유형에 따라 접근법을 다르게 적용하는 '패밀리' 구조를 채택했습니다. ### 습식 실험 검증 결과 딥마인드는 VEGF-A, SARS-CoV-2 스파이크 단백질 RBD, PD-L1 세 가지 표적 단백질에 대한 습식 실험(Wet-lab testing)을 수행했습니다. 그 결과 워터마크가 삽입된 설계가 비워터마크 버전과 히트율(Hit rate), 결합 친화도(Binding affinity), 자연 서열 다양성(Natural sequence diversity) 모두에서 동등한 성능을 보였음을 확인했습니다. > 인용: “In wet-lab testing across three target proteins (VEGF-A, the SARS-CoV-2 spike protein RBD, and PD-L1), our watermarked designs matched the hit rate, binding affinity, and natural sequence diversity of unwatermarked versions.” ### 생물보안 체계 내 위치 신스아이디 바이오는 AI 생성 생물학적 무기 위협에 대한 다층 방어 체계의 한 축으로 자리매김합니다. 물리적 제조 장비 모니터링, AI 공급자 분류기 등과 연계 운영돼야 실효성을 확보할 수 있다고 딥마인드는 강조했습니다. ## 사이언스유니버스: AI 자동화 실험실 벤치마크의 현재 C5R 코퍼레이션이 개발한 사이언스유니버스(SciUniverse)는 92개 태스크, 17개 태스크 패밀리로 구성된 자동화 실험실 운영 벤치마크입니다. 기본 시료 준비, 기기 제어, 프로토콜 적응, 실험 간 학습, 시설 관리, 실측 데이터 해석 등 실제 실험실 워크플로 전 단계를 포괄합니다. 화학(NMR 구조 할당), 생물학(세포 자유 시스템에서 sfGFP 발현), 재료과학(BaTiO₃ 펠렛 프레스) 등 다학제적 태스크를 포함합니다. ### 프론티어 모델 성능 비교 평가 결과 클로드 페이블 5.1(xhigh)이 패스율 45.3%, 태스크당 비용 $40.61로 선두를 차지했습니다. 뒤를 이어 GPT-5 아스트라(xhigh) 32.5%($52.37), 클로드 오퍼스 5(xhigh) 30.5%($46.31) 순이었습니다. | 모델 | 패스율(%) | 태스크당 비용($) | |---|---|---| | Claude Fable 5.1 (xhigh) | 45.3 | 40.61 | | GPT-5 Astra (xhigh) | 32.5 | 52.37 | | Claude Opus 5 (xhigh) | 30.5 | 46.31 | ### 자동화 과학자 향한 경고 신호 2026년이 AI 자동화 AI R&D 역량의 '경고 신호' 해였다면, 이제는 AI 자동화 과학 실험 역량에서도 동등한 경고 신호가 켜지고 있다는 평가가 나옵니다. 사이언스유니버스는 AI가 가상 추론을 넘어 물리적 실험 장비를 제어하며 실제 과학적 발견을 창출할 수 있는가를 측정하는 초기 척도 역할을 합니다. ## 종합: 스케일링·거버넌스·생물보안·자동화 과학의 교차점 이번 Import AI 475호는 AI 능력 확장의 새로운 축(스웜 스케일링), 사회적 수용성 한계(여론조사), 이중 용도 기술 안전장치(신스아이디 바이오), 실세계 영향력 측정(사이언스유니버스)이라는 네 가지 서로 다른 층위가 사실상 동일 시점에 동시 진화하고 있음을 보여줍니다. 스웜 스케일링이 추론 비용·시간 트레이드오프를 재정의하는 동안, 사회는 기업 자율 규제의 한계를 명확히 인지하고 정부 개입을 요구합니다. 한편 생물학·화학·재료과학 등 물리 세계 개입 능력이 벤치마크화되면서 '자동화 과학자' 도래 시계가 빨라지고 있음을 데이터로 확인할 수 있습니다. 이들 네 영역은 독립적이지 않습니다. 스웜 에이전트가 자동화 실험실을 24시간 가동하고, 그 결과물이 신스아이디 바이오 같은 워터마킹 체계 하에서 추적·관리되며, 거버넌스 프레임워크가 이 전체 파이프라인을 감시하는 통합적 AI-과학-안보 생태계가 형성되고 있습니다. 개발자·기업·정책 입안자는 단일 기술 지표를 넘어 시스템 차원의 상호작용을 설계해야 하는 시점에 와 있습니다.

Verified figures

Our take

스웜 스케일링은 추론 비용 대비 속도 이득을 주는 실용적 패러다임이나, λ 파라미터로 인한 규모의 비경제성이 대규모 배포 시 병목이 될 전망입니다. 여론조사 수치는 미국 입법부의 연내 강제 규제 법안 발의 가능성을 높이는 강력한 동력으로 작용할 것입니다.

Open questions

Models mentioned

ProviderInputOutputContext window
Anthropic: Claude Fable 5.1 · Anthropic$10$501,000,000
Anthropic: Claude Opus 5 · Anthropic$5$251,000,000

Source

Back to catalog