Google DeepMind AutoHarness: 작은 모델이 큰 모델을 이기는 하네스 엔지니어링 증명
Google DeepMind 연구팀이 AutoHarness 논문을 공개했다. AI 에이전트에 실행 가능한 코드 하네스를 자동으로 씌워서, 작은 모델(Gemini-2.5-Flash)이 큰 모델(Gemini-2.5-Pro, GPT-5.2)을 이기게 만드는 프레임워크다. 하네스 엔지니어링이 학술적으로 정의되는 순간이다.
Kaggle GameArena 체스 대회에서 Gemini-2.5-Flash의 패배 원인을 분석한 결과가 충격적이었다. 패배의 78%가 잘못된 전략 때문이 아니라, 체스 규칙상 허용되지 않는 불법 수(illegal move) 때문이었다. 모델은 전략을 알고 있었지만, 규칙에 맞는 행동으로 변환하는 과정에서 실패한 것이다. Google DeepMind의 6명의 연구자(Xinghua Lou, Miguel Lázaro-Gredilla, Antoine Dedieu, Carter Wendelken, Wolfgang Lehrach, Kevin P. Murphy)는 이 문제를 해결하기 위해 AutoHarness를 설계했다. 2026년 2월 arXiv에 공개(arXiv:2603.03329)되고, ICLR 2026 Recursive Self-Improvement 워크숍에서 발표되었다.
| 항목 | 내용 |
|---|---|
| 논문 제목 | AutoHarness: Improving LLM Agents by Automatically Synthesizing a Code Harness |
| 저자 | Xinghua Lou 외 5인 (전원 Google DeepMind) |
| arXiv | 2603.03329 (2026년 2월 10일) |
| 발표 | ICLR 2026 Recursive Self-Improvement Workshop |
| 핵심 발견 | Gemini-2.5-Flash + 하네스 > Gemini-2.5-Pro (하네스 없음) |
| 벤치마크 | 145개 TextArena 게임, 불법 행동 100% 제거 |
| 핵심 수치 | Gemini 패배의 78%가 전략 실패가 아닌 불법 수 때문 |
AutoHarness가 해결하는 문제는 무엇인가?
AI 에이전트의 실패 원인 대부분은 "모델이 멍청해서"가 아니라 "모델이 환경의 규칙을 지키지 못해서"다. Gemini-2.5-Flash의 체스 패배 78%가 전략 실패가 아닌 불법 수(illegal move)에서 발생했다. AutoHarness는 에이전트의 행동에 규칙 준수 레이어를 자동으로 씌워서 이 문제를 구조적으로 해결한다.
이것은 체스에만 해당하는 문제가 아니다. 기업 환경에서 AI 에이전트가 실패하는 패턴도 동일하다. 보고서를 쓸 때 존재하지 않는 논문을 인용하고(딜로이트 사건), 코드를 생성할 때 런타임 에러를 일으키고, API를 호출할 때 잘못된 파라미터를 전달한다. 모델은 "무엇을 해야 하는지"는 알지만, "어떻게 하면 규칙에 맞는지"에서 실패한다. 하네스는 이 간극을 메운다.
AutoHarness는 어떻게 작동하는가?
AutoHarness는 두 가지 모드로 작동한다. Action-Verifier 모드는 모델의 행동을 실시간으로 검증하고 불법 행동을 차단한다. Code-as-Policy 모드는 전체 의사결정 로직을 실행 가능한 코드로 변환해 모델 호출 자체를 제거한다.
모드 1: Action-Verifier: 행동을 검증하고 차단한다
모델이 행동을 제안하면, 하네스가 규칙 적합성을 실시간으로 확인한다. 불법 행동은 거부하고, 모델에게 다시 제안하도록 요청한다(rejection-sampling loop). 모델은 여전히 전략을 담당하고, 하네스는 규칙 준수만 담당한다. 가장 작은 코드 패치로 가장 큰 효과를 얻는 접근이다.
모드 2: Code-as-Policy: 로직 자체를 코드로 만든다
모델이 한 번 프로그램을 작성하면, 이후 추론 시점에서는 LLM 호출 없이 그 프로그램이 직접 실행된다. 비용이 극적으로 줄어들고, 결정론적 행동이 보장된다.
하네스 생성 방법: 프로그램 공간 탐색
하네스를 사람이 작성하는 것이 아니라, 자동으로 생성한다는 점이 AutoHarness의 핵심이다. LLM(Gemini-2.5-Flash)이 하네스 코드의 변이(mutation) 연산자 역할을 하고, Thompson 샘플링 기반 트리 탐색으로 최적의 하네스 구조를 찾는다. 환경에서 피드백을 받아 여러 라운드에 걸쳐 하네스를 정제한다.
벤치마크 결과는 어떤가?
145개 TextArena 게임에서 테스트한 결과, Action-Verifier 모드는 불법 행동을 100% 제거했고, Gemini-2.5-Flash + 하네스가 하네스 없는 Gemini-2.5-Pro를 능가했다. Code-as-Policy 모드는 16개 단일 플레이어 게임에서 Gemini-2.5-Pro와 GPT-5.2-High보다 높은 보상을 달성하면서 비용은 더 낮았다.
| 구성 | 불법 행동 | 성능 |
|---|---|---|
| Gemini-2.5-Flash (하네스 없음) | 패배의 78%가 불법 수 | 기준선 |
| Gemini-2.5-Flash + Action-Verifier | 0% (완전 제거) | Gemini-2.5-Pro 능가 |
| Gemini-2.5-Flash + Code-as-Policy | 0% | Gemini-2.5-Pro, GPT-5.2-High 능가 (더 낮은 비용) |
작은 모델 + 좋은 하네스 > 큰 모델 + 하네스 없음. 이것이 하네스 엔지니어링의 핵심 명제이고, Google DeepMind이 145개 게임에서 실증한 결과다.
하네스 엔지니어링이 학문으로 정립되고 있다는 신호는?
AutoHarness는 단독 논문이 아니다. 2026년에 들어 하네스 관련 논문이 연속으로 발표되면서, 하네스 엔지니어링은 독립적인 연구 분야로 정립되고 있다.
- Lilian Weng의 서베이(2026년 7월 4일): "Harness Engineering for Self-Improvement" 제목으로 35개 이상의 논문을 종합 정리. 하네스를 "베이스 모델을 둘러싸고, 실행을 조율하고, 사고와 계획을 결정하고, 도구를 호출하고, 맥락을 관리하고, 결과를 평가하는 시스템"으로 정의. 재귀적 자기 개선(RSI)이 가중치 재학습이 아니라 하네스 진화를 통해 일어날 수 있다고 주장
- HarnessCompass(arXiv:2608.01918, 2026년 8월): SWE-bench Verified에서 GPT-5.4의 Pass@1을 54%에서 66%로 향상. 5회 반복만으로 12%p 개선
- Harness-R1(arXiv:2608.02276, 2026년 8월): 9B 파라미터의 "하네스 엔지니어" 모델이 실패 궤적에서 학습해 하네스를 자동 패치. Qwen3.5-9B의 코딩 벤치마크 점수를 44.3%에서 64.2%로 향상
- Continual Harness(arXiv:2605.09998): Google DeepMind 기여 포함. 연속적 하네스 적응으로 포켓몬 블루, 옐로 레거시, 크리스탈 엘리트 포를 클리어
6개월 사이에 Google DeepMind, 독립 연구팀, 그리고 Lilian Weng의 종합 서베이까지: 하네스가 AI 에이전트의 핵심 아키텍처 레이어로 인정받는 흐름이 형성되고 있다.
기업 AI 도입에 주는 시사점은 무엇인가?
AutoHarness의 가장 실용적인 교훈은 명확하다. 더 큰 모델을 사는 것보다, 기존 모델에 좋은 하네스를 씌우는 것이 더 효과적이고 더 저렴하다.
기업이 AI 에이전트를 도입할 때 가장 흔한 실수는 "더 좋은 모델을 쓰면 문제가 해결될 것"이라고 기대하는 것이다. AutoHarness는 이 가정이 틀렸음을 실증한다. Gemini-2.5-Flash(작은 모델)에 하네스를 씌우면 Gemini-2.5-Pro(큰 모델)보다 성능이 높고 비용은 낮다.
이것은 AX is의 하네스 엔지니어링 프레임워크(Prompt → Context → Harness → Loop)에서 세 번째 단계 Harness의 가치를 학술적으로 증명한 것이다. 프롬프트를 아무리 정교하게 쓰고(Prompt), 맥락을 풍부하게 제공해도(Context), 출력에 규칙 준수 레이어가 없으면(Harness 부재) 에이전트는 불법 행동을 한다. 딜로이트가 가짜 논문을 납품한 것도, Gemini가 불법 수를 둔 것도, 구조적으로 같은 문제다. 하네스의 부재.
Google DeepMind의 AutoHarness는 하네스 엔지니어링을 직관이나 경험론에서 학술적으로 검증된 방법론으로 격상시켰다. "작은 모델 + 좋은 하네스 > 큰 모델 + 하네스 없음"이라는 명제는 이제 145개 게임의 실험 데이터로 뒷받침된다. 기업이 AI 에이전트를 프로덕션에 배포하려면, 모델 선택보다 하네스 설계에 투자해야 한다. 딜로이트 사건이 하네스 부재의 대가를 보여주고, LLM-as-a-Judge 검증 에이전트가 하네스의 구현 방법을 제시하며, AutoHarness가 그 효과를 학술적으로 증명한다. 하네스 엔지니어링은 더 이상 선택이 아니다.
참고: AutoHarness (arXiv:2603.03329), Google DeepMind, ICLR 2026 RSI Workshop · Harness Engineering for Self-Improvement, Lilian Weng (2026.07.04)
이 주제의 전체 그림: 하네스 엔지니어링 총론
AI 에이전트에 하네스를 씌울 준비가 되셨나요?
하네스 엔지니어링 프레임워크 기반의 AI 에이전트 설계부터 검증 체계 구축까지, 기업 맞춤 AI 안전 체계를 함께합니다.
하네스 엔지니어링 상담하기