Skip to content

최전선 Harness 분석

이 섹션에서는 강의에서 다룬 harness 이론을 현재 최전선의 실제 제품들과 하나씩 대조합니다. 각 제품에서 살펴볼 것은 단 하나, harness를 어떻게 설계했는가입니다. 즉, 모델을 둘러싼 엔지니어링 인프라인 명령, 도구, 환경, 상태, 피드백의 다섯 가지 하위 시스템과 컨텍스트 연속성, 초기화, 검증, 관찰 가능성, 인계, 루프 등의 핵심 메커니즘을 분석합니다.

모델의 추론 능력이 강한지, 특정 벤치마크 점수가 높은지는 의도적으로 다루지 않으며, "이 agent로 무엇을 할 수 있는가"도 포괄적으로 소개하지 않습니다. 그런 내용은 모델 계층과 제품 계층의 문제입니다. 여기서는 harness, 즉 모델 가중치 바깥의 모든 것만 분석합니다.

분석할 가치가 있는 이유

첫 번째 강의에서 설명했듯이 모델의 능력이 강하다고 해서 실행이 신뢰할 만한 것은 아닙니다. 같은 모델도 서로 다른 harness에 배치하면 성능이 한 자릿수 이상 차이 날 수 있습니다. 하지만 강의가 "어떻게 해야 하는가"를 설명한다면, 이 제품들은 "선도 팀이 실제로 어떻게 하는가"에 답합니다.

각 제품은 독립적인 설계 결정의 집합입니다. 이들을 나란히 비교하면, 서로 다른 팀이 같은 핵심 메커니즘을 완전히 다른 방식으로 구현한 모습을 볼 수 있습니다.

  • Pi는 harness를 극도로 단순한 커널과 프로그래밍 가능한 확장으로 구성하고, "최소한의 시스템 프롬프트 + 필요할 때 로드"하는 방식으로 컨텍스트 엔지니어링을 수행합니다.
  • Claude Code는 harness를 계층형 메모리, 5단계 compaction, permissions, hooks, subagent를 갖춘 완전한 실행 환경으로 만듭니다.
  • Codex는 harness 철학을 극한까지 밀어붙입니다. 저장소를 사실의 원천으로 삼고 AGENTS.md는 디렉터리 페이지로만 사용하며, worktree로 환경을 격리합니다.
  • DeepSeek Harness는 아예 harness 자체를 모델과 독립적인 런타임으로 정의합니다. Everything is a Plugin.

글 목록

읽는 방법

먼저 강의의 앞부분, 특히 강의 2: Harness란 정확히 무엇인가를 읽어 다섯 가지 하위 시스템 프레임워크를 익힌 다음, 여기로 돌아와 실제 제품이 이 메커니즘을 어떻게 구현하는지 살펴보기를 권합니다.

각 글의 끝에는 "강의 프레임워크에 매핑하기"와 "참고할 만한 설계"라는 두 섹션이 있습니다. 제품 설계를 강의 개념으로 빠르게 변환해 자신의 프로젝트에 바로 적용할 수 있도록 도와줍니다.