Holo4 화면·코드·API 에이전트: 점수보다 하네스와 평가 분할을 먼저 보기

한 업무가 웹의 승인 버튼, 데스크톱 파일, 사내 API를 차례로 거친다면 GUI 전용 에이전트나 API 전용 에이전트 하나만으로는 빈틈이 생긴다. H Company의 Holo4 발표는 모델 하나가 화면 클릭·입력, 코드 실행, MCP/API 도구 호출을 오가도록 설계했다고 설명한다. 하지만 “여러 인터페이스를 다룬다”는 제품 설명과 우리 조직의 실제 업무를 안정적으로 마친다는 검증은 다르다. 여기서는 발표 수치를 결과 정의와 평가 조건으로 나눠 읽고, 혼합 업무를 시험할 때 기록할 표를 제안한다.

모델이 선택하고, 하네스가 실행한다

발표에는 27B 밀집형과 35B-A3B MoE 두 모델이 나온다. 27B 모델 카드의 Usage에 따르면 하네스가 스크린샷과 도구 결과를 모델에 전달하고, 모델이 요청한 클릭·입력·코드·도구 호출을 실행한 뒤 결과를 다시 보낸다. 즉 모델 가중치만 다운로드한다고 마우스나 사내 API 접근이 자동으로 생기는 것은 아니다. 화면 위치, 셸 권한, 도구 자격 증명, 네트워크와 감사 로그를 누가 제공하는지 확인해야 한다. 카드의 최대 컨텍스트 구성 값 262,144토큰도 모든 배포에서 그 길이의 작업이 성공한다는 보장은 아니다.

예를 들어 구매 요청을 처리한다면 화면에서 주문번호를 읽고, 승인 조건을 코드로 점검하고, 권한을 제한한 API로 상태를 조회한 다음 다시 화면에서 결과를 확인할 수 있다. 이것은 이해를 위한 가상 흐름이며 Holo4의 실제 구매 시스템 데모나 성공 사례가 아니다. 운영 평가에서는 각 인터페이스가 같은 주문을 가리키는지, 승인 전 쓰기를 막았는지, 잘못된 파일·계정에 접근하지 않았는지를 따로 검사한다. 모델 성능 점수 하나로 권한 설계를 대신할 수 없다.

가상 구매 요청을 화면 GUI, 코드와 셸, MCP와 API 순으로 처리하고 하네스의 권한 경계를 표시한 도식

혼합 인터페이스는 모델의 행동 제안과 하네스의 실제 실행·권한 검증을 분리해 살펴야 한다. 가상 업무 도식이며 실행 화면이 아니다. 출처: hcompany.ai/newsroom/holo4.

OSWorld 2.0: 부분 점수와 완전 성공은 다른 열

회사 발표의 Benchmark 표에서 Holo4 27B의 OSWorld 2.0은 평균 부분 점수 61.7%, 완전 성공 41.5%, 회사 API 요율을 적용한 작업당 토큰 비용 1.22달러다. “61.7%의 업무를 완수했다”로 바꾸면 결과 정의를 바꿔 말하는 셈이다. 각주에 따르면 이 시험은 회사 하네스에서 한 차례 실행했고, 비교표의 다른 업체 점수는 각기 다른 하네스·노력 설정·과제 부분집합·반복 횟수에서 온 공개 수치다. 따라서 다른 열의 비용과 성공률을 동일 예산 대조 실험처럼 비교할 수 없다. 1.22달러도 회사 요율로 환산한 토큰 비용이지 운영 인프라, 검토·재시도까지 포함한 총비용은 아니다.

OSWorld 2.0에서 27B의 평균 부분 점수 61.7%, 완전 성공 41.5%, 회사 API 토큰 비용 1.22달러를 분리한 비교 도식

61.7% 부분 점수는 41.5% 완전 성공과 다르며 1.22달러는 총 운영비가 아닌 제공자 요율의 토큰 비용이다. 출처: hcompany.ai/newsroom/holo4.

출시 설명의 OSWorld 85.2%와 0.08달러는 별도의 OSWorld 행이다. 이름이 비슷한 OSWorld 2.0의 장기 작업 점수·비용과 합쳐 “같은 평가에서 85.2% 성공에 1.22달러”라고 적을 수 없다. 더 길고 복잡한 업무에는 부분 완료가 실제 산출물로 연결되지 않는 경우가 있으므로, 중간 상태와 최종 인수 기준을 둘 다 보관해야 한다.

AutomationBench: 공개 600개와 미사용 120개

발표가 보고한 Holo4 27B의 AutomationBench 45.4%는 공개 v1.0.6 600개 과제의 점수다. 각주는 그중 480개가 훈련 데이터 수집에 포함된 분할, 120개가 홀드아웃이라고 구분하고, 홀드아웃 120개의 점수는 49.3%라고 별도로 적는다. 이 말은 480개 모두를 모델이 그대로 암기했다는 증거도 아니지만, 45.4%를 “완전히 보지 않은 테스트만의 성능”으로 소개해서도 안 된다는 뜻이다. 회사는 공식 비공개 세트 평가가 나오기 전까지 공개 세트 점수를 보고한다고 밝힌다. 조직 내부의 새 업무를 대표하는 성능이라고 추론하려면 분할과 데이터 접촉 가능성을 별도로 검토해야 한다.

AutomationBench 공개 600개 중 훈련자료 수집 분할 480개와 홀드아웃 120개의 비례 면적 및 서로 다른 점수 45.4%, 49.3%

공개 600개 점수 45.4%는 홀드아웃 120개의 49.3%와 분모가 다르다. 막대 길이는 480대 120 과제 수에 비례한다. 출처: hcompany.ai/newsroom/holo4.

점수를 움직인 것은 가중치만이 아니다

H Company는 훈련 외에도 하네스를 재구축했다고 설명한다. 긴 단계의 기억·문맥 관리, 데스크톱 머신의 셸 제공, 모델 서빙과 채점 오류 수정, 실행 단계·시간 예산 확대, 셸에서 데스크톱 제어 등이 발표의 Harness 항목에 함께 적혀 있다. 공개 점수의 변화만 보고 어느 개선분이 모델 가중치 때문이고 어느 부분이 하네스·예산 때문인지는 분리할 수 없다. 실제 도입 평가에서는 같은 모델이라도 하네스 버전이 다르면 다시 시험해야 한다. 셸과 클릭을 한 경로에서 다루는 편의성은 권한 상승 위험도 함께 가져오므로, 읽기 전용 시험 환경과 쓰기 승인 경계를 먼저 정한다.

27B 모델 카드의 가중치 라이선스는 CC BY-NC 4.0 비상업용이다. 기반 모델 Qwen3.8-27B의 Apache 2.0 표기가 Holo4 27B 가중치의 비상업 조건을 없애지는 않는다. 발표의 다른 크기나 API 이용 조건을 27B 카드 한 장으로 대신 판단하지 말고 해당 배포물의 라이선스·서비스 계약을 각각 확인하자. 이 글은 법률 자문이 아니다.

우리 팀의 혼합 업무 평가표

같은 업무 입력과 권한, 하네스, 최대 단계·시간을 고정하고 부분 점수와 완전 성공을 별도 열에 기록한다.

평가 단계 고정할 조건 남길 증거와 중단 기준
업무 표본 웹·데스크톱·API를 실제로 넘나드는 업무와 단일 인터페이스 업무를 구분한다. 동일 입력·초기 상태를 각 후보에 복제한다. 시작 상태, 정답 판정, 허용된 읽기/쓰기 범위. 유리한 성공 사례만 골라 평균 내지 않는다.
실행 경계 같은 권한, 도구 버전, 하네스, 단계·시간 한도와 실패 처리 규칙을 적용한다. 화면 행동, 코드·API 호출, 권한 위반, 중단 원인. 다른 하네스 점수와 같은 조건인 척 합치지 않는다.
결과 정의 중간 부분 완료와 최종 업무 완료를 분리한다. 부분 점수와 완전 성공, 사람이 수정한 단계, 재시도 횟수. 잘못된 계정에 쓴 경우 점수가 높아도 실패로 처리한다.
비용과 배포 API 요율과 자체 호스팅 자원, 검토 시간, 라이선스 범위를 각각 확인한다. 토큰 비용, 인프라·재시도·검토 비용. 비상업 가중치를 상업 운영 후보로 곧바로 배정하지 않는다.

이 표는 실험 결과가 아니라 시험을 설계하기 위한 틀이다. 첫 파일럿은 민감하지 않은 복제 환경에서 시작하고, 작업마다 금지된 경로 접근과 승인 없는 쓰기를 실패 조건으로 둔다. 적은 표본에서 높은 점수가 나와도 장기 흐름·예외 처리·조직의 권한 체계를 통과했다고 간주하지 않는다. 아래 평가는 발표와 모델 카드의 범위를 독자의 시험 설계로 바꾼 제안이며, 이 글은 모델 가중치 실행이나 벤치마크 재현을 하지 않았다.

권한 경계, 화면·셸·API 호출 기록, 부분 점수와 완전 성공, 비용과 라이선스 확인의 네 단계 파일럿 평가표

동일 조건의 업무 표본으로 모델과 하네스 효과를 분리하기 위한 편집상 설계표이며 독립 실험 결과는 아니다. 출처: hcompany.ai/newsroom/holo4.

출처와 범위: H Company — Holo4 발표 (Benchmark 표·각주, Harness, Run it yourself); Holo4-27B 모델 카드 (Model summary, Usage, License). 숫자는 제공자 보고이며 이 글의 구매 요청 예시와 평가표는 편집상 구성이다. 공개된 실행 궤적을 본문에서 재실행하거나 독립 채점하지 않았다.

댓글

이 블로그의 인기 게시물

체크아웃은 분리됐는데 Git 상태는 공유된다: Codex 0.154 worktree의 세 경계

잠근 작업이 커밋 뒤 다시 나온다: PostgreSQL 에이전트 큐의 소유권 설계

코딩 에이전트는 API 문서보다 AGENTS.md를 먼저 읽었다