업무 에이전트 97.7% 성공, 부작용 1.9%: WorkBench 재시험을 읽는 법

업무 에이전트가 요청한 일을 끝냈다는 것과 그 과정에서 다른 사람에게 잘못된 메일을 보내지 않았다는 것은 서로 다른 질문입니다. WorkBench Revisited: Workplace Agents Two Years On은 이 두 축을 나란히 보여 줍니다. 표 1에서 Claude Fable 5는 작업 완료율 97.7%, 해로운 부작용률 1.9%를 기록했고, GPT-5.5는 각각 94.9%, 3.9%였습니다. 이는 저자들이 구성한 샌드박스 작업의 결과이지 회사 메일과 일정을 맡겼을 때의 사고 확률이 아닙니다. 이 글은 숫자를 구매 추천으로 바꾸기보다, 팀의 평가표를 어떻게 설계할지에 초점을 맞춥니다.

무엇을 끝냈고, 무엇을 잘못 건드렸나

논문은 24개 모델을 690개 업무 과제에 시험했습니다. 과제는 템플릿마다 10개씩 만들었고, 달력·메일·웹 분석·고객 관리·프로젝트 관리의 작은 데이터베이스 다섯 개와 읽기·쓰기 도구 26개를 사용합니다. 에이전트는 과제당 최대 20단계까지 도구를 호출하며, 최종 샌드박스 상태를 정답과 대조합니다. 특정 행동 순서를 따라 했는지 또는 다른 LLM 심판이 좋다고 평가했는지가 아니라 끝난 상태가 채점 대상입니다.

표 1의 완료율과 부작용률은 각각 모델별 전체 690개 과제를 분모로 합니다. 부작용은 잘못된 수신자에게 메일을 보내는 것처럼 의도와 다른 쓰기 행동입니다. 완료된 작업만을 분모로 한 사고율도, 현실의 실제 피해 건수도 아닙니다. 두 비율을 합해서 100%가 되어야 하는 상호 배타적 범주로 취급하지 마세요. 성공 여부와 잘못된 행동 여부를 별도 축으로 기록한 것입니다.

Claude Fable 5와 GPT-5.5의 690개 샌드박스 과제 완료율 및 해로운 부작용률을 별도 열에 표시

두 비율은 모델마다 전체 690개 과제가 분모다. 부작용은 잘못된 쓰기 행동이지 실제 조직의 사고율이 아니다. 출처: arxiv.org/html/2606.13715v2.

같은 표에는 과제당 추정 비용도 있습니다. Fable 5는 0.355달러, GPT-5.5는 0.206달러이며, Qwen3.5는 완료율 70.7%, 부작용률 21.4%, 과제당 0.003달러입니다. 가격만 싼 모델과 완료율이 높은 모델을 같은 성능의 대체재라고 읽어서는 안 됩니다. 논문은 입력·출력 길이를 대략 네 문자당 한 토큰으로 환산하고 호출마다 반복되는 시스템 지시와 도구 스키마 약 7,000토큰을 더한 뒤 표준 가격을 적용했습니다. 캐시는 반영하지 않은 청구서가 아닌 추정치입니다. 조직의 도구 호출 횟수와 캐시 정책이 다르면 비용도 달라집니다.

2024년 43%에서 2026년 97.7%로 곧장 선을 긋지 말 것

원 논문의 2024년 최고 GPT-4 완료율은 당시 구성에서 43%였습니다. 최신 표의 97.7%와 차이를 모두 모델 능력 향상이라고 계산할 수는 없습니다. 개정판은 정답 상태, 과제 문구, 채점 및 도구를 고쳤고, 자유형 텍스트에서 행동을 파싱하던 ReAct 대신 네이티브 구조화 도구 호출을 사용합니다. 과제 상태와 하네스가 같지 않습니다.

부록 A.1.1은 그 차이를 분리하려고 같은 GPT-4를 같은 재표본 방식으로 구판과 수정판에 다시 채점했습니다. 그 결과 구판 49%, 수정판 57%로 8%포인트 차이가 났습니다. 여기서 구판의 49%를 원 발표의 43%와 혼용해서는 안 됩니다. 49→57은 동일 모델에 대한 벤치마크 수정 효과를 보여 주는 비교이며, 43→97.7은 구판 당시 결과와 신판 최고 모델을 나란히 놓은 서술입니다. 적어도 56개 과제(8%)는 정답이나 문구가 바뀌었고, 채점 허용 여부 등까지 넓히면 약 90~95개(약 14%)가 영향을 받았다는 저자의 분석도 함께 확인해야 합니다.

2024년 발표 GPT-4 43%와 부록의 동일 모델 구판 49%에서 수정판 57% 통제 비교를 분리

49→57은 재표본한 동일 모델의 수정판 비교이고, 발표 당시 43%와 최신 97.7%는 직접적인 동일 조건 비교가 아니다. 출처: arxiv.org/html/2606.13715v2.

따라서 팀이 이전 평가와 새 평가를 비교한다면 모델명 옆에 과제 집합 버전·정답 버전·도구 스키마·호출 방식·채점 방식을 함께 적어야 합니다. 한 칸이라도 바뀌었다면 점수 차이를 시간에 따른 향상으로 단정하지 말고, 같은 모델을 양쪽 설정으로 재평가한 연결 실험을 요구하세요. 이것은 논문의 부록을 현장 평가 기록으로 옮긴 편집상 제안이지, 우리가 GPT-4를 다시 실행했다는 뜻은 아닙니다.

독자용 판단표: 파일럿의 통과 조건을 나누기

먼저 성공률과 부작용률을 별도 열로 읽고, 실제 도입에서는 잘못 보낸 메일이나 잘못 수정한 일정을 독립적인 차단 조건으로 둡니다. 다음 표는 저자의 샌드박스 결과와 한계에서 도출한 편집자의 설계 예시입니다. 수치 문턱은 조직의 피해 규모와 복구 가능성에 맞게 정해야 하므로 임의의 보편 합격선을 넣지 않았습니다.

평가 질문 남길 증거 파일럿 판단
요청한 최종 상태가 맞는가 과제별 전후 상태, 정답 기준과 미완료 사유 완료율만 높아도 쓰기 행동 검토는 계속
요청하지 않은 상태 변경이 있는가 잘못 보낸 메일·수정한 레코드의 대상과 복구 기록 피해가 큰 행동은 완료 성공과 무관하게 차단
검색 결과가 전체인가 쿼리·페이지 제한·재검색 흔적 최대 건수 응답이면 누락 가능성을 먼저 검토
비교한 단위가 같은가 원값·백분율·기간·분모 단위 불일치로 후속 작업을 건너뛰었다면 실패로 분류
전후 실험이 같은가 과제·정답·하네스·가격 산식 버전 설정이 다르면 직접적인 모델 향상 주장 보류

이 판단표는 논문 결과에서 도출한 편집자의 파일럿 설계 예시이며, 실제 조직의 사고율이나 특정 모델의 배포 안전성을 검증한 결과가 아닙니다. 특히 외부 발송과 삭제처럼 되돌리기 어려운 도구에는 승인·권한 분리·감사 로그를 붙여야 합니다. 읽기 전용 질의와 쓰기 도구를 한 개의 평균 성공률로 묶으면, 드물지만 중요한 잘못된 쓰기를 놓칩니다.

요청한 상태, 요청하지 않은 변경, 피해와 복구 가능성을 분리하는 업무 에이전트 파일럿 판단 흐름

완료 성공도 잘못된 발송을 면제하지 않는다. 논문에서 도출한 편집자용 도입 절차이며 검증된 자동 판정기가 아니다. 출처: arxiv.org/html/2606.13715v2.

아직 남은 실패를 테스트 케이스로 바꾸기

저자들은 구조화 호출 덕분에 옛 ReAct 형식 오류가 사라졌고, 프런티어 모델의 잘못된 일정 선택 같은 오류도 크게 줄었다고 봅니다. 그러나 부록 B.2에서는 참여 사용자 증가 백분율과 평균 세션 시간의 원값을 혼동해 필요한 후속 행동을 생략한 사례를 제시합니다. B.3에서는 검색 도구가 호출당 최대 다섯 결과만 반환하는데, 다섯 건을 보고 전체를 다 봤다고 생각한 사례가 나옵니다. 이들은 실제 관찰 사례이지 각 실패 유형의 발생률 추정은 아닙니다.

팀의 회귀 과제로 옮긴다면 서로 다른 단위를 조건식에서 비교할 때는 행동 전에 분모와 단위를 다시 확인하게 하고, 검색 결과가 반환 상한과 같을 때는 범위를 좁혀 재검색하거나 결과가 완전하지 않다고 알리게 합니다. 테스트에서는 정답뿐 아니라 잘못 쓰인 상태가 없는지도 검사하세요. 샌드박스의 상태 기반 채점이라는 장점을 유지하되, 상태 변경이 없는 순수 검색 답변은 이 방식만으로 채점할 수 없다는 논문의 한계도 분리해야 합니다.

검색 상한 다섯 건에서의 재검색과 백분율 대 원값의 단위 확인을 나란히 보여 주는 회귀 과제 도식

부록 B.2–B.3 관찰 사례를 회귀 과제로 재구성했다. 각 유형의 발생률이나 실제 제품 화면을 나타내지 않는다. 출처: arxiv.org/html/2606.13715v2.

어디까지 믿을 수 있나

논문의 데이터베이스는 실제 수년치 메일과 달력보다 작습니다. 공개 벤치마크에는 비공개 홀드아웃이 없어 2024년 이후 학습된 모델이 과제나 답을 보았을 가능성도 배제하지 못합니다. 저자도 시간에 따른 향상을 순수한 능력 진보의 확정치가 아니라 상한으로 읽으라고 경고합니다. 모델별 출시일을 잇는 곡선은 여러 공급자와 학습 목표를 섞은 기술적 그림이지 한 회사의 개선 속도를 증명하지 않습니다.

따라서 이 글의 결론은 “97.7%니까 자동 발송해도 안전하다”가 아닙니다. 공개 벤치마크는 후보를 거르고 실패 유형을 찾는 시작점입니다. 실제 도입 전에는 자기 조직의 권한·데이터 크기·검색 제한·되돌릴 수 없는 행동을 반영한 비공개 과제에서 완료와 부작용을 둘 다 측정해야 합니다. 이 글은 보존된 v2 논문 본문과 표·부록을 읽어 구성했으며, 모델 실행·독립 재현·운영 환경 사고 측정은 하지 않았습니다. 관련 내부 글의 정확한 공개 URL과 실질적 연관성을 이 단계에서 확인하지 못해 억지로 연결하지 않았습니다.

출처

댓글

이 블로그의 인기 게시물

체크아웃은 분리됐는데 Git 상태는 공유된다: Codex 0.154 worktree의 세 경계

잠근 작업이 커밋 뒤 다시 나온다: PostgreSQL 에이전트 큐의 소유권 설계

코딩 에이전트는 API 문서보다 AGENTS.md를 먼저 읽었다