에이전트 한 명을 바꿨더니 소통 비용이 63% 늘었다: 멀티에이전트 교체의 숨은 상태
멀티에이전트 시스템에서 같은 역할의 에이전트는 서로 바꿔 끼울 수 있다고 생각하기 쉽다. 모델과 system prompt가 같고 도구 권한도 같다면 더 그렇다. 하지만 오래 함께 일한 에이전트는 과제 지식만 쌓지 않는다. 상대가 먼저 알려 주는 정보, 요청을 넘기는 표현, 누가 계획을 시작하는지 같은 작은 합의도 텍스트 메모에 남는다.
9월 4일 공개된 「Testing Interchangeability in LLM Agent Teams」는 이 차이를 교체 실험으로 분리했다. 같은 base model과 역할, 같은 양의 경험을 가진 에이전트를 다른 팀에서 데려왔을 때 과제 점수는 비교적 적게 떨어졌다. 대신 완료한 작업 한 단위에 필요한 메시지나 힌트는 16%에서 63%까지 늘었다. 성공률만 보는 운영 대시보드라면 놓치기 쉬운 비용이다.
요약: 역할 설정이 같아도 팀의 프로토콜은 같지 않다
연구진은 두 에이전트가 각자 200 token 이내의 notebook을 유지하도록 했다. 메모는 환경의 규칙과 실패 원인을 적는 task notes, 특정 동료가 무엇을 먼저 하는지와 어떤 hand-off 표현이 통했는지를 적는 partner notes로 나뉜다. 각 팀은 10회 formation episode를 거친 뒤 처음 보지 않은 과제에서 평가받았다.
핵심 비교는 단순한 기존 팀과 교체 팀이 아니다. 연구진은 교체 공지만 하고 같은 에이전트를 다시 넣는 placebo를 따로 뒀다. 실제 swap에서는 다른 팀의 같은 역할 에이전트를 notebook과 함께 옮겼다. 모델, 역할, 경험량은 고정하고 파트너의 정체와 그 파트너에 맞춘 기록만 달라지게 한 셈이다.
교체 공지의 충격은 placebo로 통제하고, 실제 swap에서는 다른 팀의 같은 역할 에이전트를 notebook과 함께 옮겼다. 출처: arxiv.org/html/2609.05279v1.
세 설정에는 협업 결합도가 낮은 Collab-Overcooked, hand-off가 많이 필요한 높은 결합도의 Collab-Overcooked, 서로의 카드만 볼 수 있는 2인 Hanabi가 쓰였다. main study는 설정마다 8개 팀을 운용했고, 조건·복구 실험과 ablation을 합쳐 4,190 episode를 실행했다. 다만 모든 팀은 2인조였고 main study의 base model도 하나였다. 이 수치를 일반적인 조직 전체의 법칙으로 넓히면 안 된다.
점수보다 먼저 흔들린 것은 소통량이었다
낮은 결합도의 Collab-Overcooked에서 placebo 팀의 진행도는 91.6, swap 팀은 90.0이었다. 메시지 비용은 완료한 sub-task당 3.33회에서 3.85회로 16% 늘었다. 높은 결합도에서는 진행도가 63.2에서 58.0으로 내려갔고 메시지는 4.33회에서 6.53회로 51% 증가했다.
Hanabi에서도 같은 모양이 나왔다. 점수는 25점 만점에 15.8에서 13.7로 내려갔지만, 점수 1점당 힌트 비용은 0.64에서 1.04로 63% 늘었다. 경험 없는 새 에이전트의 값은 1.00이었다. 옛 파트너에게 맞춘 규칙을 들고 온 숙련 에이전트가 아무 기록도 없는 새 에이전트보다 소통 면에서 조금 더 비쌌다.
역할이 같은 숙련 에이전트를 교체했을 때 과제 점수보다 완료 단위당 메시지·힌트 비용의 상대 변화가 더 컸다. 출처: arxiv.org/html/2609.05279v1.
추가 메시지의 내용도 결합도에 따라 달랐다. 낮은 결합도에서는 응답이 없어 요청을 다시 보내는 경우가 33%로 가장 많았다. 높은 결합도에서는 hand-off 실패 뒤의 수정이 38%로 가장 컸다. 미리 질문해서 맞추기보다 서로 다른 전제를 갖고 실행한 뒤에야 충돌을 발견한 것이다.
잘못된 partner notes는 없는 것보다 나쁠 수 있다
연구진은 swap된 에이전트의 task notes는 남기고 partner notes만 지우는 조건도 돌렸다. 높은 결합도 Collab-Overcooked의 진행도는 58.0에서 59.6으로, Hanabi는 13.7에서 14.8로 회복했다. 오래된 동료 모델을 계속 믿는 것보다 동료에 대한 가정을 비운 편이 나았다는 뜻이다.
반대 실험도 있다. 멤버를 바꾸지 않은 팀에서 partner notes만 지우면, 실제 교체 손실의 상당 부분이 재현됐다. 높은 결합도 Collab-Overcooked에서는 81%, Hanabi에서는 64%였다. 연구진이 정해 둔 메모 구획이 partner-specific state를 완벽히 가른 것은 아니다. 메모를 지우면 context 길이도 짧아지고, 에이전트가 동료 관련 사실을 task notes에 적을 수도 있다. 그래도 교체 비용이 단순한 reset 공지나 모델 성능 차이로만 생긴 것이 아니라는 증거는 된다.
리더를 바꾸면 남아 있는 쪽이 더 많이 말했다
Collab-Overcooked에는 recipe를 보고 계획을 시작하는 initiator와 그 요청을 수행하는 responder가 있다. 높은 결합도에서 initiator를 바꾸면 진행도 손실은 7.54점이었다. responder 교체의 2.55점보다 약 3배 컸다. 낮은 결합도에서도 방향은 같았지만 값이 작아 비율 자체를 일반화하기는 어렵다.
더 흥미로운 건 누가 추가 메시지를 보냈는지다. initiator가 바뀌었을 때 높은 결합도 설정의 추가 메시지 중 70%는 새 에이전트가 아니라 기존 responder가 보냈다. 남아 있는 쪽이 이전에는 암묵적이던 정보를 다시 설명하고, 확인하고, 요청을 반복했다. 장애 원인을 새 멤버의 로그만 보고 찾으면 틀릴 수 있는 이유다.
복구 속도도 지표마다 달랐다. 과제 점수는 낮은 결합도에서 2회차, 높은 결합도에서 5회차, Hanabi에서 6회차에 placebo의 1% 이내로 돌아왔다. 소통 비용은 약 두 배 느리게 줄었고, 결합도가 있는 두 설정에서는 10회차에도 같은 기준으로 완전히 회복하지 못했다. Hanabi는 10회차에도 7% premium이 남았다.
실전 적용: 교체를 배포가 아니라 protocol migration으로 다룬다
첫째, 역할 prompt와 tool schema만 맞추고 교체를 끝내지 않는다. hand-off message의 필수 필드, 상태 보고 시점, 실패를 알리는 형식을 versioned contract로 둔다. 팀별 notebook에는 과제 사실과 파트너별 가정을 구분하고, 멤버가 바뀌면 이전 파트너 구획을 자동으로 비우거나 새 팀 정보로 명시적으로 초기화한다.
둘째, canary 교체에서 성공률과 latency만 보지 않는다. 완료한 sub-task당 메시지 수, 같은 요청의 재전송, clarification, failed hand-off 뒤 correction을 따로 센다. 이 연구에서는 높은 결합도에서 correction이 추가 트래픽의 38%였다. 결과가 맞더라도 repair loop가 길어지면 비용과 지연이 이미 나빠진 상태다.
셋째, plan을 시작하는 자리를 우선 점검한다. coordinator나 planner를 바꾸면 뒤따르는 worker가 더 많은 재설명 비용을 낼 수 있다. 교체 직후에는 incumbent와 newcomer 양쪽의 메시지 변화를 함께 비교해야 한다. 기존 멤버 쪽 트래픽이 늘었다고 기존 멤버가 고장 났다고 결론 내리면 안 된다.
마지막으로, 이 논문의 greedy decoding 결과는 흥미롭지만 곧바로 운영 규칙으로 고정할 단계는 아니다. temperature 0에서는 팀 간 protocol divergence와 swap penalty가 함께 줄었지만, 표본은 제한적이고 temperature 2.0에서는 과제 학습 자체가 무너져 비율 해석이 불안정했다. 먼저 정해진 protocol prompt와 메모 migration을 시험하고, decoding 설정은 같은 workload에서 별도 ablation으로 확인하는 편이 안전하다.
주의점: 이 실험이 아직 답하지 못한 것
연구는 2인 팀과 5·10·20회 formation 범위에 머문다. 3명 이상이면 다른 멤버가 교체 충격을 우회할 수 있고, 오래 운영된 팀에서는 protocol이 포화될지 계속 갈라질지 알 수 없다. partner notes를 별도 heading으로 요구한 설계도 실제 제품보다 효과를 선명하게 만들었을 가능성이 있다.
또 논문이 보고한 비용은 짧은 benchmark episode의 API 비용과 메시지 효율이다. production incident 수나 실제 고객 지연을 직접 측정한 결과가 아니다. 따라서 "에이전트를 바꾸면 장애가 난다"가 아니라 "같은 역할과 경험량만으로 교체 안전성을 증명할 수 없으며, 성공률과 별도로 소통 효율을 측정해야 한다"가 이 자료로 말할 수 있는 범위다.


댓글
댓글 쓰기