AI 코드 리뷰는 모델보다 관문이 중요하다: Meta RADAR 53만 건의 교훈

AI가 코드를 더 빨리 만들수록 다음 병목은 생성이 아니라 검토가 된다. Meta 연구진의 RADAR 논문은 이 변화를 대규모 내부 운영 자료로 보여준다. 전년 대비 사람이 최종 반영한 diff당 유의미 코드 줄 수는 105.9%, 개발자당 월 diff 수는 51% 늘었고, 증가분의 80% 이상을 에이전트형 AI가 만들었다. 반면 24시간 안에 리뷰되는 diff의 비중은 내려갔다.

여기서 중요한 질문은 “리뷰도 더 큰 모델에 맡기면 되는가”가 아니다. 변경의 출처와 위험을 먼저 좁히고, 실패했을 때 자동 반영이 아니라 사람 리뷰로 되돌리는 운영 구조를 만들 수 있는지가 핵심이다.

RADAR는 리뷰 모델 하나가 아니라 다섯 개 관문이다

RADAR는 먼저 변경이 사람, AI 봇, 결정론적 코드 변환 중 어디서 왔는지 분류한다. 이후 소스별 허용 목록, 변경 이력, 일일 한도 같은 적격성 조건을 확인한다. 공개 소스나 규제 범위 코드를 건드리는지도 정적 규칙으로 거르고, 머신러닝 기반 Diff Risk Score로 위험도를 매긴다.

그 뒤에야 LLM 리뷰 에이전트가 실제 변경을 읽는다. 여기까지 통과해도 테스트 같은 결정론적 검증과 대기 시간이 남는다. 어느 단계에서든 실패한 diff는 자동 반영하지 않고 사람 리뷰 큐로 보낸다. 모델의 판단력이 아니라 실패가 안전한 방향으로 흐르는 파이프라인이 자동화의 경계를 정한다.

변경 출처 분류, 적격성 검사, 정적 안전 규칙, 위험 점수, LLM 리뷰, 결정론적 검증을 거쳐 저위험 diff만 자동 반영하고 실패한 변경은 사람 리뷰로 보내는 RADAR 흐름도

RADAR의 핵심은 단일 리뷰 모델이 아니라 실패한 변경을 사람에게 되돌리는 여러 안전 관문이다. 출처: arxiv.org/html/2605.30208.

535,290건의 결과가 말해주는 것

논문은 RADAR가 535,290건의 diff를 검토했고 그중 331,720건이 실제로 반영됐다고 보고한다. 일일 검토량은 최대 2만5천 건에 이르렀으며, 현재 승인율은 60.31%, 마지막 검증 통과율은 26.31%였다. RADAR 대상 diff의 되돌림 비율은 비대상 diff의 3분의 1, 운영 장애 비율은 50분의 1로 보고됐다. 중간 리뷰 대기시간의 중앙값도 사람이 리뷰한 diff보다 35% 짧았다.

하지만 이 숫자를 “AI 리뷰가 사람보다 안전하다”는 인과 결론으로 읽으면 안 된다. RADAR 대상은 처음부터 낮은 위험으로 선별됐다. 무작위 배정이 아니며 절대 장애율과 전체 분석 모형도 공개되지 않았다. 정책, 모델, 검증 규칙이 함께 바뀌었기 때문에 어느 요소가 결과를 만들었는지 분리하기도 어렵다.

팀에 옮길 때는 승인율보다 실패 경로를 먼저 설계한다

도입 순서는 다음처럼 잡는 편이 안전하다.

  1. 코드 작성 주체와 변경 유형을 기록한다.
  2. 민감 저장소, 규제 코드, 대형 diff는 자동화 대상에서 제외한다.
  3. 위험 점수와 별개로 정적 금지 규칙과 테스트를 둔다.
  4. 실패한 diff는 폐기하지 말고 담당자 리뷰 큐로 보낸다.
  5. 승인율뿐 아니라 되돌림, 장애, 사람의 사후 거부율을 함께 본다.

처음부터 자동 반영률을 높일 이유는 없다. 좁은 허용 목록과 낮은 일일 한도로 시작하고, 문제가 생기면 소스 단위로 즉시 멈출 수 있어야 한다. 리뷰 자동화는 사람을 없애는 기능이라기보다 사람이 읽을 변경을 선별하는 운영 정책에 가깝다.

이 연구를 평가할 때 남는 질문

조직 밖에서 그대로 재현할 수 있는지는 아직 분명하지 않다. Meta의 코드베이스, 테스트 인프라, 변경 분류 체계가 RADAR의 전제이기 때문이다. 승인율보다 중요한 것은 각 팀이 어떤 변경을 저위험으로 정의하고, 잘못된 자동 승인을 어떻게 탐지하며, 장애 이후 어떤 기준으로 자동화를 중지할지다.

따라서 도입 실험은 “몇 건을 자동 승인했는가”보다 “어떤 변경을 제외했고, 어떤 실패를 사람이 다시 잡았는가”를 기록해야 한다. 이 데이터가 있어야 자동화 범위를 넓혀도 되는지 판단할 수 있다.

참고 자료와 게시 안내

이 페이지가 Vibe Programming Lab의 정식 웹 버전이며, 네이버 글은 같은 연구를 해당 플랫폼 독자에게 맞춰 압축한 파생 글이다. 이 글은 공개 논문을 바탕으로 작성한 해설이다. 자료 정리와 초안 작성에 AI 도구를 활용했으며 주요 수치와 출처를 원문과 대조했다. 제품 사용 후기나 독립 재현 결과를 의미하지 않는다.

댓글

이 블로그의 인기 게시물

체크아웃은 분리됐는데 Git 상태는 공유된다: Codex 0.154 worktree의 세 경계

잠근 작업이 커밋 뒤 다시 나온다: PostgreSQL 에이전트 큐의 소유권 설계

코딩 에이전트는 API 문서보다 AGENTS.md를 먼저 읽었다