스킬 점수는 올랐는데 상위 폴더를 허용했다: 플러그인 마이그레이션 평가의 빈틈
버전이 바뀐 플러그인을 AI 에이전트에게 옮기게 할 때, 답변 점수가 높다는 사실만으로 실제 수정이 안전하다고 말할 수 있을까요? 이번 논문은 점수 상승과 구체적인 계약 위반 사례가 함께 존재할 수 있음을 보여줍니다. 핵심은 “스킬이 효과 있다/없다”의 단정이 아니라, 무엇을 시험했고 무엇은 아직 시험하지 않았는지를 평가표에서 분리하는 일입니다. Beiming Liu 외 연구진의 「Evaluating Agent Skills for Version-Specific Plugin Migration: A Retrospective Study」(arXiv:2609.30120v1, 2026년 9월 24일 공개)는 한 플러그인 마이그레이션 스킬을 정적 진단 과제에 적용한 후향 연구입니다. 본문 §4.1은 22개 정적 과제에서 층화 추출한 16개를 비교합니다. 스킬 없음/있음 두 조건에서 과제마다 두 번씩 실행해 64개 보고서를 만들고, 328개의 기준별 판정을 매겼습니다. 반복 보고서와 기준 판정 수를 독립적인 마이그레이션 과제 수로 세면 안 됩니다. 평균은 올랐지만, 무엇의 평균인가 표 1의 원래 루브릭 평균은 스킬 없음 93.83, 스킬 있음 98.75로 차이는 4.92점입니다. 이는 0~100점 보상 척도의 점수 차이지, 상대 개선율도 아니고 “마이그레이션 성공률이 4.92% 상승”했다는 뜻도 아닙니다. 16개 과제 중 6개는 상승, 2개는 하락, 8개는 두 조건 모두 100점이었습니다. S1 하나가 42.5점을 보탰고, 이를 제외하면 나머지 15개 과제의 평균 차이는 2.42점입니다. 논문이 제시한 과제 단위 부트스트랩 95% 구간은 [0.31, 10.86], Wilcoxon 검정의 p값은 0.0797입니다. 이 숫자는 관찰된 과제들에 대한 탐색적 요약으로 읽는 편이 정확합니다. 천장 효과가 크고 한 과제의 기여가 두드러지며, 연구진도 후향적 단일 사례라는 범위를 설명합니다. 이 구간을 다른 플러그인·모델·운영체제에 그대로 일반화할 수 없습니다. 원 루브릭 평...