글

라벨이 표현 분석인 게시물 표시

멀티모달 정렬 점수가 높아도 이미지를 읽었다는 뜻은 아니다: PA gap의 쓰임과 한계

이미지
이미지와 질문을 함께 처리하는 모델에서 시각 토큰과 텍스트 토큰의 내부 표현이 비슷해지면, 모델이 이미지를 잘 이해했다고 말하기 쉽습니다. 하지만 비슷한 좌표에 놓였다는 사실과 그 이미지가 해당 질문의 답에 도움이 됐다는 사실은 다릅니다. 이번 글은 Wang·Wang·Ding의 arXiv v1 프리프린트 가 제시한 개입 실험을 바탕으로, 평가자가 정렬 점수를 읽을 때 던져야 할 반례와 비교 순서를 정리합니다. 동료 심사를 거친 확정 결과로 소개하지 않습니다. 독자의 실무 질문은 ‘우리 모델의 정렬 곡선이 올라갔는데, 이를 이미지 사용의 증거로 보고해도 되는가?’입니다. 답은 내부 점수 하나로는 불가능하다는 것입니다. 이 연구가 다룬 것은 비전 인코더의 출력을 projector로 언어모델 토큰 공간에 옮긴 뒤, 시각·텍스트 토큰이 같은 LLM 층을 통과하는 구조입니다. 연구팀은 다섯 계열의 모델 체크포인트 13개(0.5B~72B)에 대해 MMBench의 동일한 질문–이미지 객관식 쌍 1,000개를 조건별로 평가했습니다. 13,000개의 독립 질문을 새로 수집한 실험이라고 읽어서는 안 됩니다. ① 정렬이 유지돼도 정답은 무너질 수 있다 연구의 첫 개입은 이미지 자체를 흐리게 만드는 방식이 아닙니다. projector 출력의 시각 토큰을 각각 등방성 가우시안 노이즈 벡터로 바꾸되, 원래 토큰의 노름에 맞춰 크기를 다시 조정합니다. 이렇게 하면 크기 변화의 영향을 줄이고 내용·방향을 제거한 경우를 볼 수 있습니다. 원본(Orig)과 노이즈(Noise)를 같은 질문에서 비교하자, 모델별 정확도 차이 Noise − Orig 의 교차 모델 중앙값은 −45.2 퍼센트포인트(pp) , 사분위 범위는 −46.6~−43.2pp였습니다(논문 §4 Table 2). 이는 ‘정확도가 45.2% 상대적으로 감소’했다는 뜻이 아닙니다. 반면 첫 번째 주각 코사인 σ₁, CKA, SVCCA, MIR 같은 단일 요약 점수는 원본과 내용이 사라진 노이즈를 일관되게 분리하지 못했습니다(§...