산업

검색
  • 댓글 0

실시간 랭킹 뉴스

전 세계 AI 혼란 빠뜨린 '착시 채점표' 바로잡은 UNIST

노컷뉴스 이 시각 추천뉴스

노컷뉴스를 선호 하는 출처로 추가

이 시각 추천뉴스를 확인하세요

UNIST 유재준 교수팀, AI 시각 인식 평가의 문제점 개선한 새 벤치마크
"고양이 몸에 코끼리 피부" 평가법 함정…성능 가른 건 '선호' 아닌 '총량'

고양이에 코끼리 피부를 입힌 큐컨플릭트 벤치마크의 이미지(왼쪽)와 연구진이 제시한 벤치마크 이미지. UNIST 제공고양이에 코끼리 피부를 입힌 큐컨플릭트 벤치마크의 이미지(왼쪽)와 연구진이 제시한 벤치마크 이미지. UNIST 제공
국내 연구진이 세계 학계에서 사용해 온 인공지능(AI) 사물 인식 평가 기준의 결정적인 허점을 규명하고 새 표준을 제시했다.

UNIST(울산과학기술원) 인공지능대학원 유재준 교수팀은 기존 AI 평가법인 '큐 컨플릭트(Cue-conflict)'의 구조적 문제를 규명하고, 새 벤치마크 '리파인드 바이어스(REFINED-BIAS)'를 제시했다고 1일 밝혔다.

특히 이번 문제를 다룬 논문은 유럽 컴퓨터 비전 학회(ECCV 2026)에서 전체 제출 논문 1만473편 중 약 1.3%에 해당하는 스포트라이트 논문으로 선정됐다.

큐 컨플릭트는 AI가 사물을 알아볼 때 형상과 표면 질감 중 어느 쪽에 더 의존하는지 평가하기 위해 2019년 독일 튀빙겐대 연구진이 제시한 벤치마크다.

예를 들어 고양이 몸에 코끼리 피부 질감을 입힌 합성 이미지를 보여준다. 고양이라고 답하면 형상에, 코끼리라고 답하면 질감에 의존한 것으로 본다.

당시 테스트에서 AI는 사람과 달리 질감에 더 의존하는 것으로 나타났다. 이는 AI가 형상 위주로 학습해야 한다는 주장의 배경이 됐다.

하지만 이후 형상 선호도와 인식 성능의 관계를 두고 엇갈린 연구 결과가 이어졌다.

UNIST 연구팀은 이런 혼선의 원인을 벤치마크 자체에서 찾았다. 가장 큰 문제는 '비율'만 본다는 점이다.

100장 중 형상 답을 8번, 질감 답을 2번 고른 AI와 80번, 20번 고른 AI는 모두 '형상 선호도 80%'를 받았다.

형상을 잘 알아봐서 높아진 경우와 질감을 못 알아봐서 상대적으로 높아진 경우를 구분하지 못한다는 것.

합성 이미지에서 형상과 질감이 제대로 분리되지 않거나 한쪽이 더 알아보기 쉽게 편향된 점, 제한적인 채점 범위가 결과를 왜곡할 수 있다는 점도 결함으로 지적됐다.

연구팀이 제시한 리파인드 바이어스는 형상과 질감을 각각 얼마나 잘 알아보는지 점수로 나타내도록 평가지표를 바꿨다.

평가 이미지는 시계·모래시계 등 형상이 뚜렷한 사물 10종과 얼룩말·벌집 등 질감이 뚜렷한 사물 10종, 총 6천장으로 구성했다.

형상 평가용은 배경과 표면 무늬를 제거했다. 질감 평가용은 표면 일부를 잘라 재배열해 전체 형상이 드러나지 않게 했다.

(왼쪽부터)유재준 교수, 김범준 연구원, 이승아 연구원. UNIST 제공(왼쪽부터)유재준 교수, 김범준 연구원, 이승아 연구원. UNIST 제공
채점 범위도 AI가 고를 수 있는 전체 답으로 넓혔다.

새 벤치마크로 테스트한 결과, 성능이 높은 모델일수록 한쪽에 치우치기보다 형상과 질감을 모두 더 적극적으로 활용했다.

'형상을 선호할수록 성능이 좋다'는 기존 관찰은 유지됐다. 하지만 성능을 가르는 것은 선호의 방향이 아니라 두 정보를 쓰는 총량이었다.

최신 트랜스포머 구조나 이미지·텍스트 동시 학습 방식을 적용한 AI가 실제로 형상을 더 잘 알아본다는 점도 확인됐다.

유재준 교수는 "벤치마크는 AI의 성능을 평가하고 개발 방향까지 제시하는 만큼 제대로 된 평가 기준을 마련하는 것이 중요하다. 이번 벤치마크가 모델 구조와 학습 방법을 개선하는 데 도움이 되길 기대한다"고 했다.

이번 연구에는 김범준·이승아 연구원이 공동 제1저자로 참여했다.
영문기사 보기 (View English Article)

0

0

실시간 랭킹 뉴스

오늘의 기자

※CBS노컷뉴스는 여러분의 제보로 함께 세상을 바꿉니다. 각종 비리와 부당대우, 사건사고와 미담 등 모든 얘깃거리를 알려주세요.

상단으로 이동