• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
반도체
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'벤치맥싱'통합검색 결과 입니다. (1건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

독파모 '벤치맥싱' 논란에 AAII 입장…"평가 방법론 지속 업데이트"

글로벌 인공지능(AI) 평가기관 아티피셜 애널리시스가 벤치마크 맞춤형 학습으로 실제 성능 개선 없이 점수만 높아질 수 있다는 우려를 인정했다. 현재 이같은 이슈를 최소화하기 위해 내부적으로 기술적 조치를 강화하고 있는 것으로 확인됐다. 14일 아티피셜 애널리시스는 지디넷코리아에 보낸 이메일에서 "벤치마크를 활용해 모델 약점을 보완하는 것은 통상적인 개발 과정"이라면서도 "특정 평가에 과도하게 최적화해 점수만 끌어올리는 방식은 경계해야 한다"고 밝혔다. 아티피셜 애널리시스는 글로벌 AI 모델 성능과 속도, 비용 등을 비교·분석하는 민간 평가기관이다. 해당 기관이 운영하는 '아티피셜 애널리시스 인텔리전스 지수(AAII)'가 독파모 2차 평가에서 전체 100점 중 25점을 차지한다. 아티피셜 애널리시스는 이같은 벤치마크 이슈를 최소화하기 위해 내부 분석과 검증, 자체 평가 데이터 활용, 지속적 평가 방법론 업데이트 등 세 가지 장치를 추진하고 있다고 말했다. 아티피셜 애널리시스 관계자는 "우리는 개별 평가와 전체 지수 차원에서 모델 답변과 추론 과정, 실행 로그, 점수 분포를 검토한다"며 "이를 통해 비정상적인 점수 변화나 특정 평가에만 특화된 최적화 흔적을 찾는다"고 말했다. 이어 자체적으로 개발·관리하는 평가와 외부 벤치마크도 활용한다고 밝혔다. 특정 공개 데이터나 하나의 평가 방식에 대한 의존도를 낮춰 일부 시험에 특화된 학습이 전체 점수 상승으로 이어지는 것을 막기 위해서다. 관계자는 평가 항목과 가중치, 채점 방식도 정기적으로 바꾸겠다고 밝혔다. 최신 AI 기술과 산업에서 중요해진 역량을 반영해 평가 체계를 지속적으로 개편함으로써 AAII가 개발사 공략 대상이 되지 않도록 한다는 취지다. 기관이 현재 사용 중인 'AAII 4.1.1' 버전은 에이전트 업무와 코딩, 과학적 추론, 장문 맥락 추론, 지식과 환각 등을 측정하는 9개 평가로 구성됐다. 아티피셜 애널리시스는 한 영역에서만 점수를 높이더라도 성능이 다른 과제로 확장되지 않으면 전체 지수에 미치는 영향은 제한적이라고 주장하고 있다. 그러나 아티피셜 애널리시스는 실제 벤치마크 과적합 징후를 발견한 사례가 있는지는 공개하지 않았다. 과적합 징후를 확인했을 때 해당 점수를 제외하거나 모델을 재평가하는지, 순위를 조정하거나 외부에 경고하는지 등 사후 조치 기준도 밝히지 않았다. 독파모 평가 25점 걸린 AAII...업계 "실제 성능 왜곡 우려" 최근 업계에선 일부 독파모 참여사 일부가 AAII 점수를 겨냥한 맞춤형 사후학습 데이터를 활용하고 있다는 의혹이 제기되고 있다. 이에 일각에선 일부 참여사가 모델이 낮은 점수를 받은 지식 영역과 문제 유형을 분석한 뒤 유사한 사후학습 데이터를 구매하거나 별도 구축하고 있다는 주장이 나온다. 벤치마크 문제와 정답을 그대로 학습하는 방식은 아니지만, 실제 사용 역량보다 특정 평가 점수만 높아진다면 모델 성능을 왜곡하는 벤치맥싱으로 이어질 수 있다는 우려다. AAII 순위가 독파모 2차 평가의 최종 결과를 의미하는 것은 아니다. NIA 벤치마크와 전문가·사용자 평가가 별도로 진행되는 데다 AAII 역시 버전과 평가 구성에 따라 점수가 달라질 수 있어서다. 과학기술정보통신부는 AAII만으로 모델 우열을 판단하지 않고 한국지능정보사회진흥원(NIA) 벤치마크와 전문가·사용자 평가를 종합한다는 입장이다. 그러나 AAII에 전체 점수의 4분의 1이 배정된 만큼 벤치마크 맞춤형 학습을 실제 성능 향상과 어떻게 구분할지가 평가 공정성을 가를 핵심 과제로 꼽힌다. 아티피셜 애널리시스는 "우리는 모델 답변과 추론 과정, 실행 로그, 점수 분포를 분석해 평가에만 특화된 최적화 방법론을 꾸준히 연구 중"이라고 밝혔다.

2026.08.14 15:40김미정 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

삼성전자, 기흥 신규 R&D팹 '파운드리' 활용 추진…엔비디아 수요 선제 대응

로보티즈, 中 안방서 휴머노이드 공개…최신 액추에이터 판매 시동

40도 폭염에도 PC 케이스 강화유리 자파현상 '잠잠'...왜?

정부, 'AI 윤리원칙' 초안 공개…업계 "권리 보호·기업 지침 보강해야"

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.