• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'AAII'통합검색 결과 입니다. (8건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

[AI 리더스] 한국 온 조지 카메론 AA 창업자 "AAII 개편, 모티프 독파모 탈락과 무관"

"이번 개편은 특정 사건에 반응해 이뤄진 조치가 아닙니다. 우리는 일반적인 관점에서 인공지능(AI)을 가장 잘 측정할 수 있는 방법론을 만드는 데만 집중하고 있습니다."조지 카메론 아티피셜 애널리시스 공동창업자 겸 최고제품책임자(CPO)가 이달 초 진행된 '인텔리전스 인덱스(AAII) v4.2' 개편을 두고 한국의 독자 AI 파운데이션 모델 평가에서 불거진 모티프테크놀로지스 탈락 논란과는 무관하다고 선을 그었다. 모티프가 AAII에서는 참여팀 가운데 가장 높은 점수를 받고도 정부 종합평가에서 탈락하면서 벤치마크와 실제 성능 간 괴리를 둘러싼 논쟁이 커졌지만, 이번 개편은 특정 기업이나 사례에 대응한 조치가 아니라고 강조했다. 카메론 CPO는 14일 서울 강서구 마곡 LG사이언스파크에서 열린 'LG AI 토크 콘서트 2026'에 참석한 후 지디넷코리아와 만나 "인텔리전스 인덱스는 최신 AI 역량을 반영할 수 있도록 계속 업데이트해 왔다"며 "이번에는 터미널 벤치 최신 버전을 반영하고 비공개 테스트셋을 갖춘 'AA 브리프케이스'를 추가한 것이 주요 변화"라고 말했다. 앞서 아티피셜 애널리시스는 지난 4일 AAII를 v4.2로 개편한 바 있다. 이번 개편에선 비공개 테스트가 전체 평가에서 차지하는 비중을 기존 20%에서 40%로 확대하고 실제 업무 수행 능력을 측정하는 평가 항목도 강화했다. 이는 공개된 평가 문제와 정답을 활용해 점수를 끌어올리는 벤치마크 게이밍 우려가 커지면서 평가 신뢰도를 높이기 위한 조치로 해석된다. 벤치마크 게이밍은 국내에서 '벤치맥싱(Benchmaxxing)'으로도 불리는 방식으로, 미국 애프터쿼리처럼 특정 벤치마크 성능 향상을 위한 데이터와 학습 방법론을 제공하는 업체도 등장하면서 평가 점수가 실제 활용 성능을 얼마나 반영하는지를 둘러싼 논쟁이 커지고 있다. 다만 카메론 CPO는 비공개 테스트 비중 확대가 최근 특정 논란에 대응해 단기간에 결정한 것이 아니라고 강조했다. 그는 "비공개 테스트셋은 이전부터 벤치마크에 포함해 왔고 그 비중도 계속 늘려왔다"며 "이번 변화 역시 어떤 특정 사건에 반응해 결정한 것이 아니라 인텔리전스 인덱스를 지속적으로 개선해 온 과정의 하나"라고 말했다. 또 카메론 CPO는 아티피셜 애널리시스가 벤치마크 게이밍을 막기 위해 평가 구조도 분산하고 있다고 주장했다. 특정 시험 하나에 모델을 집중적으로 학습해 높은 점수를 얻더라도 전체 평가에선 우위를 확보하기 어렵도록 여러 평가를 함께 적용하는 방식을 택한 것이다. 카메론 CPO는 "게이밍을 방지하기 위해 여러 방법을 사용하고 있다"며 "특히 인텔리전스 인덱스 안에 10개의 서로 다른 평가를 두고 특정 벤치마크 하나에만 집중하기 어렵게 했다"고 설명했다. 그러면서 "비공개 테스트셋도 운영하고 있다"며 "새로운 벤치마크를 계속 반영해 인덱스를 최신 상태로 유지하고 있다"고 덧붙였다. 최근 AI 모델 경쟁의 중심이 단순한 문제풀이 성능에서 실제 업무 수행 능력으로 빠르게 옮겨가고 있는 점도 평가 방식 변화에 영향을 주고 있다. 웹을 탐색하고 외부 도구를 활용하며 여러 단계를 거쳐 장시간 업무를 수행하는 에이전트형 AI가 확산되면서 기존 정적 벤치마크만으로 모델 성능을 충분히 비교하기 어려워지고 있어서다. 실제로 최신 AI 모델은 코딩과 도구 활용, 컴퓨터 사용, 장기 업무 수행 등에서 빠르게 성능을 높이고 있다. 평가기관들도 이에 맞춰 단순 정답률보다 실제 업무에 가까운 환경에서 모델이 얼마나 안정적으로 과제를 수행하는지를 측정하는 방향으로 평가 범위를 넓히고 있다. 이에 아티피셜 애널리시스는 이번 개편에서 'AA 브리프케이스'도 새로 반영했다. 비공개 테스트셋을 활용해 실제 지식 노동에 가까운 업무 수행 능력을 평가하고, 공개 문제에 맞춘 과적합 가능성을 낮추기 위해서다. 카메론 CPO는 "AA 브리프케이스는 비공개 테스트셋을 갖춘 에이전틱 지식 업무 벤치마크"라며 "이를 인텔리전스 인덱스에 통합해 AI가 실제로 무엇을 할 수 있는지를 더 잘 반영하도록 했다"고 설명했다. 하지만 국내에선 벤치마크 점수와 실제 모델 역량을 어떻게 함께 평가할지를 두고 논쟁이 꾸준히 이어지고 있다. 특히 정부의 독자 AI 파운데이션 모델 프로젝트 2차 단계평가에서 모티프테크놀로지스가 AAII 평가에서 참여팀 가운데 가장 높은 점수를 기록했지만 전문가·사용자 평가에서 뒤지며 최종 탈락한 것이 화근이 됐다. 이후 업계에선 벤치마크 점수만으로 모델의 실제 활용성과 경쟁력을 판단하기 어렵다는 의견이 나왔다. 반면 실제 추론과 업무 수행, 에이전틱 역량을 객관적으로 비교하려면 벤치마크가 여전히 필요하고 이를 실제 성능에 가깝게 측정하도록 계속 고도화해야 한다는 주장도 제기됐다. 이를 두고 카메론 CPO는 모티프 사례와 같은 개별 평가 결과보다 모든 모델에 동일하게 적용할 수 있는 평가 방법론을 만드는 것이 중요하다고 주장했다. 특정 기업이나 국가의 평가 결과에 따라 기준을 달리하지 않고 동일한 조건에서 모델 성능을 비교해야 한다고 봐서다. 그는 "우리는 매우 표준화된 방법론을 유지하고 있다"며 "생태계 내 모든 모델에 동일한 벤치마크를 적용하고 특정 모델에 따라 평가 방식을 바꾸지 않는다"고 피력했다. 카메론 CPO는 한국 AI 기업들과의 교류가 AAII 평가 방식에 영향을 미치는지에 대한 질문에도 같은 원칙을 강조했다. 또 아티피셜 애널리시스는 AI 기업과 이용자들로부터 평가 방식에 관한 의견을 받고 있지만, 특정 기업이나 모델에 맞춰 벤치마크 구성을 바꾸지는 않고 있다고 주장했다. 그는 "모든 모델에 동일한 표준화된 방법론을 적용하고 있으며 모델에 따라 평가 방식을 다르게 운영하지 않는다"며 "AI 생태계에 있는 기업들과 아티피셜 애널리시스를 사용하는 수많은 이용자들로부터 폭넓게 피드백을 받고 있다"고 설명했다. 업계에선 AAII가 지속적으로 개편되면서 서로 다른 버전에서 나온 점수와 순위를 어떻게 비교해야 하는지도 관심사로 떠올랐다. 같은 모델이라도 새로운 벤치마크가 추가되거나 평가 비중이 바뀌면 이전 버전과 점수, 순위가 달라질 수 있어서다. 실제 아티피셜 애널리시스는 지난 3일 기존 지수에서 오픈AI의 'GPT-6 아스트라'를 61점으로 평가해 메타의 '뮤즈 스파크 1.3'보다 낮은 순위에 뒀지만, 하루 뒤 v4.2로 개편하면서 아스트라의 순위를 2위로 끌어올렸다. 새 지수에서는 앤트로픽의 '클로드 페이블 5.1'이 1위에 올랐다. 이에 대해 카메론 CPO는 평가판이 바뀌면 같은 모델의 점수와 순위도 달라질 수 있다고 설명했다. AI 모델이 할 수 있는 일이 계속 달라지는 만큼 이를 측정하는 기준도 함께 바뀌며 새 평가 항목과 비중이 적용되면 이전 버전과 결과가 달라질 수 있다는 것이다. 그는 "AI 모델이 할 수 있는 일이 계속 변하고 있기 때문에 인텔리전스 인덱스도 이를 최신 상태로 유지하기 위해 계속 바뀐다"며 "AI 지능에 대한 기대와 평가 방식이 발전하는 만큼 점수와 순위가 달라지는 것도 자연스러운 일"이라고 말했다.

2026.09.14 15:41장유미 기자

아티피셜 애널리시스 "한국 AI 강점, 오픈웨이트·제조업…AGI도 키워야"

"한국이 글로벌 인공지능(AI) 경쟁력을 높이려면 산업 특화 모델 개발을 공략하면서도 범용인공지능(AGI) 기술 역량도 지속적으로 강화해야 합니다." 조지 카메론 아티피셜 애널리지스 공동창업자 겸 최고제품책임자(CPO)는 14일 오전 서울 강서구 마곡 LG사이언스파크에서 'LG AI 토크 콘서트 2026'에서 이홍락 LG AI연구원 공동원장과 진행한 대담에서 한국 AI 생태계 경쟁력과 향후 기술 개발 방향을 이같이 제시했다. 아티피셜 애널리시스는 전 세계 AI 모델의 성능과 비용·속도 등을 평가하는 독립 벤치마크 기업이다. 해당 기관이 운영하는 '아티피셜 애널리시스 인텔리전스 지수(AAII)'가 독파모 1~2차 평가에서 전체 100점 중 25점을 차지했다. 카메론 CPO는 한국 AI 생태계가 최근 1년 동안 빠르게 발전했다고 평가했다. LG AI연구원을 비롯한 국내 AI 기업 기술 개발과 한국 정부의 독자 AI 파운데이션 모델 사업이 성장을 뒷받침했다고 설명했다. 그는 국내 AI 모델 지능 수준이 여전히 미국과 중국 최상위 모델에 뒤처진다고 진단했다. 다만 모델 경쟁력을 지능만으로 판단해서는 안 된다고도 강조했다. 카메론 공동창업자는 "AI 모델별 과업 수행 비용은 100배 이상 차이 날 수 있다"며 "기업은 성능뿐 아니라 비용 효율성과 운영 방식도 함께 고려해야 한다"고 설명했다. "한국 AI, 비용·현지화 경쟁력 갖춰" 카메론 CPO는 다수 한국 AI 모델이 오픈웨이트로 공개된 점을 경쟁력으로 꼽았다. 기업이 해당 모델을 자체 하드웨어(HW)와 시스템에 구축할 수 있어 비용을 줄이고 내부 업무에 맞춰 모델을 조정하기 쉽다는 이유에서다. 카메론 CPO는 한국어와 국내 산업 환경에 최적화된 현지화 역량도 강점으로 봤다. 범용 벤치마크 점수가 가장 높은 모델이 아니더라도 한국 기업 업무와 규제·데이터 환경에서는 국산 모델이 더 적합할 수 있다는 분석이다. 그는 한국 AI 기업이 우선 공략할 분야로 첨단 제조업과 지식 업무 부문을 꼽았다. 한국이 이미 제조업 기반과 관련 기업을 갖춘 만큼 산업 현장에서 활용할 수 있는 AI 기술을 개발하면 차별화된 경쟁력을 확보할 수 있다는 이유에서다. 또 과학 연구를 지원하는 AI와 장시간 자율적으로 업무를 수행하는 에이전트 기술도 주요 개발 분야로 꼽혔다. 모델이 현실에서 과업을 수행하려면 직접 코드를 작성하고 외부 시스템을 조작할 수 있는 코딩 역량도 필요하다는 평가다. 카메론 CPO는 한국이 산업 특화 전략에만 집중해 범용 모델 개발을 소홀히해선 안 된다고 지적했다. 범용 지능이 제조·과학 등 특정 분야 문제를 해결하는 기반이 되는 만큼 한국 기업도 AGI 경쟁을 지속해야 한다는 주장이다. 그는 이에 발맞춰 AI 평가 방식도 실제 업무 수행 능력을 측정하는 방향으로 바뀌어야 한다고 내다봤다. 실제 아티피셜 애널리시스는 이메일 작성과 파워포인트 제작·엑셀 분석 등 기업 지식 업무를 평가하는 'AA-브리프케이스' 벤치마크를 인텔리전스 인덱스에 반영했다. 카메론 CPO는 "향후 문제가 발생하기 전 상황을 감지하고 조치하는 AI 능력도 주요 평가 대상이 될 전망"이라며 "제조 공정에서 이상이 발생하면 AI 에이전트가 이를 스스로 파악해 대응하고 담당자에게 결과를 알릴 수 있어야 할 것"이라고 강조했다.

2026.09.14 12:35김미정 기자

모티프, 독파모 탈락 이의신청…해외선 '벤치마크 무용론'

글로벌 벤치마크 지표에서 최고점을 받고도 정부 '독자 AI 파운데이션 모델(독파모)' 2차 평가에서 탈락한 모티프테크놀로지스가 벤치마크 비중을 더 반영하라며 이의를 제기했다. 그러나 해외 AI 연구 현장에서는 벤치마크만으로 모델을 평가하는 방식에 회의론이 커지고 있는 상황이다. 27일 모티프테크놀로지스는 독파모 2차 선정 결과에 공식 이의를 제기하고 세부 평가점수와 기준 공개, 재심의를 요청했다. 회사가 개발한 '모티프 3'는 글로벌 AI 평가기관 아티피셜 애널리시스의 종합 지표 AAII에서 47점을 받아 참여 4개 모델 중 1위를 기록했다. 모티프는 입장문에서 "AAII 1위(47점)와 4위(31점)의 16점 격차가 배점 환산 과정에서 4점으로 줄었다"며 "배점 산정 방식이 실제 성능 차이를 반영하지 못한다"고 주장했다. 하지만 해외에선 벤치마크 점수를 실제 성능 척도로 삼는 데 대한 회의론이 커지고 있다. 노엄 브라운 오픈AI 연구부사장은 "막대그래프 하나로 AI 실력을 재는 시대는 끝났다"고 말했다. 오픈AI 추론 모델 'o1'·'o3' 시리즈를 설계한 그는 벤치마크가 성능을 하나의 숫자로 압축하면서 정작 중요한 차이를 지운다고 지적했다. 브라운 부사장이 든 근거는 연산량이다. 같은 모델이라도 더 오래 연산하게 하면 성능이 크게 달라지는데 막대그래프 점수 하나로는 이 차이가 드러나지 않는다. 그는 "최신 모델일수록 추론에 투입하는 연산량을 늘리면 성능이 계속 오르는 반면, 구형 모델은 일정 수준에서 정체된다"며 "단일 점수가 아니라 연산량 대비 성능 곡선으로 모델을 평가해야 하고 이를 무시하면 실제 역량을 과소평가하거나 반대로 발생할 수 있는 위험을 놓칠 수 있다"고 말했다. 나만 고얄 구글 딥마인드 머신러닝 리서치 엔지니어는 벤치마크를 '텅 빈 코스에서 치르는 운전면허 시험'에 비유했다. 정제된 환경에서 시험을 통과해도, 노이즈와 예외가 뒤섞인 실제 현장에서 잘 작동한다는 보장은 없다는 뜻이다. 고얄 엔지니어는 자신의 초기 연구 사례를 들었다. 성능이 뛰어난 물체 탐지 모델이 영상의 한 프레임에서는 대상을 정확히 찾고도, 거의 똑같아 보이는 다음 프레임에서는 놓치는 경우가 있었다. 그는 "친구를 알아보고 나서 1초 뒤 고개를 돌렸을 뿐인데 알아보지 못하는 것과 같았다"며 "정제된 테스트에서 조금만 벗어나도 모델이 무너질 수 있다"고 말했다. 또 "모델 배포 전에 복잡하고 예외적인 상황을 의도적으로 시험하는 테스트를 통과 관문으로 두어야 한다"고 제안했다. 과기정통부가 2차 평가에서 사용자 평가를 새로 도입한 배경도 이러한 벤치마크 한계와 연관된다. 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점으로 짜인 이번 평가에서 AI 전문가 49명과 일반 국민 185명이 각 팀 모델을 직접 써보고 채점했다. 벤치마크 성능만으로는 통과할 수 없는 구조다. 3차에 오른 곳은 업스테이지·SK텔레콤·LG AI연구원이다. 김경만 과기정통부 AI정책실장은 27일 제2차 과학기술·인공지능 미래전략회의 현장에서 모티프 이의신청에 대해 "AAII의 공신력은 인정한다"면서도 "한국어 특성과 안전성, 신뢰성 등을 반영한 별도 성능평가도 있었다"고 밝혔다. 공개 벤치마크 점수만으로 최종 순위를 판단하기는 어렵다는 취지다. 그는 "모델을 잘 만드는 능력과 이를 실제로 활용하는 능력은 다를 수 있다"고 덧붙였다. 김 실장은 모티프 이의신청을 15일 이내에 처리하되, 세부 점수 전면 공개는 하위 평가 기업에 낙인 효과를 줄 수 있어 신중히 검토하겠다고 밝혔다. 일각에서는 모티프테크놀로지스를 둘러싸고 이른바 '벤치맥싱' 논란도 제기된다. 미국 AI 데이터 기업 애프터쿼리가 최근 링크드인을 통해 모티프 3의 '유일한 데이터 파트너'로 참여했다는 소식을 알리면서다. 벤치맥싱은 특정 벤치마크에서 높은 점수가 나오도록 데이터와 사후학습을 설계하는 작업을 뜻한다. 애프터쿼리는 모델의 취약 영역을 파악해 이를 개선할 데이터와 학습법을 제공하는 사업을 하고 있다. 모티프 측은 "에이전트 성능을 높이기 위한 협업이며 벤치마크 점수만을 겨냥한 것은 아니다"라고 반박했다.

2026.08.27 14:44김동원 기자

한국 AI, 美中 이어 '3위' 굳히기…독파모 성과 주목

한국이 미국과 중국에 이어 글로벌 인공지능(AI) 경쟁에서 3위권 국가로 자리매김했다는 평가가 나왔다. 단일 기업이나 모델 성과를 넘어 국내 여러 AI 기업이 자체 파운데이션 모델 경쟁력을 동시에 입증하면서 한국 AI 생태계의 저변이 확대되고 있다는 분석이다. 글로벌 AI 성능 분석 전문기관 아티피셜 애널리시스는 26일 엑스(X·옛 트위터)에서 "한국은 미국과 중국에 이어 글로벌 AI 경쟁에서 다시 한번 명확한 3위를 차지했다"며 "한국 AI 생태계의 깊이와 활력은 탄탄한 국내 인재와 정부 투자, '독자 AI 파운데이션 모델(독파모)' 프로젝트가 만들어낸 인센티브에 의해 뒷받침되고 있다"고 밝혔다. 최근 아티피셜 어낼리시스의 종합 평가 지표인 '아티피셜 애널리시스 인텔리전스 인덱스'(AAII)에서는 국내 주요 AI 모델들이 잇따라 30점 이상을 기록했다. 모티프테크놀로지스의 '모티프3'가 47점으로 가장 높은 점수를 받았고 업스테이지 '솔라 프로4' 42점, SK텔레콤 'A.X K2' 35점, LG AI연구원 'K-엑사원 2.0' 31점 등이 뒤를 이었다. 특히 모티프3와 솔라 프로4는 40점 이상을 기록하며 미국과 중국을 제외한 국가에서 개발된 모델 가운데 가장 높은 수준의 점수를 받았다. 독파모 사업에 참여한 기업뿐 아니라 트릴리온랩스, KT 등도 자체 모델 개발에 나서면서 국내 AI 모델 생태계의 경쟁 구도가 확대되는 모습이다. 아티피셜 애널리시스는 "한국의 모델 개발 생태계는 계속해서 확대되고 있다"며 "한국 내 AI 분야는 1년 전보다 훨씬 더 깊고 경쟁력 있는 생태계로 발전했다"고 설명했다. 이번 평가를 두고 국내에서도 한국 AI 생태계가 주요국과의 경쟁에서 의미 있는 수준까지 올라섰다는 목소리가 나온다. 하정우 전 대통령실 AI미래기획수석비서관은 이날 엑스에서 "글로벌에서 가장 널리 인정받는 AAII가 한국을 명실공히 AI 레이스 넘버 3(No.3) 국가로 인정하고 있다"며 "오픈웨이트 모델 기준 미국을 제치고 2위를 차지했다"고 말했다. 이어 "현재 벤치마크 한계를 고려해도 이 성과 자체는 상당히 큰 의미가 있다"며 "국가 AI 전략과 혁신역량을 보유한 국내 독파모 기업들이 함께 만든 성과"라고 강조했다.

2026.08.26 14:30이나연 기자

독파모 최종전 '실행력' 본다…평가기준·투명성 과제로

정부 주도의 국가대표 인공지능(AI) 선발전인 '독자 AI 파운데이션 모델(독파모)' 프로젝트가 내년 초 최종 2개 팀을 가린다. 마지막 단계평가를 앞두고 정부가 벤치마크 자체 평가 항목 중 도구·에이전트와 코딩 분야를 구축하기로 하면서 결과에 어떤 영향을 미칠지 주목된다. 24일 업계에 따르면 한국지능정보사회진흥원(NIA)은 지난 12일 'AI 모델 벤치마크 데이터셋 구축 사업(2차)' 공모를 냈다. 도구·에이전트와 코딩 2개 분야에서 한국어 기반 벤치마크 데이터셋을 구축하는 사업으로, 다음 달 11일까지 참가 신청을 받는다. 총사업비는 12억원이며 분야당 6억원이 지원된다. 벤치마크 자체 평가에 에이전트·코딩 분야 신규 편입 이 사업은 독파모 평가에 쓰이는 벤치마크를 만드는 과제다. 실제 공모안내서에는 이 사업이 독파모 프로젝트와 함께 과기정통부의 월드 베스트 거대언어모델(LLM) 데이터 활용 지원 사업' 산하에서 추진된다고 명시됐다. 이렇게 구축된 데이터셋은 AI 모델 성능 검증을 2회 지원하게 된다. NIA는 지난해 7월 1차로 공고했던 'LLM 성능 평가 데이터셋 구축 사업'에서 수학·지식·장문이해 3개 분야 벤치마크를 구축했다. 반면 이번 공모에서는 도구·에이전트와 코딩 분야를 신규로 구축한다. 텍스트 기반의 지식·추론 능력을 재던 1차와 달리, 2차 사업에서는 도구를 활용해 실제 과업을 완수하는 실행 능력을 새 평가 축으로 삼은 셈이다. 이 같은 변화는 독파모 2차수가 사실상 텍스트 기반 평가에 머물렀다는 지적을 반영한 것으로 풀이된다. 2차 평가에 오른 LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 4개 팀 모델은 모두 미국 비영리 연구기관 에포크AI의 '주목할 만한 AI 모델'에 이름을 올렸지만 도메인은 언어에만 한정됐다. 모델 사용성을 보는 정성 평가도 텍스트에 한정됐다. 2차수 당시 전문가 평가와 일반 국민 평가 모두 LLM의 텍스트 응답 성능을 대상으로 이뤄졌고 파일 첨부나 이미지·영상 생성 같은 텍스트 외 기능은 평가 대상에서 빠졌다. 글로벌 프론티어 모델 경쟁이 이미지·음성·영상을 함께 처리하는 멀티모달로 이동한 것과는 대비되는 지점이다. 최종 평가 어떻게 진행되나…기준 설정에 쏠린 눈 독파모 최종전인 3차 평가 방식은 2차 결과에 대한 이의제기 절차가 끝난 뒤 참가 팀들과의 합의를 거쳐 확정된다. 앞선 두 차례 평가 전후로 업계 안팎에서 여러 논란이 이어진 만큼 3차 평가 기준이 어떻게 짜일지에 업계 이목이 쏠린다. 독파모는 기술 독자성(프롬 스크래치) 논란에 이어 2차에서 특정 벤치마크를 겨냥한 데이터와 사후학습으로 점수를 집중적으로 끌어올리는 '벤치맥싱' 의혹에 휩싸였다. 세부 점수 공개를 둘러싼 투명성 문제도 제기됐다. 안광섭 세종대학교 겸임교수(인레벨나인 대표)는 "사업 목표와 쓰임새를 분명히 정하고 가야 평가 논란이나 실효성에 대한 의문이 반복되지 않는다"며 "모델을 하나의 기준으로 줄 세우기보다 크기별·용도별로 나눠 평가하는 체계도 고려해야 한다"고 말했다. 벤치마크 다양화부터 투명성 개념 재정립까지 2차 평가에서 AAII 점수를 둘러싼 벤치맥싱 논란이 불거지면서 단일 지표에 대한 의존도를 낮춰야 한다는 목소리도 커졌다. 단순 배점만 조정해서는 벤치맥싱 같은 논란을 근본적으로 막기 어렵다는 이유에서다. 업계에서는 아티피셜 애널리시스의 AI 모델 종합평가인 'AAII' 외에도 글로벌 지표를 추가로 검토해야 한다는 의견이 나온다. AI에 가상의 사업 운영을 맡기고 최종 잔고로 채점하는 '벤딩벤치', 실사용 세션 수백만 건으로 작업 완수를 재는 '에이전트 아레나' 등이 AAII를 보완할 주요 지표로 거론된다. 안 교수는 "문제를 미리 알려주고 보는 시험은 없다"면서 "2차 평가 요소에 AAII를 추가했듯 3차에 새 지표를 넣더라도 어떤 시험지를 쓸지는 각 팀에 알려주지 않는 블라인드 방식으로 가야 한다"고 강조했다. 독파모 평가 지표 및 평가 결과 산출 기준에 대한 투명성의 본질이 점수 공개 여부에 있지 않다는 의견도 있다. 점수를 낱낱이 공개하기보다 평가가 어떤 절차와 기준으로 이뤄졌는지를 사전에 밝히는 게 우선이라는 것이다. 과학기술정보통신부는 2차 평가 발표 브리핑에서 1위 기업에 대한 인식 제고와 나머지 기업에 대한 낙인 효과를 우려해 세부 순위를 밝히지 않았다. 그러나 결과 공개 이후 구체적인 점수 산출 근거에 대한 요구가 커지자 이틀 만에 보도설명자료를 내고 1차 평가와 같이 항목별 1위 기업과 점수를 공개했다. 안 교수는 "대학수학능력시험(수능) 출제위원도 외부와 차단된 환경에서 비공개로 문제를 만들지만 아무도 이를 불투명하다고 하지 않는다"며 "점수 하나하나를 공개하는 것보다 전문가 평가위원을 어떤 기준으로 선정했는지 등을 구체적으로 알리는 것이 투명성 확보에 더 가깝다"고 제언했다.

2026.08.24 14:56이나연 기자

독파모 '벤치맥싱' 논란에 AAII 입장…"평가 방법론 지속 업데이트"

글로벌 인공지능(AI) 평가기관 아티피셜 애널리시스가 벤치마크 맞춤형 학습으로 실제 성능 개선 없이 점수만 높아질 수 있다는 우려를 인정했다. 현재 이같은 이슈를 최소화하기 위해 내부적으로 기술적 조치를 강화하고 있는 것으로 확인됐다. 14일 아티피셜 애널리시스는 지디넷코리아에 보낸 이메일에서 "벤치마크를 활용해 모델 약점을 보완하는 것은 통상적인 개발 과정"이라면서도 "특정 평가에 과도하게 최적화해 점수만 끌어올리는 방식은 경계해야 한다"고 밝혔다. 아티피셜 애널리시스는 글로벌 AI 모델 성능과 속도, 비용 등을 비교·분석하는 민간 평가기관이다. 해당 기관이 운영하는 '아티피셜 애널리시스 인텔리전스 지수(AAII)'가 독파모 2차 평가에서 전체 100점 중 25점을 차지한다. 아티피셜 애널리시스는 이같은 벤치마크 이슈를 최소화하기 위해 내부 분석과 검증, 자체 평가 데이터 활용, 지속적 평가 방법론 업데이트 등 세 가지 장치를 추진하고 있다고 말했다. 아티피셜 애널리시스 관계자는 "우리는 개별 평가와 전체 지수 차원에서 모델 답변과 추론 과정, 실행 로그, 점수 분포를 검토한다"며 "이를 통해 비정상적인 점수 변화나 특정 평가에만 특화된 최적화 흔적을 찾는다"고 말했다. 이어 자체적으로 개발·관리하는 평가와 외부 벤치마크도 활용한다고 밝혔다. 특정 공개 데이터나 하나의 평가 방식에 대한 의존도를 낮춰 일부 시험에 특화된 학습이 전체 점수 상승으로 이어지는 것을 막기 위해서다. 관계자는 평가 항목과 가중치, 채점 방식도 정기적으로 바꾸겠다고 밝혔다. 최신 AI 기술과 산업에서 중요해진 역량을 반영해 평가 체계를 지속적으로 개편함으로써 AAII가 개발사 공략 대상이 되지 않도록 한다는 취지다. 기관이 현재 사용 중인 'AAII 4.1.1' 버전은 에이전트 업무와 코딩, 과학적 추론, 장문 맥락 추론, 지식과 환각 등을 측정하는 9개 평가로 구성됐다. 아티피셜 애널리시스는 한 영역에서만 점수를 높이더라도 성능이 다른 과제로 확장되지 않으면 전체 지수에 미치는 영향은 제한적이라고 주장하고 있다. 그러나 아티피셜 애널리시스는 실제 벤치마크 과적합 징후를 발견한 사례가 있는지는 공개하지 않았다. 과적합 징후를 확인했을 때 해당 점수를 제외하거나 모델을 재평가하는지, 순위를 조정하거나 외부에 경고하는지 등 사후 조치 기준도 밝히지 않았다. 독파모 평가 25점 걸린 AAII...업계 "실제 성능 왜곡 우려" 최근 업계에선 일부 독파모 참여사 일부가 AAII 점수를 겨냥한 맞춤형 사후학습 데이터를 활용하고 있다는 의혹이 제기되고 있다. 이에 일각에선 일부 참여사가 모델이 낮은 점수를 받은 지식 영역과 문제 유형을 분석한 뒤 유사한 사후학습 데이터를 구매하거나 별도 구축하고 있다는 주장이 나온다. 벤치마크 문제와 정답을 그대로 학습하는 방식은 아니지만, 실제 사용 역량보다 특정 평가 점수만 높아진다면 모델 성능을 왜곡하는 벤치맥싱으로 이어질 수 있다는 우려다. AAII 순위가 독파모 2차 평가의 최종 결과를 의미하는 것은 아니다. NIA 벤치마크와 전문가·사용자 평가가 별도로 진행되는 데다 AAII 역시 버전과 평가 구성에 따라 점수가 달라질 수 있어서다. 과학기술정보통신부는 AAII만으로 모델 우열을 판단하지 않고 한국지능정보사회진흥원(NIA) 벤치마크와 전문가·사용자 평가를 종합한다는 입장이다. 그러나 AAII에 전체 점수의 4분의 1이 배정된 만큼 벤치마크 맞춤형 학습을 실제 성능 향상과 어떻게 구분할지가 평가 공정성을 가를 핵심 과제로 꼽힌다. 아티피셜 애널리시스는 "우리는 모델 답변과 추론 과정, 실행 로그, 점수 분포를 분석해 평가에만 특화된 최적화 방법론을 꾸준히 연구 중"이라고 밝혔다.

2026.08.14 15:40김미정 기자

업스테이지 '솔라 프로 4', 韓 모델 최초 글로벌 개발자 플랫폼에

업스테이지의 최신 거대언어모델(LLM) '솔라 프로 4'가 한국 모델 최초로 글로벌 개발자 플랫폼에 이름을 올렸다. 업스테이지는 솔라 프로 4 공개 직후 미국 누스 리서치가 개발한 AI 에이전트 '헤르메스 에이전트'와 응용 프로그램 인터페이스(API) 라우팅 플랫폼 '오픈라우터'에 등재됐다고 14일 밝혔다. 오픈라우터 등재 3일 만에 누적 토큰 소비량은 800억 토큰을 넘어섰다. 글로벌 주요 모델의 에이전트 성능을 비교하는 '에이전트 아레나' 리더보드에도 한국 모델 최초로 진입해 미국·중국 모델이 독점하던 47개 주요 모델 순위표에 자리했다. 솔라 프로 4는 실제 업무 수행에 최적화된 에이전트 역량이 핵심이다. 터미널 다단계 작업 완수 능력 평가(Terminal-Bench v2.1)에서 57점으로 전작보다 4.8배 향상됐고 도구 사용 능력 평가(τ³-Banking)에서도 23점으로 2.6배 개선됐다. 장문 이해 벤치마크(AA-LCR)에서는 71점으로 전작 대비 2.3배 이상 우수한 성능을 보였다. 글로벌 AI 평가기관 아티피셜 애널리시스의 종합 성능 지표(AAII)에서는 42점으로 전작 대비 3배 이상 개선됐다. 엔비디아 '네모트론 3 울트라'(38점)·구글 '제미나이 3.5 플래시-라이트'(37점) 등 미국 빅테크는 물론, 미스트랄 '미디엄 3.5'(30점), 코히어 '커맨드 A+'(23점) 등 경쟁 소버린 모델을 앞섰다. 국내 기업 및 공공기관 사무 환경에 특화된 한국어 성능과 문서 처리 능력도 향상됐다. 솔라 프로 4는 업스테이지의 에이전트 문서 처리 통합 솔루션 '업스테이지 스튜디오'에 탑재됐다. 한글 문서를 비롯한 다양한 문서 서식에서 정보를 추출해 요약·분석·번역 등의 작업을 한 번에 처리할 수 있다. 김성훈 업스테이지 대표는 "실무에서 AI에게 필요한 것은 시험을 잘 보는 능력이 아니라 맡은 일을 끝까지 해내는 신뢰성"이라며 "솔라 프로 4가 글로벌 개발자 플랫폼에 한국 모델 최초로 이름을 올린 것은 우리 AI 기술이 세계 현장에서 통한다는 증거"라고 말했다.

2026.08.14 12:59이나연 기자

모티프 3, 글로벌 AI 성적표서 한국 기업 '1위'

모티프테크놀로지스가 자체 개발한 인공지능(AI) 파운데이션 모델 '모티프 3'가 글로벌 AI 모델 평가기관 아티피셜 애널리시스의 종합 지능 지수(AAII)에서 47점을 받으며 한국 기업 1위, 글로벌 10위를 기록했다. 오픈웨이트 모델 기준으로는 글로벌 4위에 올랐다. 모티프테크놀로지스는 모티프 3를 허깅페이스에 오픈소스로 공개했다고 13일 밝혔다. 모티프 3는 회사가 정부 '독자 AI 파운데이션 모델' 사업 2차에 합류한 후 5개월 만에 사전학습부터 후처리까지 전 과정을 처음부터(from scratch) 개발한 모델이다. 총 3140억 개(314B) 파라미터, 활성 132억 개(13.2B) 파라미터의 전문가 혼합(MoE) 구조 LLM으로 구성됐다. 세부 벤치마크 결과에 따르면 모티프 3는 실제 업무 수행 능력을 측정하는 에이전틱 벤치마크가 가장 두드러진 성과를 냈다. 금융 업무 에이전트 과업 완수율 평가(τ³-Banking)에서 35.3점으로 딥시크 V4 프로(30.1점)·키미 K2.6(23.3점)·GLM-5.1(13.6점)·큐원-3.5(13.4점) 등 비교군 전원을 앞섰다. 터미널 환경 실전 코딩·시스템 작업 능력 평가(Terminal-Bench 2.1)에서도 74.9점으로 1위를 기록했다. 장문 추론 능력 평가(AA-LCR)에서는 72.3점으로 규모가 2~5배 큰 모델들과 대등한 수준을 보였다. 실물 경제 업무 수행 가치 평가(GDPval v2)에서는 38.7점으로 5배 규모인 딥시크 V4 프로(40.2점)를 뒤이었다. 모르는 내용을 아는 것처럼 지어내지 않는지를 측정하는 논-할루시네이션 지표(AA-Omniscience)에서는 71.6점으로 비교군 중 2위에 올랐다. 이 밖에 소프트웨어 엔지니어링(SWE-bench Verified) 76.2점, 전문가급 초고난도 지식 평가인 '인류 최후의 시험(Humanity's Last Exam)' 37.0점을 기록했다. 모티프테크놀로지스 측은 "총 1조 파라미터를 넘나드는 초대형 모델과의 경쟁 속 실제 서비스 비용을 좌우하는 활성 연산량을 최소 수준으로 유지하면서 프론티어급 성능에 도달한 것"이라며 "연산량 대비 지능(intelligence per FLOP) 관점에서 세계 최고 수준의 효율"이라고 강조했다. 모티프 3는 상업적 활용을 포함한 MIT 라이선스로 모델 가중치와 학습 코드, 라이브러리까지 전면 공개됐다. 모티프테크놀로지스는 자체 개발한 어텐션 구조 GDLA(Grouped Differential Latent Attention)를 비롯해 아키텍처, 옵티마이저, 후처리 등 모델 개발 전 계층에 걸쳐 자체 설계 기술을 적용했다. 언어모델 외에도 비전(7B), 오디오(0.7B), 비디오 VAE(1.2B) 등 3개 모달리티 인코더를 병행 개발해 총 4개 모듈을 완성했다. 자체 비전 인코더는 메타의 V-JEPA 2.1, DINOv3 등 해외 최신 비전 모델을 상회하는 성능을 보인 것으로 나타났다. 모티프테크놀로지스는 향후 모티프 3 고도화와 더불어 차세대 모델 '모티프 4'에서 글로벌 5위권 진입을 목표로 한다. 비전, 오디오, 비디오 모듈을 언어모델과 결합한 멀티모달 통합 모델로 확장할 계획이다. 임정환 모티프테크놀로지스 대표는 "모티프 3는 짧은 기간과 제한된 자원 속에서 독자 아키텍처만으로 글로벌과 경쟁할 수 있는 수준임을 증명한 시작점"이라며 "같은 조건이 주어졌을 때 우리가 어디까지 갈 수 있는지는 이제부터가 증명의 시간"이라고 말했다. 이어 "이번에 얻은 자신감을 바탕으로 미국과 중국 프론티어 모델들과 대등하게 경쟁할 수 있는 최고 수준의 AI 모델을 완성하겠다"고 덧붙였다.

2026.08.13 11:29이나연 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

대답만 하는 AI는 끝…'AI페스타'서 일하는 AI 만난다

퀄컴, PC 프로세서 보급형까지 확대...게임·메모리 가격 관건

도쿄 통신비가 더 싸다고?…일본 정부가 만든 '제멋대로 비교'

[ZD브리핑] 마이크론 최대실적 예고...개보위원장·통신3사 CEO 첫회동

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.