• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'독파모'통합검색 결과 입니다. (180건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

이의 제기에 공개된 독파모 점수…참여 업체들 "이젠 모티프가 답할 차례"

정부 독자 AI 파운데이션 모델(독파모) 2차 평가에서 탈락한 모티프테크놀로지스가 거듭 이의를 제기하자 참여 업체들이 비판에 나섰다. 정작 자사 모델을 둘러싼 의혹엔 답하지 않으면서 정부 평가만 문제 삼는다는 지적이다. 27일 AI 업계에 따르면 독파모 사업에 참여한 업체들 사이에서는 모티프테크놀로지스의 잇단 문제 제기에 "결과에 아쉬움은 이해하지만 방식에는 동의하기 어렵다"는 반응이 많은 것으로 나타났다. 앞서 모티프테크놀로지스는 자사 모델 '모티프 3'가 글로벌 AI 평가지표 아티피셜 애널리시스 인텔리전스 인덱스(AAII)에서 참여 모델 중 1위를 기록하고도 종합 최하위로 탈락하자 이의를 제기했다. 정부가 이례적으로 전체 세부 점수를 공개하자 이번에는 전문가 평가 채점 기준과 평가위원 구성을 다시 문제 삼았다. 공개된 세부 점수를 보면 모티프 3는 AAII에서만 11.9점으로 1위였고 나머지는 모두 최하위였다. 한국어와 안전성을 반영한 NIA 벤치마크가 12.7점, 전문가 평가 27.1점, 사용자 평가 14.1점으로 모두 꼴찌였다. 종합 점수는 65.8점으로 ▲SK텔레콤(70.6점) ▲업스테이지(69.9점) ▲LG AI연구원(69.0점)에 뒤처졌다. AI 업계가 대표적으로 지적한 대목은 문제 제기의 초점이 계속 바뀐다는 점이다. A사 관계자는 "세부 점수를 공개하라고 해서 정부가 전체 점수를 공개했더니 이번에는 전문가 평가와 평가위원을 문제 삼는다"고 말했다. C사 관계자도 "붙었으면 아무 말 없었을 텐데 떨어지니 따질 대상을 계속 바꾼다"며 "판정에 불만이 있다고 심판 자질부터 문제 삼는 격"이라고 꼬집었다. 정작 모티프테크놀로지스 스스로는 검증에 침묵한다는 비판도 나왔다. 이 회사는 최근 이른바 '벤치맥싱' 논란에 휩싸였다. 미국 AI 데이터 기업 애프터쿼리가 링크드인을 통해 모티프 3의 '유일한 데이터 파트너'로 참여했다는 소식을 알리면서다. 벤치맥싱은 특정 벤치마크에서 높은 점수가 나오도록 데이터와 사후학습을 설계하는 작업을 뜻한다. 애프터쿼리는 모델의 취약 영역을 파악해 이를 개선할 데이터와 학습법을 제공하는 사업을 하고 있다. C사 관계자는 "특정 벤치마크만 겨냥해 점수를 끌어올리는 것은 얼마든지 가능하다"며 "AAII 1위가 곧 최강이라는 뜻은 아니다"라고 선을 그었다. 이어 "떳떳하다면 애프터쿼리와 협업하기 전과 후로 점수가 어떻게 달라졌는지 공개하면 될 일"이라고 강조했다. A사 관계자도 "정부에는 투명성을 요구하면서 자사 의혹은 공격으로만 규정한다"며 "같은 잣대를 스스로에게도 적용해야 한다"고 지적했다. 이에 대해 모티프테크놀로지스 측은 "에이전트 성능을 높이기 위한 협업이며 벤치마크 점수만을 겨냥한 것은 아니다"라고 반박했다. 모티프테크놀로지스가 요구한 평가위원 공개는 비현실적이라는 반론도 있다. C사 관계자는 "심사위원을 공개하면 그 사람은 다음부터 평가에 참여할 수 없다"며 "국내 전문가 풀이 좁아 해외 교수까지 거론됐던 상황"이라고 전했다. 평가 기준도 4개 팀이 함께 모여 여러 번 논의 끝에 정한 만큼 모티프테크놀로지스가 몰랐을 리 없다는 설명이다. 다만 전문가 평가 방식은 손볼 여지가 있다는 데 일부가 공감했다. B사 관계자는 세부 점수 공개는 긍정적으로 보면서도 "전문가 평가는 종합 점수로만 나왔을 뿐 평가위원을 어떻게 뽑고 무엇을 기준으로 채점했는지 알 수 없다"고 말했다. 이 관계자는 벤치마크 비중을 줄이자는 일각의 주장에는 신중한 입장을 보였다. 그는 "다른 평가 방식을 찾는 것은 가능하지만 단순히 벤치마크 비중만 줄이면 전문가나 사용자 평가 비중이 그만큼 높아진다"며 "지금도 불명확한 전문가 평가를 보완 없이 키우면 문제가 더 커질 수 있다"고 말했다. 모티프테크놀로지스가 이번 일로 얻을 실익이 없다는 반응도 이어졌다. A사 관계자는 "이미 3차에 참여하지 않겠다고 한 상황에서 정부와 충돌해 얻을 것이 무엇인지 모르겠다"고 토로했다. C사 관계자는 "정부에 답을 요구하기 전에 자사 모델을 둘러싼 의혹부터 스스로 풀어야 할 때"라고 강조했다.

2026.08.27 22:29장유미 기자

베일 벗은 독파모 AI 평가 점수...전문가·국민 평가가 승패 갈랐다

정부가 '독자 인공지능(AI) 파운데이션 모델' 프로젝트 2차 평가의 상세 점수를 발표하면서, 모티프테크놀로지스가 최종 선정되지 못한 이유가 명확해졌다. 과학기술정보통신부는 27일 2차 단계평가 종합점수를 공개했다. SK텔레콤이 70.6점으로 1위를 차지했으며, 업스테이지 69.9점, LG AI연구원 69.0점으로 뒤를 이었다. 모티프테크놀로지스는 65.8점으로 4위를 기록했다. 모티프는 글로벌 벤치마크 평가에서는 가장 높은 점수를 받았지만 전문가와 사용자 평가에서 상대적으로 낮은 점수를 기록한 것으로 나타났다. 모티프의 벤치마크 평가는 24.6점으로 4개 팀 중 가장 높았지만 전문가 평가는 27.1점과 사용자 평가는 14.1점으로 모두 최하위였다. 특히 글로벌 AI 성능을 측정하는 '아티피셜 애널리시스 인텔리전스 인덱스(AAII)' 평가에서 모티프는 11.9점으로 1위를 기록했다. 업스테이지가 9.4점으로 뒤를 이었으며 SK텔레콤은 8.8점과 LG AI연구원은 7.8점을 받았다. 한국어와 안전성 등 국내 활용 환경을 반영한 한국지능정보사회진흥원(NIA) 벤치마크에서는 SK텔레콤이 13.4점으로 가장 높은 점수를 받았다. 업스테이지는 13.3점과 LG AI연구원은 12.8점이었으며 모티프는 12.7점을 기록했다. 전문가 평가에서는 LG AI연구원이 29.5점으로 1위에 올랐다. SK텔레콤은 29.3점과 업스테이지는 29.1점을 기록했으며 모티프는 27.1점으로 가장 낮았다. 평가는 개발 전략과 기술 10점, 개발 성과와 계획 10점, 파급효과와 기여계획 15점으로 구성됐다. 실제 이용자 평가에서는 SK텔레콤과 LG AI연구원이 강점을 보였다. AI 전문 사용자 평가에서는 SK텔레콤이 11.6점으로 1위였으며 LG AI연구원 11.3점과 업스테이지 10.8점, 모티프 8.4점 순이었다. 일반 국민 평가에서는 LG AI연구원이 7.6점으로 가장 높은 점수를 받았다. SK텔레콤은 7.5점과 업스테이지는 7.3점을 기록했으며 모티프는 5.7점에 그쳤다. 일반 국민 평가는 성별과 연령별 비율을 반영해 무작위로 선정된 200명 가운데 실제 참여한 185명을 대상으로 진행됐다. 정부는 이번 추가 공개가 모티프 요청에서 시작됐다고 설명했다. 이날 모티프는 입장문을 통해 세부 평가 결과 공개를 요청했으며, 다른 정예팀들도 이에 동의했다. 정부는 그동안 기업의 직·간접적 피해 가능성과 평가 과정 공정성·투명성을 함께 고려해 공개 범위를 신중하게 결정해왔다. 과기정통부는 "이번 결과 공개 이후에도 우리 기업들이 단순한 점수나 순위로 평가받기 보다 보유한 저력과 역량을 바탕으로 국내외 AI생태계에 폭넓게 기여해야 한다"며 "우리 AI생태계가 새롭고 경쟁력 있는 AI기업들이 끊임없이 도전하는 역동적인 생태계로 발전해 나가기를 기대한다"고 밝혔다. 임정환 모티프 대표는 AAII 평가에서는 1위를 기록했지만 국지능정보사회진흥원(NIA) 벤치마크에서 최하위로 낮은 점수를 받은 데 대해서는 회사 모델 개발 전략에 따른 결과라고 선을 그었다. 모티프는 글로벌 AI 시장에서 경쟁력을 우선 확보하는 방향으로 개발하면서 한국어 데이터 확보와 성능 개선에는 상대적으로 역량을 덜 투입했다고 밝혔다. 그는 "우리가 한국어 성능까지 잡을 여력은 없었다"며 "한국어 데이터가 타사에 비해 많이 부족한 것도 사실"이라고 밝혔다. 이어 "궁극적으로 AI는 글로벌 경쟁을 해야 한다고 판단하고 있어서 한국어 성능을 완벽하게 잡고 갈 수는 없겠다는 내부 판단을 하고 진행한 것이고 거기에 맞는 숫자가 나온 것"이라고 말했다. 임 대표는 NIA 평가 결과 자체에 대해서도 별도 문제를 제기할 계획은 없다는 입장이다. 그는 "이건 시험 보듯 그냥 채점한 것이라 검수할 필요조차 없는 부분이고 특별히 다른 할 말은 없다"고 밝혔다.

2026.08.27 20:06김동원 기자

모티프, 독파모 탈락 이의신청…해외선 '벤치마크 무용론'

글로벌 벤치마크 지표에서 최고점을 받고도 정부 '독자 AI 파운데이션 모델(독파모)' 2차 평가에서 탈락한 모티프테크놀로지스가 벤치마크 비중을 더 반영하라며 이의를 제기했다. 그러나 해외 AI 연구 현장에서는 벤치마크만으로 모델을 평가하는 방식에 회의론이 커지고 있는 상황이다. 27일 모티프테크놀로지스는 독파모 2차 선정 결과에 공식 이의를 제기하고 세부 평가점수와 기준 공개, 재심의를 요청했다. 회사가 개발한 '모티프 3'는 글로벌 AI 평가기관 아티피셜 애널리시스의 종합 지표 AAII에서 47점을 받아 참여 4개 모델 중 1위를 기록했다. 모티프는 입장문에서 "AAII 1위(47점)와 4위(31점)의 16점 격차가 배점 환산 과정에서 4점으로 줄었다"며 "배점 산정 방식이 실제 성능 차이를 반영하지 못한다"고 주장했다. 하지만 해외에선 벤치마크 점수를 실제 성능 척도로 삼는 데 대한 회의론이 커지고 있다. 노엄 브라운 오픈AI 연구부사장은 "막대그래프 하나로 AI 실력을 재는 시대는 끝났다"고 말했다. 오픈AI 추론 모델 'o1'·'o3' 시리즈를 설계한 그는 벤치마크가 성능을 하나의 숫자로 압축하면서 정작 중요한 차이를 지운다고 지적했다. 브라운 부사장이 든 근거는 연산량이다. 같은 모델이라도 더 오래 연산하게 하면 성능이 크게 달라지는데 막대그래프 점수 하나로는 이 차이가 드러나지 않는다. 그는 "최신 모델일수록 추론에 투입하는 연산량을 늘리면 성능이 계속 오르는 반면, 구형 모델은 일정 수준에서 정체된다"며 "단일 점수가 아니라 연산량 대비 성능 곡선으로 모델을 평가해야 하고 이를 무시하면 실제 역량을 과소평가하거나 반대로 발생할 수 있는 위험을 놓칠 수 있다"고 말했다. 나만 고얄 구글 딥마인드 머신러닝 리서치 엔지니어는 벤치마크를 '텅 빈 코스에서 치르는 운전면허 시험'에 비유했다. 정제된 환경에서 시험을 통과해도, 노이즈와 예외가 뒤섞인 실제 현장에서 잘 작동한다는 보장은 없다는 뜻이다. 고얄 엔지니어는 자신의 초기 연구 사례를 들었다. 성능이 뛰어난 물체 탐지 모델이 영상의 한 프레임에서는 대상을 정확히 찾고도, 거의 똑같아 보이는 다음 프레임에서는 놓치는 경우가 있었다. 그는 "친구를 알아보고 나서 1초 뒤 고개를 돌렸을 뿐인데 알아보지 못하는 것과 같았다"며 "정제된 테스트에서 조금만 벗어나도 모델이 무너질 수 있다"고 말했다. 또 "모델 배포 전에 복잡하고 예외적인 상황을 의도적으로 시험하는 테스트를 통과 관문으로 두어야 한다"고 제안했다. 과기정통부가 2차 평가에서 사용자 평가를 새로 도입한 배경도 이러한 벤치마크 한계와 연관된다. 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점으로 짜인 이번 평가에서 AI 전문가 49명과 일반 국민 185명이 각 팀 모델을 직접 써보고 채점했다. 벤치마크 성능만으로는 통과할 수 없는 구조다. 3차에 오른 곳은 업스테이지·SK텔레콤·LG AI연구원이다. 김경만 과기정통부 AI정책실장은 27일 제2차 과학기술·인공지능 미래전략회의 현장에서 모티프 이의신청에 대해 "AAII의 공신력은 인정한다"면서도 "한국어 특성과 안전성, 신뢰성 등을 반영한 별도 성능평가도 있었다"고 밝혔다. 공개 벤치마크 점수만으로 최종 순위를 판단하기는 어렵다는 취지다. 그는 "모델을 잘 만드는 능력과 이를 실제로 활용하는 능력은 다를 수 있다"고 덧붙였다. 김 실장은 모티프 이의신청을 15일 이내에 처리하되, 세부 점수 전면 공개는 하위 평가 기업에 낙인 효과를 줄 수 있어 신중히 검토하겠다고 밝혔다. 일각에서는 모티프테크놀로지스를 둘러싸고 이른바 '벤치맥싱' 논란도 제기된다. 미국 AI 데이터 기업 애프터쿼리가 최근 링크드인을 통해 모티프 3의 '유일한 데이터 파트너'로 참여했다는 소식을 알리면서다. 벤치맥싱은 특정 벤치마크에서 높은 점수가 나오도록 데이터와 사후학습을 설계하는 작업을 뜻한다. 애프터쿼리는 모델의 취약 영역을 파악해 이를 개선할 데이터와 학습법을 제공하는 사업을 하고 있다. 모티프 측은 "에이전트 성능을 높이기 위한 협업이며 벤치마크 점수만을 겨냥한 것은 아니다"라고 반박했다.

2026.08.27 14:44김동원 기자

'독파모' 학습데이터 29종 푼다…1.56조 토큰 'AI허브' 개방

정부가 '독자 인공지능(AI) 파운데이션 모델' 개발 과정에서 확보한 학습용 데이터를 민간에 개방했다. 국내 기업과 연구자가 대형 AI 모델과 멀티모달·안전성 기술을 개발할 수 있는 기반을 넓히기 위한 전략이다. 과학기술정보통신부는 독파모 5개 정예팀이 1차 단계평가 과정에서 확보한 데이터 29종을 한국지능정보사회진흥원(NIA)의 AI허브에 공개했다고 27일 밝혔다. 개방 규모는 약 3544만건으로 토큰으로 환산하면 약 1조 5600억개다. 이번 데이터는 정예팀들이 각자 AI 모델 개발 전략에 맞춰 2025년 데이터 구축·가공 예산 150억원으로 확보했다. 대규모 사전학습 데이터부터 영상·음성 기반 멀티모달 데이터와 AI 안전성 확보를 위한 레드티밍 데이터까지 포함됐다. 전체 데이터는 이론적으로 약 700~800억개 매개변수 수준의 대형 AI 모델을 학습하는 데 사용할 수 있는 규모다. 독자 AI 모델 개발에 참여한 정예팀들의 학습 전략과 데이터 구축 경험도 담겼다. 네이버클라우드는 공개 영상 234만건과 방송 영상 52만건을 비롯해 영상 클립을 기반으로 만든 텍스트 1550만건과 음성 질의응답 1200만건을 구축했다. 장면을 문장 단위로 설명한 캡션 등이 포함돼 AI의 영상 이해 능력과 이미지 생성 모델 학습에 활용할 수 있다. 업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만건의 사후학습 데이터를 공개했다. 사전학습 데이터는 대형 AI 모델을 처음부터 학습하는 데 쓸 수 있으며 사후학습 데이터는 추론과 판단·실행 능력을 갖춘 AI 에이전트 개발에 활용할 수 있다. SK텔레콤은 수학·과학·법률 분야의 고난도 다단계 추론 데이터와 음성·이미지 기반 사후학습 데이터를 구축했다. 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만건도 포함했다. NC AI는 제조 분야 기술문서와 민원 상담 음성 등 산업 현장에서 확보한 실제 데이터 기반으로 7종의 학습 데이터를 마련했다. 긴 문맥 이해와 단계별 추론·멀티턴 대화·질의응답·멀티모달 학습 등에 활용할 수 있다. LG AI연구원은 국내 50개 실제 가정환경에서 50종 넘는 가사 활동을 촬영해 한국 가정환경에 특화된 피지컬 AI 멀티모달 데이터를 구축했다. 17만개 이상의 영상 클립에 객체와 분할·자세·맥락 정보를 다층으로 표시해 비전 언어 모델 학습과 상용 서비스 개발 등에 이용할 수 있도록 했다. NIA와 한국정보통신기술협회(TTA)는 정예팀들로부터 데이터를 제공받아 품질과 개인정보·유해성을 검증했다. 라이선스 제약이 있는 데이터는 개방 대상에서 제외했다. 사업 참여 조건에 따라 데이터 구축·가공 예산으로 확보한 데이터 가운데 50% 이상을 공개해야 한다. 네이버클라우드와 업스테이지·SK텔레콤·NC AI는 검증을 마친 데이터를 모두 개방하고 LG AI연구원은 의무 개방량을 충족하도록 세부 데이터셋을 통계적으로 선별해 공개했다. 국내 기업과 연구자·학생 등 대한민국 국민은 누구나 AI허브 '독자AI모델 데이터' 항목에서 데이터를 무료로 내려받아 활용할 수 있다. 일부 데이터는 보안이 보장된 온라인 AI 모델 개발 공간인 '안심존' 이용을 별도로 신청해야 한다. 과기정통부는 독파모 고도화 지원을 이어갈 방침이다. 향후 2차 단계평가 과정에서 데이터 구축·가공 예산으로 확보한 데이터도 품질검증을 거쳐 추가로 개방할 예정이다. 김경만 과기정통부 AI정책실장은 "독파모 프로젝트는 단순히 AI모델 개발을 넘어 개발과정에서 축적된 경험과 노하우를 통해 AI생태계 전반의 질적 성장에 기여한다는 점에서 큰 의미"라면서 "오늘 개방된 데이터는 정예팀의 AI학습 전략이 담긴 귀중한 자산인 만큼 AI생태계의 성장과 자생력 강화를 이끄는 밑거름이 될 것"이라고 밝혔다.

2026.08.27 14:00김미정 기자

과기정통부, 독파모 평가 '공정성·기업 보호' 최우선…"투명한 절차로 이의신청 심의"

과학기술정보통신부(이하 과기정통부)가 모티프테크놀로지스(이하 모티프)의 '독자 AI 파운데이션 모델(독파모') 2차 평가 이의제기에 공식 입장을 내놨다. 과기정통부는 국가대표 AI 육성을 위한 독파모 2차 평가와 관련해, 절차적 투명성을 엄격히 준수하는 동시에 참여 기업을 적극 보호하겠다는 의지를 표명했다. 이의신청을 15일 이내에 처리하되 업체별 상세 점수의 전면 공개는 기업에 미칠 파장을 고려해 신중히 검토하겠다는 입장이다. 아울러 독파모 탈락이 해당 기업 AI 역량 전반이나 다른 정부 사업 참여에 불이익으로 이어져서는 안 된다고 선을 그었다. 더불어 경쟁력 있는 기업과 탈락 이후에도 기술 개발과 사업화를 이어갈 수 있도록 협력을 이어갈 것이란 의지도 내비쳤다. 김경만 과기정통부 AI정책실장은 27일 서울 프레지던트호텔에서 열린 '제2차 과학기술·인공지능 미래전략회의' 현장에서 독파모 이의신청 처리 절차와 벤치마크 배점 산정 배경, 활용성 평가 도입 취지 등을 설명했다. 김 실장은 "이의신청은 저희가 이틀 전에 받았다"며 "절차와 형식에 따라 접수 여부를 검토하고 있고 내용 판단은 전문가 평가위원들의 몫"이라고 말했다. 이어 이의신청은 15일 이내 결론을 내릴 예정이며 관련 심의는 별도 위원회가 주관할 것이라고 설명했다. 점수 공개 범위를 두고는 1차 발표 때보다 공개 정보가 적었다는 지적이 제기된 데 따라, 2차 평가에서도 1차와 유사한 수준의 정보를 공개했다는 입장이다. 김 실장은 "제도의 공정성과 객관성에 최대한 가치를 두고 있다"면서도, 세부 점수를 전면 공개할 경우 하위 평가를 받은 기업에 불필요한 낙인 효과가 생길 수 있다는 우려를 나타냈다. 그는 "얼마만큼 공개할 수 있을지는 오후에 결정해서 별도 자료로 다시 안내하겠다"고 말했다. 이번 논란의 핵심인 사용성·활용성 평가에 대해서는 오해가 있다고 선을 그었다. 김 실장은 "1차 평가 이후 독자성 기준을 명확히 하자는 지적과 모델을 만드는 것보다 활용이 더 중요하다는 지적이 있었다"며 "2차 평가부터 독자성 합치 여부를 확인했고, 활용 관련 배점은 전문가 평가 내에서 10점에서 15점으로 높였다"고 설명했다. 이어 "사업계획서상 목적에는 성능 목표뿐 아니라 서비스 목표도 포함돼 있다"며 "활용성 평가가 UI·UX를 보겠다는 뜻은 아니다"라고 말했다. 오히려 UI·UX를 인위적으로 꾸민 결과물이 평가에 영향을 미치지 않도록, 평가자들에게 프로토타입과 모델 자체를 중심으로 판단해 달라고 요청했다는 설명이다. 앞서 모티프는 자사 모델 '모티프 3'가 글로벌 AI 평가기관 아티피셜 애널리시스의 AI 인덱스(AAII)에서 참여 모델 가운데 가장 높은 47점을 받았지만, 독파모 2차 종합평가에서는 최하위로 탈락했다며 이의신청을 냈다. 김 실장은 모티프의 글로벌 벤치마크 성과는 인정했다. 그는 "모티프의 AAII 점수가 다른 팀보다 높고 성능이 좋다는 점을 정부 발표에서도 계속 강조했다"며 "글로벌 평가에서 좋은 성과를 낸 것은 사실"이라고 말했다. 다만 AAII 결과가 독파모 평가의 전부는 아니라고 밝혔다. 김 실장은 "AAII의 공신력은 인정한다"면서도 "한국어 특성과 안전성, 신뢰성 등을 반영한 별도 성능평가도 있었다"고 설명했다. 공개 벤치마크 점수만으로 최종 순위를 판단하기는 어렵다는 취지다. 독파모 2차 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성됐다. 정부는 사용자 평가에 일반 국민뿐 아니라 실제 AI를 활용하는 현업 종사자 평가도 포함됐다고 밝혔다. 김 실장은 "모델을 잘 만드는 능력과 이를 실제로 활용하는 능력은 다를 수 있다"고 말했다. 독파모가 국가대표급 AI 모델 개발에 더해 개인과 기업 현장으로 AI를 확산하는 것을 목표로 하는 만큼, 활용성 역시 주요 평가 요소라는 설명이다. 평가 기준이 계속 바뀐다는 지적에는 정부가 일방적으로 기준을 정한 것이 아니라고 설명했다. 김 실장은 "기준은 참여 업체와의 합의를 통해 만들어졌으며 정부가 일방적으로 정한 것이 아니다"라며 "이 기준은 6월 17일자로 이미 공지됐다"고 강조했다. 그는 독파모가 기획 단계부터 고정된 목표가 아니라 기술 흐름에 맞춰 목표와 평가 요소를 조정할 수 있는 '무빙 타깃(moving target)' 개념을 전제로 했다고 설명했다. 에이전트형 AI, 추론, 코딩 능력 등이 핵심 경쟁 요소로 급부상하는 등 AI 트렌드가 빠르게 바뀌는 환경에서 최신 버전의 AAII를 적용하면서 일부 기업의 점수 변화가 있었다는 것이다. 김 실장은 이번 탈락 결과가 모티프의 기술력 전반에 대한 부정적 평가나 낙인으로 번져서는 안 된다고도 강조했다. 경쟁형 평가 특성상 순위와 탈락 기업이 나올 수밖에 있지만, 하위 평가를 받은 기업이 마치 역량이 부족한 기업처럼 받아들여지는 부작용은 경계해야 한다는 것이다. 김 실장은 "정부가 생각하는 공정성과 객관성의 가치는 변함없다"며 "기업들의 더 좋은 부분을 부각시키려 노력한다는 점을 이해해 달라"고 말했다. 모티프가 KT 컨소시엄으로 참여 중인 '모두의 AI' 사업 등 다른 정부 사업에서 이번 탈락이 불이익으로 이어질 수 있다는 우려에도 선을 그었다. 김경만 실장은 "정부가 가진 진심이 그렇게 호도되는 것은 걱정스럽다"며 "경쟁력 있는 기업들이 나오고 그런 기업이 제공하는 서비스가 실제 현장에서 쓰이기를 더 바란다"고 말했다.

2026.08.27 13:20남혁우 기자

모티프 "벤치마크 배점, 성능 차이 못 담아"…독파모 이의 제기

정부의 '독자 AI 파운데이션 모델(독파모)' 프로젝트 2차 평가에서 탈락한 모티프테크놀로지스가 세부 평가 기준과 결과를 공개하라며 이의를 제기했다. 글로벌 벤치마크 점수는 참여 기업 중 가장 높았지만 종합 점수에서 최하위로 탈락한 데 따른 것이다. 모티프테크놀로지스는 27일 공식 입장문을 내고 독파모 2차 단계 선정 결과에 대해 정식으로 이의 제기를 신청했다고 밝혔다. 모티프테크놀로지스는 ▲전체 평가 항목별 업체별 상세 점수와 평가 기준 및 내용 ▲벤치마크 평가의 배점 산정 방식 근거 ▲전문가 평가의 상세 기준과 결과 ▲사용자 평가의 방법론·상세기준·결과 등을 공개할 것을 요구했다. 독파모 사업은 정부가 국가대표급 AI 모델을 확보하기 위해 참여 기업에 그래픽처리장치(GPU) 등 자원을 지원하고 단계별 평가로 최종 2팀을 압축 선정하는 사업이다. 과기정통부가 지난 18일 발표한 2차 평가 결과 업스테이지·SK텔레콤·LG AI연구원 3개 팀이 최종 단계인 3차수에 진출했다. 모티프테크놀로지스가 개발한 모델 '모티프 3'는 글로벌 AI 모델 평가 기관 아티피셜 애널리시스의 종합 성능 지표 AAII에서 47점을 받아 참여 4개 모델 중 1위였다. 모델 업체 기준으로는 글로벌 10위로, 미국과 중국을 제외하면 1위에 해당하는 성과다. 하지만 벤치마크(40점)·전문가(35점)·사용자(25점) 평가를 합산한 종합 점수(100점 만점)에서는 모티프 3가 최하위에 그치며 탈락했다. 2차 평가 결과 발표 직후 모티프테크놀로지스는 평가 결과를 받아들이며 이의 제기 계획이 없다고 밝혀왔다. 그러나 언론을 통해 모티프3가 벤치마크 점수에 비해 실제 추론 성능이 미흡하고 사용성과 활용성도 떨어진다는 평가를 받았다는 보도가 이어지자 입장을 선회했다. 모티프테크놀로지스는 AAII 1위(47점)와 4위(31점) 간 16점 격차가 배점 환산 시 4점으로 줄어든 점을 들어 벤치마크 배점 산정 방식이 실제 성능 차이를 제대로 반영하지 못한다고 주장했다. AAII 최하위 모델이 전문가 평가 1위를 차지한 근거, 전문가 평가 중 외국계 자본 관련 서면 질의를 받은 목적도 공개하라고 요구했다. 모티프테크놀로지스는 "이의 제기는 저희가 독파모에 선정돼야 한다는 주장을 위한 것이 아니다"라며 "이의 제기 결과와 관계없이 독파모 3차에는 참여하지 않겠다"고 말했다. 과기정통부는 이에 대해 아직 공식 입장을 밝히지 않았다.

2026.08.27 09:44이나연 기자

[K-미토스②] 앤트로픽이 당긴 방아쇠…막오른 국산 AI 보안 경쟁

인공지능(AI)을 활용한 사이버 공격 우려가 현실화되면서 보안업계 경계 수위도 높아지고 있다. 과거에는 AI가 해커의 공격을 돕는 도구로 활용됐다면 최근 AI 모델 스스로 취약점을 찾아내고 공격에 필요한 작업을 수행할 수 있다는 점이 새로운 위협으로 떠올랐다. 우리 정부도 고도화하는 AI발 사이버 위협에 대응하기 위한 독자적인 보안 AI 확보에 나섰다. 26일 업계에 따르면 이날 오후 마감된 '사이버 보안 특화 AI 파운데이션 모델 개발 사업'에 SK텔레콤과 네이버클라우드 등 총 2개의 컨소시엄 제안이 접수됐다. 과학기술정보통신부와 정보통신산업진흥원(NIPA)이 추진하는 이번 사업은 국내 AI·사이버 보안 역량을 결집해 보안 분야에 특화된 독자 AI 파운데이션 모델을 개발하는 것을 목표로 한다. 과기정통부는 다음 달 초 1개 팀을 선정할 계획이다. 최종 선발된 팀에는 B200 그래픽처리장치(GPU) 256장(32노드)을 10개월간 지원한다. 5개월 뒤에는 중간 성과 모델을 공개하고 성과를 점검해 지속 지원 여부를 결정한다. 개발된 모델은 오픈소스를 지향하며 국내 보안 생태계 전반에 확산한다는 계획이다. 이번 사업의 배경에는 빠르게 고도화하는 AI의 사이버 공격 역량이 자리한다. 대표적인 사례가 앤트로픽이 지난 4월 공개한 '클로드 미토스 프리뷰'다. 미토스는 사이버 보안 작업 과정에서 소프트웨어 취약점을 찾아내고 이를 공격에 활용할 수 있는 코드를 만들어내는 능력으로 업계 주목을 받았다. 미토스 등장 이후에는 AI 모델의 공격 역량뿐 아니라 이를 통제하는 것 자체도 새로운 보안 과제로 떠올랐다. 오픈AI는 지난달 사이버보안 평가 과정에서 자사 모델이 제로데이 취약점을 이용해 외부 인터넷과 허깅페이스 인프라에 접근한 사례를 공개했다. 앤트로픽과 메타 역시 평가 환경의 격리·설정 문제 등으로 각 사 모델이 실제 외부 시스템에 접근하거나 취약점을 악용한 사례가 잇따라 확인됐다. 한국 정부의 대응도 올해 상반기 들어 구체화됐다. 과기정통부는 지난 5월 미토스 등 고성능 AI를 활용한 사이버 위협에 대응하기 위한 'AI 기반 사이버 위협에 대응하기 위한 민간 정보보호 추진계획'을 발표했다. 해당 계획에는 AI가 찾아낸 취약점을 신속하게 공유·조치할 수 있는 민관 합동 대응 체계를 구축하겠다는 내용 등이 담겼다. 업계에서도 AI를 방어 수단으로 활용하려는 움직임이 활발해졌다. 앤트로픽은 지난 4월 미토스 프리뷰를 공개한 데 이어 이를 활용해 주요 소프트웨어 취약점을 선제적으로 찾아내는 프로젝트를 가동했다. 프로젝트 글래스윙은 고성능 AI를 방어 목적으로 활용해 공격자가 악용하기 전 취약점을 찾아내는 프로젝트로, 전 세계 기업과 기관이 최신 AI를 사이버 방어에 적용해 볼 수 있는 기회가 됐다. 국내에서는 삼성전자·SK하이닉스·SK텔레콤·한국인터넷진흥원(KISA) 등이 참여했다. 하지만 해외 AI를 활용한 보안 대응 역시 해당 모델에 대한 접근권을 전제로 한다는 한계가 드러났다. 미국 정부가 국가안보를 이유로 지난 6월 앤트로픽 최신 모델에 대한 외국 국적자의 접근을 제한하면서 국내 기업 및 기관들의 글래스윙 참여에도 제동이 걸렸다. 당시 앤트로픽은 이용자 국적을 실시간으로 확인하기 어려운 점을 고려해 클로드 미토스 프리뷰의 정식판인 '클로드 미토스5'와 일반 이용자용 '클로드 페이블5'의 서비스를 모두 일시 중단했다. 이후 18일 만인 6월 30일부로 두 모델의 수출통제가 해제됐다. 정부가 사이버 보안 특화 독자 AI 모델 개발 필요성을 공식적으로 강조한 것도 이 시점 이후다. 고도화된 AI가 사이버 공격에 활용될 가능성이 커지는 상황에서 외산 모델에 의존하지 않고 국내 환경에 맞는 보안 AI를 직접 확보하겠다는 의지를 나타낸 셈이다. 배경훈 과기정통부 부총리 겸 장관은 지난달 대통령 주재 업무보고에서 "우리나라도 독자 AI 모델을 보유하고 있지만 그 수준으로는 대응이 어렵다"며 "기존 독자 모델에 보안 데이터를 추가 학습해 연내 보안 특화 모델을 개발하겠다"고 밝혔다. 또 "미토스 같은 고도화된 프론티어 모델이 보안만을 겨냥한 모델이 아님에도 보안 문제를 쉽게 풀 수 있게 된 것"이라며 "고도화된 프론티어 모델 개발에 대한 고민이 필요하다"고 강조했다. 이재명 대통령도 미국의 AI 수출 통제를 둘러싼 불확실성을 두고 "막힌다고 보고 대비해야 한다"며 "다른 나라가 우리 보안을 대신 지켜주다가 갑자기 문을 열어버리는 상황이 생기면 안 된다"고 지적했다.

2026.08.26 16:49이나연 기자

한국 AI, 美中 이어 '3위' 굳히기…독파모 성과 주목

한국이 미국과 중국에 이어 글로벌 인공지능(AI) 경쟁에서 3위권 국가로 자리매김했다는 평가가 나왔다. 단일 기업이나 모델 성과를 넘어 국내 여러 AI 기업이 자체 파운데이션 모델 경쟁력을 동시에 입증하면서 한국 AI 생태계의 저변이 확대되고 있다는 분석이다. 글로벌 AI 성능 분석 전문기관 아티피셜 애널리시스는 26일 엑스(X·옛 트위터)에서 "한국은 미국과 중국에 이어 글로벌 AI 경쟁에서 다시 한번 명확한 3위를 차지했다"며 "한국 AI 생태계의 깊이와 활력은 탄탄한 국내 인재와 정부 투자, '독자 AI 파운데이션 모델(독파모)' 프로젝트가 만들어낸 인센티브에 의해 뒷받침되고 있다"고 밝혔다. 최근 아티피셜 어낼리시스의 종합 평가 지표인 '아티피셜 애널리시스 인텔리전스 인덱스'(AAII)에서는 국내 주요 AI 모델들이 잇따라 30점 이상을 기록했다. 모티프테크놀로지스의 '모티프3'가 47점으로 가장 높은 점수를 받았고 업스테이지 '솔라 프로4' 42점, SK텔레콤 'A.X K2' 35점, LG AI연구원 'K-엑사원 2.0' 31점 등이 뒤를 이었다. 특히 모티프3와 솔라 프로4는 40점 이상을 기록하며 미국과 중국을 제외한 국가에서 개발된 모델 가운데 가장 높은 수준의 점수를 받았다. 독파모 사업에 참여한 기업뿐 아니라 트릴리온랩스, KT 등도 자체 모델 개발에 나서면서 국내 AI 모델 생태계의 경쟁 구도가 확대되는 모습이다. 아티피셜 애널리시스는 "한국의 모델 개발 생태계는 계속해서 확대되고 있다"며 "한국 내 AI 분야는 1년 전보다 훨씬 더 깊고 경쟁력 있는 생태계로 발전했다"고 설명했다. 이번 평가를 두고 국내에서도 한국 AI 생태계가 주요국과의 경쟁에서 의미 있는 수준까지 올라섰다는 목소리가 나온다. 하정우 전 대통령실 AI미래기획수석비서관은 이날 엑스에서 "글로벌에서 가장 널리 인정받는 AAII가 한국을 명실공히 AI 레이스 넘버 3(No.3) 국가로 인정하고 있다"며 "오픈웨이트 모델 기준 미국을 제치고 2위를 차지했다"고 말했다. 이어 "현재 벤치마크 한계를 고려해도 이 성과 자체는 상당히 큰 의미가 있다"며 "국가 AI 전략과 혁신역량을 보유한 국내 독파모 기업들이 함께 만든 성과"라고 강조했다.

2026.08.26 14:30이나연 기자

독파모, 3차 심사부터 일반 기업도 사용한다

독자 인공지능(AI) 파운데이션 모델(독파모) 프로젝트에서 개발 중인 AI 모델이 3차 심사부터는 일반 사용자와 기업도 체감할 수 있는 방향으로 확대될 전망이다. 그간 촉박한 개발 일정과 인프라 부담 등으로 외부 공개가 제한돼 왔지만, 3차부터는 사용성과 현장 적용성이 본격적으로 평가되면서 실제 서비스 형태의 공개·연동 가능성도 커지고 있기 때문이다. 24일 업계에 따르면 독파모 2차 평가를 통과한 LG AI연구원, SK텔레콤, 업스테이지는 3차 심사를 준비하고 있다. 마지막 심사를 앞두고 모델 성능뿐 아니라 일반 사용자와 산업 현장에서 실제로 써볼 수 있는 환경을 얼마나 마련하느냐도 주요 평가 요소인 만큼 각 참가사도 사용성 확대에 집중하는 모양새다. LG AI연구원은 아직 구체적인 공개 방식은 확정하지 않았지만, 사용성 강화 방향에 맞춘 후속 계획을 논의 중이라는 입장이다. LG AI연구원 측은 "아직 구체적인 3차 공개 방식은 확정되지 않았지만 사용성 강화 방향에 맞춰 내부적으로 후속 계획을 논의하고 있다"며 "다만 대규모 모델은 상용 서비스 형태까지 연결하려면 리소스와 인력 부담이 큰 만큼 준비에 시간이 필요하다"고 밝혔다. 업스테이지 측은 "사용자 활용이 중요해지고 있다고 보고 있다"며 "업스테이지는 계속 모델 공급을 맡고, 법률·교육·의료 등 산업별 특화 서비스는 컨소시엄 파트너사가 만드는 구조가 될 것"이라고 설명했다. SK텔레콤 관계자는 "독파모는 AI 모델을 만드는 프로젝트로 서빙 인프라까지 갖춘 프로젝트는 아니었던 만큼 그동안 개발에만 집중해왔다"며 "현재 국방부 등 정부부처를 대상으로 서비스를 제공하고 있어 3차에서는 이를 더 고도화해 제공할 수 있을 것"이라고 밝혔다. 독파모는 과학기술정보통신부와 정보통신산업진흥원(NIPA)이 추진하는 프로젝트로 해외 모델에 의존하지 않는 국산 소버린 AI를 육성하고 글로벌 프런티어 모델과 경쟁할 수 있는 국가대표 AI를 선발하기 위한 사업이다. 평가 방식도 단계별로 이뤄지고 있다. 참여 기업들은 일정 기간 동안 모델 개발과 고도화를 진행한 뒤 성능 평가와 전문가 심사, 국민 체감 평가 등을 거쳐 다음 단계 진출 여부를 가려왔다. 초기 단계에서는 한국어 성능과 추론·지식 능력 등 모델 자체 경쟁력 검증에 초점이 맞춰졌다면 후반으로 갈수록 실제 활용성과 서비스 연계 가능성까지 함께 따져보는 구조로 옮겨가고 있다. 이 과정에서 아쉬움도 있었다. 참가 기업별로 모델 공개 방식이 달라 일반 개발자나 기업이 직접 체감하기 쉽지 않았다. 일부는 오픈 웨이트나 라이선스 형태로만 공개됐고 일부는 특정 사업이나 협력 구조 안에서만 제한적으로 접근할 수 있었다. 특히 대형 AI 모델은 가중치를 내려받더라도 실제로 구동하려면 추가 인프라와 운영 인력이 요구됐다. 이로 인해 일반 사용자나 수요 기업 입장에서는 국민 체험 평가 외에 각 모델을 지속적으로 비교·검증해볼 기회가 제한적이었다는 반응도 나왔다. 업계에서는 1·2차 심사 기간 자체가 짧았다는 점을 주요 제약으로 꼽는다. 짧은 개발 기간 안에 모델 학습과 튜닝, 평가 대응까지 병행해야 하는 만큼 외부 공개용 서비스나 API 환경을 별도로 구축할 여력이 크지 않았다는 설명이다. 한 AI 기업 대표는 "1단계와 2단계가 각각 6개월 단위로 진행돼 기업들이 모델 완성도와 평가 대응에 우선 집중할 수밖에 없었을 것"이라며 "대형 모델을 일반 테스트용이나 서비스형 환경으로 별도 구성하려면 추가 작업이 필요한데 초기 단계에선 그런 여유가 부족했을 수 있다"고 말했다. 이어 "다만 3차에서도 이런 체감 환경이 충분히 갖춰지지 않으면 평가의 설득력이 떨어질 수 있다"며 "마지막 심사에서 일반 사용자와 기업이 직접 써볼 수 있는 서비스가 늘어나면 독파모 사업도 기술 검증을 넘어 시장 확산 단계로 넘어가게 될 것"이라고 덧붙였다.

2026.08.24 15:01남혁우 기자

독파모 최종전 '실행력' 본다…평가기준·투명성 과제로

정부 주도의 국가대표 인공지능(AI) 선발전인 '독자 AI 파운데이션 모델(독파모)' 프로젝트가 내년 초 최종 2개 팀을 가린다. 마지막 단계평가를 앞두고 정부가 벤치마크 자체 평가 항목 중 도구·에이전트와 코딩 분야를 구축하기로 하면서 결과에 어떤 영향을 미칠지 주목된다. 24일 업계에 따르면 한국지능정보사회진흥원(NIA)은 지난 12일 'AI 모델 벤치마크 데이터셋 구축 사업(2차)' 공모를 냈다. 도구·에이전트와 코딩 2개 분야에서 한국어 기반 벤치마크 데이터셋을 구축하는 사업으로, 다음 달 11일까지 참가 신청을 받는다. 총사업비는 12억원이며 분야당 6억원이 지원된다. 벤치마크 자체 평가에 에이전트·코딩 분야 신규 편입 이 사업은 독파모 평가에 쓰이는 벤치마크를 만드는 과제다. 실제 공모안내서에는 이 사업이 독파모 프로젝트와 함께 과기정통부의 월드 베스트 거대언어모델(LLM) 데이터 활용 지원 사업' 산하에서 추진된다고 명시됐다. 이렇게 구축된 데이터셋은 AI 모델 성능 검증을 2회 지원하게 된다. NIA는 지난해 7월 1차로 공고했던 'LLM 성능 평가 데이터셋 구축 사업'에서 수학·지식·장문이해 3개 분야 벤치마크를 구축했다. 반면 이번 공모에서는 도구·에이전트와 코딩 분야를 신규로 구축한다. 텍스트 기반의 지식·추론 능력을 재던 1차와 달리, 2차 사업에서는 도구를 활용해 실제 과업을 완수하는 실행 능력을 새 평가 축으로 삼은 셈이다. 이 같은 변화는 독파모 2차수가 사실상 텍스트 기반 평가에 머물렀다는 지적을 반영한 것으로 풀이된다. 2차 평가에 오른 LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 4개 팀 모델은 모두 미국 비영리 연구기관 에포크AI의 '주목할 만한 AI 모델'에 이름을 올렸지만 도메인은 언어에만 한정됐다. 모델 사용성을 보는 정성 평가도 텍스트에 한정됐다. 2차수 당시 전문가 평가와 일반 국민 평가 모두 LLM의 텍스트 응답 성능을 대상으로 이뤄졌고 파일 첨부나 이미지·영상 생성 같은 텍스트 외 기능은 평가 대상에서 빠졌다. 글로벌 프론티어 모델 경쟁이 이미지·음성·영상을 함께 처리하는 멀티모달로 이동한 것과는 대비되는 지점이다. 최종 평가 어떻게 진행되나…기준 설정에 쏠린 눈 독파모 최종전인 3차 평가 방식은 2차 결과에 대한 이의제기 절차가 끝난 뒤 참가 팀들과의 합의를 거쳐 확정된다. 앞선 두 차례 평가 전후로 업계 안팎에서 여러 논란이 이어진 만큼 3차 평가 기준이 어떻게 짜일지에 업계 이목이 쏠린다. 독파모는 기술 독자성(프롬 스크래치) 논란에 이어 2차에서 특정 벤치마크를 겨냥한 데이터와 사후학습으로 점수를 집중적으로 끌어올리는 '벤치맥싱' 의혹에 휩싸였다. 세부 점수 공개를 둘러싼 투명성 문제도 제기됐다. 안광섭 세종대학교 겸임교수(인레벨나인 대표)는 "사업 목표와 쓰임새를 분명히 정하고 가야 평가 논란이나 실효성에 대한 의문이 반복되지 않는다"며 "모델을 하나의 기준으로 줄 세우기보다 크기별·용도별로 나눠 평가하는 체계도 고려해야 한다"고 말했다. 벤치마크 다양화부터 투명성 개념 재정립까지 2차 평가에서 AAII 점수를 둘러싼 벤치맥싱 논란이 불거지면서 단일 지표에 대한 의존도를 낮춰야 한다는 목소리도 커졌다. 단순 배점만 조정해서는 벤치맥싱 같은 논란을 근본적으로 막기 어렵다는 이유에서다. 업계에서는 아티피셜 애널리시스의 AI 모델 종합평가인 'AAII' 외에도 글로벌 지표를 추가로 검토해야 한다는 의견이 나온다. AI에 가상의 사업 운영을 맡기고 최종 잔고로 채점하는 '벤딩벤치', 실사용 세션 수백만 건으로 작업 완수를 재는 '에이전트 아레나' 등이 AAII를 보완할 주요 지표로 거론된다. 안 교수는 "문제를 미리 알려주고 보는 시험은 없다"면서 "2차 평가 요소에 AAII를 추가했듯 3차에 새 지표를 넣더라도 어떤 시험지를 쓸지는 각 팀에 알려주지 않는 블라인드 방식으로 가야 한다"고 강조했다. 독파모 평가 지표 및 평가 결과 산출 기준에 대한 투명성의 본질이 점수 공개 여부에 있지 않다는 의견도 있다. 점수를 낱낱이 공개하기보다 평가가 어떤 절차와 기준으로 이뤄졌는지를 사전에 밝히는 게 우선이라는 것이다. 과학기술정보통신부는 2차 평가 발표 브리핑에서 1위 기업에 대한 인식 제고와 나머지 기업에 대한 낙인 효과를 우려해 세부 순위를 밝히지 않았다. 그러나 결과 공개 이후 구체적인 점수 산출 근거에 대한 요구가 커지자 이틀 만에 보도설명자료를 내고 1차 평가와 같이 항목별 1위 기업과 점수를 공개했다. 안 교수는 "대학수학능력시험(수능) 출제위원도 외부와 차단된 환경에서 비공개로 문제를 만들지만 아무도 이를 불투명하다고 하지 않는다"며 "점수 하나하나를 공개하는 것보다 전문가 평가위원을 어떤 기준으로 선정했는지 등을 구체적으로 알리는 것이 투명성 확보에 더 가깝다"고 제언했다.

2026.08.24 14:56이나연 기자

[안광섭 AI 진테제] AI지원 韓中日 다른 접근..."더 줄까"에서 벗어나야

지난 18일 류제명 과학기술정보통신부 제2차관은 독자 AI 파운데이션 모델 프로젝트(이하 독파모) 2차 단계평가 결과를 발표하면서 예상 밖의 말을 덧붙였다. 현재의 지원 규모와 경쟁 방식만으로는 최정상급 모델을 따라잡기 어렵다고 판단, 그래서 지원 규모와 방식을 전면 재검토하겠다는 것이었다. 재검토의 방향은 아직 정해지지 않았다고도 덧붙였다. 정부가 진행 중인 자기 사업의 한계를 공개 브리핑에서 인정하는 일은 흔치 않다. 그 점에서 이날 발언은 평가받을 만하다. 그리고 필자는 이 말에 매우 동의 한다. 다만, 필자가 걱정하는 것은 그다음이다. 재검토가 '얼마를 더 줄까'로 흐르면 지난 8년간 반복된 실패를 더 큰 금액으로 다시 하게 된다. 바꿔야 할 것은 '금액'이 아니라 '문법'이다. 1. 마중물의 결산서...마중물은 왜 자꾸 증발하나 공교롭게도 엿새 전인 8월 12일, 감사원이 'AI 산업 육성 실태' 감사 결과를 공개했다. 과기정통부가 2017년부터 2024년까지 1조6328억원을 들여 908종의 AI 학습용 데이터를 구축했으나, 기관 간 조정 없이 유사 데이터가 중복 구축됐고 품질검증은 기관마다 제각각이었으며, 오류가 발견된 데이터는 납품업체 폐업을 이유로 수정되지 않은 채 방치됐다는 내용이다. 감사원의 결론 문장이 가장 아프다. 공공부문이 AI 기업 지원을 위해 노력하는 중이지만, 쓸 만한 데이터가 없다는 기업의 호소가 지속되고 있다는 것이다. 1조6000억원을 들여 공급을 만들었는데 수요자는 여전히 없다고 말한다. 이것이 8년치 마중물의 결산서다. 액수가 부족해서 벌어진 일이 아니다. 2. 의무 조항이라는 자연 실험 더 선명한 사례가 있다. 국가AI컴퓨팅센터다. 이 사업은 작년 5월과 6월, 두 차례 연속으로 응찰자를 한 곳도 구하지 못해 유찰됐다. 민간 참여를 가로막은 조항으로 세 가지가 지목됐다. 공공 지분 51%, 민간이 공공 지분을 되사야 하는 매수청구권, 그리고 2030년까지 센터 반도체 구성의 최대 절반을 국산 신경망처리장치(NPU)로 채우라는 의무 장착 조건이다. 정부는 3차 공모에서 셋을 동시에 풀었다. 공공 지분을 30% 미만으로 낮추고, 매수청구권을 삭제하고, 국산 NPU 의무를 통째로 없앴다. 그러자 삼성SDS 컨소시엄이 단독으로 들어왔고, 올 3월 우선협상대상자를 거쳐 5월 사업자가 최종 확정됐다. 정리하면 이렇다. 국산 칩을 사주겠다는 조항이 국산 칩이 들어갈 데이터센터 자체를 2년 가까이 늦췄다. 정책 실험으로 이보다 깔끔한 대조군은 찾기 어렵다. 같은 기간 국산 NPU는 다른 곳에서 검증받았다. 퓨리오사AI는 8월 5일, 미국 I/ONX HPC 및 벨록스와 함께 스웨덴 스톡홀름에 조성하는 15MW(메가와트) 규모 데이터센터에 참여한다고 밝혔다. 1단계에 추론 가속기 '레니게이드(RNGD)' 1800장을 공급하고, 확장 단계까지 포함해 총 8800장 이상을 순차 납품한다. 카드당 약 1만 달러 기준으로 전체 1230억원 안팎으로 추산되는 규모다. 이 숫자를 기억해 둘 필요가 있다. 정부가 독파모 3개 팀에 6개월간 지원하는 GPU 임차 총액이 1200억원이다. 팀당 400억원꼴이다. 금액은 사실상 같은데, 하나는 보호받는 시장에서 빌려 쓰는 돈이고 다른 하나는 경쟁 시장에서 벌어온 돈이다. 3. '모두의 AI'가 드러낸 것 같은 문법이 하드웨어에서 소프트웨어로 옮겨오는 중이다. 정부가 연내 출시를 목표로 추진하는 '모두의 AI' 프로젝트의 조건은 이렇다. 독파모 기준에 부합하는 국산 AI 모델을 50% 이상, 타사 국산 모델도 30% 이상 활용해야 한다. 외산 모델은 최소한의 기능에 한해 제한적으로 허용하되 정부 지원 대상에서는 제외된다. 올해 엔비디아 B200 512장을 우선 지원하고 내년부터 운영비를 지원하며, 2028년까지 전 국민에게 무료로 제공한다는 계획이다. 여기서 익숙한 딜레마가 생긴다. 외산 모델을 넣으면 왜 국산을 안 쓰느냐는 비판이 나오고, 국산만 쓰면 성능 좋은 무료 서비스를 두고 굳이 왜 이걸 쓰겠느냐는 반문이 나온다. 숫자를 보자. 8월 22일 기준 오픈라우터(OpenRouter)에서 업스테이지 솔라 프로 4는 100만 토큰당 입력 0.03달러, 출력 0.12달러다. 다만 이것은 90% 할인이 적용된 가격이고, 정가는 입력 0.3달러, 출력 1.2달러다. 같은 화면의 오픈AI GPT-5.6 루나는 입력 0.2달러, 출력 1.2달러로 별도 할인 표기가 없다. 정가끼리 비교하면 국산 모델의 입력 단가가 50% 비싸고 출력은 같다. 컨텍스트는 52만4288 토큰 대 105만 토큰, 서빙 제공자는 1곳 대 5곳, 처리량은 초당 39토큰 대 최대 81토큰이다. 그러나 여기서 서둘러 결론을 내면 안 된다. 90% 할인은 정부가 준 것이 아니다. 업스테이지가 자기 돈으로 시장에서 싸우는 중이라는 뜻이다. 그리고 그 싸움은 실제로 먹히고 있다. 같은 페이지의 트래픽 상위 앱 2위가 다음(Daum)이고 누적 167억 토큰이다. 필자는 지난 칼럼에서 업스테이지가 모델을 다음 포털에 얹기로 한 것이 성능 발표보다 중요한 뉴스라고 썼는데, 그 판단은 벤치마크가 아니라 트래픽으로 확인됐다. 문제는 정부가 그 옆에서 하려는 일이다. 의무 비율은 업스테이지가 지금 하고 있는 싸움을 돕는 것이 아니라, 그 싸움을 하지 않아도 되게 만든다. 90% 할인을 감수하며 트래픽을 사는 이유는 그렇게 하지 않으면 안 쓰이기 때문이다. 수요가 비율로 보장되는 순간 그 이유가 사라진다. 8월 18일 마감된 공모에 SK텔레콤·KT·카카오 등 6개 컨소시엄이 참여했지만 네이버클라우드가 최종 불참한 것도, 이 구조를 각자 계산해 본 결과일 것이다. 4. 배부른 스타트업이 가장 위험하다 전례가 있다. 2020년 비대면 서비스 바우처 사업이다. 예산 2880억원, 기업당 400만원, 10만1146개사가 신청했다. 결과는 페이백과 리베이트, 조직적 대리신청이었다. 중기부는 공급기업 7개사를 수사의뢰했고, 특정 공급기업이 25% 이상 점유하지 못하도록 제한을 걸어야 했으며, 부적정 서비스로 분류한 상품만 80개였다. 그리고 올해도 AX 원스톱 바우처가 260억원 규모로 돌아가고 있다. 기술 전략을 다뤄온 관점에서 보면, 스타트업에서 가장 위험한 상태는 매출이 0인 상태가 아니다. 잘못된 매출이 있는 상태다. 매출이 0이면 제품을 고치지만, 공고에서 나온 매출이 있으면 다음 공고를 준비한다. 피드백 루프가 시장이 아니라 사업계획서로 연결되는 순간 조직의 학습 방향 자체가 뒤틀린다. 지원금이 사주는 것은 런웨이가 아니라 판단 유예다. 배부른 스타트업이 위험한 이유가 여기에 있다. 모두의 AI 공고에는 참여 기업이 이용자 프롬프트 데이터 활용 등 자체 수익 모델을 마련해 서비스를 지속할 전략을 갖춰야 한다는 조건이 들어 있다. 정부 지원은 2028년까지다. 그렇다면 2029년에 무엇이 남는지가 지금 물어야 할 질문이다. 5. 일본과 대만은 무엇을 샀나 한국만 돈을 쓰는 것이 아니다. 일본과 대만 정부도 쓴다. 다만 다르게 쓴다. 일본에는 국산 대규모 언어모델(LLM)이 올 3월 기준 30종 이상 있다. 라쿠텐 AI 3.0이 7000억 파라미터, SB인튜이션스 사라시나가 4600억 파라미터이고 NTT 츠즈미, PFN PLaMo, 후지쯔 다카네, NEC 코토미가 각자 자리를 잡았다. 그런데 이들 중 누구도 프런티어 경쟁에 뛰어들지 않는다. 대신 디지털청이 생성형 AI 플랫폼 '겐나이'를 구축해 올 3월 7개 벤더를 선정하고 공무원 약 18만 명에게 배포했다. 만드는 데 돈을 쓰는 대신 쓰이는 자리를 만든 것이다. 경제산업성의 국산 모델 육성 사업 GENIAC은 1~3기 공모 총액이 339억엔, 약 3000억원이다. 독파모의 2027년까지 총예산 5300억원보다 작다. 그리고 2026년부터 사업의 축을 로봇 파운데이션 모델과 제조 데이터의 AI-Ready화로 옮겼다. 자국이 이미 강한 자리로 전선을 이동한 것이다. 6월 22일 공개된 사카나AI의 'Fugu'는 아예 자체 프런티어 모델을 학습하지 않고, 외부 모델을 런타임에 호출해 지휘하는 오케스트레이터로 설계됐다. 대만은 더 명시적이다. 국가과학기술위원회(NSTC)는 국가 LLM인 TAIDE의 임무를 프런티어 모델과 경쟁하지 않고 산업 전반의 AI 배치를 지원하는 인프라로 공식 재정의했다. 대신 7월 30일, 대만 대표 하드웨어 기업들이 3억 대만달러(약 93억원)를 모아 TAIONE 오픈소스 재단을 세웠다. 용도는 칩도 서버도 모델도 아니다. vLLM, 쿠버네티스, 레이 같은 오픈소스 프로젝트의 코어 거버넌스에 자국 엔지니어를 앉히는 펠로우십이다. vLLM에 기능 하나를 병합할 권한이 사실상 전 세계 추론 인프라의 표준을 쓰는 일이라는 계산이다. 한국은 국산을 사준다. 일본은 국산이 쓰이는 자리를 만든다. 대만은 표준을 정하는 자리를 산다. 같은 돈으로 셋은 서로 다른 것을 사고 있다. 마무리 이날 브리핑에서 정부가 함께 공개한 숫자가 하나 더 있다. 아티피셜 애널리시스 지능지수(AAII)에 등록된 58개 AI 개발기업 가운데 한국 기업이 7곳이고, 등재된 12개국 중 프랑스나 싱가포르보다 두터운 개발 생태계를 갖췄다는 자평이다. 이 자산은 사실이다. 다만 이 자산을 만든 것은 GPU 임차권이 아니라 사람이다. 모델은 6개월이면 낡고 임차한 컴퓨트는 계약 종료와 함께 사라지지만, 그것을 돌려본 엔지니어는 남는다. 마중물 정책의 유일하게 확실한 잔여물이 인재라는 뜻이다. 문제는 그 인재가 무엇을 보고 있느냐다. 시장을 보고 있으면 자산이 되고, 다음 공고를 보고 있으면 그마저 소모된다. 보호 조항과 단발성 바우처는 정확히 후자를 만드는 장치다. 그러니 3차 재설계가 물어야 할 질문은 "얼마를 더 줄까"가 아니다. "지원이 끝나는 날, 이 팀에 무엇이 남는가"다. 이 질문에 답할 수 없는 항목은 금액을 두 배로 올려도 두 배로 증발할 뿐이다.

2026.08.23 10:16안광섭 컬럼니스트

[안광섭 AI 진테제] 독파모 2차 평가가 남긴 것

필자는 지난 10일 이 코너에서 정부의 독자 파운데이션 모델(이하 독파모) 프로젝트 2차 평가에 대해 썼다. 당시는 결과 발표를 앞둔 시점이었고, 필자는 벤치마크 점수보다 실제 쓰임새를 물어야 한다고 주장했다. 그 뒤 열흘 사이에 많은 일이 일어났다. 독파모 2차 평가 결과는 그제 18일 나왔다. 그 사이 벤치마크 점수만 겨냥해 모델을 튜닝했다는 '벤치맥싱(benchmaxing)' 공방이 업계를 달궜고, 평가 기관인 아티피셜 애널리시스(Artificial Analysis)가 직접 입장을 내는 상황까지 갔다. 18일 발표에서 SK텔레콤, LG AI연구원, 업스테이지가 살아 남았고, 아티피셜 애널리시스 벤치마크 점수가 가장 높았던 모티프테크놀로지스는 떨어졌다. 다음 날 언론은 세부 점수 공개를 요구했고, 오늘(20일) 과학기술정보통신부는 항목별 1위 기업과 점수를 담은 보도설명자료를 냈다. 필자는 지난회 칼럼을 "무엇을 재느냐가 결국 무엇을 만드느냐를 결정한다"는 문장으로 끝냈다. 열흘 뒤 이 문장이 이렇게 시험대에 오를 줄은 몰랐다. 지난회 칼럼 이후 여러 곳에서 의견과 인터뷰 요청을 받았고, 대부분 결과가 나온 뒤 답하겠다고 미뤄 뒀다. 이 글이 그 답이다. 1. 벤치마크 1위 탈락, 두 개의 진영 먼저 사실관계다. 이번 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점, 총 100점으로 치러졌다. 벤치마크 40점은 아티피셜 애널리시스 지능지수(AAII) 기반 25점과 한국지능정보사회진흥원(NIA) 벤치마크 15점으로 구성됐다. AAII 점수는 각 사 자체 보고가 아니라 아티피셜 애널리시스가 직접 측정했다. 지난 칼럼에서 "남(외부기관)이 다시 잰 숫자"를 요구했는데, 실제로 그렇게 됐다. 그 남이 잰 숫자에서 모티프의 '모티프 3'는 47점을 받았다. 미국·중국 외 국가 모델 중 최고점이고, 나머지 3개 팀보다 한참 위다. 그럼에도 모티프는 떨어졌다. 여론은 둘로 갈렸다. 한쪽은 "벤치마크만 잘 나오는 모델이니 떨어지는 게 당연하다"고 했고, 다른 쪽은 "최고 점수를 낸 팀을 떨어뜨리는 것은 프로젝트의 자기모순"이라고 했다. 남은 세 팀이 대기업 둘이고 하나는 상장을 앞둔 업스테이지이고 떨어진 팀은 30명 규모 스타트업이라는 점도 논란을 키웠다. 필자가 보기에 두 진영은 정반대 주장을 하는 것 같지만 같은 전제를 공유한다. 이 평가의 본체가 벤치마크였다는 전제다. 하지만 그 전제가 틀렸다. 2. 배점표를 뜯어 보면 두 진영 모두 틀렸다 20일 과기정통부 보도설명자료의 숫자를 그대로 옮긴다. 항목별 최고점과 4팀 평균이다. • AAII 벤치마크(배점 25점): 최고 모티프 11.9점, 평균 9.48점 • NIA 벤치마크(배점 15점): 최고 SK텔레콤 13.4점, 평균 13.05점 • 전문가 평가(배점 35점): 최고 LG AI연구원 29.5점, 평균 28.75점 • AI 전문 사용자진 평가(배점 15점): 최고 SK텔레콤 11.6점, 평균 10.53점 • 일반 국민 평가(배점 10점): 최고 LG AI연구원 7.6점, 평균 7.03점 스케일링 공식을 역산하면 모티프의 AAII 원점수 47점은 나머지 3팀 평균(약 35점)을 12점가량 앞선다. 그런데 배점 환산을 거치면 이 격차는 3.2점으로 압축된다. 100점짜리 시험에서 가장 압도적인 우위가 3.2점짜리 우위로 줄어드는 구조인 것이다. 이 구조는 평가 전에 이미 공개돼 있었다. 벤치마크는 이 평가의 본체가 아니라 배점 25점짜리 항목 하나였다. 그럼 당락은 어디서 갈렸나. 18일 발표에 따르면 영역별 1위와 4위의 격차는 벤치마크 4.0점, 전문가 평가 2.4점, 사용자 평가 5.0점이다. 배점이 가장 큰 전문가 평가(35점)가 가장 변별하지 않았고, 이번에 신설된 사용자 평가(25점)가 가장 크게 변별했다. 과기정통부도 브리핑에서 모티프에 대해 기술력은 뛰어났지만 사용성·활용성에서 다른 기업보다 낮은 평가를 받았다고 설명했다. 정리하면, 모티프가 벤치마크에서 벌어들인 우위보다 사용자 평가에서 잃은 열위가 컸다. 데이터를 가르치는 입장에서 하나 더 짚는다. AI 스타트업 대표 49명으로 구성한 전문 사용자진의 평균 점수를 5점 척도로 환산하면 3.51점, 일반 국민 185명의 평균은 3.52점이다. 전문가와 비전문가 234명이 국산 모델 네 개를 사실상 같은 자리, 즉 '보통과 우수 사이'에 놓았다. 순위 경쟁보다 이 수렴이 국산 모델의 현재 수준을 더 정확히 보여준다. 3. '성능 대 실용성'이라는 가짜 대립 많은 논평이 이번 결과를 '성능은 좋은데 실용성이 없는 모델의 탈락'으로 요약했다. 이 요약은 성능과 실용성을 대립항으로 놓는데, AI에서 이 둘은 대립하지 않는다. 모델의 성능이란 결국 추론 능력이고, 추론 능력이 올라가면 실무 효용도 따라서 커진다. 프론티어 모델들이 코딩과 문서 작업 시장을 잠식하는 것은 벤치마크 점수와 별개의 현상이 아니라 같은 현상이다. 논평들이 실제로 혼동하는 것은 성능과 실용성이 아니라 과업 수행 능력과 비용이다. 무엇을 해낼 수 있는가와, 그것을 얼마에 어떤 형태로 쓸 수 있는가는 다른 축이다. 모티프의 47점은 첫 번째 축의 숫자이고, 사용자 평가에서 잃은 점수는 두 번째 축, 즉 인터페이스와 서빙 안정성과 접근성의 문제다. 이렇게 구분하면 판정의 의미가 달라진다. 모티프는 '일은 잘하는데 실무에 못 쓰는 모델'이 아니라 '일은 잘하는데 아직 상품이 아닌 모델'이었다. 전자는 기술의 실패이고 후자는 제품화의 미완이다. 둘을 섞어 부르면 진단도 처방도 틀리게 된다. 국내 모델의 진짜 문제는 따로 있다. 시험이 바뀌는 순간 점수가 요동친다는 것이다. 아티피셜 애널리시스의 트렌드 자료를 보면, 지능지수가 아홉 개 평가로 구성을 바꿔 가며 개편(현재 v4.1.1)되는 동안에도 국가별 상위권은 미국 프론티어 모델과 중국 오픈웨이트 모델이 유지해 왔다. 능력이 특정 시험 바깥으로 일반화돼 있다는 뜻이다. 이번 배점표 안에도 같은 증거가 있다. 국내에서 설계된 NIA 벤치마크에서 4팀 평균은 13.05점으로 배점 15점의 87%에 달하고, 최고점과 평균의 차이가 0.35점에 불과할 만큼 만점 부근에 밀집해 있다. 반면 에이전트 중심으로 재편된 AAII에서 4팀 평균은 9.48점, 배점 25점의 38%로 떨어진다. 익숙한 시험에서는 다 같이 만점 부근이고, 낯선 시험에서는 다 같이 절반 아래다. 벤치맥싱 비판이 겨냥해야 할 과녁은 이것이고, 검증법은 간단하다. 시험을 바꿔서 다시 재면 된다. 이 기준으로 보면 모티프의 47점은 오히려 무게가 실린다. 바뀐 시험, 전 세계 모델이 아직 다 잘하지 못하는 새 평가에서 낸 점수이기 때문이다. 4. 이것은 경진대회가 아니라 조달이었다 그렇다면 모티프를 떨어뜨린 판정은 잘못됐나. 필자의 답은, 불편하지만, 아니다에 가깝다. 독파모를 단독 사업으로 보면 '국가대표 AI 선발전'으로 읽힌다. 그러나 정부의 AI 사업 포트폴리오 안에 놓고 보면 다르게 읽힌다. 정부는 '모두의 AI'로 국민 대상 AI 서비스 보급을, '전국민 AI 경진대회'와 'AI 배움터'로 이용 저변을, 'AI 테스트베드'로 검증 인프라를 만들고 있다. 전부 수요와 확산 쪽 인프라다. 그 옆에 놓인 독파모는 가장 좋은 모델을 뽑는 대회가 아니라, 이 인프라에 연결할 공급자, 즉 소버린 AI를 장기간 운영할 조직을 고르는 조달에 가깝다. 조달에서 공급자를 고를 때는 기술력만큼 지속가능성을 본다. 자본, 인력 유지, 서빙 인프라, 유통 채널이다. 2차 평가에서 활용성 배점이 10점에서 15점으로 오르고 1차의 배점 항목이던 독자성이 최소기준 체크로 바뀐 것은 이 성격 전환의 문서적 증거다. 그 기준으로 통신 가입자와 에이닷을 가진 SK텔레콤, 그룹 계열사와 단말을 가진 LG, 포털을 확보한 업스테이지를 남긴 판단은, 최선인지는 몰라도 조달로서는 일관된 판단이다. 그리고 이것은 필자가 지난 칼럼에서 내린 결론과 같은 방향이다. 필자는 "'모델'이 아니라 '조직'에 기대하라. 모델은 6개월이면 낡지만 조직은 남는다"고 썼다. 정부가 한 일이 바로 그것이다. 모델 점수 1위를 떨어뜨리고 조직을 남겼다. 5. 측정이 만든 것들 판정이 방어된다면 글은 여기서 끝나야 한다. 그런데 끝나지 않는다. 배점표는 평가 결과만 만든 것이 아니다. 기업들의 행동을 바꿨다. 첫 번째 사례는 업스테이지다. 업스테이지는 올해 1월 카카오와 포털 다음(Daum) 운영사 지분 인수 양해각서를 맺고 5월 본계약을 체결했다. 현재 공정거래위원회 기업결합 심사 중이다. 인수 명분에는 독파모로 개발 중인 모델의 대국민 확산이 명시됐고, 20일 자료에 공개된 전문가 평가 의견에서 다음 연계 추진은 실제 긍정 평가 사유로 꼽혔다. 인수의 주된 동기가 상장을 앞둔 외형 확충이라는 분석이 유력하지만, 확산 배점과 상장 전략이 같은 방향을 가리켰고 그 선택이 평가에서 득점했다는 사실은 남는다. 이 대목에서 필자가 교정해야 할 것이 있다. 지난 칼럼에서 필자는 '솔라 오픈 2'를 다음 포털에 얹는 계획을 영리한 유통 전략으로 평가했다. 절반만 맞았다. 그것은 제휴가 아니라 인수한 자기 채널에 얹는 것이고, 제3자 채택이 아니라 내부 활용에 가깝다. 남의 플랫폼이 내 모델을 선택하는 것과 내가 산 플랫폼에 내 모델을 싣는 것은 확산의 증거로서 무게가 다르다. 확산 항목이 이 둘을 구분하지 않는다면, 채널은 빌리는 것보다 사는 것이 확실하다는 교훈만 남는다. 두 번째 사례는 모티프다. 모티프테크놀로지스는 무명의 신생 팀이 아니다. 국산 슈퍼컴퓨터 '천둥'을 만든 서울대 연구진이 2020년 세운 AI 인프라 소프트웨어 회사 모레(Moreh)가 파운데이션 모델 사업을 위해 분사한 회사다. 모레는 엔비디아 쿠다(CUDA)를 대체하는 소프트웨어로 KT와 AMD의 전략 투자를 받았고, 2024년 말 102B 규모 한국어 모델을 공개하며 모델 사업 진출을 예고했다. 30명이 GPU 700여 장으로 5개월 만에 314B 모델을 만든 것은 기적이 아니라, GPU 커널부터 다뤄 온 시스템 소프트웨어 조직의 축적이 모델로 전환된 것이다. 이 계보를 알면 '대자본에 희생된 언더독'이라는 서사는 유지되기 어렵다. 모티프는 자본이 없는 팀이 아니라 KT와 AMD가 투자한 인프라 기업의 모델 사업 부문이다. 흥미로운 것은 그 모회사 모레가 YTN 보도에 따르면 업스테이지와 함께 AMD 반도체 기반 거대언어모델 구축 협력을 진행 중이라는 점이다. 평가에서는 탈락팀과 생존팀이지만 공급망에서는 같은 방향을 보는 파트너다. 두 사례를 나란히 놓으면 구조가 보인다. 확산을 배점하자, 채널이 없던 한 회사는 30년 된 포털을 통째로 샀고, 채널이 없던 다른 회사는 떨어졌다. 확산 실적을 절대량으로 재는 항목은, GTM(Go To Market) 전략의 언어로 말하면 모델 역량의 측정이 아니라 보유 채널 자산의 대리 측정이다. 정부도 이 비대칭을 인지해 모티프에게 기존 모델의 확산 실적까지 폭넓게 인정하는 보정을 뒀지만, 배점표가 재는 것 자체를 바꾸지는 못했다. 무엇을 재느냐가 무엇을 만드느냐를 결정한다는 지난 칼럼의 문장은 경고로 쓴 것인데, 열흘 사이에 실제로 일어난 일이 됐다. 측정 기준 하나가 한 회사의 인수합병을 밀었고, 다른 회사를 탈락시켰다. 6. 누구를 떨어뜨렸어도 시끄러웠을 것 그럼에도 논란이 이렇게 커진 이유를 판정의 하자에서만 찾으면 다음 라운드에서 같은 일이 반복된다. 네 팀 중 하나를 떨어뜨려야 하는 구조에서, 다른 팀이 떨어졌다면 조용했을까? SK텔레콤이 떨어졌다면 가장 많은 사용자를 가진 서비스를 떨어뜨렸다는 비판이, LG가 떨어졌다면 사용자 평가 1위를 떨어뜨렸다는 비판이, 업스테이지가 떨어졌다면 가장 빠르게 성장하는 AI 기업을 꺾었다는 비판이 나왔을 것이다. 그리고 모티프가 남았다면, 벤치맥싱을 성토하던 바로 그 목소리가 벤치마크 점수로 뽑았다고 성토했을 것이다. 어떤 조합을 골라도 비판이 성립하는 구조였다. 비판이 반증 불가능하다면 그것은 판정에 대한 비판이 아니라, 위원회가 선별한다는 사실 자체에 대한 불신이다. 그 불신에는 두 개의 실재하는 뿌리가 있다. 하나는 사업의 성격 규정 실패다. 조달을 하면서 국가대표 선발전으로 브랜딩했다. 배점표 맨 앞에 글로벌 지수를 걸고 언론이 점수 경쟁으로 중계하게 두었다가 지수 1위를 떨어뜨리면, 대중의 눈에는 모순으로 보일 수밖에 없다. 결과 공개 방식도 이 실패를 키웠다. 낙인효과를 이유로 점수를 비공개했다가 논란이 커지자 이틀 만에 공개로 돌아섰는데, 공개된 것도 항목별 1위와 평균뿐이라 종합 순위는 여전히 재구성되지 않는다. 공개된 다섯 항목 중 1위가 하나도 없는 업스테이지의 통과는 논리적으로 얼마든지 가능한 결과이지만, 설명 자료를 다 읽고도 독자가 순위를 검증할 수 없다면 투명성의 목적은 달성되지 않은 것이다. 다른 하나가 더 근본적인데, 독파모 바깥에 있다. 미국이나 중국이라면 에이전트 벤치마크에서 그 성적을 낸 30명 팀은 정부 사업에서 떨어져도 투자 제안과 서빙 제안을 받는다. 한국에서는 프런티어급 컴퓨트와 자본에 접근하는 경로가 사실상 이 프로젝트 하나다. 탈락이 다음 라운드 진출 실패가 아니라 퇴출처럼 읽히는 이유, 여론이 언더독 서사에 이토록 반응한 이유가 여기에 있다. 시장이 해야 할 선별을 위원회가 1년에 몇 번 대신하는 구조에서는 어떤 판정도 시장의 판정보다 잔인하게 읽힌다. 임정환 모티프 대표가 탈락 직후 내놓은 입장은 이랬다. "결과에 상관없이 이번 독파모 프로젝트를 통해 기술력만으로 한국에서도 글로벌 프론티어 수준의 AI 모델 개발이 가능하다는 것을 증명했다는 점에서 매우 뜻깊었다." 임 대표는 "앞으로도 글로벌 프론티어 모델 개발에 전력을 다할 것"이라고 덧붙였다. 실제로 모티프는 결과 발표 당일 마감된 '모두의 AI' 사업자 공모에 KT 컨소시엄으로 참여했다. 탈락이 끝이 아니라는 것을 회사가 먼저 행동으로 보여준 셈이다. 마무리: 3차 평가가 물어야 할 것 3차를 앞두고 물어야 할 질문을 정부 몫과 시장 몫으로 나눈다. 정부 몫은 두 가지다. 첫째, 확산을 계속 배점할 거라면 절대량이 아니라 증가율과 생태계 기여도로 재야 한다. 절대량 배점은 다음 라운드에서도 채널 자산이 큰 팀의 승리를 예약해 두는 것이고, 그러면 평가는 측정이 아니라 확인이 된다. 둘째, 탈락팀의 성과가 소멸하지 않는 경로를 넓혀야 한다. 모두의 AI 공모는 독파모 탈락 기업에도 열려 있고 모티프는 실제로 그 문으로 들어갔다. 이 구조를 AI 테스트베드 같은 확산 인프라 전반으로 넓히는 것은 조달의 목적과도 어긋나지 않는다. 목표가 순위 경쟁이 아니라 생태계 육성이라는 공언의 증명은, 잔류팀 지원이 아니라 탈락팀의 다음 6개월에서 나온다. 시장 몫의 질문은 더 무겁다. 사용성 논쟁이 소모적으로 흐르지 않으려면 제3자가 재고 결과가 업무 완수로 나오는 지표를 봐야 한다. 참고할 지표는 이미 있다. 안돈랩스(Andon Labs)의 벤딩벤치 2는 AI에게 가상의 '자판기 사업'을 1년간 맡기고 최종 잔고로 채점한다. 아레나(Arena.ai)의 에이전트 리더보드는 실사용 세션 189만 건을 기반으로 도구 활용과 작업 완수를 잰다. 두 지표의 상위권은 미국 프론티어와 중국 오픈웨이트 모델들이 채우고 있다. 시험이 바뀌어도 점수가 유지되는 모델들이다. 이 대목에서 공정성 논쟁에 보태야 할 사실이 하나 있다. 오늘(20일) 기준 아레나의 에이전트 워크 리더보드에 오른 50개 모델 중 국산은 업스테이지의 '솔라 프로 4 하나'로 45위, 하위권이다. 업스테이지는 텍스트 아레나(393개 모델 중 171위)와 코드 아레나(117개 모델 중 77위)에도 모델을 올려 두고 있다. 순위만 보면 초라해 보일 수 있다. 그러나 나머지 국내 팀들은 이 무대에서 순위가 낮은 것이 아니라 무대에 없다. 국가대표 선발의 공정성을 따지는 논쟁은 뜨거웠지만, 세계가 보는 리더보드에 모델을 올려 검증받는 팀이 하나뿐이라는 사실은 거의 논의되지 않았다. 필자가 보기에 3차 평가가 배점해야 할 것은 자기 채널의 탑재 실적이 아니라, 이런 다양한 외부 무대에서 검증받은 기록이다. 가령, 금융 업무 완수를 재는 벤치마크에서 국내 최고점을 낸 모델이 나왔는데도 국내 금융사와 엔터프라이즈가 움직이지 않는다면, 문제는 모델 공급이 아니라 수요 쪽의 검증 역량이다. 지난 칼럼에서 확인했듯 다운로드 수는 채택의 증거가 아니다. 채택은 계약으로 확인되고, 그 계약은 정부가 아니라 시장에서 나온다. 끝으로 지난 칼럼의 마지막 문장을 정정한다. 무엇을 재느냐는 무엇을 만드느냐만 결정하는 것이 아니었다. 누가 남느냐까지 결정한다. 측정 설계는 기술의 문제가 아니라 산업 구조의 문제이고, 3차 평가의 배점표는 그 자체로 한국 AI 산업에 보내는 가장 강한 시그널이 될 것이다.

2026.08.20 20:45안광섭 컬럼니스트

노타, 국가대표 AI 모델 최적화 지원 이어간다

노타가 자체 인공지능(AI) 모델 경량화 및 최적화 기술을 바탕으로 국가대표 AI 모델의 활용 경쟁력 강화에 나선다. 노타는 정부의 '독자 AI 파운데이션 모델(독파모)' 프로젝트에 참여한 업스테이지 컨소시엄이 3차수에 진출한 데 따라 기술 지원을 이어갈 계획이라고 20일 밝혔다. 노타는 업스테이지 컨소시엄에서 AI 파운데이션 모델 '솔라' 계열 경량화와 최적화를 담당하고 있다. 모델 성능을 유지하면서 연산 자원과 메모리 사용량을 줄여 다양한 하드웨어와 서비스 환경에 적용할 수 있도록 지원하는 역할이다. 다음 단계에 진출한 업스테이지의 '솔라 오픈 2'는 2500억 개의 매개변수를 갖춘 AI 모델이다. 노타는 모델 가중치를 INT4 또는 NVFP4 기반의 4비트 형식으로 변환하고 중요도가 낮은 연산 모듈을 선별적으로 정리하는 경량화 기술을 적용했다. 그 결과 가중치 저장에 필요한 메모리를 500.6 기가바이트(GB)에서 117.8GB로 76.5% 줄였다. 메모리 용량 기준으로 엔비디아 H100 그래픽처리장치(GPU) 8장이 필요했던 원본 모델을 2장으로도 구동할 수 있게 한 것이다. 채명수 노타 대표는 "국가대표 AI 모델이 다양한 산업 현장에서 비용 효율적으로 활용될 수 있도록 최적화 기술을 지속 고도화할 것"이라며 "업스테이지와 함께 독파모 3차수 평가에서도 좋은 성과를 거둘 수 있도록 최선을 다하겠다"고 말했다.

2026.08.20 17:17이나연 기자

래블업·로앤컴퍼니, 국대 AI 인프라·법률 데이터 지원 이어간다

래블업과 로앤컴퍼니가 정부 주도의 국가대표 인공지능(AI) 개발 사업에 참여 중인 업스테이지의 인프라·법률 협력사 역할을 맡아 함께 2차 관문을 통과했다. 래블업과 로앤컴퍼니는 각 사가 참여 기업으로 속한 업스테이지 컨소시엄이 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모)' 프로젝트 3차수에 진출했다고 19일 밝혔다. 독파모 프로젝트는 국내 기술력으로 글로벌 경쟁력을 갖춘 AI 파운데이션 모델을 만들기 위한 국가 핵심 사업이다. 래블업은 이 사업에서 자체 AI 인프라 플랫폼 '백엔드닷에이아이(Backend.AI)'를 기반으로 학습 인프라 전반을 운영해 왔다. 1차수에서는 500장 이상의 엔비디아 B200 그래픽처리장치(GPU) 클러스터를 운영하며 업스테이지의 '솔라 오픈 100B' 모델 학습을 지원했다. 2차수에서는 엔비디아 H100·B200 등으로 구성된 1,000장 규모의 클러스터에서 업스테이지의 '솔라 오픈 2 250B' 모델 학습을 지원했다. 또 컨소시엄 파트너들이 모델 경량화, 평가 파이프라인 고도화, 산업별 실증 서비스 개발, 기초연구 및 안전성 확보 등 다양한 목적으로 GPU를 활용할 수 있도록 했다. 3차수에서는 클러스터 규모가 1000장 이상으로 확대된다. 래블업은 파운데이션 모델 성능을 끌어올리기 위해 강화학습(RL)을 비롯한 사후학습 비중이 커지는 흐름에 맞춰 백엔드닷에이아이의 슬럼(Slurm) 인터페이스 지원을 본격화할 예정이다. 신정규 래블업 대표는 "500장에서 시작해 1000장 이상으로 확대된 클러스터를 3개 차수에 걸쳐 안정적으로 운영한 것은 백엔드닷에이아이의 대규모 학습 인프라 운영 역량을 실제 국책사업 환경에서 검증한 결과"라고 말했다. 이어 "3차수에서는 슬럼 인터페이스 지원과 신경망처리장치(NPU) 호환성을 확대해 더 다양한 대규모 학습과 추론 환경에 대응할 수 있도록 플랫폼을 고도화하겠다"고 덧붙였다. 리걸테크 기업 중 유일하게 독파모 사업에 참여한 로앤컴퍼니는 업스테이지 컨소시엄에서 글로벌 표준 AI 생태계 조성을 위한 모델 확산 역할을 맡고 있다. 지난 1차수에서 법률 특화 학습 데이터셋 및 평가 데이터셋을 구축한 데 이어, 2차에서는 법률 데이터 평가를 고도화하며 솔라 오픈 2 250B 모델 성능 개선에 기여했다. 모델 확산도 진행 중이다. 로앤컴퍼니는 자체 개발한 법률 AI 서비스 '슈퍼로이어'의 온프레미스 구축형 상품에 솔라 오픈 모델을 적용했다. 지난달 업스테이지가 개최한 솔라 오픈2 공개 행사인 '솔라 오픈 웨이트 데이'에서 솔라 오픈 2 기반의 슈퍼로이어 온프레미스 버전도 시연한 바 있다. 김본환 로앤컴퍼니 대표는 "국가 AI 산업 경쟁력 강화에 일조할 수 있는 의미있는 여정을 이어가게 돼 기쁘다"며 "모델 성능 고도화와 함께 실제 서비스 적용을 통한 법률 AI 생태계 확산에 박차를 가해 국가 AI 경쟁력 강화에 기여할 수 있도록 최선을 다하겠다"고 강조했다.

2026.08.19 16:12이나연 기자

슈퍼브에이아이, LG AI연구원과 독파모 3차 진출

슈퍼브에이아이가 LG AI연구원의 피지컬 인공지능(AI) 데이터 구축 역할을 수행하며 정부 주도의 국가대표 인공지능(AI) 개발 사업 2차 관문을 통과했다. 슈퍼브에이아이는 자사가 참여한 LG AI연구원 정예팀(컨소시엄)이 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모)' 프로젝트 3차수에 진출했다고 19일 밝혔다. 슈퍼브에이아이는 이 컨소시엄에서 초거대 모델 'K-엑사원'의 비전·영상·피지컬 AI 영역을 담당해왔다. 비(非) LG 계열사 중 고성능 AI 파운데이션 모델 개발에 참여한 곳은 슈퍼브에이아이가 유일하다. 슈퍼브에이아이는 2025년 8월 정예팀 선정 이후 1차 사업에서 초거대 AI 학습용 영상 데이터 구축을 완수했다. 2차 사업에서는 시각 이해와 3차원(3D) 공간 정보 해석 등 고난도 비전 기술을 구현했다. 사람의 동작을 1인칭·3인칭 영상으로 수집·가공하고 자연어 라벨링을 결합해 AI 학습 기반이 되는 멀티모달 데이터 파운데이션을 구축했다는 설명이다. 김현수 슈퍼브에이아이 대표는 "비전·영상·행동 데이터 구축 역량을 바탕으로 우리 기술과 데이터로 구축하는 독자 피지컬 AI 파운데이션 모델과 비전 언어 행동(VLA) 모델 개발에 기여하겠다"고 말했다.

2026.08.19 13:25이나연 기자

오픈AI·딥마인드가 짚은 벤치마크 함정, AI 승부는 '현장'서 갈린다

인공지능(AI) 경쟁 기준이 성적표에서 현장으로 옮겨가고 있다. 벤치마크 점수가 아무리 높아도 실제 업무에서 쓰이지 않으면 좋은 모델로 보기 어렵다는 인식이 확산 중이다. 18일 발표된 정부의 국가대표 AI 선발 2차 평가가 이 변화를 그대로 보여줬다. 이날 독자 AI 파운데이션 모델(독파모) 2차 단계평가에서는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII 지표에서 참여팀 중 최고점을 받은 모티프테크놀로지스가 사용성·활용성에서 밀려 탈락했다. 반면 업스테이지·SK텔레콤·LG AI연구원이 3차에 진출했다. 이번 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 진행했다. AI 전문가 49명과 일반 국민 185명이 각 팀의 모델을 직접 써보고 채점하는 사용자 평가를 새로 도입해, 벤치마크 성능만으로는 통과할 수 없는 구조였다. 류제명 과기정통부 제2차관은 브리핑에서 "기술력이 뛰어나도 75점의 상당한 배점이 주어진 사용성·활용성에서 낮은 평가를 받으면 종합 결과가 달라질 수 있다"고 설명했다. 성적표가 실력을 보증하지 못하는 이유는 벤치마크 구조적 한계에 있다. 벤치마크는 미리 정해진 문제와 정제된 환경에서 모델을 시험한다. 문제 유형이 고정돼 있어 특정 시험에 맞춰 최적화하면 점수를 끌어올릴 수 있지만, 이렇게 얻은 고득점이 실제 업무 능력으로 이어진다는 보장은 없다. 현장 입력은 지저분하고 예외적이며, 사용자의 질문은 시험지처럼 정돈돼 있지 않기 때문이다. 이 문제는 최전선 연구자들이 먼저 지적해왔다. 노엄 브라운 오픈AI 연구부사장은 지난달 서울에서 열린 글로벌 AI 프론티어 심포지엄 2026에서 "막대그래프 하나로 AI 실력을 재는 시대는 끝났다"고 말했다. 오픈AI의 추론 모델 'o1'과 'o3' 시리즈를 설계한 그는 벤치마크 점수 하나가 아니라 연산량 대비 성능 곡선으로 모델을 평가해야 한다고 지적했다. 같은 모델이라도 더 오래 연산하게 하면 성능이 달라지는데, 단일 점수로는 이 차이가 드러나지 않는다고 강조했다. 국제 AI 학회 ICML 참석차 방한한 나만 고얄 구글 딥마인드 머신러닝 리서치 엔지니어는 벤치마크를 '텅 빈 코스에서 치르는 운전면허 시험'에 비유했다. 시험을 통과했다고 실제 도로에서 잘 달릴 수 있는 것은 아니란 뜻이다. 그는 성능이 뛰어난 물체 탐지 모델이 영상의 한 프레임에서는 대상을 정확히 찾고도 거의 똑같아 보이는 다음 프레임에서는 놓치는 사례를 들며 "정제된 환경에서 잘 작동하던 모델도 조건이 조금만 어긋나면 무너질 수 있다"고 지적했다. 통과한 팀들이 활용성을 전면에 내세운 배경도 여기에 있다. LG AI연구원은 이번 모델의 차별점으로 파라미터 규모가 아니라 실제 업무 현장에서 스스로 일을 처리하는 AI 에이전트 성능을 앞세웠다. LG AI연구원 관계자는 "크기를 키우면서도 실제 사용자가 더 효율적으로 쓸 수 있도록 에이전트 기능에 집중했다"며 "단순히 큰 모델을 만드는 게 아니라 사용자가 실제 업무에서 성과를 내도록 돕는 AI를 만드는 것이 핵심"이라고 밝혔다. 정부는 독파모 3차 평가를 거쳐 내년 초 최종 2개 팀을 선정한다. 2027년 이후 지원 방식은 개발 주관사 중심의 기존 구도에서 벗어나 전면 재검토하기로 했다. 글로벌 프론티어 모델과의 격차를 좁히기 위해 지원 규모와 경쟁 방식을 다시 짠다는 방침이다. 고얄 엔지니어는 10년 전 알파고가 정복한 대상이 규칙이 정해진 바둑판이었다면, 지금 마주한 대상은 규칙이 수시로 바뀌는 현실 속 AI라고 했다. 그는 "AI 실력은 정해진 판 위 고득점이 아니라, 판이 흔들리는 현실에서 얼마나 믿을 만한 결정을 내리느냐에 있다"고 밝혔다.

2026.08.19 11:13김동원 기자

[시론] 독파모 2차 평가를 보고...남은 과제는

벤치마크 함정을 넘어 현장 실행력으로 정부가 어제(19일) 2차 독자 AI 파운데이션 모델(독파모) 평가 결과를 발표했다. 글로벌 AI 평가기관 Artificial Analysis의 Intelligence Index(AAII)에서 47점을 기록하며 국내 모델 가운데 가장 높은 성적을 거둔 모티프테크놀로지스가 탈락하고, 업스테이지·SK텔레콤·LG AI연구원 3개 컨소시엄이 다음 단계에 진출했다. 표면적으로만 보면 의아해할 수 있는 결과다. 정부 역시 Motif 3가 미국과 중국 이외 국가에서 개발된 모델 가운데 AAII 최고 수준에 도달했고, 아키텍처와 토크나이저, 옵티마이저, 커널까지 자체 개발한 독자 기술력을 확보했다고 평가했다. 글로벌 수준의 모델을 만들겠다는 국가 프로젝트에서 글로벌 벤치마크 점수가 가장 높은 모델이 탈락한 것에 대해, 평가 기준에 의문이 제기되는 것은 당연하다. 하지만 독파모는 단순히 벤치마크 점수가 가장 높은 모델을 뽑는게 아니다. 대한민국의 산업과 공공 현장에서 실제로 작동할 수 있는 국가 AI 기반 모델을 선정하는 거다. Motif 3의 47점은 모델의 기술적 가능성을 강하게 입증했다. 하지만 높은 벤치마크 점수와 실제 사용은 전혀 다른 차원이다. 현재 Motif 3는 그 기술적 성취에 비해 공개적으로 확인되는 대규모 상용 서비스와 산업 현장의 레퍼런스는 충분히 축적된 것으로 보이지 않는다. 아무리 높은 벤치마크 점수를 기록한 모델이라도 실제 시장에서 선택되고 반복적으로 사용되지 않는다면, 그 점수는 아직 검증된 산업 경쟁력이라기보다 가능성에 대한 증명에 가깝다. 그래서 이번 평가가 던진 질문은 단순하지 않다. 좋은 AI의 기준은 무엇일까. 얼마나 똑똑한가인가, 아니면 그 지능을 현실에서 얼마나 잘 작동시킬 수 있는가일까. 굿하트 법칙에 갇힌 글로벌 벤치마크 경제학에서 말하는 '굿하트의 법칙'이 있다. 측정 지표가 강력한 목표가 되는 순간 그 지표가 본래 측정하려던 현실을 제대로 반영하지 못한다는 것이다. AI 벤치마크에서도 같은 문제가 발생한다. AAII는 에이전트, 코딩, 과학적 추론, 일반 역량을 종합적으로 평가하는 현재 가장 영향력 있는 글로벌 AI지표 가운데 하나다. 과거의 단순한 질의응답형 벤치마크보다 훨씬 정교해졌고, 프런티어 모델의 지능 수준을 비교하는 데 유용한 것이 사실이다. 문제는 벤치마크가 측정의 도구에서 개발의 목표가 되는 순간이다. 벤치마크 순위가 모델의 기술력을 대표하고 기업 가치와 투자, 시장의 평가에까지 영향을 미치기 시작하면 연구개발 역시 자연스럽게 해당 평가를 최적화하는 방향으로 움직인다. 공개된 문제 유형에 맞춘 합성데이터를 집중적으로 생성하거나 후학습을 최적화하고, LLM-as-a-Judge가 선호하는 답변 형태를 학습하는 이른바 벤치맥싱(Bench-maxing) 유인이 발생한다. 단순히 부정행위 문제가 아니라, 공개된 측정 지표가 경쟁의 목표가 되는 순간 발생하는 구조적 문제다. 모델의 범용적인 지능이 향상된 것인지, 특정 평가에서 높은 점수를 얻는 능력이 향상된 것인지 구분하기 어려워지는 순간 벤치마크는 본래의 목적에서 멀어진다. AI 산업이 벤치마크 경쟁에 과도하게 매몰될수록 이 문제는 커질 수밖에 없다. 모델 개발사가 높은 점수를 얻기 위해 벤치마크의 출제 경향과 채점 방식에 적응하는 것은 어찌 보면 합리적인 선택이다. 그러나 국가가 어떤 AI를 전략적으로 육성할 것인가를 결정할 때까지 그 숫자를 그대로 받아들여야 하는지는 별개의 문제다. 정부는 이번 발표에서 "벤치맥싱은 없다"고 밝혔다. 더 근본적인 한계도 있다. AAII는 영어 텍스트를 중심으로 한 글로벌 평가다. 한국어의 미묘한 문맥과 행정,법률 용어, 한국의 제도와 문화적 정합성을 직접 평가하지 않는다. 개인정보 보호와 온프레미스 구축 가능성, 기업의 실제 데이터베이스와 업무 시스템 연동, 서비스 환경에서의 지연시간과 처리량 역시 하나의 지능지수에 담기 어렵다. 무엇보다 벤치마크에는 실제 사용자가 없다. 수많은 사용자가 동시에 접속했을 때도 안정적인지, 기업의 실제 데이터를 넣어도 성능이 유지되는지, 복잡한 업무 시스템에 연결했을 때 오류가 얼마나 발생하는지, 장기간 운영해도 비용을 감당할 수 있는지는 결국 실제 사용을 통해서만 검증된다. 물론, 벤치마크는 모델의 가능성을 증명하지만, 그 가능성이 현실에서도 작동하는지를 증명해야 한다. AI의 마지막 벤치마크는 결국 사용자다. 아무리 높은 점수를 받은 모델도 실제 현장에서 선택받고 반복적으로 사용되기 전까지는 잘 만든 모델일 수는 있어도 검증된 산업 인프라라고 말하기 어렵다. 47점과 31점 사이에 존재하는 현실의 격차 AAII에서 Motif 3는 47점을 기록했다. K-EXAONE 2.0은 31점이었다. 16점이라는 격차는 결코 작지 않다. 글로벌 벤치마크만 놓고 보면 상당한 차이다. 하지만 AI가 연구실을 벗어나 프로덕션 환경으로 들어오는 순간 평가 변수는 급격히 늘어난다. 모델의 추론능력뿐 아니라 TTFT(Time to First Token), 처리량, 메모리 사용량, 동시접속 안정성, 장문 처리능력, 데이터베이스와 외부 도구 연동, 보안, 온프레미스 구축, 운영비용이 동시에 중요해진다. 특히 AI가 단순히 챗봇에서 에이전트로 진화하면서 경제성의 기준도 달라지고 있다. 앞으로 중요한 것은 토큰 하나가 얼마인가가 아니라 업무 하나를 성공적으로 끝내는 데 얼마가 드는가다. 에이전트가 하나의 업무를 완료하기 위해 수십 차례 모델을 호출하고 외부 도구를 사용한다면 모델 호출 비용뿐 아니라 추론시간, 실패와 재시도, 사람의 개입까지 모두 비용이기 때문이다. 이 관점에서 보면 단순히 벤치마크 숫자로 표현되지 않는 또 다른 경쟁 공간이 존재한다. 지능의 격차와 산업 경쟁력의 격차는 동일하지 않다. Motif 3의 47점은 높은 지능을 보여준다. 그러나 높은 지능이 곧바로 프로덕션에서의 안정성과 경제성, 산업적 유용성을 보장하지는 않는다. 특히 아직 충분히 사용자가 붙지 않은 모델이라면 벤치마크에서 확인된 능력이 실제 환경에서도 동일하게 재현되는지를 검증해야 할 단계가 남아 있다. 반대로 실제 서비스에 배포된 모델은 훨씬 가혹한 시험을 받는다. 사용자는 정해진 문제만 묻지 않는다. 예상하지 못한 입력을 넣고, 긴 문서를 올리고, 외부 시스템을 연결하며, 개발자가 예상하지 못한 방식으로 서비스를 사용한다. 지연과 장애, 환각과 비용 문제 역시 이 과정에서 드러난다. 똑똑하지만 아작 잘 쓰지 않는 AI와 매일 누군가의 업무를 처리하는 AI 사이에는 벤치마크가 측정하지 못하는 거대한 검증의 차이가 존재하는 것이다. 국가가 막대한 컴퓨팅 자원과 재정을 투입해 국가대표 AI를 육성한다면 이 차이는 결코 부차적인 평가 요소가 될 수 없다. 생존한 3사의 공통분모: 작동하는 AX와 서빙 경제성 이번 2차 단계평가에서 살아남은 세 팀의 공통점도 이 관점에서 볼 필요가 있다. 업스테이지는 Solar Open 2의 MoE 구조를 통해 모델의 추론 성능과 서빙 경제성을 함께 끌어올리고 실제 서비스와 국산 NPU로 이어지는 실증 경로를 제시했다. 거대한 모델을 만드는 것뿐 아니라 제한된 GPU 자원에서 얼마나 효율적으로 서비스할 수 있는지를 경쟁력으로 내세웠다는 점이 중요하다. SK텔레콤은 A.X K2의 모델 성능과 함께 통신, 기업용 AI, 제조·국방 등 대규모 서비스 환경으로 확장할 수 있는 운영 기반을 갖추고 있다. 수많은 실제 사용자를 감당하는 서비스 인프라와 운영 경험은 모델 자체의 벤치마크에서는 측정하기 어려운 자산이다. LG AI연구원 역시 K-EXAONE 2.0과 함께 제조·화학·바이오 등 산업 현장에서 축적한 AX 경험, 안전성과 신뢰성, Agentic AI와 오픈소스 생태계 확장 전략을 제시했다. 세 팀의 공통점은 모델 크기나 벤치마크 숫자에 있지 않다. 모델에서 서비스로, 서비스에서 산업으로 이어지는 경로를 이미 갖고 있거나 구체적으로 제시했다는 점이다. 모델을 만드는 능력과 모델을 실제로 운영하는 능력은 다르다. 연구 환경에서 높은 성능을 기록하는 것과 수많은 사용자가 동시에 접속하는 프로덕션 환경에서 동일한 품질을 유지하는 것도 다르다. API를 공개하는 것과 기업의 ERP,CRM,그룹웨어,데이터베이스에 연결해 실제 업무를 수행하게 만드는 것 역시 다른 기술적 문제다. 물론 이것만으로 Motif 3의 탈락 원인을 특정할 수는 없다. 정부가 팀별 세부 평가점수를 공개하지 않았기 때문이다. 그러나 독파모가 단순한 모델 개발 경진대회가 아니라 국가 AI 생태계를 구축하는 프로젝트라면, 모델 자체의 성능뿐 아니라 그 성능을 실제 가치로 전환할 능력까지 평가하는 것은 충분히 합리적이다. 소버린 AI 기준은 리더보드가 아니라 현장 여기에서 독파모라는 사업의 목적을 다시 생각할 필요가 있다. 독파모는 세계에서 가장 높은 점수를 받는 한국산 LLM 하나를 만드는 사업이 아니다. 대한민국이 필요할 때 핵심 기술을 스스로 통제하고, 산업과 정부가 실제로 사용할 수 있는 AI 기반을 확보하기 위한 국가 프로젝트다. 그래서 1차 평가때는 프롬 스크래치 논란이 나오고, 네이버가 탈락할 정도로 우리의 자체 모델 개발 순수 역량을 평가했던 것이다. 소버린 AI 역시 단순히 국산 LLM을 보유하는 것을 의미하지 않는다. 국가와 기업이 핵심 AI 기술을 스스로 통제할 수 있어야 하고, 한국의 언어와 제도, 산업 데이터를 이해할 수 있어야 하며, 합리적인 인프라 비용으로 운영할 수 있어야 한다. 공공 행정과 제조·금융·의료 같은 국가 핵심 영역에 안전하게 연결되고, 국내 소프트웨어와 하드웨어, 서비스 기업들이 그 위에서 새로운 산업을 만들어낼 수 있어야 한다. 그렇다면 국가대표 AI의 경쟁력도 최소한 세 가지 축으로 평가해야 한다. 첫째는 지능이다. 추론·코딩·과학·에이전트 역량에서 세계 최고 수준의 모델과 경쟁할 수 있어야 한다. 글로벌 벤치마크는 이 격차를 냉정하게 측정하는 데 필요하다. 둘째는 주권이다. 한국의 언어와 문화, 법률·행정·금융 체계를 이해하고 핵심 기술과 데이터를 우리 스스로 통제할 수 있어야 한다. 개인정보 보호, 데이터 주권, 온프레미스 구축 가능성도 여기에 포함된다. 셋째는 실행력이다. 높은 지능을 합리적인 비용으로 실제 산업과 정부 시스템에 배치할 수 있어야 한다. 동일한 하드웨어와 업무 조건에서 처리량과 메모리 사용량뿐 아니라 업무 성공률, 실패와 재시도율, 사람의 개입 횟수와 최종 업무완료 비용까지 봐야 한다. 정리하면 간단하다. 지능은 세계와 경쟁하고, 주권은 우리가 통제하며, 실행력은 현장에서 증명해야 한다. 어느 하나도 다른 하나를 대신할 수 없다. 현장 실행력도 새로운 블랙박스가 되면 안돼 여기까지가 이번 독파모 2차 평가에 대한 생각이다. 그러나 정부 역시 이번 결과로부터 숙제를 받아야 한다. 벤치마크 만능주의를 피한다는 이유로 '현장성'과 '실행력'이 검증하기 어려운 정성적 표현으로 남아서는 안 된다. 특히 기존 고객과 서비스, 계열사와 인프라를 이미 확보한 대기업은 실증 레퍼런스를 만들기 쉽다. 반대로 기술력이 뛰어난 스타트업은 모델 자체의 성능과 무관하게 동일한 수준의 실증 기회를 확보하기 어렵다. 기존 사업자의 유통망과 시장 지배력이 모델의 실행력으로 그대로 환산된다면 또 다른 종류의 기울어진 운동장이 만들어질 수 있다. 그렇다면 역설적으로 다음 독파모가 해야 할 일은 현장 실행력의 벤치마크를 만드는 것이다. 동일한 GPU와 데이터, 동일한 업무 시나리오를 주고 실제 에이전트가 업무를 처음부터 끝까지 수행하게 하면 된다. 정답률만 보는 것이 아니라 업무완료율, 처리시간, 총추론비용, 실패와 재시도 횟수, 외부 도구 호출의 정확성, 사람의 개입 정도를 함께 측정하는 것이다. 기존 고객사가 몇 곳인지가 아니라 주어진 환경에서 얼마나 적은 비용으로 얼마나 많은 실제 업무를 완수했는가를 평가해야 한다. 이렇게 해야 '현장 실행력' 역시 객관적인 경쟁의 대상이 될 수 있다. 에이전트 시대에는 하나의 답변을 생성하는 데 필요한 비용보다 하나의 업무를 끝까지 완수하는 데 필요한 비용과 시간이 더 중요해지기 때문이다. 모델 자체의 지능뿐 아니라 계획, 도구 호출, 오류 복구와 검증까지 포함한 전체 시스템의 성능을 평가해야 한다. 정부가 개별 기업의 영업비밀 때문에 세부 점수를 모두 공개하기 어렵다면 최소한 평가 항목과 정규화 방식, 익명화된 점수 분포, 평가의 재현 절차는 보다 투명하게 제시할 필요가 있다. 동시에 이번 평가에서 기술적 가능성은 충분히 입증했지만, 아쉽게 탈락한 모티프에게 현장 레퍼런스를 확보하기 위해 별도의 실증,사업화 트랙을 마련하고 적극 지원해야 한다. 3차 단계에 진출한 기업들에 준하는 수준의 컴퓨팅 자원과 수요기관 연계, 공공,산업 실증 기회를 제공해 이미 확보한 기술력이 쓰이는 AI로 전환될 수 있도록 적극 지원해야 한다. 2차 평가는 끝났고, 증명은 이제 시작이다 결국 독파모 2차 평가의 의미는 특정 모델의 탈락이나 통과 그 자체에 있지 않다. 이번 평가가 던진 더 큰 메시지는 국가 AI 경쟁의 기준이 단순히 모델의 성능만으로는 완성되지 않는다는 것이다. 정부는 이번 평가를 통해 벤치마크 밖의 가치를 선택했다. 그렇다면 이제 그 선택이 옳았음을 결과로 증명해야 한다. 다음 단계의 모델들이 실제 산업과 공공 현장에서 생산성을 높이고, 비용을 낮추며, 대한민국 AI 생태계의 경쟁력을 확장하는지를 보여줘야 한다. 독파모의 성패 역시 결국 이 같은 기준으로 평가받을 것이다. 얼마나 높은 점수를 받은 모델을 만들었는가가 아니라, 대한민국에 얼마나 강한 AI 역량을 남겼는지, 얼마나 산업 등 대한민국 국가경쟁력에 기여할 지다. 이번 2차 평가 이후 독파모가 답해야 할 진짜 질문이다.

2026.08.19 09:14이승현 컬럼니스트

SKT 손잡은 셀렉트스타, 독파모 3차 진출

셀렉트스타가 정부 주도의 국가대표 인공지능(AI) 개발 프로젝트에 참여 중인 SK텔레콤의 데이터 품질을 총괄하며 '독자 AI 파운데이션 모델(독파모)' 사업 2차 관문을 통과했다. 셀렉트스타는 '에이닷엑스 케이투(A.X K2)'를 개발해 독파모 3차수에 진출한 SK텔레콤 정예팀에서 학습데이터 품질관리와 검수를 담당했다고 18일 밝혔다. 독파모 프로젝트는 대한민국을 대표할 독자적인 AI 파운데이션 모델을 개발하기 위한 국가 사업이다. 과학기술정보통신부는 이번 평가에서 벤치마크 평가와 전문가 평가, 국민평가 등을 종합해 후속 개발을 이어갈 3개 팀을 선정했다. 셀렉트스타는 1차 단계에서 대규모 학습데이터의 구축과 검증을 통해 SK텔레콤의 '에이닷엑스 케이원(A.X K1)' 성능과 신뢰성 향상을 지원한 바 있다. 이어 2차 단계에서는 여러 참여기관이 생성·구축한 데이터의 품질을 통합 관리하는 역할로 범위를 확대했다. 모델 개발 단계별로 요구되는 데이터 품질 기준을 수립하고 질문과 답변의 적절성을 보는 '질의·응답 적정성', 이미지와 질의응답 간 일치 여부를 평가하는 '시각 질의응답(VQA) 적정성', 문장의 형식과 구조를 확인하는 '구문 정확성' 등을 종합 점검해 안정적인 사후학습을 지원했다. 모델 안전성 강화를 위한 레드티밍 학습용 데이터셋 품질 검수도 진행하며 모델의 성능뿐 아니라 안전성 향상도 함께 지원했다. 자체 개발한 AI 신뢰성 평가 플랫폼 '다투모 플랫폼'과 산업·공공 분야에서 축적한 레드티밍 경험을 바탕으로, 실제 활용 과정에서 발생할 수 있는 안전성과 편향 위험까지 고려했다는 설명이다. 셀렉트스타는 후속 단계에서도 SK텔레콤 모델의 산업 및 실생활 확산 성과를 바탕으로 데이터를 고도화하고 모델 안전성과 신뢰성을 체계적으로 검증할 계획이다. 김세엽 셀렉트스타 대표는 "이번 2차 평가 통과는 SK텔레콤 정예팀 참여기관들이 각자의 영역에서 역량을 모아온 결과"라며 "이번 프로젝트의 기술과 데이터 성과가 특정 기업에 머무르지 않고 국내 AI 생태계가 활용할 수 있는 결과물로 이어질 수 있도록 데이터와 신뢰성 평가 기술을 고도화하겠다"고 말했다.

2026.08.18 16:02이나연 기자

[독파모 2차 발표] SK텔레콤 3차 진출, 다음 행보는 "산업·생활 서비스 확산"

SK텔레콤이 독자 인공지능(AI) 모델 '에이닷엑스 케이투(A.X K2)' 지식·추론 능력과 산업 활용도를 동시에 높인다. 모델 성능을 실제 산업·서비스로 연결해 국내 AI 생태계가 활용할 수 있는 모델을 만든다는 구상이다. 18일 과학기술정보통신부에 따르면 SK텔레콤 정예팀은 '독자 AI 파운데이션 모델 프로젝트' 2차 단계평가를 통과해 3차 단계에 진출했다. SK텔레콤은 3차 단계에서 지식과 추론 중심으로 모델 역량을 확장한다고 밝혔다. 멀티모달 파생 모델과 산업별 서비스를 개발해 기업·기관이 실제 활용할 수 있는 형태로 모델 고도화에 나선다. 회사는 다음 단계에서 모델 산업 현장 적용도 확대한다고 강조했다. 특히 제조 분야에서는 KG스틸·코넥과 특화 AI 에이전트를 개발한다. 국방 분야에서는 국방부와 협력해 경량화 모델을 제공하고 바이오 분야에서는 SK바이오팜과 협업한다. 앞서 SK텔레콤은 2차 단계에서 비전언어모델 '에이닷엑스 케이투 브이엘 라이트 프리뷰(A.X K2 VL Light-Preview)'와 음성언어모델 '에이닷엑스 케이투 ALM(A.X K2 ALM)', '에이닷엑스 K2 라온-스피치(A.X K2 Raon-Speech)'를 공개했다. 이들 파생 모델을 활용한 데모까지 구현해 전문가·사용자 평가에서 실제 사용 가능성을 제시했다. A.X K2는 매개변수 6880억개 규모로 전작 A.X K1의 5190억개보다 커졌다. 국내외 14개 벤치마크 평균 성능은 전작보다 32.2%포인트 높아졌으며 장문 이해와 에이전트 관련 평가에서는 약 83.9%포인트 개선됐다. 모델 수리 추론 능력도 강화됐다. SK텔레콤에 따르면 A.X K2는 국제수학올림피아드 2026 금메달 수준의 성능을 기록했다. '매스아레나 에이미 2026'에서 공동 최고점을 받았다. 긴 문맥 처리에는 SK텔레콤이 자체 개발한 '희소 게이트 어텐션(SGA)' 구조가 적용됐다. 긴 내용 가운데 관련성 높은 정보만 선별해 참조하는 방식으로 정확성과 운영 효율을 높인다. SK텔레콤은 앞으로 모델 경량화와 추론 가속 기술도 지속해서 공개할 계획이다. 모델 파일을 개방하는 데 그치지 않고 기업과 기관이 운영 과정에서 겪는 메모리와 속도·장비 부담을 낮추기 위해서다. 정부는 다음 평가에서 현재 3개 정예팀을 2개팀으로 압축할 예정이다. 구체적인 평가 방식과 배점은 참여 기업과 협의를 거쳐 확정한다. 프론티어급 AI 모델과 관련한 내용은 별도로 발표할 계획이다. SK텔레콤 관계자는 "다음 단계에 참여하게 된 것을 뜻깊게 생각한다"며 "자체 AI 모델의 산업·실생활 확산 성과를 바탕으로 국내 AI 생태계가 함께 활용할 수 있는 결과물을 만드는 데 집중할 것"이라고 밝혔다.

2026.08.18 15:27김미정 기자

[독파모 2차 발표] LG 'K-엑사원' 3차 진출…"승부처는 활용성"

정부가 국가대표 AI 모델을 뽑는 '독자 AI 파운데이션 모델' 프로젝트에서 LG AI연구원의 'K-엑사원'이 3차 진출을 확정했다. LG는 이번 모델 차별점으로 파라미터 규모가 아니라, 실제 업무 현장에서 스스로 일을 처리하는 'AI 에이전트' 성능을 내세웠다. 18일 과학기술정보통신부 발표에 따르면 LG AI연구원 정예팀은 독파모 2차 단계평가를 통과해 3차 단계에 진출했다. 독파모는 과학기술정보통신부가 글로벌 수준의 국산 AI 파운데이션 모델을 키우기 위해 여러 팀을 선정한 뒤 단계별 평가를 거쳐 최종 후보를 추려 나가는 사업이다. 과기정통부는 이날 2차 단계 평가 결과를 발표했고, K-엑사원은 이전 모델보다 규모를 3배 이상 키우며 이 관문을 통과했다. LG가 규모를 키우면서도 방점을 찍은 지점은 실사용성이다. 아무리 성능이 좋아도 현장에서 쓰이지 않는 모델은 의미가 없다고 보고, 사람 대신 도구를 골라 쓰고 여러 단계의 작업을 직접 수행하는 에이전트 기능을 끌어올리는 데 집중했다. LG AI연구원 관계자는 "크기를 키우면서도 기존보다 성능이 뛰어나고, 실제 사용자가 더 효율적으로 쓸 수 있도록 에이전트 기능에 더 집중했다"고 밝혔다. LG가 모델 규모를 3배 키운 것도 글로벌 경쟁에 뛰어들기 위한 선택이다. 몸집을 충분히 키워야 세계 최고 수준의 이른바 '프런티어급' 모델 시장에 발을 들일 수 있다는 판단이다. 다만 여기서 '프런티어급'은 GPT나 제미나이 같은 범용 초대규모 모델과 정면으로 겨루겠다는 의미가 아니다. LG AI연구원 관계자는 "지금은 범용이라기보다 프런티어급 전문가 모델을 지향하고 있는 것이 맞다"면서 "특정 분야에서 최고 수준을 노리는 '전문가 AI' 노선을 그대로 이어가되, 그 안에서 글로벌급 규모를 갖추고자 한다"고 했다. 규모를 키우는 데 필요한 컴퓨팅 자원은 독파모 사업에서 지원받은 그래픽처리장치(GPU)로 확보했다. 실제로 쓰이는 AI에 무게를 싣는 전략은 최근 성과에서도 드러난다. 앞서 공개한 'K-엑사원 2.0'은 750B(7500억 개) 파라미터 규모로, 독파모 1차수 모델(236B)보다 크기가 3배 이상 커졌다. 24개 벤치마크 평균 70.1점을 기록해 1차수(63.3점)보다 10% 이상 높은 성능을 냈고, 코딩과 에이전틱 코딩 영역의 주요 지표 3개 평균 성능이 30% 올랐다. AI가 스스로 도구를 골라 쓰는 능력을 평가하는 항목(Tau3-Bench Banking)에서는 14.2점으로 중국 지푸의 GLM-5.1(11.5점), 큐원3.5(13.4점)를 앞섰다. 단순히 모델을 키우는 데 그치지 않고, 사용자가 실제 업무에서 더 효율적으로 쓸 수 있도록 에이전트 성능을 끌어올리는 데 초점을 맞췄다는 게 LG의 설명이다. LG AI연구원은 다음 달 초 산업 특화 AI 파운데이션 모델을 추가로 공개해 '전문가 AI' 포트폴리오를 넓힐 계획이다. 한 달 뒤에는 토크 콘서트를 열고 향후 기술 개발 방향을 상세히 설명한다. LG AI연구원 관계자는 "단순히 큰 모델을 만드는 것이 목표가 아니라, 사용자가 실제 업무에서 성과를 내도록 돕는 AI를 만드는 것이 핵심"이라며 "앞으로도 전문가 AI 영역에서 실질적인 활용 가치를 높여 나가겠다"고 말했다.

2026.08.18 14:33김동원 기자

  Prev 1 2 3 4 5 6 7 8 9 Next  

지금 뜨는 기사

이시각 헤드라인

삼성전자, P5 첫 양산라인 구축 속도…장비 도입 내년 2분기로 앞당겨

AMD "BOE와 컴퓨팅·디스플레이 경험 함께 혁신"

퀄컴·삼성, '폰·워치·글래스' 삼각편대 구축…'하이브리드 AI' 생태계 연다

하정우 부위원장, AI 현장 소리 직접 듣는다…정책 토크쇼 개최

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.