• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'LG 독파모'통합검색 결과 입니다. (51건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

이의 제기에 공개된 독파모 점수…참여 업체들 "이젠 모티프가 답할 차례"

정부 독자 AI 파운데이션 모델(독파모) 2차 평가에서 탈락한 모티프테크놀로지스가 거듭 이의를 제기하자 참여 업체들이 비판에 나섰다. 정작 자사 모델을 둘러싼 의혹엔 답하지 않으면서 정부 평가만 문제 삼는다는 지적이다. 27일 AI 업계에 따르면 독파모 사업에 참여한 업체들 사이에서는 모티프테크놀로지스의 잇단 문제 제기에 "결과에 아쉬움은 이해하지만 방식에는 동의하기 어렵다"는 반응이 많은 것으로 나타났다. 앞서 모티프테크놀로지스는 자사 모델 '모티프 3'가 글로벌 AI 평가지표 아티피셜 애널리시스 인텔리전스 인덱스(AAII)에서 참여 모델 중 1위를 기록하고도 종합 최하위로 탈락하자 이의를 제기했다. 정부가 이례적으로 전체 세부 점수를 공개하자 이번에는 전문가 평가 채점 기준과 평가위원 구성을 다시 문제 삼았다. 공개된 세부 점수를 보면 모티프 3는 AAII에서만 11.9점으로 1위였고 나머지는 모두 최하위였다. 한국어와 안전성을 반영한 NIA 벤치마크가 12.7점, 전문가 평가 27.1점, 사용자 평가 14.1점으로 모두 꼴찌였다. 종합 점수는 65.8점으로 ▲SK텔레콤(70.6점) ▲업스테이지(69.9점) ▲LG AI연구원(69.0점)에 뒤처졌다. AI 업계가 대표적으로 지적한 대목은 문제 제기의 초점이 계속 바뀐다는 점이다. A사 관계자는 "세부 점수를 공개하라고 해서 정부가 전체 점수를 공개했더니 이번에는 전문가 평가와 평가위원을 문제 삼는다"고 말했다. C사 관계자도 "붙었으면 아무 말 없었을 텐데 떨어지니 따질 대상을 계속 바꾼다"며 "판정에 불만이 있다고 심판 자질부터 문제 삼는 격"이라고 꼬집었다. 정작 모티프테크놀로지스 스스로는 검증에 침묵한다는 비판도 나왔다. 이 회사는 최근 이른바 '벤치맥싱' 논란에 휩싸였다. 미국 AI 데이터 기업 애프터쿼리가 링크드인을 통해 모티프 3의 '유일한 데이터 파트너'로 참여했다는 소식을 알리면서다. 벤치맥싱은 특정 벤치마크에서 높은 점수가 나오도록 데이터와 사후학습을 설계하는 작업을 뜻한다. 애프터쿼리는 모델의 취약 영역을 파악해 이를 개선할 데이터와 학습법을 제공하는 사업을 하고 있다. C사 관계자는 "특정 벤치마크만 겨냥해 점수를 끌어올리는 것은 얼마든지 가능하다"며 "AAII 1위가 곧 최강이라는 뜻은 아니다"라고 선을 그었다. 이어 "떳떳하다면 애프터쿼리와 협업하기 전과 후로 점수가 어떻게 달라졌는지 공개하면 될 일"이라고 강조했다. A사 관계자도 "정부에는 투명성을 요구하면서 자사 의혹은 공격으로만 규정한다"며 "같은 잣대를 스스로에게도 적용해야 한다"고 지적했다. 이에 대해 모티프테크놀로지스 측은 "에이전트 성능을 높이기 위한 협업이며 벤치마크 점수만을 겨냥한 것은 아니다"라고 반박했다. 모티프테크놀로지스가 요구한 평가위원 공개는 비현실적이라는 반론도 있다. C사 관계자는 "심사위원을 공개하면 그 사람은 다음부터 평가에 참여할 수 없다"며 "국내 전문가 풀이 좁아 해외 교수까지 거론됐던 상황"이라고 전했다. 평가 기준도 4개 팀이 함께 모여 여러 번 논의 끝에 정한 만큼 모티프테크놀로지스가 몰랐을 리 없다는 설명이다. 다만 전문가 평가 방식은 손볼 여지가 있다는 데 일부가 공감했다. B사 관계자는 세부 점수 공개는 긍정적으로 보면서도 "전문가 평가는 종합 점수로만 나왔을 뿐 평가위원을 어떻게 뽑고 무엇을 기준으로 채점했는지 알 수 없다"고 말했다. 이 관계자는 벤치마크 비중을 줄이자는 일각의 주장에는 신중한 입장을 보였다. 그는 "다른 평가 방식을 찾는 것은 가능하지만 단순히 벤치마크 비중만 줄이면 전문가나 사용자 평가 비중이 그만큼 높아진다"며 "지금도 불명확한 전문가 평가를 보완 없이 키우면 문제가 더 커질 수 있다"고 말했다. 모티프테크놀로지스가 이번 일로 얻을 실익이 없다는 반응도 이어졌다. A사 관계자는 "이미 3차에 참여하지 않겠다고 한 상황에서 정부와 충돌해 얻을 것이 무엇인지 모르겠다"고 토로했다. C사 관계자는 "정부에 답을 요구하기 전에 자사 모델을 둘러싼 의혹부터 스스로 풀어야 할 때"라고 강조했다.

2026.08.27 22:29장유미 기자

베일 벗은 독파모 AI 평가 점수...전문가·국민 평가가 승패 갈랐다

정부가 '독자 인공지능(AI) 파운데이션 모델' 프로젝트 2차 평가의 상세 점수를 발표하면서, 모티프테크놀로지스가 최종 선정되지 못한 이유가 명확해졌다. 과학기술정보통신부는 27일 2차 단계평가 종합점수를 공개했다. SK텔레콤이 70.6점으로 1위를 차지했으며, 업스테이지 69.9점, LG AI연구원 69.0점으로 뒤를 이었다. 모티프테크놀로지스는 65.8점으로 4위를 기록했다. 모티프는 글로벌 벤치마크 평가에서는 가장 높은 점수를 받았지만 전문가와 사용자 평가에서 상대적으로 낮은 점수를 기록한 것으로 나타났다. 모티프의 벤치마크 평가는 24.6점으로 4개 팀 중 가장 높았지만 전문가 평가는 27.1점과 사용자 평가는 14.1점으로 모두 최하위였다. 특히 글로벌 AI 성능을 측정하는 '아티피셜 애널리시스 인텔리전스 인덱스(AAII)' 평가에서 모티프는 11.9점으로 1위를 기록했다. 업스테이지가 9.4점으로 뒤를 이었으며 SK텔레콤은 8.8점과 LG AI연구원은 7.8점을 받았다. 한국어와 안전성 등 국내 활용 환경을 반영한 한국지능정보사회진흥원(NIA) 벤치마크에서는 SK텔레콤이 13.4점으로 가장 높은 점수를 받았다. 업스테이지는 13.3점과 LG AI연구원은 12.8점이었으며 모티프는 12.7점을 기록했다. 전문가 평가에서는 LG AI연구원이 29.5점으로 1위에 올랐다. SK텔레콤은 29.3점과 업스테이지는 29.1점을 기록했으며 모티프는 27.1점으로 가장 낮았다. 평가는 개발 전략과 기술 10점, 개발 성과와 계획 10점, 파급효과와 기여계획 15점으로 구성됐다. 실제 이용자 평가에서는 SK텔레콤과 LG AI연구원이 강점을 보였다. AI 전문 사용자 평가에서는 SK텔레콤이 11.6점으로 1위였으며 LG AI연구원 11.3점과 업스테이지 10.8점, 모티프 8.4점 순이었다. 일반 국민 평가에서는 LG AI연구원이 7.6점으로 가장 높은 점수를 받았다. SK텔레콤은 7.5점과 업스테이지는 7.3점을 기록했으며 모티프는 5.7점에 그쳤다. 일반 국민 평가는 성별과 연령별 비율을 반영해 무작위로 선정된 200명 가운데 실제 참여한 185명을 대상으로 진행됐다. 정부는 이번 추가 공개가 모티프 요청에서 시작됐다고 설명했다. 이날 모티프는 입장문을 통해 세부 평가 결과 공개를 요청했으며, 다른 정예팀들도 이에 동의했다. 정부는 그동안 기업의 직·간접적 피해 가능성과 평가 과정 공정성·투명성을 함께 고려해 공개 범위를 신중하게 결정해왔다. 과기정통부는 "이번 결과 공개 이후에도 우리 기업들이 단순한 점수나 순위로 평가받기 보다 보유한 저력과 역량을 바탕으로 국내외 AI생태계에 폭넓게 기여해야 한다"며 "우리 AI생태계가 새롭고 경쟁력 있는 AI기업들이 끊임없이 도전하는 역동적인 생태계로 발전해 나가기를 기대한다"고 밝혔다. 임정환 모티프 대표는 AAII 평가에서는 1위를 기록했지만 국지능정보사회진흥원(NIA) 벤치마크에서 최하위로 낮은 점수를 받은 데 대해서는 회사 모델 개발 전략에 따른 결과라고 선을 그었다. 모티프는 글로벌 AI 시장에서 경쟁력을 우선 확보하는 방향으로 개발하면서 한국어 데이터 확보와 성능 개선에는 상대적으로 역량을 덜 투입했다고 밝혔다. 그는 "우리가 한국어 성능까지 잡을 여력은 없었다"며 "한국어 데이터가 타사에 비해 많이 부족한 것도 사실"이라고 밝혔다. 이어 "궁극적으로 AI는 글로벌 경쟁을 해야 한다고 판단하고 있어서 한국어 성능을 완벽하게 잡고 갈 수는 없겠다는 내부 판단을 하고 진행한 것이고 거기에 맞는 숫자가 나온 것"이라고 말했다. 임 대표는 NIA 평가 결과 자체에 대해서도 별도 문제를 제기할 계획은 없다는 입장이다. 그는 "이건 시험 보듯 그냥 채점한 것이라 검수할 필요조차 없는 부분이고 특별히 다른 할 말은 없다"고 밝혔다.

2026.08.27 20:06김동원 기자

'독파모' 학습데이터 29종 푼다…1.56조 토큰 'AI허브' 개방

정부가 '독자 인공지능(AI) 파운데이션 모델' 개발 과정에서 확보한 학습용 데이터를 민간에 개방했다. 국내 기업과 연구자가 대형 AI 모델과 멀티모달·안전성 기술을 개발할 수 있는 기반을 넓히기 위한 전략이다. 과학기술정보통신부는 독파모 5개 정예팀이 1차 단계평가 과정에서 확보한 데이터 29종을 한국지능정보사회진흥원(NIA)의 AI허브에 공개했다고 27일 밝혔다. 개방 규모는 약 3544만건으로 토큰으로 환산하면 약 1조 5600억개다. 이번 데이터는 정예팀들이 각자 AI 모델 개발 전략에 맞춰 2025년 데이터 구축·가공 예산 150억원으로 확보했다. 대규모 사전학습 데이터부터 영상·음성 기반 멀티모달 데이터와 AI 안전성 확보를 위한 레드티밍 데이터까지 포함됐다. 전체 데이터는 이론적으로 약 700~800억개 매개변수 수준의 대형 AI 모델을 학습하는 데 사용할 수 있는 규모다. 독자 AI 모델 개발에 참여한 정예팀들의 학습 전략과 데이터 구축 경험도 담겼다. 네이버클라우드는 공개 영상 234만건과 방송 영상 52만건을 비롯해 영상 클립을 기반으로 만든 텍스트 1550만건과 음성 질의응답 1200만건을 구축했다. 장면을 문장 단위로 설명한 캡션 등이 포함돼 AI의 영상 이해 능력과 이미지 생성 모델 학습에 활용할 수 있다. 업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만건의 사후학습 데이터를 공개했다. 사전학습 데이터는 대형 AI 모델을 처음부터 학습하는 데 쓸 수 있으며 사후학습 데이터는 추론과 판단·실행 능력을 갖춘 AI 에이전트 개발에 활용할 수 있다. SK텔레콤은 수학·과학·법률 분야의 고난도 다단계 추론 데이터와 음성·이미지 기반 사후학습 데이터를 구축했다. 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만건도 포함했다. NC AI는 제조 분야 기술문서와 민원 상담 음성 등 산업 현장에서 확보한 실제 데이터 기반으로 7종의 학습 데이터를 마련했다. 긴 문맥 이해와 단계별 추론·멀티턴 대화·질의응답·멀티모달 학습 등에 활용할 수 있다. LG AI연구원은 국내 50개 실제 가정환경에서 50종 넘는 가사 활동을 촬영해 한국 가정환경에 특화된 피지컬 AI 멀티모달 데이터를 구축했다. 17만개 이상의 영상 클립에 객체와 분할·자세·맥락 정보를 다층으로 표시해 비전 언어 모델 학습과 상용 서비스 개발 등에 이용할 수 있도록 했다. NIA와 한국정보통신기술협회(TTA)는 정예팀들로부터 데이터를 제공받아 품질과 개인정보·유해성을 검증했다. 라이선스 제약이 있는 데이터는 개방 대상에서 제외했다. 사업 참여 조건에 따라 데이터 구축·가공 예산으로 확보한 데이터 가운데 50% 이상을 공개해야 한다. 네이버클라우드와 업스테이지·SK텔레콤·NC AI는 검증을 마친 데이터를 모두 개방하고 LG AI연구원은 의무 개방량을 충족하도록 세부 데이터셋을 통계적으로 선별해 공개했다. 국내 기업과 연구자·학생 등 대한민국 국민은 누구나 AI허브 '독자AI모델 데이터' 항목에서 데이터를 무료로 내려받아 활용할 수 있다. 일부 데이터는 보안이 보장된 온라인 AI 모델 개발 공간인 '안심존' 이용을 별도로 신청해야 한다. 과기정통부는 독파모 고도화 지원을 이어갈 방침이다. 향후 2차 단계평가 과정에서 데이터 구축·가공 예산으로 확보한 데이터도 품질검증을 거쳐 추가로 개방할 예정이다. 김경만 과기정통부 AI정책실장은 "독파모 프로젝트는 단순히 AI모델 개발을 넘어 개발과정에서 축적된 경험과 노하우를 통해 AI생태계 전반의 질적 성장에 기여한다는 점에서 큰 의미"라면서 "오늘 개방된 데이터는 정예팀의 AI학습 전략이 담긴 귀중한 자산인 만큼 AI생태계의 성장과 자생력 강화를 이끄는 밑거름이 될 것"이라고 밝혔다.

2026.08.27 14:00김미정 기자

독파모, 3차 심사부터 일반 기업도 사용한다

독자 인공지능(AI) 파운데이션 모델(독파모) 프로젝트에서 개발 중인 AI 모델이 3차 심사부터는 일반 사용자와 기업도 체감할 수 있는 방향으로 확대될 전망이다. 그간 촉박한 개발 일정과 인프라 부담 등으로 외부 공개가 제한돼 왔지만, 3차부터는 사용성과 현장 적용성이 본격적으로 평가되면서 실제 서비스 형태의 공개·연동 가능성도 커지고 있기 때문이다. 24일 업계에 따르면 독파모 2차 평가를 통과한 LG AI연구원, SK텔레콤, 업스테이지는 3차 심사를 준비하고 있다. 마지막 심사를 앞두고 모델 성능뿐 아니라 일반 사용자와 산업 현장에서 실제로 써볼 수 있는 환경을 얼마나 마련하느냐도 주요 평가 요소인 만큼 각 참가사도 사용성 확대에 집중하는 모양새다. LG AI연구원은 아직 구체적인 공개 방식은 확정하지 않았지만, 사용성 강화 방향에 맞춘 후속 계획을 논의 중이라는 입장이다. LG AI연구원 측은 "아직 구체적인 3차 공개 방식은 확정되지 않았지만 사용성 강화 방향에 맞춰 내부적으로 후속 계획을 논의하고 있다"며 "다만 대규모 모델은 상용 서비스 형태까지 연결하려면 리소스와 인력 부담이 큰 만큼 준비에 시간이 필요하다"고 밝혔다. 업스테이지 측은 "사용자 활용이 중요해지고 있다고 보고 있다"며 "업스테이지는 계속 모델 공급을 맡고, 법률·교육·의료 등 산업별 특화 서비스는 컨소시엄 파트너사가 만드는 구조가 될 것"이라고 설명했다. SK텔레콤 관계자는 "독파모는 AI 모델을 만드는 프로젝트로 서빙 인프라까지 갖춘 프로젝트는 아니었던 만큼 그동안 개발에만 집중해왔다"며 "현재 국방부 등 정부부처를 대상으로 서비스를 제공하고 있어 3차에서는 이를 더 고도화해 제공할 수 있을 것"이라고 밝혔다. 독파모는 과학기술정보통신부와 정보통신산업진흥원(NIPA)이 추진하는 프로젝트로 해외 모델에 의존하지 않는 국산 소버린 AI를 육성하고 글로벌 프런티어 모델과 경쟁할 수 있는 국가대표 AI를 선발하기 위한 사업이다. 평가 방식도 단계별로 이뤄지고 있다. 참여 기업들은 일정 기간 동안 모델 개발과 고도화를 진행한 뒤 성능 평가와 전문가 심사, 국민 체감 평가 등을 거쳐 다음 단계 진출 여부를 가려왔다. 초기 단계에서는 한국어 성능과 추론·지식 능력 등 모델 자체 경쟁력 검증에 초점이 맞춰졌다면 후반으로 갈수록 실제 활용성과 서비스 연계 가능성까지 함께 따져보는 구조로 옮겨가고 있다. 이 과정에서 아쉬움도 있었다. 참가 기업별로 모델 공개 방식이 달라 일반 개발자나 기업이 직접 체감하기 쉽지 않았다. 일부는 오픈 웨이트나 라이선스 형태로만 공개됐고 일부는 특정 사업이나 협력 구조 안에서만 제한적으로 접근할 수 있었다. 특히 대형 AI 모델은 가중치를 내려받더라도 실제로 구동하려면 추가 인프라와 운영 인력이 요구됐다. 이로 인해 일반 사용자나 수요 기업 입장에서는 국민 체험 평가 외에 각 모델을 지속적으로 비교·검증해볼 기회가 제한적이었다는 반응도 나왔다. 업계에서는 1·2차 심사 기간 자체가 짧았다는 점을 주요 제약으로 꼽는다. 짧은 개발 기간 안에 모델 학습과 튜닝, 평가 대응까지 병행해야 하는 만큼 외부 공개용 서비스나 API 환경을 별도로 구축할 여력이 크지 않았다는 설명이다. 한 AI 기업 대표는 "1단계와 2단계가 각각 6개월 단위로 진행돼 기업들이 모델 완성도와 평가 대응에 우선 집중할 수밖에 없었을 것"이라며 "대형 모델을 일반 테스트용이나 서비스형 환경으로 별도 구성하려면 추가 작업이 필요한데 초기 단계에선 그런 여유가 부족했을 수 있다"고 말했다. 이어 "다만 3차에서도 이런 체감 환경이 충분히 갖춰지지 않으면 평가의 설득력이 떨어질 수 있다"며 "마지막 심사에서 일반 사용자와 기업이 직접 써볼 수 있는 서비스가 늘어나면 독파모 사업도 기술 검증을 넘어 시장 확산 단계로 넘어가게 될 것"이라고 덧붙였다.

2026.08.24 15:01남혁우 기자

슈퍼브에이아이, LG AI연구원과 독파모 3차 진출

슈퍼브에이아이가 LG AI연구원의 피지컬 인공지능(AI) 데이터 구축 역할을 수행하며 정부 주도의 국가대표 인공지능(AI) 개발 사업 2차 관문을 통과했다. 슈퍼브에이아이는 자사가 참여한 LG AI연구원 정예팀(컨소시엄)이 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모)' 프로젝트 3차수에 진출했다고 19일 밝혔다. 슈퍼브에이아이는 이 컨소시엄에서 초거대 모델 'K-엑사원'의 비전·영상·피지컬 AI 영역을 담당해왔다. 비(非) LG 계열사 중 고성능 AI 파운데이션 모델 개발에 참여한 곳은 슈퍼브에이아이가 유일하다. 슈퍼브에이아이는 2025년 8월 정예팀 선정 이후 1차 사업에서 초거대 AI 학습용 영상 데이터 구축을 완수했다. 2차 사업에서는 시각 이해와 3차원(3D) 공간 정보 해석 등 고난도 비전 기술을 구현했다. 사람의 동작을 1인칭·3인칭 영상으로 수집·가공하고 자연어 라벨링을 결합해 AI 학습 기반이 되는 멀티모달 데이터 파운데이션을 구축했다는 설명이다. 김현수 슈퍼브에이아이 대표는 "비전·영상·행동 데이터 구축 역량을 바탕으로 우리 기술과 데이터로 구축하는 독자 피지컬 AI 파운데이션 모델과 비전 언어 행동(VLA) 모델 개발에 기여하겠다"고 말했다.

2026.08.19 13:25이나연 기자

오픈AI·딥마인드가 짚은 벤치마크 함정, AI 승부는 '현장'서 갈린다

인공지능(AI) 경쟁 기준이 성적표에서 현장으로 옮겨가고 있다. 벤치마크 점수가 아무리 높아도 실제 업무에서 쓰이지 않으면 좋은 모델로 보기 어렵다는 인식이 확산 중이다. 18일 발표된 정부의 국가대표 AI 선발 2차 평가가 이 변화를 그대로 보여줬다. 이날 독자 AI 파운데이션 모델(독파모) 2차 단계평가에서는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII 지표에서 참여팀 중 최고점을 받은 모티프테크놀로지스가 사용성·활용성에서 밀려 탈락했다. 반면 업스테이지·SK텔레콤·LG AI연구원이 3차에 진출했다. 이번 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 진행했다. AI 전문가 49명과 일반 국민 185명이 각 팀의 모델을 직접 써보고 채점하는 사용자 평가를 새로 도입해, 벤치마크 성능만으로는 통과할 수 없는 구조였다. 류제명 과기정통부 제2차관은 브리핑에서 "기술력이 뛰어나도 75점의 상당한 배점이 주어진 사용성·활용성에서 낮은 평가를 받으면 종합 결과가 달라질 수 있다"고 설명했다. 성적표가 실력을 보증하지 못하는 이유는 벤치마크 구조적 한계에 있다. 벤치마크는 미리 정해진 문제와 정제된 환경에서 모델을 시험한다. 문제 유형이 고정돼 있어 특정 시험에 맞춰 최적화하면 점수를 끌어올릴 수 있지만, 이렇게 얻은 고득점이 실제 업무 능력으로 이어진다는 보장은 없다. 현장 입력은 지저분하고 예외적이며, 사용자의 질문은 시험지처럼 정돈돼 있지 않기 때문이다. 이 문제는 최전선 연구자들이 먼저 지적해왔다. 노엄 브라운 오픈AI 연구부사장은 지난달 서울에서 열린 글로벌 AI 프론티어 심포지엄 2026에서 "막대그래프 하나로 AI 실력을 재는 시대는 끝났다"고 말했다. 오픈AI의 추론 모델 'o1'과 'o3' 시리즈를 설계한 그는 벤치마크 점수 하나가 아니라 연산량 대비 성능 곡선으로 모델을 평가해야 한다고 지적했다. 같은 모델이라도 더 오래 연산하게 하면 성능이 달라지는데, 단일 점수로는 이 차이가 드러나지 않는다고 강조했다. 국제 AI 학회 ICML 참석차 방한한 나만 고얄 구글 딥마인드 머신러닝 리서치 엔지니어는 벤치마크를 '텅 빈 코스에서 치르는 운전면허 시험'에 비유했다. 시험을 통과했다고 실제 도로에서 잘 달릴 수 있는 것은 아니란 뜻이다. 그는 성능이 뛰어난 물체 탐지 모델이 영상의 한 프레임에서는 대상을 정확히 찾고도 거의 똑같아 보이는 다음 프레임에서는 놓치는 사례를 들며 "정제된 환경에서 잘 작동하던 모델도 조건이 조금만 어긋나면 무너질 수 있다"고 지적했다. 통과한 팀들이 활용성을 전면에 내세운 배경도 여기에 있다. LG AI연구원은 이번 모델의 차별점으로 파라미터 규모가 아니라 실제 업무 현장에서 스스로 일을 처리하는 AI 에이전트 성능을 앞세웠다. LG AI연구원 관계자는 "크기를 키우면서도 실제 사용자가 더 효율적으로 쓸 수 있도록 에이전트 기능에 집중했다"며 "단순히 큰 모델을 만드는 게 아니라 사용자가 실제 업무에서 성과를 내도록 돕는 AI를 만드는 것이 핵심"이라고 밝혔다. 정부는 독파모 3차 평가를 거쳐 내년 초 최종 2개 팀을 선정한다. 2027년 이후 지원 방식은 개발 주관사 중심의 기존 구도에서 벗어나 전면 재검토하기로 했다. 글로벌 프론티어 모델과의 격차를 좁히기 위해 지원 규모와 경쟁 방식을 다시 짠다는 방침이다. 고얄 엔지니어는 10년 전 알파고가 정복한 대상이 규칙이 정해진 바둑판이었다면, 지금 마주한 대상은 규칙이 수시로 바뀌는 현실 속 AI라고 했다. 그는 "AI 실력은 정해진 판 위 고득점이 아니라, 판이 흔들리는 현실에서 얼마나 믿을 만한 결정을 내리느냐에 있다"고 밝혔다.

2026.08.19 11:13김동원 기자

[독파모 2차 발표] SK텔레콤 3차 진출, 다음 행보는 "산업·생활 서비스 확산"

SK텔레콤이 독자 인공지능(AI) 모델 '에이닷엑스 케이투(A.X K2)' 지식·추론 능력과 산업 활용도를 동시에 높인다. 모델 성능을 실제 산업·서비스로 연결해 국내 AI 생태계가 활용할 수 있는 모델을 만든다는 구상이다. 18일 과학기술정보통신부에 따르면 SK텔레콤 정예팀은 '독자 AI 파운데이션 모델 프로젝트' 2차 단계평가를 통과해 3차 단계에 진출했다. SK텔레콤은 3차 단계에서 지식과 추론 중심으로 모델 역량을 확장한다고 밝혔다. 멀티모달 파생 모델과 산업별 서비스를 개발해 기업·기관이 실제 활용할 수 있는 형태로 모델 고도화에 나선다. 회사는 다음 단계에서 모델 산업 현장 적용도 확대한다고 강조했다. 특히 제조 분야에서는 KG스틸·코넥과 특화 AI 에이전트를 개발한다. 국방 분야에서는 국방부와 협력해 경량화 모델을 제공하고 바이오 분야에서는 SK바이오팜과 협업한다. 앞서 SK텔레콤은 2차 단계에서 비전언어모델 '에이닷엑스 케이투 브이엘 라이트 프리뷰(A.X K2 VL Light-Preview)'와 음성언어모델 '에이닷엑스 케이투 ALM(A.X K2 ALM)', '에이닷엑스 K2 라온-스피치(A.X K2 Raon-Speech)'를 공개했다. 이들 파생 모델을 활용한 데모까지 구현해 전문가·사용자 평가에서 실제 사용 가능성을 제시했다. A.X K2는 매개변수 6880억개 규모로 전작 A.X K1의 5190억개보다 커졌다. 국내외 14개 벤치마크 평균 성능은 전작보다 32.2%포인트 높아졌으며 장문 이해와 에이전트 관련 평가에서는 약 83.9%포인트 개선됐다. 모델 수리 추론 능력도 강화됐다. SK텔레콤에 따르면 A.X K2는 국제수학올림피아드 2026 금메달 수준의 성능을 기록했다. '매스아레나 에이미 2026'에서 공동 최고점을 받았다. 긴 문맥 처리에는 SK텔레콤이 자체 개발한 '희소 게이트 어텐션(SGA)' 구조가 적용됐다. 긴 내용 가운데 관련성 높은 정보만 선별해 참조하는 방식으로 정확성과 운영 효율을 높인다. SK텔레콤은 앞으로 모델 경량화와 추론 가속 기술도 지속해서 공개할 계획이다. 모델 파일을 개방하는 데 그치지 않고 기업과 기관이 운영 과정에서 겪는 메모리와 속도·장비 부담을 낮추기 위해서다. 정부는 다음 평가에서 현재 3개 정예팀을 2개팀으로 압축할 예정이다. 구체적인 평가 방식과 배점은 참여 기업과 협의를 거쳐 확정한다. 프론티어급 AI 모델과 관련한 내용은 별도로 발표할 계획이다. SK텔레콤 관계자는 "다음 단계에 참여하게 된 것을 뜻깊게 생각한다"며 "자체 AI 모델의 산업·실생활 확산 성과를 바탕으로 국내 AI 생태계가 함께 활용할 수 있는 결과물을 만드는 데 집중할 것"이라고 밝혔다.

2026.08.18 15:27김미정 기자

[독파모 2차 발표] LG 'K-엑사원' 3차 진출…"승부처는 활용성"

정부가 국가대표 AI 모델을 뽑는 '독자 AI 파운데이션 모델' 프로젝트에서 LG AI연구원의 'K-엑사원'이 3차 진출을 확정했다. LG는 이번 모델 차별점으로 파라미터 규모가 아니라, 실제 업무 현장에서 스스로 일을 처리하는 'AI 에이전트' 성능을 내세웠다. 18일 과학기술정보통신부 발표에 따르면 LG AI연구원 정예팀은 독파모 2차 단계평가를 통과해 3차 단계에 진출했다. 독파모는 과학기술정보통신부가 글로벌 수준의 국산 AI 파운데이션 모델을 키우기 위해 여러 팀을 선정한 뒤 단계별 평가를 거쳐 최종 후보를 추려 나가는 사업이다. 과기정통부는 이날 2차 단계 평가 결과를 발표했고, K-엑사원은 이전 모델보다 규모를 3배 이상 키우며 이 관문을 통과했다. LG가 규모를 키우면서도 방점을 찍은 지점은 실사용성이다. 아무리 성능이 좋아도 현장에서 쓰이지 않는 모델은 의미가 없다고 보고, 사람 대신 도구를 골라 쓰고 여러 단계의 작업을 직접 수행하는 에이전트 기능을 끌어올리는 데 집중했다. LG AI연구원 관계자는 "크기를 키우면서도 기존보다 성능이 뛰어나고, 실제 사용자가 더 효율적으로 쓸 수 있도록 에이전트 기능에 더 집중했다"고 밝혔다. LG가 모델 규모를 3배 키운 것도 글로벌 경쟁에 뛰어들기 위한 선택이다. 몸집을 충분히 키워야 세계 최고 수준의 이른바 '프런티어급' 모델 시장에 발을 들일 수 있다는 판단이다. 다만 여기서 '프런티어급'은 GPT나 제미나이 같은 범용 초대규모 모델과 정면으로 겨루겠다는 의미가 아니다. LG AI연구원 관계자는 "지금은 범용이라기보다 프런티어급 전문가 모델을 지향하고 있는 것이 맞다"면서 "특정 분야에서 최고 수준을 노리는 '전문가 AI' 노선을 그대로 이어가되, 그 안에서 글로벌급 규모를 갖추고자 한다"고 했다. 규모를 키우는 데 필요한 컴퓨팅 자원은 독파모 사업에서 지원받은 그래픽처리장치(GPU)로 확보했다. 실제로 쓰이는 AI에 무게를 싣는 전략은 최근 성과에서도 드러난다. 앞서 공개한 'K-엑사원 2.0'은 750B(7500억 개) 파라미터 규모로, 독파모 1차수 모델(236B)보다 크기가 3배 이상 커졌다. 24개 벤치마크 평균 70.1점을 기록해 1차수(63.3점)보다 10% 이상 높은 성능을 냈고, 코딩과 에이전틱 코딩 영역의 주요 지표 3개 평균 성능이 30% 올랐다. AI가 스스로 도구를 골라 쓰는 능력을 평가하는 항목(Tau3-Bench Banking)에서는 14.2점으로 중국 지푸의 GLM-5.1(11.5점), 큐원3.5(13.4점)를 앞섰다. 단순히 모델을 키우는 데 그치지 않고, 사용자가 실제 업무에서 더 효율적으로 쓸 수 있도록 에이전트 성능을 끌어올리는 데 초점을 맞췄다는 게 LG의 설명이다. LG AI연구원은 다음 달 초 산업 특화 AI 파운데이션 모델을 추가로 공개해 '전문가 AI' 포트폴리오를 넓힐 계획이다. 한 달 뒤에는 토크 콘서트를 열고 향후 기술 개발 방향을 상세히 설명한다. LG AI연구원 관계자는 "단순히 큰 모델을 만드는 것이 목표가 아니라, 사용자가 실제 업무에서 성과를 내도록 돕는 AI를 만드는 것이 핵심"이라며 "앞으로도 전문가 AI 영역에서 실질적인 활용 가치를 높여 나가겠다"고 말했다.

2026.08.18 14:33김동원 기자

[독파모 2차 발표] 예정대로 2곳 선정…AI 개발 지원책은 재검토

국가대표 인공지능(AI) 모델 2개가 이르면 연말 결정되는 가운데, 정부가 기존 '독자 AI 파운데이션 모델(독파모)' 사업과 범용인공지능(AGI) 프로젝트 등을 연계한 프론티어급(최첨단) AI 모델 개발 지원 사업 전반을 재검토한다. 독파모 사업의 3차수 평가는 당초 계획대로 진행해 3개 정예팀 중 최종 2곳을 선정한다는 입장이다. 정부는 독파모 4차수 지속 여부 등을 포함해 프론티어급 모델 개발 사업의 구체적인 방향을 조만간 발표할 계획이다. 류제명 과학기술정보통신부 제2차관은 18일 정부서울청사에서 독파모 프로젝트 2차 단계평가 결과 브리핑을 열고 업스테이지, SK텔레콤, LG AI연구원 등 3개 팀이 다음 단계에 진출했다고 밝혔다. 1차 평가 당시 모델 독자성 기준 등에 따른 2개 팀 탈락 후 추가 공모를 통해 합류했던 모티프테크놀로지스는 이번 관문에서 고배를 마셨다. 평가 항목 중 가장 높은 배점이 부여된 벤치마크 평가의 한 축인 글로벌 AI 평가기관 아티피셜 애널리시스의 인텔리전스 인덱스(AAII)에서는 모티프테크놀로지스의 '모티프 3'가 47점으로 4개 팀 중 최고 점수를 기록한 것과 대조된 결과다. 2차 평가 항목별 1위 비공개…모티프 '사용성·활용성'서 약세 이번 2차 단계평가는 벤치마크 평가(40점)·전문가 평가(35점)·사용자 평가(25점)로 구성됐다. 이중 벤치마크 평가는 글로벌 AI 평가기관 아티피셜 애널리시스의 인텔리전스 인덱스(AAII) 벤치마크 평가가 25점, 한국지능정보사회진흥원(NIA) 벤치마크 평가가 15점을 차지한다. 사용자 평가는 AI 스타트업 대표 등 49명 AI 전문 사용자진과 최종 선정된 200명 중 실제 평가에 참여한 일반 국민 185명이 참여했다. 과기정통부는 1차 평가 발표 때와 달리 이번에 세부 평가항목별 1위 기업을 공개하지 않았다. 항목별 4개 팀의 점수 차이가 크지 않은 상황에서 개별 순위를 공개할 실익이 크지 않은 데다 나머지 기업에 미칠 영향도 고려했다는 설명이다. 2차 평가 결과에 따르면 벤치마크 평가에서 4개 정예팀 전체 평균은 22.5점이며 1위와 4위 간 점수 격차는 4.0점이었다. 전문가 평가에서 4개 정예팀 전체 평균은 28.8점이며 1위와 4위 간 점수 격차는 2.4점으로 나타났다. 사용자 평가에서 4개 정예팀 전체 평균은 17.6점이며 1위와 4위 간 점수 격차는 5.0점이었다. 다만 모티프테크놀로지스는 AAII 기준 높은 벤치마크 성능에도 불구하고 사용성·활용성 측면이 약했던 것으로 알려졌다. 류 차관은 "모티프테크놀로지스 모델 기술력은 뛰어났지만 사용성과 활용성 부분에서는 다른 기업에 비해 낮은 평가를 받았다"며 "특정 한 항목이 (탈락에) 결정적이었다기보다는 각 평가 항목 결과가 종합적으로 반영된 것"이라고 역설했다. 벤치맥싱 논란, 점수 미반영…"AAII·전문가 검증서 문제 없어" 올해 초 발표된 1차 평가는 '프롬 스크래치' 등 모델 독자성이 주요 쟁점이었다면 2차 평가에서는 이른바 '벤치맥싱' 논란이 제기됐다. 벤치맥싱은 특정 벤치마크를 겨냥한 데이터와 사후학습으로 점수를 집중적으로 끌어올리는 전략을 말한다. 애프터쿼리, 스케일AI, 머코 등 미국 AI 학습 전문업체들이 한국 시장에 진출을 본격화한 가운데 일부 업체가 지난달 서울에서 열린 머신러닝 분야 학회 'ICML 2026'에서 독파모 팀들을 상대로 영업에 나선 것으로 전해지면서 논란이 점화됐다. 과기정통부는 이번 평가에서 벤치맥싱 의혹을 점수에 반영하지 않았다고 선을 그었다. 정부가 AAII 운영기관인 아티피셜 애널리시스에 관련 의혹에 대한 검토를 요청한 결과, 평가를 위한 체계적인 암기나 과적화 문제를 입증할 단서를 찾지 못한 것으로 확인됐다. 류 차관은 "벤치맥싱 관련된 이슈는 평가에 반영되지 않았다"며 "AAII의 공식적인 답변과 함께 전문가 평가를 통해 교차 검증한 결과 불공정한 기술 지원 등은 없었다는 결론을 내렸다"고 말했다. 과기정통부는 향후에도 외부 평가기관과의 협력 등을 통해 평가 신뢰성과 공정성을 높인다는 방침이다. 이번 2차 평가에서도 AAII가 직접 벤치마크 평가를 수행했으며 3차수 평가와 관련해서도 전문적인 의견 교환과 자문 등 협력 관계를 이어갈 계획이다. 3차 평가 진행…2027년 이후 지원 체계 등 4차수는 재검토 이르면 연말에서 내년 초 진행될 3차 평가는 이번 결과 이의제기 절차가 끝난 뒤 구체적인 평가방식을 확정해 추진한다. 다음 단계에 진출한 3개 팀에는 고성능 그래픽처리장치(GPU)인 B200 지원도 확대된다. 과기정통부는 올해 상반기 768장 수준이었던 지원 규모를 하반기 1000장 수준으로 늘릴 계획이다. 3차수 평가를 통해 최종 2개 팀을 선정한다는 계획은 그대로 유지한다. 하지만 2027년부터 이들 팀을 어떤 방식으로 지원할지는 개발 주관사를 주체로 한 기존 구도에서 벗어나 전면 재검토한다. 과기정통부는 프론티어급 AI 모델 개발을 검토하면서 기존 독파모 사업과 AGI 프로젝트 등 관련 사업 간 연계와 재편도 함께 살펴볼 예정이다. 기존 사업의 지원 규모를 조정하는 데 그치지 않고 사업 간 연계 여부와 지원 대상·방식, 경쟁 구조까지 다시 설계할 수 있다는 의미다. 류 차관은 "지금과 같은 경쟁 방식을 탈피해서 프런티어 기업들의 모델에 버금가는 모델 경쟁이 가능한 방식으로 재편하자는 공감대가 있다"며 "예산이 확정되는 대로 구체적인 사업 방향을 발표할 계획"이라고 강조했다.

2026.08.18 13:49이나연 기자

모티프, 독파모 벤치마크 1위에도 탈락…대기업과 경쟁서 존재감·차기 행보 주목

모티프테크놀로지스(이하 모티프)가 과학기술정보통신부의 '독자 AI 파운데이션 모델'(독파모) 2차 평가에서 벤치마크 1위를 기록하고도 최종 탈락했다. 다만 대기업과 대규모 투자를 받은 AI기업이 경쟁한 무대에서 후발주자인 신생 스타트업이 짧은 기간 안에 성능 경쟁력을 입증했다는 점에서 모티프의 차기 행보가 주목 받고 있다. 18일 과기정통부가 발표한 독파모 2차 평가 결과에 따르면 3차 단계 진출팀은 업스테이지, SK텔레콤, LG AI연구원 등 3곳이다. 모티프는 벤치마크 부문에서 두각을 나타냈지만 최종 명단에는 이름을 올리지 못했다. 이번 평가는 총 100점 만점 기준으로 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점을 합산하는 방식으로 진행됐다. 벤치마크 성적과 함께 개발 전략과 기술력, 향후 계획, 산업 파급효과, 실제 사용성 등을 아우른 종합 점수에 따라 결과가 갈릴 수 있는 구조다. 관련 업계에선 이번 독파모에서 모티프가 남긴 성과와 의미는 적지 않다는 평이다. 모티프는 사업 초기부터 참여한 팀이 아니라 중간에 합류한 후발주자다. 그럼에도 약 5개월 만에 사전학습부터 후처리까지 처음부터 개발한 모델을 선보이며 벤치마크 1위를 기록했다. 대기업 중심의 경쟁 구도 속에서 국내 스타트업도 짧은 기간 안에 프론티어급 AI 모델 경쟁력을 입증할 수 있다는 점을 보여준 사례라는 평가가 나온다. 대표적으로 모티프가 자체 개발한 인공지능(AI) 파운데이션 모델 '모티프 3'가 글로벌 AI 모델 평가기관 아티피셜 애널리시스의 종합 지능 지수(AAII)에서 47점을 받으며 한국 기업 1위, 글로벌 10위를 기록했다. 오픈웨이트 모델 기준으로는 글로벌 4위에 오르는 성과다. 단순히 프로젝트 참여에 의미를 두는 수준을 넘어 실제 수치와 평가 결과로 존재감을 증명했다는 점에서, 이번 독파모 결과와 별개로 시장의 관심을 끌기에 충분했다는 분석이다. 특히 이번 사례는 규모의 차이가 절대적인 장벽이 아니라는 점을 보여줬다는 데 의미가 있다. AI 파운데이션 모델 개발은 막대한 자본과 인프라, 연구 인력이 필요한 영역으로 여겨져 왔지만 모티프는 제한된 조건에서도 기술력으로 경쟁 구도 안에 들어설 수 있음을 입증했다. 중도 합류라는 불리한 조건 속에서도 단기간에 가시적 성과를 낸 만큼, 후속 모델 개발이나 사업 확장 가능성을 주목해야 한다는 목소리도 나온다. 임정환 모티프 대표는 이번 결과를 담담하게 받아들이면서도 프로젝트의 의미를 강조했다. 그는 "우리 정부가 자체적인 AI 파운데이션 모델 개발에 도전하기로 결정하지 않았다면 그리고 저희와 같은 작은 신생 스타트업에도 그 도전의 기회를 주지 않았다면 이런 성과도 만들어내지 못했을 것"이라며 "이 도전을 가능하게 해주신 모든 관계자분들께 감사드린다"고 말했다. 모티프는 이번 결과와 무관하게 기존 사업과 연구개발을 이어간다는 방침이다. 독파모 최종 선정에는 실패했지만 이번 프로젝트에서 확보한 경험과 기술 자산을 바탕으로 자체 모델 고도화와 글로벌 경쟁력 강화에 나설 전망이다. 대표적으로 같은 날 마감하는 모두의 AI사업에 KT 컨소시엄 파트너사로 참여한다. 임정환 대표는 "결과에 상관없이 이번 독파모 프로젝트를 통해 기술력만으로 한국에서도 글로벌 프론티어 수준의 AI 모델 개발이 가능하다는 것을 증명했다는 점에서 매우 뜻깊었다"고 밝혔다. 이어 "모티프는 앞으로도 지속적으로 글로벌 프론티어 모델 개발에 전력을 다하겠다"고 덧붙였다.

2026.08.18 12:12남혁우 기자

독파모 '벤치맥싱' 논란에 AAII 입장…"평가 방법론 지속 업데이트"

글로벌 인공지능(AI) 평가기관 아티피셜 애널리시스가 벤치마크 맞춤형 학습으로 실제 성능 개선 없이 점수만 높아질 수 있다는 우려를 인정했다. 현재 이같은 이슈를 최소화하기 위해 내부적으로 기술적 조치를 강화하고 있는 것으로 확인됐다. 14일 아티피셜 애널리시스는 지디넷코리아에 보낸 이메일에서 "벤치마크를 활용해 모델 약점을 보완하는 것은 통상적인 개발 과정"이라면서도 "특정 평가에 과도하게 최적화해 점수만 끌어올리는 방식은 경계해야 한다"고 밝혔다. 아티피셜 애널리시스는 글로벌 AI 모델 성능과 속도, 비용 등을 비교·분석하는 민간 평가기관이다. 해당 기관이 운영하는 '아티피셜 애널리시스 인텔리전스 지수(AAII)'가 독파모 2차 평가에서 전체 100점 중 25점을 차지한다. 아티피셜 애널리시스는 이같은 벤치마크 이슈를 최소화하기 위해 내부 분석과 검증, 자체 평가 데이터 활용, 지속적 평가 방법론 업데이트 등 세 가지 장치를 추진하고 있다고 말했다. 아티피셜 애널리시스 관계자는 "우리는 개별 평가와 전체 지수 차원에서 모델 답변과 추론 과정, 실행 로그, 점수 분포를 검토한다"며 "이를 통해 비정상적인 점수 변화나 특정 평가에만 특화된 최적화 흔적을 찾는다"고 말했다. 이어 자체적으로 개발·관리하는 평가와 외부 벤치마크도 활용한다고 밝혔다. 특정 공개 데이터나 하나의 평가 방식에 대한 의존도를 낮춰 일부 시험에 특화된 학습이 전체 점수 상승으로 이어지는 것을 막기 위해서다. 관계자는 평가 항목과 가중치, 채점 방식도 정기적으로 바꾸겠다고 밝혔다. 최신 AI 기술과 산업에서 중요해진 역량을 반영해 평가 체계를 지속적으로 개편함으로써 AAII가 개발사 공략 대상이 되지 않도록 한다는 취지다. 기관이 현재 사용 중인 'AAII 4.1.1' 버전은 에이전트 업무와 코딩, 과학적 추론, 장문 맥락 추론, 지식과 환각 등을 측정하는 9개 평가로 구성됐다. 아티피셜 애널리시스는 한 영역에서만 점수를 높이더라도 성능이 다른 과제로 확장되지 않으면 전체 지수에 미치는 영향은 제한적이라고 주장하고 있다. 그러나 아티피셜 애널리시스는 실제 벤치마크 과적합 징후를 발견한 사례가 있는지는 공개하지 않았다. 과적합 징후를 확인했을 때 해당 점수를 제외하거나 모델을 재평가하는지, 순위를 조정하거나 외부에 경고하는지 등 사후 조치 기준도 밝히지 않았다. 독파모 평가 25점 걸린 AAII...업계 "실제 성능 왜곡 우려" 최근 업계에선 일부 독파모 참여사 일부가 AAII 점수를 겨냥한 맞춤형 사후학습 데이터를 활용하고 있다는 의혹이 제기되고 있다. 이에 일각에선 일부 참여사가 모델이 낮은 점수를 받은 지식 영역과 문제 유형을 분석한 뒤 유사한 사후학습 데이터를 구매하거나 별도 구축하고 있다는 주장이 나온다. 벤치마크 문제와 정답을 그대로 학습하는 방식은 아니지만, 실제 사용 역량보다 특정 평가 점수만 높아진다면 모델 성능을 왜곡하는 벤치맥싱으로 이어질 수 있다는 우려다. AAII 순위가 독파모 2차 평가의 최종 결과를 의미하는 것은 아니다. NIA 벤치마크와 전문가·사용자 평가가 별도로 진행되는 데다 AAII 역시 버전과 평가 구성에 따라 점수가 달라질 수 있어서다. 과학기술정보통신부는 AAII만으로 모델 우열을 판단하지 않고 한국지능정보사회진흥원(NIA) 벤치마크와 전문가·사용자 평가를 종합한다는 입장이다. 그러나 AAII에 전체 점수의 4분의 1이 배정된 만큼 벤치마크 맞춤형 학습을 실제 성능 향상과 어떻게 구분할지가 평가 공정성을 가를 핵심 과제로 꼽힌다. 아티피셜 애널리시스는 "우리는 모델 답변과 추론 과정, 실행 로그, 점수 분포를 분석해 평가에만 특화된 최적화 방법론을 꾸준히 연구 중"이라고 밝혔다.

2026.08.14 15:40김미정 기자

독파모 2차 결과 발표 임박…AI 업계 '초긴장', 관전 포인트는

독자 인공지능(AI) 파운데이션 모델 프로젝트(독파모) 2차 단계 평가 결과 발표가 임박하면서 국내 AI 업계 관심이 집중되고 있다. 단순한 모델 성능 경쟁을 넘어 결과에 따라 국내 AI 업계 관심 구도도 달라질 것으로 예상되기 때문이다. 14일 업계에 따르면 독파모 2차 단계 평가 결과는 이르면 다음 주 발표될 것으로 알려졌다. 독파모는 이번 2차 평가 결과 발표를 통해 3개 팀으로 압축된 뒤 추가 평가를 거쳐 올해 12월 최종 2개 팀을 선발한다. 최종 생존팀에는 엔비디아(NVIDIA) B200 그래픽처리장치(GPU)와 대규모 데이터 구축·가공비, 'K-AI 기업' 명칭 부여 등 국가 차원의 지원이 이어진다. 독파모에 참가한 LG AI연구원, SK텔레콤(SKT), 업스테이지, 모티프테크놀로지스 4개 팀은 모든 2차 과정을 마치고 결과를 기다리고 있는 중이다. 과기정통부는 기존 3개 팀의 모델 제출 기한인 6월 말과 추가 합류한 모티프테크놀로지스의 7월 말 제출 완료 이후, 8월 초부터 4개 팀을 대상으로 2차 단계 평가를 동시 진행해 왔다. 이번 발표로 한 팀이 탈락해 3파전으로 재편되는 만큼 업계 안팎의 촉각이 날카롭게 세워진 상태다. 이번 2차 평가에서 주목받는 변수는 평가 기준 변화다. 1차 평가가 기본 언어 이해·생성 능력과 모델 완성도에 초점을 맞췄다면, 2차에서는 외부 도구를 호출해 실제 업무를 자율 수행하는 에이전틱 AI 역량과 오케스트레이션 능력 검증 비중이 크게 높아진 것으로 알려졌다. 이에 따라 참여 기업도 수개월 동안 에이전트 성능 고도화에 집중해 왔다. LG AI연구원은 평가 제출 모델인 엑사원(EXAONE)의 에이전트 작업 수행 능력 강화에 주력한 것으로 알려졌다. 단순 질의응답을 넘어 실제 업무를 수행하는 오케스트레이션 역량을 높이는 데 개발 역량을 집중했으며 계열사와 파트너사를 통한 실사용 환경 적용도 병행해 왔다. 특히 1차 단계 평가에서 가장 높은 평가를 받은 만큼 업계에서는 이번 결과에서도 선두를 유지할 수 있을지 주목받고 있다. SK텔레콤은 지난달 신규 모델 'A.X K2'를 공개하며 에이전트 기능을 전면에 내세웠다. 서울대 황승원 교수 연구진의 에이전트 연구 성과를 반영해 다양한 환경에서 활용 가능한 AI 에이전트 역량 확보에 집중하고 있다는 설명이다. 독자 모델과 AI 인프라를 함께 제공할 수 있는 점도 차별화 요소로 꼽힌다. 업스테이지는 최근 공개한 '솔라 2'를 통해 에이전트 성능 향상을 강조하고 있다. 기존 모델 대비 도구 호출과 작업 수행 능력을 강화하며 기업 업무 환경에서 활용 가능한 AI 구현에 초점을 맞췄다. 회사 측은 최근 모델이 실제 에이전트 활용 환경에서도 충분한 경쟁력을 갖췄다고 평가하고 있다. 추가 공모를 통해 합류한 모티프테크놀로지스는 독자 설계 아키텍처를 강점으로 내세우고 있다. 해외 오픈소스 모델을 기반으로 하지 않은 자체 모델 개발 전략을 추진하며 독자성 확보에 집중해 왔다. 최근 관련 벤치마크에서 강한 성능을 내세우며 존재감을 키운 점도 업계가 주목하는 부분이다. 에이전틱 역량과 함께 '독자성' 판단 기준의 적용 강도도 주요 관전 포인트다. 독파모 사업이 목표로 하는 독자 파운데이션 모델은 해외 모델 파인튜닝이나 파생형이 아닌, 모델 설계부터 사전학습까지 전 과정을 자체 수행한 모델이다. 가중치를 초기화한 상태에서 독자적으로 학습·최적화하는 것이 최소 요건이다. 1차 평가에서 네이버클라우드가 독자성 기준 미달 판정을 받아 탈락한 전례가 있어, 이 잣대가 이번에도 결과를 가를 핵심 기준이 될 수 있다는 분석이 나온다. 실제 산업 현장 적용 가능성을 뜻하는 '확산성' 항목도 빼놓을 수 없는 평가 기준이다. LG AI연구원과 한컴의 공공 AI 오피스 협력, SKT의 자동차 부품업체 코넥스 현장 AI 에이전트 투입, 업스테이지의 공공기관 특화 검색증강생성(RAG) 서비스 구축 등 각사가 현장 확산 실적을 쌓아온 만큼, 이 항목이 최종 순위를 좌우하는 변수가 될 수 있다는 관측이 나온다. 독파모 사업의 의미가 산업 육성을 넘어 국가 경쟁력과 안보 영역으로 확대되고 있다는 점도 이번 발표의 무게감을 키우는 배경이다. 글로벌 AI 기반 사이버 위협이 현실화하면서 독자 AI 모델 확보가 국가 전략 자산이라는 인식이 확산되고 있기 때문이다. 국가AI전략위 보안특위를 중심으로 독파모를 안보 역량 강화 수단으로 격상해야 한다는 논의도 본격화한 상황이다. 한 업계 관계자는 "이번 2차 평가는 어느 기업의 모델이 더 뛰어난지를 가리는 차원을 넘어 국내 AI 산업의 방향성과 기술 자립 수준을 확인하는 과정"이라며 "결과 발표가 가까워질수록 업계의 관심도 더욱 높아지고 있다"고 말했다.

2026.08.14 08:14남혁우 기자

독파모 4개 팀 모두 해냈다…美 에포크AI '주목할 모델' 선정

정부가 추진하는 독자 인공지능(AI) 파운데이션 모델 프로젝트 4개 정예팀이 글로벌 인공지능(AI) 경쟁력을 인정받았다. 과학기술정보통신부는 4개 정예팀인 LG AI연구원, SK텔레콤, 업스테이지, 모티프의 올 상반기 독자 AI 파운데이션 모델이 미국 비영리 AI 연구기관 에포크AI '주목할 만한 모델'에 등재됐다고 11일 밝혔다. 올해 현재까지 에포크AI의 주목할 만한 모델을 배출한 국가는 미국과 중국 한국 등 3개국이다. 과기정통부는 이번 등재가 한국이 세계적 수준의 AI 경쟁력을 확보하고 있음을 보여주는 성과라고 평했다. 에포크AI의 주목할 만한 모델은 국가별 AI 기술 경쟁력을 살펴보는 주요 지표로 활용된다. 미국 스탠퍼드대 사람 중심 AI 연구소가 매년 발간하는 'AI 인덱스' 보고서에도 관련 수치가 포함된다. 스탠퍼드대의 'AI 인덱스 2026'에 따르면 지난해 국가별 주목할 만한 모델 수는 미국이 59개로 가장 많았다. 중국은 35개였으며 한국은 8개를 기록했다. 4개 정예팀은 글로벌 빅테크보다 상대적으로 제한된 자원과 여건에서 올해 상반기 독자 AI 파운데이션 모델의 성능을 끌어올렸다는 평을 받고 있다. 개발한 모델을 오픈소스로 공개해 국내 AI 경쟁력과 개방형 생태계 조성 역량도 입증했다는 것이 과기정통부 설명이다. 배경훈 부총리 겸 과기정통부 장관은 "대한민국 기술로 만든 독자 AI 모델이 글로벌 수준 기술력을 입증하며 저력을 보여주고 있다"며 "이제는 더 큰 무대에서 주요 선도국과 어깨를 나란히 하며 경쟁해야 하는 만큼 국민이 체감할 수 있는 성과를 이어 나갈 수 있도록 지원을 아끼지 않겠다"고 밝혔다.

2026.08.11 15:22김미정 기자

정부, 독파모 2차 평가 돌입…"데이터·비용·활용성 검증 관건"

정부가 독자 인공지능(AI) 파운데이션 모델 프로젝트 2차 단계평가에 들어가면서 평가체계 전반을 정교화해야 한다는 목소리가 커지고 있다. 벤치마크 점수뿐 아니라 모델이 답하는 데 들어가는 토큰과 추론 시간·비용, 한국어 데이터 활용 능력, 산업 현장 적용 가능성까지 구체적으로 봐야 한다는 지적이다. 7일 IT 업계에 따르면 정부는 2차 평가에서도 벤치마크 평가와 전문가 평가, 사용자 평가 등 기존 단계평가 틀을 유지할 방침이다. 글로벌 주요 리더보드에 활용되는 벤치마크를 선정하고, 전문가 평가에서는 모델 독자성을 세분화해 검증하는 방안도 검토하고 있다. 업계에서는 초기 데이터와 학습 로그를 보유했는지, 개발 과정서 발생한 문제를 외부 기술에 의존하지 않고 자체적으로 해결할 수 있는지가 독자성 판단 핵심 기준이 될 것이란 분위기다. 이는 1차 평가 과정서 독자 모델 정의와 평가 기준을 둘러싼 논란을 줄이려는 조치다. 다만 2차 평가가 또다시 성능 점수 중심으로 흐를 경우 독파모 사업의 정책적 목표를 충분히 반영하기 어렵다고 보고 있다. 국가대표 AI 모델을 선정하는 사업인 만큼 한국어와 국내 제도·문화에 대한 이해도, 공공·산업 분야 활용 가능성까지 종합적으로 검증해야 한다는 주장이다. 익명을 요청한 AI 업계 관계자는 "벤치마크 평가도 단일 점수를 비교하는 기존 방식에서 벗어나야 한다"며 "최근 추론형 모델은 답을 생성하는 데 사용하는 토큰 수와 연산 시간, 비용에 따라 성능 차이가 벌어질 수 있다"고 설명했다. 이어 "같은 문제를 맞힌 모델이라도 한쪽이 수십 배 많은 토큰과 연산 자원을 사용했다면 실제 서비스 운영 비용은 달라질 수 있다"며 "최고 성능만 보면 앞선 모델이더라도 속도와 비용을 고려하면 산업 현장에서는 경쟁력이 낮을 수 있다"고 덧붙였다. 앞서 노엄 브라운 오픈AI 리서치 부문 부사장도 최근 열린 '글로벌 AI 프론티어 심포지엄 2026'에서 AI 모델 평가에 추론 자원을 별도로 반영해야 한다고 주장했다. 그는 "추론 자원은 안전성 평가와도 연결된다"며 "짧은 시간과 적은 비용으로 시험할 때 나타나지 않았던 도구 오용이나 공격적 행동이 모델에 더 많은 시간과 연산 자원을 제공했을 때 드러날 수 있다"고 지적했다. 업계에서는 국민이 모델을 직접 사용해 평가하는 사용자 평가의 취지에는 공감하면서도 세부 설계가 중요하다는 목소리가 나온다. 일반 이용자가 체감하는 품질을 반영할 수 있지만 평가단 구성과 질문 유형, 모델별 응답 조건이 통제되지 않으면 기술력보다 브랜드 인지도나 화면 구성 등이 결과에 영향을 줄 수 있다는 지적이다. 국민평가가 단순한 선호도 조사나 인기투표로 흐르지 않도록 해야 한다는 의견도 제기된다. 평가 참여자의 연령과 직업, AI 이용 경험을 고르게 구성하고 모델별로 동일한 질문과 응답 시간, 사용 환경을 적용해야 평가 결과의 대표성과 신뢰성을 확보할 수 있다는 설명이다. 사실 정확성과 환각 발생 여부, 유해 답변 차단, 보안성 등 일반 이용자가 판단하기 어려운 항목은 전문가 평가로 보완해야 한다는 목소리도 나온다. 국민평가는 편의성과 자연스러운 대화 능력, 한국어 표현력 등 체감 요소에 집중하고 안전성과 기술적 완성도는 별도로 검증해야 한다는 주장이다. "성능만큼 데이터 확보 중요…국민 평가에 전문가 의견 보완" 국내 데이터 확보·활용 역량도 독파모 2차 평가 핵심 과제로 떠오르고 있다. 국내 공공데이터를 얼마나 효과적으로 학습하고, 한국어 맥락에 맞는 답을 내놓는지도 관건이라는 설명이다. 실제 독파모 참여 기업들은 국가AI전략위원회와 간담회를 열고 데이터 확보 방안을 논의한 바 있다. LG AI연구원과 업스테이지는 국립중앙도서관 도서 데이터화와 학습 목적 저작물 활용을 위한 텍스트·데이터 마이닝(TDM) 면책 규정 마련을 요청했다. SK텔레콤은 정부 데이터 정제 체계 고도화와 한국어 평가 데이터셋 확대를 제안했다. 모티프테크놀로지스는 대규모 한국어 사전학습 데이터를 국가 차원에서 구축하고 정제·분류·후처리까지 지원해야 한다고 강조했다. 당시 임문영 전 국가AI전략위원회 부위원장은 "기업은 모델 개발에 그치지 않고 제조·금융·공공·의료 등 산업 현장에서 실제 서비스로 확장할 수 있는지도 함께 살펴야 한다"고 강조한 바 있다. 업계에서는 국민이 모델을 직접 사용해 평가하는 사용자 평가 취지엔 공감하면서도 세부 설계가 중요하다는 목소리가 나온다. 일반 이용자가 체감하는 품질을 반영할 수 있지만 평가단 구성과 질문 유형, 모델별 응답 조건이 통제되지 않으면 기술력보다 브랜드 인지도나 화면 구성 등이 결과에 영향을 줄 수 있다는 제언이다. 한 AI 업계 관계자는 "평가 참여자 연령과 직업, AI 이용 경험을 고르게 구성하고 모델별로 동일한 질문과 응답 시간, 사용 환경을 적용해야 평가 결과 대표성과 신뢰성을 확보할 수 있을 것"이라고 언급했다. 이어 "사실 정확성과 환각 발생 여부, 유해 답변 차단, 보안성 등 일반 이용자가 판단하기 어려운 항목은 전문가 평가로 보완해야 한다"며 "국민평가는 편의성과 자연스러운 대화 능력, 한국어 표현력 등 체감 요소에 집중하고 안전성과 기술적 완성도는 별도로 검증해야 할 것"이라고 덧붙였다.

2026.08.07 10:51김미정 기자

개방형 국산 AI 출격…국가대표 4사4색 전략은

국가대표 인공지능(AI) 개발사들이 차세대 오픈웨이트(가중치 개방형) 모델을 잇달아 공개하며 본격적인 확산 경쟁에 돌입했다. 4일 업계에 따르면 모티프테크놀로지스, 업스테이지, SK텔레콤, LG AI연구원은 과학기술정보통신부가 추진하는 '독자 AI 파운데이션 모델(독파모)' 사업 2차 평가용 모델을 세계 최대 AI 오픈소스 플랫폼 허깅페이스에 차례로 공개했다. 1차 평가 이후 합류해 최종 버전이 아닌 프리뷰(베타) 모델을 선공개한 모티프테크놀로지스를 제외하면 나머지 3개 팀 모두 올해 초 1차 평가 당시 공개했던 초기 모델보다 성능을 높인 버전들이다. 정부는 이렇게 개발된 모델을 전 국민의 AI 문해력을 키우고 국산 모델 사용 기반을 확대하는 '모두의 AI' 사업에 활용한다는 계획이다. 체급부터 효율까지…같은 목표, 다른 해법 이번 공개는 단순한 모델 업데이트를 넘어 각 기업이 내세우는 독자 AI 개발 방향을 구체화했다는 점에서 의미가 있다. 1차 평가를 통과한 LG AI연구원과 SK텔레콤, 업스테이지는 각각 체급 확대와 산업 적용, 효율성 강화에 초점을 맞췄다. 올해 새롭게 합류한 모티프테크놀로지스는 독자 설계 기반 모델을 앞세워 경쟁에 뛰어들었다. LG AI연구원은 직전 모델보다 3배 이상 몸집을 키워 4개 팀 가운데 가장 큰 규모를 갖췄다. 기존 K-엑사원 가중치를 재활용하는 업사이클링 방식으로 'K-엑사원 2.0'을 7500억 개(750B) 매개변수(파라미터) 규모까지 키우면서다. 학습 비용을 줄이면서도 성능을 끌어올렸고 라이선스도 아파치 2.0으로 전환해 상업적 활용 범위를 넓혔다. SK텔레콤은 6880억 개(688B) 매개변수 규모 '에이닷 엑스 케이투(A.X K2)'를 공개하며 장문 추론과 에이전트 성능을 강화했다. 향후 조(兆) 단위 모델과 비전·음성 모델까지 확장하는 로드맵도 함께 제시했다. 라이선스 역시 아파치 2.0을 적용해 누구나 수정과 상업적 활용이 가능하도록 개방했다. 올해 합류한 모티프테크놀로지스는 자체 개발한 3140억 개(314B) 매개변수 규모 전문가혼합(MoE) 모델 '모티프3'를 선보였다. 프리뷰 모델은 글로벌 AI 평가기관 아티피셜 애널리시스 인텔리전스 지수(AAII)에서 44점을 기록했다. 정식 버전에는 MIT 라이선스를 적용해 상업적 이용 제한 없이 공개할 예정이다. 업스테이지는 2500억 개(250B) 매개변수 규모 '솔라 오픈 2'를 통해 효율성을 앞세웠다. MoE 구조를 기반으로 에이전트 성능과 한국어 경쟁력을 높였고 최대 100만 토큰 문맥 처리 능력을 구현했다. 특히 기업이 자체 인프라에서도 비용 부담을 줄여 활용할 수 있도록 설계했다. '잘 만든 AI'보다 '많이 쓰는 AI'로 독파모 프로젝트도 모델 성능뿐 아니라 개방성과 실제 활용성을 함께 평가하는 단계에 접어들었다. 초기에는 독자 모델 개발과 성능 확보가 핵심이었다면 이제 산업 적용과 생태계 확산 역량의 비중이 커지고 있다. 이에 맞춰 기업들도 서로 다른 모델 확산 및 서비스 전략을 내놓고 있다. 업스테이지는 올 상반기 인수한 포털 다음과 AI 에이전트 플랫폼을 기반으로 서비스 적용을 확대하고 있다. LG AI연구원은 공공 서비스 적용 경험을 바탕으로 대국민 체험 서비스를 준비 중이다. SK텔레콤은 제조·국방·바이오 등 산업 현장 실증과 '모두의 AI' 참여를 추진하고 있으며 모티프테크놀로지스는 금융·회계 분야 협력사를 중심으로 초기 상용 레퍼런스를 확보하는 데 집중하고 있다. 글로벌 경쟁 역시 치열해지고 있다. 오픈웨이트 모델이 AI 산업의 새로운 축으로 자리 잡으면서 개발자 생태계 확보 경쟁도 본격화되는 모습이다. 중국에서는 딥시크와 알리바바, 문샷AI, Z.AI(옛 지푸) 등이 공격적으로 오픈웨이트 모델을 공개하며 생태계를 넓히고 있다. 미국도 메타를 비롯해 구글, 오픈AI 등이 오픈웨이트 모델을 확대하며 전략을 다변화하고 있다. 모델 경쟁력의 기준도 단순 벤치마크 점수보다 얼마나 많은 개발자와 기업이 실제 활용하느냐로 옮겨가는 분위기다. 업계 관계자는 "2차 평가는 모델 성능뿐 아니라 실제 활용성과 생태계 확장 가능성이 중요한 평가 요소"라며 "결국 산업 현장에서 선택받고 개발자들이 지속적으로 활용하는 모델이 경쟁력을 갖게 될 것"이라고 말했다.

2026.08.04 10:25이나연 기자

[AI는 지금] LG, 더 크게 진화한 'K-엑사원'…확산 속도전

LG AI연구원이 국내 최대인 750B(7500억 개) 파라미터 규모 거대언어모델(LLM)을 오픈웨이트로 공개하며 소버린(주권) 인공지능(AI) 경쟁력 확보에 나섰다. 처음부터 다시 학습시키는 대신 전작의 가중치를 확장해 재사용하는 업사이클링 방식으로 몸집을 키웠다. LG AI연구원은 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모) 프로젝트' 2차수 모델인 'K-엑사원(K-EXAONE) 2.0'를 허깅페이스에 31일 공개했다. 라이선스는 상업적 이용까지 가능한 아파치 2.0으로 전환해 개방성을 높였다. 적은 자원으로 몸집 3배 불렸다…전작 대비 성능 10%↑ K-엑사원 2.0 테크 리포트에 따르면 이 모델은 처음부터 새로 학습시키지 않고 전작 K-엑사원의 가중치를 재사용해 구조를 확장하는 '업사이클링' 방식으로 개발됐다. LLM을 처음부터 학습시키면 이전 모델에 투입된 연산과 데이터, 학습 노하우를 모두 버리게 된다. LG AI연구원은 이를 그대로 이어받으면서 총 파라미터를 236B에서 750B로, 실제 작업 시 활성화되는 파라미터를 23B에서 37B로 늘렸다. 이 전략 덕분에 처음부터 다시 학습시키는 것보다 적은 자원으로 레이어를 48개에서 78개로, 레이어당 전문가 수를 128개에서 256개로 확장할 수 있었다는 설명이다. 종합 성능도 전작 대비 뚜렷한 향상을 보였다. LG AI연구원에 따르면 K-엑사원 2.0은 독파모 성능 평가 반영 항목을 포함한 9개 영역 24개 벤치마크에서 평균 70.1점을 기록해 전작(63.3점)보다 10% 이상 높은 성능을 냈다. 코딩·에이전틱 코딩 영역 주요 지표 3개 평균은 30% 상승했다. 장문 문맥 이해 평가(OpenAI-MRCR·Ko-LongBench)에서 GLM-5.1을 웃돌았고, 에이전틱 툴 사용 능력 평가(Tau3-Bench Banking)에서는 GLM-5.1과 큐원3.5를 모두 앞섰다. 지원 언어는 한국어·영어·스페인어·독일어·일어·베트남어 등 6개에 프랑스어·이탈리아어·포르투갈어·폴란드어를 더해 10개로 확장했다. LG AI연구원 관계자는 "국내 AI 파운데이션 모델 중 가장 많은 언어를 지원하는 것"이라며 "소버린 AI가 국내를 넘어 글로벌 시장까지 공략하는 발판을 마련했다"고 말했다. 엑사원, 정부 대국민 서비스 탑재…안전성 기준도 자체 확장 K-엑사원 2.0에 앞선 엑사원 계열 모델은 이미 정부기관의 대국민 서비스에 투입돼 가동 중이다. 비전언어모델(VLM) '엑사원 4.5'는 지난 4월 공개돼 행정안전부 'AI 안전신문고'의 분석 엔진으로 채택돼 하루 3만 9000건 이상의 안전 신고를 처리하고 있다. 식품의약품안전처의 '신약 심사 AI'에도 탑재돼 신약 허가 심사 기간 단축에 쓰이고 있다. LG AI연구원은 K-엑사원 2.0도 이 같은 실사용 궤도에 올리기 위한 준비를 진행하고 있다. 독파모 2차 심사 기간 실사용성 평가를 위한 대국민 평가 사이트 개발을 마무리하고 있다. 향후 전 국민이 K-엑사원 2.0을 직접 체험할 수 있는 서비스도 준비 중이다. 성능 못지않게 안전성 기준 자체를 확장하는 데도 공을 들였다. LG AI연구원은 유네스코 아시아태평양 국제이해교육원(APCEIU)과 협력해 세계시민교육 인증을 받은 교사 46명으로 구성된 자문위원회를 운영했다. 이들의 검토를 거쳐 기존 위험 영역 100여 개 판단 기준을 보완하고 70개를 새로 추가했다. 이에 따라 자체 안전성 분류체계인 'K-AUT'의 위험 영역은 226개에서 296개로 늘었다. 임우형 LG AI연구원 공동 연구원장은 "K-엑사원 2.0 성능은 완성된 결과가 아니라 글로벌 프런티어 스케일 모델의 잠재력을 본격적으로 끌어내기 위한 출발점"이라며 "데이터 품질 고도화와 후속 학습, 강화 학습, 추론 기술을 정교화해 K-엑사원 성능을 완성하겠다"고 강조했다.

2026.07.31 15:53이나연 기자

LG AI연구원, 국내 최대 AI 모델 'K-엑사원 2.0' 공개

LG AI연구원이 국내 최대 규모 인공지능(AI) 모델을 공개하며 독자 AI 생태계 확대에 속도를 낸다. LG AI연구원이 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모) 프로젝트' 2차수 모델인 'K-엑사원(K-EXAONE) 2.0'를 오픈소스 커뮤니티 허깅 페이스에 31일 공개했다. K-엑사원 2.0은 국내 최대인 750B(7500억 개) 파라미터 규모의 모델로 1차수 모델(236B) 대비 크기가 3배 이상 커졌다. 모델 라이선스 정책도 누구나 상업적 이용까지 가능한 아파치 2.0으로 전환하며 개방성을 높였다. LG AI연구원이 진행한 9개 영역 24개 벤치마크 평가에 따르면 K-엑사원 2.0은 평균 70.1점을 기록해 1차수 모델(63.3점)보다 10% 이상 높은 성능을 달성했다. 특히 코딩과 에이전틱 코딩 영역 주요 지표 3개의 평균 성능이 30% 상승했다. 장문 문맥 이해 평가, 에이전틱, 지시 이행 등 주요 영역에서 글로벌 선도 모델과 비교해 높거나 대등한 성능도 기록했다. K-엑사원 2.0은 장문 문맥 이해 영역에서 글로벌 장문 이해 능력 평가(OpenAI-MRCR)와 한국어 장문 이해 능력 평가(Ko-LongBench)에서 각각 94.4점과 89.6점을 달성했다. 이는 중국 지푸의 GLM-5.1(71.5점, 83.6점) 대비 높은 점수다. 주요 지표 3개(OpenAI-MRCR, AA-LCR, Ko-LongBench) 평균 점수 역시 10% 이상 앞섰다. 에이전틱 툴 사용 능력 평가(Tau3-Bench Banking)에서는 14.2점으로 GLM-5.1(11.5점), 큐원3.5(13.4점) 보다 우수한 결과를 냈다. 지시 이행 영역 평가(IFeval, IFBench)에서도 GLM-5.1, 딥시크 V4 프로 맥스, 큐원 3.5 등에 견주는 성능을 기록했다는 설명이다. K-엑사원 2.0은 직전 모델 대비 언어를 확장하며 국내 AI 파운데이션 모델 중 가장 많은 언어를 지원하게 됐다. 기존 한국어, 영어, 스페인어, 독일어, 일어, 베트남어에 프랑스어, 이탈리아어, 포르투갈어, 폴란드어를 추가한 총 10개 언어를 제공한다. 국내 특수성과 글로벌 윤리 기준을 준수하는 안정성을 높이는 데도 주력했다. K-엑사원 2.0은 한국의 특수성과 글로벌 윤리 기준 준수 평가(KGC-Safety), 지정학적 맥락 판단과 관련된 안정성 평가(ROK-Fortress)에서 평균 94.6점을 달성했다. GLM-5.1(71.3점), 딥시크 V4 프로 맥스(65.2점), 큐원3.5(89점)와 비교해 높은 안정성을 보였다. LG AI연구원은 다음 주 새로운 산업 특화 AI 파운데이션 모델을 추가로 공개하며 산업 현장과 일상을 혁신하는 '전문가 AI' 포트폴리오를 강화할 계획이다. 임우형 LG AI연구원 공동 연구원장은 "K-엑사원 2.0은 단순히 파라미터 수가 큰 모델이 아니라, 국내 연구진이 750B급 모델 설계부터 데이터 학습, 분산 학습, 추론 환경 구축까지 전 과정을 독자적으로 완수했다는 데 의미가 있다"며 "독자 AI 파운데이션 모델 프로젝트의 핵심 목표인 글로벌 프런티어 모델과 같은 체급에서 경쟁할 수 있는 역량을 확보한 것"이라고 말했다. 이어 "현재 성능은 완성된 결과가 아니라 글로벌 프런티어 스케일 모델의 잠재력을 본격적으로 끌어내기 위한 출발점"이라며 "데이터 품질 고도화와 후속 학습, 강화 학습, 추론 기술을 정교화해 K-엑사원 성능을 완성하겠다"고 부연했다.

2026.07.31 10:24이나연 기자

'K-AI' 성능 국민이 평가…정부, 일반 심사단 200명 모집

정부가 국민이 직접 국산 인공지능(AI) 모델을 사용하고 성능을 평가하는 절차를 마련했다. 과학기술정보통신부는 정보통신산업진흥원(NIPA)과 내달 4일 오후 6시까지 '독자 AI 파운데이션 모델' 프로젝트 국민 평가단 200명을 모집한다고 28일 밝혔다. 평가단에는 일반 국민 누구나 지원할 수 있다. 선정된 평가단은 내달 8일부터 11일까지 LG AI연구원과 업스테이지, SK텔레콤, 모티프테크놀로지스 정예팀이 개발한 AI 모델을 직접 사용한다. 이후 각 모델을 절대평가 방식으로 평가한다. 국민 평가단 평가 결과는 오는 8월 진행되는 독자 AI 파운데이션 모델 프로젝트 2차 단계평가에 반영된다. 2차 평가에서는 벤치마크 평가와 전문가 평가도 진행된다. 과기정통부와 NIPA는 평가단 대표성을 높이기 위해 주민등록인구 통계 기준으로 성별과 연령별 인원을 배분할 계획이다. 평가단 선정 결과는 지원자에게 개별 통보한다. 참여 희망자는 NIPA 홈페이지 게시물에 포함된 QR코드를 통해 신청할 수 있다. 선정된 뒤 천재지변 등으로 평가에 참여하지 못하면 해당 평가 결과에는 반영되지 않는다. 독자 AI 파운데이션 모델 프로젝트는 민관이 협력해 글로벌 수준의 자체 AI 모델을 개발하는 사업이다. 세부 평가 기준과 2차 단계평가 결과는 8월 중 공개될 예정이다.

2026.07.28 09:41김미정 기자

[AI는 지금] 모티프, 독파모 2차전 앞두고 '반전'…글로벌 경쟁력 입증

국가대표 인공지능(AI) 기업을 가리는 독자 AI 파운데이션 모델 개발 사업의 2차 평가를 앞두고 참여 기업 간 경쟁이 달아오르고 있다. 가장 늦게 합류한 모티프테크놀로지가 프리뷰 모델로 글로벌 오픈소스 최상위권 성능을 기록하면서 예상 선발 구도에 변화가 생길지 주목된다. 모티프는 독파모 사업을 통해 개발 중인 대규모언어모델(LLM) '모티프 3' 프리뷰 버전이 글로벌 AI 평가기관 아티피셜 애널리시스의 종합 성능 지표인 AAII에서 44점을 기록했다고 21일 밝혔다. 회사 측에 따르면 '모티프 3 프리뷰'는 딥시크 최신 모델과 같은 44점을 기록해 미국과 중국을 제외한 국가에서 개발된 모델 가운데 가장 높은 성적을 거뒀다. 글로벌 오픈소스 모델 순위에서도 문샷AI의 키미와 즈푸AI의 GLM에 이어 미니맥스, 딥시크 모델과 함께 3위권에 올랐다. 이번 결과는 모티프가 독파모 2차 평가용 최종 모델을 제출하기 전에 확보한 성적이라는 점에서 주목된다. 모티프는 이달 말 모델을 제출한 뒤 8월 초 성능을 높인 최종 버전을 공개할 예정이다. '모티프 3'는 전체 파라미터 3140억 개 규모의 전문가혼합(MoE) 모델이다. 추론 과정에선 전체의 약 4%인 130억 개 파라미터만 선택적으로 활성화하는 구조를 적용했다. 회사 측은 해외 오픈소스 모델을 개량하지 않고 아키텍처 설계부터 학습까지 자체 개발했다고 설명했다. 개발 규모도 경쟁사보다 작다. 모티프는 직원 약 30명이 정부가 제공한 그래픽처리장치(GPU) 700여 장을 활용해 선정 후 약 5개월 만에 프리뷰 모델을 완성했다. 이처럼 상대적으로 적은 인력과 연산 자원으로 글로벌 상위권 벤치마크 점수를 제시하면서 기술 효율성과 독자성을 드러낸 것으로 평가됐다. 독파모 2차 평가는 기존 4개 정예팀 가운데 1곳을 탈락시키는 방식으로 진행될 예정이다. SK텔레콤과 LG AI연구원, 업스테이지는 지난 6월 말 평가용 모델을 제출했으며 패자부활전을 통해 한 달 늦게 합류한 모티프는 이달 말까지 모델을 제출한다. 과학기술정보통신부는 8월 초부터 심사에 들어갈 계획이다. 이번 평가는 모델 성능뿐 아니라 산업 적용과 서비스 확산 가능성도 주요 평가 요소로 거론된다. 또 글로벌 벤치마크 반영 비중이 높아지는 동시에 실제 사업 적용 사례와 생태계 확장 능력도 함께 살피는 것으로 알려졌다. 업스테이지는 2차 평가에서 기존 1000억 개 규모 모델을 2000억 개 수준으로 확대할 예정이다. 이곳은 AAII에서 44.4점을 기록한 모델 성능과 국산 AI 모델·국산 신경망처리장치(NPU)를 결합한 풀스택 역량을 강점으로 내세우고 있다. 최근에는 검색 플랫폼 다음을 인수하고 AI 요약 서비스에 자체 거대언어모델(LLM) 기술을 적용하며 서비스 확장에도 나섰다. LG AI연구원은 그룹 계열사와 외부 산업 현장에서 축적한 적용 사례를 앞세우고 있다. 최근 코스콤과 협력해 국내 상장기업 약 2500개 종목의 주가 예측과 해설 서비스를 추진하고 있으며 LG유플러스와 함께 정부의 '모두의 AI' 사업 참여도 준비 중이다. SK텔레콤은 컨소시엄에 SK AX와 테크노매트릭스를 추가하며 산업 확산 역량을 강화했다. SK AX는 제조와 금융, 공공 분야의 AI 전환 사례를 발굴하고 테크노매트릭스는 독자 모델의 현장 운영과 고도화를 지원하는 역할을 맡는다. 모티프도 삼일회계법인과 딥서치 등 컨소시엄 참여 기업 및 협력사와 모델 공급을 논의하고 있다. 성능 중심의 개발 전략을 유지하면서 회계와 금융 데이터, 산업 현장 적용 사례를 확대해 상용화 평가에 대응할 계획이다. 업계에선 모티프가 공개한 AAII 성적이 2차 평가를 앞두고 선두권과 후발 주자의 격차가 예상보다 크지 않을 수 있다는 점을 드러냈다고 평가했다. 기존에는 자본력과 인력, 산업 적용 경험을 갖춘 대기업 계열 팀이 유리할 것이라는 관측이 많았지만, 이번에 모티프가 프리뷰 단계에서 성능 경쟁력을 입증하면서 평가 변수로 떠오른 분위기다. 다만 일각에선 기업별 AAII 점수가 모델 공개 시점과 평가 버전, 오픈소스 범위가 달라 단순 비교에는 한계가 있다고 지적했다. 모티프가 제시한 '글로벌 오픈소스 3위권'도 44점을 받은 여러 모델이 함께 포함된 순위인 만큼, 실제 경쟁력은 8월 독파모 평가에서 다른 정예팀과 동일한 기준으로 비교해야 확인할 수 있을 것으로 보인다. 업계 관계자는 "2차 평가부터는 벤치마크 점수만 높다고 통과할 수 있는 구조는 아닐 것"이라며 "독자 기술로 성능을 얼마나 끌어올렸는지와 실제 산업에서 활용할 수 있는지를 함께 증명하는 팀이 유리할 것"이라고 말했다.

2026.07.21 11:08장유미 기자

[유미's 픽] "해외 정부와 다르다"…AI G3 노린 韓, 전국민 무료 AI 내세운 까닭은

정부가 전국민에게 이용량 제한 없이 국산 인공지능(AI)을 제공하는 '모두의 AI' 사업에 착수하면서 국내 AI 시장의 경쟁 구도가 서비스 중심으로 옮겨가고 있다. 해외 주요국이 행정 안내와 공무원 업무 지원, 컴퓨팅 인프라 확충을 각각 추진하는 것과 달리 우리나라 정부는 전국민 무료 AI 서비스에 승부수를 던진 모습이다. 15일 과학기술정보통신부와 정보통신산업진흥원에 따르면 모두의 AI는 국민의 AI 접근성과 활용 역량 격차를 줄이고 국산 AI 모델의 서비스 경쟁력을 높이기 위해 추진된다. 정부가 연산 자원만 제공하는 데서 벗어나 전국민 이용 수요를 직접 만들어 국산 모델에 대규모 실사용 경험을 공급하는 구조다. 정부는 오는 8월 11일까지 공모를 거쳐 2~3개 기업 또는 컨소시엄을 선정한다. 사업자는 9월 베타서비스를 시작하고 12월부터 무료 범용 AI 챗봇과 공공 AI 에이전트, 특화 서비스를 제공해야 한다. 올해는 엔비디아 B200 그래픽처리장치(GPU) 최대 512장을 기업당 256장 또는 128장씩 배분한다. 자부담금 매칭이 필요하며 2027년 이후 GPU 비용과 운영비 지원 방식·규모는 관계부처와 국회 협의를 거쳐 결정된다.정부가 이번 사업을 추진한 이유는 외산 AI 서비스 의존과 AI 활용 격차에 대한 우려 때문이다. 국내 생성형 AI 이용자는 약 2300만 명에 달하지만 상당수 외산 서비스 무료 버전을 사용하고 있는 것으로 나타났다. 또 현재 국민 약 3분의 1은 여전히 AI를 이용하지 않는 것으로 집계됐다. 배경훈 부총리 겸 과기정통부 장관은 "모두의 AI는 단순한 서비스를 넘어 우리 국민들이 AI와 함께 일하고 배우며 일상을 영위할 수 있도록 지원하는 AI 시대의 계산기·컴퓨터"라고 밝혔다. 행정 효율 넘어 산업 육성까지…한국형 AI 정책 실험 모두의 AI는 행정서비스 개선이나 인프라 공급에 머문 해외 정책보다 한발 더 나아가 전국민 이용 수요와 국산 AI 산업 육성을 동시에 겨냥했다는 점에서 많은 주목을 받고 있다. 현재 해외에선 AI를 특정 행정서비스에 적용하거나 공무원 업무를 지원하고, 민간 기업에 컴퓨팅 인프라를 공급하는 방식이 주로 활용되고 있다. 한국처럼 정부가 전국민용 범용 AI의 개발과 운영까지 직접 지원하는 사례는 드문 편이다. 해외 사례를 살펴보면 국민 대상 행정 안내, 공무원 업무 지원, 민간 AI 인프라 공급으로 정책 방향이 나뉜다. 영국은 '거브닷UK 챗(GOV.UK Chat)'을 통해 정부 공식 정보를 기반으로 복지와 연금, 주택, 직업훈련 등 국민의 행정 관련 질문에 답하는 서비스를 제공 중이다. 정부 웹사이트를 일일이 찾거나, 상담센터에 문의하는 불편을 줄이는 디지털 행정 창구에 초점을 맞췄다. 싱가포르는 공무원의 자료 조사와 문서 작성, 아이디어 생성을 지원하는 내부 AI 도구 '페어(Pair)'를 앞세우고 있다. 정부 업무 생산성과 보안성을 높이는 것이 주된 목적이다. 인도는 '인디아AI 미션'을 통해 1만8000개 이상의 AI 연산 자원을 확보하고 스타트업과 연구기관 등에 최대 40% 낮은 비용으로 공급하고 있다.미국은 연방기관의 AI 도입과 공무원 업무 효율화에, 중국은 정무서비스 적용과 기업의 연산·모델 이용 지원에 무게를 두고 있다. 두 나라 모두 국가 차원의 AI 활용을 확대하고 있지만 정부가 전국민용 범용 AI의 개발과 운영을 직접 지원하는 한국과는 정책 구조가 다르다. 이와 달리 우리나라는 국민이 직접 쓰는 범용 AI를 정책의 중심으로 삼고 있다. 무료 서비스에 국산 모델 활용 조건과 GPU 지원을 더해 AI 이용 격차를 줄이고, 외산 서비스에 몰린 수요와 데이터를 국내 산업으로 끌어오겠다는 구상을 펼치고 있다. 이에 사업자는 독자 파운데이션 모델 기준을 충족하는 국산 모델을 50% 이상 활용하고 자사 외 다른 기업의 국산 모델도 30% 이상 사용해야 한다. 외산 모델은 제한적으로 병용할 수 있지만 해당 사용분은 정부 지원에서 제외된다. 디지털플랫폼정부위원회 인공지능플랫폼혁신국장 출신인 이승현 라이너 AI 에반젤리스트는 "외산 AI와의 병용을 일부 허용한 하이브리드 전략은 영리하고 실리적인 소버린 AI 확보 방안"이라며 "국산 모델이 일정 수준의 성능을 갖췄더라도 글로벌 빅테크보다 대규모 서비스 운영 경험이 부족한 만큼 초기 품질을 보완하면서 상호작용 데이터와 운영 노하우를 국내 인프라에 축적할 수 있다"고 말했다. 'K-AI' 확산 노린 정부, 독자 모델 개발·모두의 AI 투트랙 추진 업계에선 '모두의 AI'가 정부의 독자 AI 파운데이션 모델 사업과 지원 대상이 일부 겹치면서 AI 예산과 GPU가 분산될 수 있다고 우려했다. 반면 일각에선 두 사업이 같은 영역을 중복 지원하기보다 모델 개발과 서비스 구현을 나눠 맡는 구조로 봐야 한다는 의견도 내놨다. 실제 독자 AI 파운데이션 모델 사업은 글로벌 선도 모델과 경쟁할 기반 모델 확보에 초점을 두고 있다. 모두의 AI는 국산 모델을 검색과 데이터, 외부 도구 등과 결합해 국민이 실제로 사용하는 서비스로 구현하고 대규모 운영 경험을 쌓는 데 중점을 두고 있다. 이는 모델 개발과 제품 구현을 각각 맡겨 역량과 자원이 한쪽에 과도하게 분산되는 것을 줄이려는 취지다. 업계 관계자는 "독자 AI 파운데이션 모델 사업은 모델 자체를 개발하는 영역이고 모두의 AI는 여러 모델과 기술을 결합해 제품을 만드는 엔지니어링 영역"이라며 "모델 개발사에 촉박한 일정으로 전국민 서비스 구축까지 동시에 맡기면 인력과 시간, 인프라 측면에서 부담이 커질 수 있다"고 말했다. 다만 두 사업의 성과가 따로 쌓이면 정책 효과가 제한될 수 있다는 점은 다소 우려된다. 모두의 AI에서 확보한 이용자 상호작용과 에이전트 실행 기록, 오류·장애 대응 경험이 독자 모델 고도화에 반영돼야 모델 개발과 서비스 운영이 선순환 구조를 만들 수 있어서다. 이 연결이 약하면 학습과 서비스에 각각 투입한 GPU와 예산의 효율도 떨어질 수 있다. 이 에반젤리스트는 "단순한 모델 스펙 경쟁을 넘어 서빙 단계에서 국산 모델이 얼마나 밀도 높은 트래픽 경험과 실전 데이터를 축적하느냐가 중요하다"며 "에이전트 구동 과정에서 발생하는 핵심 상호작용 데이터와 운영 노하우를 국내 자산으로 쌓아 국산 모델 개선에 활용해야 한다"고 강조했다. 정부 지원 이후 자생력 입증해야 업계는 우리나라가 반도체와 디지털 인프라를 활용해 전국민 단위의 AI 수요를 만든다는 점을 두고 과감한 소버린 AI 정책을 펼치고 있다고 평가했다. 그러나 정부 지원으로 확보한 이용량이 독자적인 서비스 경쟁력과 수익성, 해외 확장으로 이어지는지는 별도로 입증해야 하는 부담도 크다고 봤다. 정부도 이를 의식해 이번 발표 평가에서 서비스 편의성과 이용자 확보·유지 전략을 가장 높은 50점으로 배정했다. 모델 성능보다 국민이 실제로 사용하고 계속 찾는 서비스를 만들 수 있는지를 중점적으로 살피겠다는 의지를 드러낸 것이다. 이 외에 서비스 품질·안정성은 30점, 국내 AI 생태계 기여도는 20점이 만점이다.일각에선 새롭게 구축한 서비스만으로 단기간에 전국민 이용을 끌어내기는 쉽지 않다는 의견도 내놨다. 또 이미 대규모 이용자를 확보한 포털과 앱에 국산 모델과 AI 기술을 접목하는 방식이 이용 확산과 비용 효율 측면에서 현실적일 수 있다고 주장했다. 업계 관계자는 "범용 모델을 통해 국민의 AI 리터러시를 높이겠다는 사업 취지에는 공감한다"며 "다만 새로운 서비스를 만들어 전국민 이용을 끌어내기는 쉽지 않은 만큼 국내 모델과 기술을 이미 국민이 사용하는 포털과 앱 등 다양한 플랫폼에 접목해 AI 활용 범위를 넓히는 것이 효과와 비용 측면에서 더 현실적일 수 있다"고 강조했다. 전국민 무료 서비스가 기존 민간 AI 구독 시장과 경쟁하거나 일부 사업자에 GPU와 데이터가 집중될 가능성이 있다는 점 역시 부담 요소로 지목됐다. 9월 베타서비스와 12월 정식 출시 일정도 촉박해 여러 모델을 연결하고 보안과 개인정보 보호, 장애 대응 체계를 단기간에 갖춰야 한다는 점도 기업들이 해결해야 할 과제로 남았다. 정부 역시 대응책 마련에 적극 나서야 할 것으로 보인다. 공공 AI 에이전트가 효용을 내려면 기존 행정 절차와 시스템 개선을 병행해야 하기 때문이다. 부처별로 파편화된 절차를 그대로 둔 채 AI만 추가할 경우에는 이용자 접점과 책임 체계가 더 복잡해질 수 있다. 또 에이전트의 권한과 실행 이력, 품질과 보안을 관리하는 에이전트옵스 체계도 앞으로 필요하다. 이 에반젤리스트는 "정부 부처 간 복잡한 절차와 파편화된 시스템을 혁신하지 않은 채 AI 에이전트만 얹으면 또 다른 파편화를 낳을 수 있다"며 "국민이 실제 효용을 느끼도록 행정 절차 혁신과 에이전트 운영 체계를 함께 준비해야 한다"고 강조했다.

2026.07.15 10:40장유미 기자

  Prev 1 2 3 Next  

지금 뜨는 기사

이시각 헤드라인

삼성 파운드리, HBM4 확대 총력…4나노 캐파 절반이 '베이스 다이'

젠슨 황 "GPT-6 아스트라, AGI 시대 열었다…GPU 10만개 투입"

'국내 1호 게임학 박사 배출' 상명대, AI·시스템 공학 품은 실무 인재 양성

[AI 고속도로] 공공 클라우드 외산 문턱 낮아지나…국내업계 "역차별 없어야"

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.