• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'독파모'통합검색 결과 입니다. (180건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

[독파모 2차 발표] '국가대표 AI' 3파전 돌입…정예팀에 B200 3천장 푼다

정부가 '독자 AI 파운데이션 모델(독파모)' 프로젝트 3차 단계에 진출한 정예팀에 엔비디아 그래픽처리장치(GPU) B200 약 3000장을 투입한다. 앞선 개발 단계에서 정예팀별로 서로 다른 GPU가 제공됐던 것과 달리 이번에는 정예팀마다 B200 1000장을 지원해 독자 AI 모델 고도화를 가속한다는 목표다. 과학기술정보통신부는 독파모 2차 단계평가 결과, 업스테이지·SK텔레콤(SKT)·LG AI연구원 등 3개 정예팀을 3차 단계 진출팀으로 선정했다고 18일 밝혔다. 올해 추가 정예팀으로 합류한 모티프테크놀로지스는 이번 평가를 끝으로 프로젝트를 마무리하게 됐다. 독파모는 글로벌 수준의 독자 AI 파운데이션 모델 개발을 목표로 정부가 추진하는 국가 핵심 AI 프로젝트다. 정부는 단계별 평가를 통해 정예팀을 압축하고 데이터와 컴퓨팅 자원을 집중 지원하는 방식으로 사업을 추진 중이다. 3차전부터 GPU 상향…팀당 B200 1천장 지원 정부는 3차 단계에 진출한 정예팀에 지난해 'AI 컴퓨팅자원 활용기반 강화 사업'을 통해 확보한 B200 총 3000장을 지원할 예정이다. 앞서 LG AI연구원과 업스테이지는 2차 단계평가를 준비하는 과정에서 각각 B200 512장과 H100 512장 수준의 컴퓨팅 자원을 지원받았다. 올해 추가 정예팀으로 뒤늦게 합류한 모티프테크놀로지스에는 B200 768장이 제공됐다. 정부는 3차 단계 진출팀에 대한 GPU 지원 규모도 확대하기로 했다. 올해 상반기 768장 수준이던 지원 규모를 하반기에는 1000장 수준으로 늘릴 계획이다. SKT는 그동안 정부 GPU 임차지원 사업자로 참여해 별도의 정부 GPU를 지원받지 않았다. 다만 정부는 3단계 평가에 진출할 경우부터 GPU를 지원할 수 있도록 했다. 이에 따라 SKT도 이번 단계부터 정부가 확보한 GPU를 활용할 수 있게 됐다. 류제명 과기정통부 제2차관은 "다음 단계에 진출한 정예팀들에게 고성능 GPU 지원을 확대해 독자 AI 모델을 빠르게 고도화할 수 있도록 뒷받침하겠다"고 말했다. NHN클라우드·카카오 인프라 투입…지난해 확보 물량 활용 독파모에 공급되는 B200은 정부가 지난해 추진한 대규모 GPU 확보 사업을 통해 마련됐다. 정부는 지난해 약 1조 4600억원을 투입해 네이버클라우드와 NHN클라우드, 카카오를 사업자로 선정했다. 이들 기업은 총 1만 3136장의 GPU를 확보·구축했다. 사업자별로 NHN클라우드는 B200 7656장, 카카오는 B200 2424장, 네이버클라우드는 H200 3056장을 구축했다. 이 가운데 정부 활용 물량은 NHN클라우드 B200 6120장, 카카오 B200 2040장, 네이버클라우드 H200 2296장이다. 이번 독파모 3차 단계에는 B200만 투입되는 만큼 NHN클라우드와 카카오가 구축한 B200 인프라가 공급 기반으로 활용될 예정이다. 최근까지 산학연에 제공돼온 정부 GPU 자원이 독파모에 집중 투입될 전망이다. 과기정통부는 정예팀당 GPU 임차 비용이 6개월 기준 약 400억원으로, 총 1200억원이 될 것으로 추산했다. 베라루빈까지 확보…차기 국가 AI 프로젝트는 검토 정부는 올해도 AI 컴퓨팅 인프라 확충을 이어가고 있다. 지난 6월 'AI 컴퓨팅자원 활용기반 강화 사업'에 네이버클라우드와 삼성SDS, 엘리스그룹을 수행기관으로 선정했다. 이를 통해 베라루빈과 B300을 포함한 최신 GPU 9704장을 추가 구축할 계획이다. 이 가운데 정부 활용 물량은 베라루빈 2016장과 B300 4360장 등 총 6376장이다. 다만 독파모 후속 사업이나 '모두의 AI' 등 특정 국가 AI 프로젝트에 해당 GPU를 어떻게 배분할지는 아직 결정되지 않았다. 과기정통부 관계자는 "내년도에 정부 활용분 GPU를 어떻게 투입할지는 아직 정해지지 않았다"며 "산학연과 국가 프로젝트를 다양하게 지원하는 방향이 될 수 있지만 아직 확정된 것은 없으며 내부 검토를 진행 중"이라고 밝혔다.

2026.08.18 14:28한정호 기자

[독파모 2차 발표] 업스테이지 3차 진출…"국산 NPU로 실증·아시아권 공략"

업스테이지가 인공지능(AI) 모델 '솔라 오픈2' 개발 중심을 성능 경쟁에서 실제 서비스 확산으로 옮긴다. 포털 '다음'과 '타임리' 플랫폼에 모델을 연계해 성능과 안정성을 높이고, 퓨리오사AI 신경망처리장치(NPU)로 서비스 운영 비용을 낮추는 것이 핵심이다. 18일 정부 발표에 따르면 업스테이지 정예팀은 '독자 AI 파운데이션 모델 프로젝트' 2차 단계평가를 통과해 3차 단계에 진출했다. 업스테이지는 다음 단계에서 모델 벤치마크 점수를 높이는 데 그치지 않고 국민이 직접 이용할 수 있는 서비스로 전환하는 데 주력할 방침이다. 업스테이지 실사용 모델 고도화 전략은 크게 세 축으로 구성됐다. 다음·타임리를 통한 서비스 적용과 퓨리오사AI NPU 기반 비용 효율 검증, 아시아권 언어 지원 확대다. 솔라 오픈2는 전체 2500억개 매개변수 가운데 추론할 때 150억개를 활성화하는 '250B-A15B' 구조 에이전트 최적화 모델로 이뤄졌다. 대규모 모델 성능을 유지하면서 실제 연산에 사용하는 매개변수를 줄여 서비스 운영에 필요한 컴퓨팅 자원과 비용을 낮추도록 설계됐다. 모델은 엔비디아 H200 그래픽처리장치(GPU) 2장으로 구동할 수 있는 것으로 알려졌다. 업스테이지는 이러한 경량 구동 능력 바탕으로 대규모 GPU 인프라를 갖추지 않은 기업도 활용할 수 있는 서비스 모델을 구현한다는 구상이다. 모델 컨텍스트 윈도는 최대 100만(1M) 토큰이다. 한 번에 수백 페이지가 넘는 문서를 처리할 수 있는 셈이다. 업스테이지는 이 기능을 긴 문서 분석과 정보 검색, 보고서 작성 등 복잡한 업무를 수행하는 AI 에이전트 서비스에 활용할 계획이다. 실제 이용 환경 검증...해외 서비스 기반 마련 업스테이지는 솔라 오픈2를 포털 다음과 타임리 서비스에 연계해 실제 이용 환경에서 응답 성능과 안정성, 비용 효율성을 입증한다고 강조했다. 다음은 솔라 오픈2가 대규모 서비스 환경에서도 안정적으로 작동하는지 확인할 수 있는 시험대 역할을 맡는다. 모델 성능뿐 아니라 실제 서비스에 필요한 처리 효율과 운영 가능성을 함께 검증할 수 있다는 설명이다. 업스테이지는 2차 평가에서도 이러한 실증 전략을 강점으로 인정받았다. 평가진은 업스테이지 정예팀이 퓨리오사AI 손잡고 국산 NPU를 다음 서비스 환경에서 실증한 점을 높게 평했다. 업스테이지 관계자는 "외산 하드웨어(HW) 의존도를 낮출 것"이라며 "솔라 오픈2를 비용 효율적으로 운영할 수 있는 국산 AI 결합 모델을 구축할 것"이라고 밝혔다. 업스테이지는 솔라 오픈2 지원 언어를 아시아권으로 확대한다. 국내에서 검증한 서비스 운영 경험을 바탕으로 솔라 오픈2를 해외에서도 활용할 수 있는 모델로 키우기 위한 전략이다. 회사는 우선 정부 컴퓨팅 자원을 모델 고도화에 활용한다. 과학기술정보통신부는 3차 단계 진출팀에 대한 엔비디아 B200 GPU 지원 규모를 올해 상반기 약 768장에서 하반기 약 1000장으로 확대할 계획이다. 업스테이지는 추가 GPU를 활용해 솔라 오픈2의 성능과 서비스 안정성을 높일 방침이다. 장문 처리와 에이전트 기능을 강화하는 동시에 아시아 언어권 서비스에 필요한 모델 역량도 높일 방침이다. 현재 정부는 독파모 3차 단계 평가 방식과 배점을 아직 확정하지 않았다. 1·2차 평가 과정에서 확인한 보완 사항을 검토하고 업스테이지·LG AI연구원·SK텔레콤 등 3개 정예팀과 협의해 평가안을 확정·발표할 예정이다. 업스테이지 관계자는 "포털 다음과 컨소시엄 참여사 등을 통해 국민이 직접 체감할 수 있는 실사용 모델을 고도화하는 데 최선을 다할 것"이라며 "아시아권으로 지원 언어를 확대해 글로벌 확산 기반도 마련하겠다"고 말했다.

2026.08.18 14:16김미정 기자

[독파모 2차 발표] 예정대로 2곳 선정…AI 개발 지원책은 재검토

국가대표 인공지능(AI) 모델 2개가 이르면 연말 결정되는 가운데, 정부가 기존 '독자 AI 파운데이션 모델(독파모)' 사업과 범용인공지능(AGI) 프로젝트 등을 연계한 프론티어급(최첨단) AI 모델 개발 지원 사업 전반을 재검토한다. 독파모 사업의 3차수 평가는 당초 계획대로 진행해 3개 정예팀 중 최종 2곳을 선정한다는 입장이다. 정부는 독파모 4차수 지속 여부 등을 포함해 프론티어급 모델 개발 사업의 구체적인 방향을 조만간 발표할 계획이다. 류제명 과학기술정보통신부 제2차관은 18일 정부서울청사에서 독파모 프로젝트 2차 단계평가 결과 브리핑을 열고 업스테이지, SK텔레콤, LG AI연구원 등 3개 팀이 다음 단계에 진출했다고 밝혔다. 1차 평가 당시 모델 독자성 기준 등에 따른 2개 팀 탈락 후 추가 공모를 통해 합류했던 모티프테크놀로지스는 이번 관문에서 고배를 마셨다. 평가 항목 중 가장 높은 배점이 부여된 벤치마크 평가의 한 축인 글로벌 AI 평가기관 아티피셜 애널리시스의 인텔리전스 인덱스(AAII)에서는 모티프테크놀로지스의 '모티프 3'가 47점으로 4개 팀 중 최고 점수를 기록한 것과 대조된 결과다. 2차 평가 항목별 1위 비공개…모티프 '사용성·활용성'서 약세 이번 2차 단계평가는 벤치마크 평가(40점)·전문가 평가(35점)·사용자 평가(25점)로 구성됐다. 이중 벤치마크 평가는 글로벌 AI 평가기관 아티피셜 애널리시스의 인텔리전스 인덱스(AAII) 벤치마크 평가가 25점, 한국지능정보사회진흥원(NIA) 벤치마크 평가가 15점을 차지한다. 사용자 평가는 AI 스타트업 대표 등 49명 AI 전문 사용자진과 최종 선정된 200명 중 실제 평가에 참여한 일반 국민 185명이 참여했다. 과기정통부는 1차 평가 발표 때와 달리 이번에 세부 평가항목별 1위 기업을 공개하지 않았다. 항목별 4개 팀의 점수 차이가 크지 않은 상황에서 개별 순위를 공개할 실익이 크지 않은 데다 나머지 기업에 미칠 영향도 고려했다는 설명이다. 2차 평가 결과에 따르면 벤치마크 평가에서 4개 정예팀 전체 평균은 22.5점이며 1위와 4위 간 점수 격차는 4.0점이었다. 전문가 평가에서 4개 정예팀 전체 평균은 28.8점이며 1위와 4위 간 점수 격차는 2.4점으로 나타났다. 사용자 평가에서 4개 정예팀 전체 평균은 17.6점이며 1위와 4위 간 점수 격차는 5.0점이었다. 다만 모티프테크놀로지스는 AAII 기준 높은 벤치마크 성능에도 불구하고 사용성·활용성 측면이 약했던 것으로 알려졌다. 류 차관은 "모티프테크놀로지스 모델 기술력은 뛰어났지만 사용성과 활용성 부분에서는 다른 기업에 비해 낮은 평가를 받았다"며 "특정 한 항목이 (탈락에) 결정적이었다기보다는 각 평가 항목 결과가 종합적으로 반영된 것"이라고 역설했다. 벤치맥싱 논란, 점수 미반영…"AAII·전문가 검증서 문제 없어" 올해 초 발표된 1차 평가는 '프롬 스크래치' 등 모델 독자성이 주요 쟁점이었다면 2차 평가에서는 이른바 '벤치맥싱' 논란이 제기됐다. 벤치맥싱은 특정 벤치마크를 겨냥한 데이터와 사후학습으로 점수를 집중적으로 끌어올리는 전략을 말한다. 애프터쿼리, 스케일AI, 머코 등 미국 AI 학습 전문업체들이 한국 시장에 진출을 본격화한 가운데 일부 업체가 지난달 서울에서 열린 머신러닝 분야 학회 'ICML 2026'에서 독파모 팀들을 상대로 영업에 나선 것으로 전해지면서 논란이 점화됐다. 과기정통부는 이번 평가에서 벤치맥싱 의혹을 점수에 반영하지 않았다고 선을 그었다. 정부가 AAII 운영기관인 아티피셜 애널리시스에 관련 의혹에 대한 검토를 요청한 결과, 평가를 위한 체계적인 암기나 과적화 문제를 입증할 단서를 찾지 못한 것으로 확인됐다. 류 차관은 "벤치맥싱 관련된 이슈는 평가에 반영되지 않았다"며 "AAII의 공식적인 답변과 함께 전문가 평가를 통해 교차 검증한 결과 불공정한 기술 지원 등은 없었다는 결론을 내렸다"고 말했다. 과기정통부는 향후에도 외부 평가기관과의 협력 등을 통해 평가 신뢰성과 공정성을 높인다는 방침이다. 이번 2차 평가에서도 AAII가 직접 벤치마크 평가를 수행했으며 3차수 평가와 관련해서도 전문적인 의견 교환과 자문 등 협력 관계를 이어갈 계획이다. 3차 평가 진행…2027년 이후 지원 체계 등 4차수는 재검토 이르면 연말에서 내년 초 진행될 3차 평가는 이번 결과 이의제기 절차가 끝난 뒤 구체적인 평가방식을 확정해 추진한다. 다음 단계에 진출한 3개 팀에는 고성능 그래픽처리장치(GPU)인 B200 지원도 확대된다. 과기정통부는 올해 상반기 768장 수준이었던 지원 규모를 하반기 1000장 수준으로 늘릴 계획이다. 3차수 평가를 통해 최종 2개 팀을 선정한다는 계획은 그대로 유지한다. 하지만 2027년부터 이들 팀을 어떤 방식으로 지원할지는 개발 주관사를 주체로 한 기존 구도에서 벗어나 전면 재검토한다. 과기정통부는 프론티어급 AI 모델 개발을 검토하면서 기존 독파모 사업과 AGI 프로젝트 등 관련 사업 간 연계와 재편도 함께 살펴볼 예정이다. 기존 사업의 지원 규모를 조정하는 데 그치지 않고 사업 간 연계 여부와 지원 대상·방식, 경쟁 구조까지 다시 설계할 수 있다는 의미다. 류 차관은 "지금과 같은 경쟁 방식을 탈피해서 프런티어 기업들의 모델에 버금가는 모델 경쟁이 가능한 방식으로 재편하자는 공감대가 있다"며 "예산이 확정되는 대로 구체적인 사업 방향을 발표할 계획"이라고 강조했다.

2026.08.18 13:49이나연 기자

모티프, 독파모 벤치마크 1위에도 탈락…대기업과 경쟁서 존재감·차기 행보 주목

모티프테크놀로지스(이하 모티프)가 과학기술정보통신부의 '독자 AI 파운데이션 모델'(독파모) 2차 평가에서 벤치마크 1위를 기록하고도 최종 탈락했다. 다만 대기업과 대규모 투자를 받은 AI기업이 경쟁한 무대에서 후발주자인 신생 스타트업이 짧은 기간 안에 성능 경쟁력을 입증했다는 점에서 모티프의 차기 행보가 주목 받고 있다. 18일 과기정통부가 발표한 독파모 2차 평가 결과에 따르면 3차 단계 진출팀은 업스테이지, SK텔레콤, LG AI연구원 등 3곳이다. 모티프는 벤치마크 부문에서 두각을 나타냈지만 최종 명단에는 이름을 올리지 못했다. 이번 평가는 총 100점 만점 기준으로 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점을 합산하는 방식으로 진행됐다. 벤치마크 성적과 함께 개발 전략과 기술력, 향후 계획, 산업 파급효과, 실제 사용성 등을 아우른 종합 점수에 따라 결과가 갈릴 수 있는 구조다. 관련 업계에선 이번 독파모에서 모티프가 남긴 성과와 의미는 적지 않다는 평이다. 모티프는 사업 초기부터 참여한 팀이 아니라 중간에 합류한 후발주자다. 그럼에도 약 5개월 만에 사전학습부터 후처리까지 처음부터 개발한 모델을 선보이며 벤치마크 1위를 기록했다. 대기업 중심의 경쟁 구도 속에서 국내 스타트업도 짧은 기간 안에 프론티어급 AI 모델 경쟁력을 입증할 수 있다는 점을 보여준 사례라는 평가가 나온다. 대표적으로 모티프가 자체 개발한 인공지능(AI) 파운데이션 모델 '모티프 3'가 글로벌 AI 모델 평가기관 아티피셜 애널리시스의 종합 지능 지수(AAII)에서 47점을 받으며 한국 기업 1위, 글로벌 10위를 기록했다. 오픈웨이트 모델 기준으로는 글로벌 4위에 오르는 성과다. 단순히 프로젝트 참여에 의미를 두는 수준을 넘어 실제 수치와 평가 결과로 존재감을 증명했다는 점에서, 이번 독파모 결과와 별개로 시장의 관심을 끌기에 충분했다는 분석이다. 특히 이번 사례는 규모의 차이가 절대적인 장벽이 아니라는 점을 보여줬다는 데 의미가 있다. AI 파운데이션 모델 개발은 막대한 자본과 인프라, 연구 인력이 필요한 영역으로 여겨져 왔지만 모티프는 제한된 조건에서도 기술력으로 경쟁 구도 안에 들어설 수 있음을 입증했다. 중도 합류라는 불리한 조건 속에서도 단기간에 가시적 성과를 낸 만큼, 후속 모델 개발이나 사업 확장 가능성을 주목해야 한다는 목소리도 나온다. 임정환 모티프 대표는 이번 결과를 담담하게 받아들이면서도 프로젝트의 의미를 강조했다. 그는 "우리 정부가 자체적인 AI 파운데이션 모델 개발에 도전하기로 결정하지 않았다면 그리고 저희와 같은 작은 신생 스타트업에도 그 도전의 기회를 주지 않았다면 이런 성과도 만들어내지 못했을 것"이라며 "이 도전을 가능하게 해주신 모든 관계자분들께 감사드린다"고 말했다. 모티프는 이번 결과와 무관하게 기존 사업과 연구개발을 이어간다는 방침이다. 독파모 최종 선정에는 실패했지만 이번 프로젝트에서 확보한 경험과 기술 자산을 바탕으로 자체 모델 고도화와 글로벌 경쟁력 강화에 나설 전망이다. 대표적으로 같은 날 마감하는 모두의 AI사업에 KT 컨소시엄 파트너사로 참여한다. 임정환 대표는 "결과에 상관없이 이번 독파모 프로젝트를 통해 기술력만으로 한국에서도 글로벌 프론티어 수준의 AI 모델 개발이 가능하다는 것을 증명했다는 점에서 매우 뜻깊었다"고 밝혔다. 이어 "모티프는 앞으로도 지속적으로 글로벌 프론티어 모델 개발에 전력을 다하겠다"고 덧붙였다.

2026.08.18 12:12남혁우 기자

독파모 2차전 '모티프' 탈락…업스테이지·SKT·LG 진출

모티프테크놀로지스가 국가대표 인공지능(AI)을 선발하는 '독자 AI 파운데이션 모델(독파모)' 프로젝트 2차 평가에서 탈락하며 3차 관문 진입이 좌절됐다. 과학기술정보통신부는 독파모 프로젝트 2차 단계평가 결과 업스테이지, SK텔레콤, LG AI연구원 등 3개 정예팀이 다음 단계에 진출했다고 18일 밝혔다. 업스테이지 정예팀이 개발한 '솔라 오픈2'는 한 번에 기억하고 처리할 수 있는 텍스트 양이 문서 수백 페이지 이상에 해당하는 최대 100만 토큰에 달해 전 세계 최상위급 AI 모델과 동일한 수준의 정보처리 능력을 확보했다. SK텔레콤 정예팀이 개발한 '에이닷엑스(A.X) K2는 국제수학올림피아드 2026년 문제 평가에서 금메달 기준에 해당하는 점수를 기록했다. LG AI연구원 정예팀이 개발한 'K-엑사원 2.0'은 아티피셜 애널리시스 인텔리전스 인덱스(AAII) 벤치마크 지표 중 AI 모델 환각 최소화 지표에서 전 세계 AI 모델 중 9위를 기록했다. 이번 2차 단계평가는 벤치마크 평가(40점)와 전문가 평가(35점), 사용자 평가(25점)를 병행해 진행됐다. 과기정통부는 1차 평가 대비 대외 공신력 높은 고난도 글로벌 벤치마크 평가 도입, 현장 AX 접목 및 확산 평가 확대, 국민 참여형 사용성 평가 신규 도입 등을 통해 평가 체계를 정교화했다고 강조했다. 벤치마크 평가는 AAII 벤치마크 평가(25점)와 NIA 벤치마크 평가(15점)로 구성됐다. AAII 벤치마크 평가는 AAII를 구성하는 ▲에이전트 ▲코딩 ▲일반 ▲과학적 추론 분야의 고난도 벤치마크 9종으로 평가를 진행했다. 이 과정에서 글로벌 AI 평가기관 아티피셜 애널리시스(AA)가 직접 벤치마크 평가를 진행했다. NIA 벤치마크 평가는 1차 평가 대비 ▲지시이행 ▲한국어 평가 분야를 확장해 ▲수학 ▲지식 ▲장문이해 ▲지시이행 ▲한국어 ▲안전성 ▲신뢰성 분야까지 포괄해 벤치마크를 구성했다. NIA 벤치마크는 전체 문제와 정답이 공개되지 않아 벤치마크 오염 우려가 낮다. AAII 벤치마크가 글로벌향 AI모델 범용 성능 평가에 중점을 뒀다면, NIA 벤치마크는 한국어·한국적 맥락에서의 성능과 안전성·신뢰성까지 종합 평가했다. 벤치마크 평가(40점) 4개 정예팀 전체 평균은 22.5점이며, 1위와 4위 간 점수 격차는 4.0점이다. 전문가 평가는 외부 AI전문가로 구성된 전문가위원회를 구성해 정예팀이 제출한 평가서류 등을 바탕으로 약 일주일 내외 간의 평가를 진행했다. 정예팀들의 ▲개발 전략 및 기술(10점) ▲개발 성과 및 계획(10점) ▲파급효과 및 기여계획(15점)을 중심으로 심층 평가했다. 전문가위원회는 AI 알고리즘, 서비스, 데이터 분야 등의 전문성을 보유한 전문가들로, 이해충돌 문제가 없는 10명이 평가에 참여했다. 단순한 독자성 확보 여부에서 나아가, '독자성 및 이를 기반으로 한 성능 향상 수준'을 전문가 평가 항목에 반영해 독자적 기술이 실제 AI모델 성능 향상으로 이어지는 경우, 이를 높게 평가할 수 있도록 했다. 또 국내외 AI생태계 파급효과·기여계획에 대한 평가 비중을 확대해 실질적인 현장 확산 등 국내 AX 등의 확대를 유도하는 데 초점을 맞췄다. 전문가 평가(35점) 4개 정예팀 전체 평균은 28.8점이며, 1위와 4위 간 점수 격차는 2.4점이다. 사용자 평가는 AI 전문 사용자진 평가(15점)와 일반 국민 평가(10점)으로 구성됐으며 이를 기반으로 AI 사용성 등에 대한 평가를 진행했다. AI 전문 사용자진 평가는 49명의 AI 전문 사용자가 참여해 평가를 진행했다. 일반 국민 평가는 최종 선정된 200명 중 185명이 직접 참여해 평가를 진행했다. 사용자 평가(25점) 4개 정예팀 전체 평균은 17.6점이며 1위와 4위 간 점수 격차는 5.0점이다. 다음 단계에 진출한 정예팀에는 고성능 그래픽처리장치(GPU) B200 지원을 확대할 계획이다. 올 상반기 768장 수준에서 B200 1000장 수준으로 규모를 늘렸다. 과기정통부는 "최상위급 독자 AI 모델 개발 필요성을 깊이 인식하고 기존 방식을 뛰어넘는 지원 체계를 관계부처와 논의 중"이라며 "추후 구체적인 내용을 준비해 발표할 것"이라고 말했다.

2026.08.18 11:01이나연 기자

독파모 '벤치맥싱' 논란에 AAII 입장…"평가 방법론 지속 업데이트"

글로벌 인공지능(AI) 평가기관 아티피셜 애널리시스가 벤치마크 맞춤형 학습으로 실제 성능 개선 없이 점수만 높아질 수 있다는 우려를 인정했다. 현재 이같은 이슈를 최소화하기 위해 내부적으로 기술적 조치를 강화하고 있는 것으로 확인됐다. 14일 아티피셜 애널리시스는 지디넷코리아에 보낸 이메일에서 "벤치마크를 활용해 모델 약점을 보완하는 것은 통상적인 개발 과정"이라면서도 "특정 평가에 과도하게 최적화해 점수만 끌어올리는 방식은 경계해야 한다"고 밝혔다. 아티피셜 애널리시스는 글로벌 AI 모델 성능과 속도, 비용 등을 비교·분석하는 민간 평가기관이다. 해당 기관이 운영하는 '아티피셜 애널리시스 인텔리전스 지수(AAII)'가 독파모 2차 평가에서 전체 100점 중 25점을 차지한다. 아티피셜 애널리시스는 이같은 벤치마크 이슈를 최소화하기 위해 내부 분석과 검증, 자체 평가 데이터 활용, 지속적 평가 방법론 업데이트 등 세 가지 장치를 추진하고 있다고 말했다. 아티피셜 애널리시스 관계자는 "우리는 개별 평가와 전체 지수 차원에서 모델 답변과 추론 과정, 실행 로그, 점수 분포를 검토한다"며 "이를 통해 비정상적인 점수 변화나 특정 평가에만 특화된 최적화 흔적을 찾는다"고 말했다. 이어 자체적으로 개발·관리하는 평가와 외부 벤치마크도 활용한다고 밝혔다. 특정 공개 데이터나 하나의 평가 방식에 대한 의존도를 낮춰 일부 시험에 특화된 학습이 전체 점수 상승으로 이어지는 것을 막기 위해서다. 관계자는 평가 항목과 가중치, 채점 방식도 정기적으로 바꾸겠다고 밝혔다. 최신 AI 기술과 산업에서 중요해진 역량을 반영해 평가 체계를 지속적으로 개편함으로써 AAII가 개발사 공략 대상이 되지 않도록 한다는 취지다. 기관이 현재 사용 중인 'AAII 4.1.1' 버전은 에이전트 업무와 코딩, 과학적 추론, 장문 맥락 추론, 지식과 환각 등을 측정하는 9개 평가로 구성됐다. 아티피셜 애널리시스는 한 영역에서만 점수를 높이더라도 성능이 다른 과제로 확장되지 않으면 전체 지수에 미치는 영향은 제한적이라고 주장하고 있다. 그러나 아티피셜 애널리시스는 실제 벤치마크 과적합 징후를 발견한 사례가 있는지는 공개하지 않았다. 과적합 징후를 확인했을 때 해당 점수를 제외하거나 모델을 재평가하는지, 순위를 조정하거나 외부에 경고하는지 등 사후 조치 기준도 밝히지 않았다. 독파모 평가 25점 걸린 AAII...업계 "실제 성능 왜곡 우려" 최근 업계에선 일부 독파모 참여사 일부가 AAII 점수를 겨냥한 맞춤형 사후학습 데이터를 활용하고 있다는 의혹이 제기되고 있다. 이에 일각에선 일부 참여사가 모델이 낮은 점수를 받은 지식 영역과 문제 유형을 분석한 뒤 유사한 사후학습 데이터를 구매하거나 별도 구축하고 있다는 주장이 나온다. 벤치마크 문제와 정답을 그대로 학습하는 방식은 아니지만, 실제 사용 역량보다 특정 평가 점수만 높아진다면 모델 성능을 왜곡하는 벤치맥싱으로 이어질 수 있다는 우려다. AAII 순위가 독파모 2차 평가의 최종 결과를 의미하는 것은 아니다. NIA 벤치마크와 전문가·사용자 평가가 별도로 진행되는 데다 AAII 역시 버전과 평가 구성에 따라 점수가 달라질 수 있어서다. 과학기술정보통신부는 AAII만으로 모델 우열을 판단하지 않고 한국지능정보사회진흥원(NIA) 벤치마크와 전문가·사용자 평가를 종합한다는 입장이다. 그러나 AAII에 전체 점수의 4분의 1이 배정된 만큼 벤치마크 맞춤형 학습을 실제 성능 향상과 어떻게 구분할지가 평가 공정성을 가를 핵심 과제로 꼽힌다. 아티피셜 애널리시스는 "우리는 모델 답변과 추론 과정, 실행 로그, 점수 분포를 분석해 평가에만 특화된 최적화 방법론을 꾸준히 연구 중"이라고 밝혔다.

2026.08.14 15:40김미정 기자

독파모 2차 결과 발표 임박…AI 업계 '초긴장', 관전 포인트는

독자 인공지능(AI) 파운데이션 모델 프로젝트(독파모) 2차 단계 평가 결과 발표가 임박하면서 국내 AI 업계 관심이 집중되고 있다. 단순한 모델 성능 경쟁을 넘어 결과에 따라 국내 AI 업계 관심 구도도 달라질 것으로 예상되기 때문이다. 14일 업계에 따르면 독파모 2차 단계 평가 결과는 이르면 다음 주 발표될 것으로 알려졌다. 독파모는 이번 2차 평가 결과 발표를 통해 3개 팀으로 압축된 뒤 추가 평가를 거쳐 올해 12월 최종 2개 팀을 선발한다. 최종 생존팀에는 엔비디아(NVIDIA) B200 그래픽처리장치(GPU)와 대규모 데이터 구축·가공비, 'K-AI 기업' 명칭 부여 등 국가 차원의 지원이 이어진다. 독파모에 참가한 LG AI연구원, SK텔레콤(SKT), 업스테이지, 모티프테크놀로지스 4개 팀은 모든 2차 과정을 마치고 결과를 기다리고 있는 중이다. 과기정통부는 기존 3개 팀의 모델 제출 기한인 6월 말과 추가 합류한 모티프테크놀로지스의 7월 말 제출 완료 이후, 8월 초부터 4개 팀을 대상으로 2차 단계 평가를 동시 진행해 왔다. 이번 발표로 한 팀이 탈락해 3파전으로 재편되는 만큼 업계 안팎의 촉각이 날카롭게 세워진 상태다. 이번 2차 평가에서 주목받는 변수는 평가 기준 변화다. 1차 평가가 기본 언어 이해·생성 능력과 모델 완성도에 초점을 맞췄다면, 2차에서는 외부 도구를 호출해 실제 업무를 자율 수행하는 에이전틱 AI 역량과 오케스트레이션 능력 검증 비중이 크게 높아진 것으로 알려졌다. 이에 따라 참여 기업도 수개월 동안 에이전트 성능 고도화에 집중해 왔다. LG AI연구원은 평가 제출 모델인 엑사원(EXAONE)의 에이전트 작업 수행 능력 강화에 주력한 것으로 알려졌다. 단순 질의응답을 넘어 실제 업무를 수행하는 오케스트레이션 역량을 높이는 데 개발 역량을 집중했으며 계열사와 파트너사를 통한 실사용 환경 적용도 병행해 왔다. 특히 1차 단계 평가에서 가장 높은 평가를 받은 만큼 업계에서는 이번 결과에서도 선두를 유지할 수 있을지 주목받고 있다. SK텔레콤은 지난달 신규 모델 'A.X K2'를 공개하며 에이전트 기능을 전면에 내세웠다. 서울대 황승원 교수 연구진의 에이전트 연구 성과를 반영해 다양한 환경에서 활용 가능한 AI 에이전트 역량 확보에 집중하고 있다는 설명이다. 독자 모델과 AI 인프라를 함께 제공할 수 있는 점도 차별화 요소로 꼽힌다. 업스테이지는 최근 공개한 '솔라 2'를 통해 에이전트 성능 향상을 강조하고 있다. 기존 모델 대비 도구 호출과 작업 수행 능력을 강화하며 기업 업무 환경에서 활용 가능한 AI 구현에 초점을 맞췄다. 회사 측은 최근 모델이 실제 에이전트 활용 환경에서도 충분한 경쟁력을 갖췄다고 평가하고 있다. 추가 공모를 통해 합류한 모티프테크놀로지스는 독자 설계 아키텍처를 강점으로 내세우고 있다. 해외 오픈소스 모델을 기반으로 하지 않은 자체 모델 개발 전략을 추진하며 독자성 확보에 집중해 왔다. 최근 관련 벤치마크에서 강한 성능을 내세우며 존재감을 키운 점도 업계가 주목하는 부분이다. 에이전틱 역량과 함께 '독자성' 판단 기준의 적용 강도도 주요 관전 포인트다. 독파모 사업이 목표로 하는 독자 파운데이션 모델은 해외 모델 파인튜닝이나 파생형이 아닌, 모델 설계부터 사전학습까지 전 과정을 자체 수행한 모델이다. 가중치를 초기화한 상태에서 독자적으로 학습·최적화하는 것이 최소 요건이다. 1차 평가에서 네이버클라우드가 독자성 기준 미달 판정을 받아 탈락한 전례가 있어, 이 잣대가 이번에도 결과를 가를 핵심 기준이 될 수 있다는 분석이 나온다. 실제 산업 현장 적용 가능성을 뜻하는 '확산성' 항목도 빼놓을 수 없는 평가 기준이다. LG AI연구원과 한컴의 공공 AI 오피스 협력, SKT의 자동차 부품업체 코넥스 현장 AI 에이전트 투입, 업스테이지의 공공기관 특화 검색증강생성(RAG) 서비스 구축 등 각사가 현장 확산 실적을 쌓아온 만큼, 이 항목이 최종 순위를 좌우하는 변수가 될 수 있다는 관측이 나온다. 독파모 사업의 의미가 산업 육성을 넘어 국가 경쟁력과 안보 영역으로 확대되고 있다는 점도 이번 발표의 무게감을 키우는 배경이다. 글로벌 AI 기반 사이버 위협이 현실화하면서 독자 AI 모델 확보가 국가 전략 자산이라는 인식이 확산되고 있기 때문이다. 국가AI전략위 보안특위를 중심으로 독파모를 안보 역량 강화 수단으로 격상해야 한다는 논의도 본격화한 상황이다. 한 업계 관계자는 "이번 2차 평가는 어느 기업의 모델이 더 뛰어난지를 가리는 차원을 넘어 국내 AI 산업의 방향성과 기술 자립 수준을 확인하는 과정"이라며 "결과 발표가 가까워질수록 업계의 관심도 더욱 높아지고 있다"고 말했다.

2026.08.14 08:14남혁우 기자

모티프 3, 글로벌 AI 성적표서 한국 기업 '1위'

모티프테크놀로지스가 자체 개발한 인공지능(AI) 파운데이션 모델 '모티프 3'가 글로벌 AI 모델 평가기관 아티피셜 애널리시스의 종합 지능 지수(AAII)에서 47점을 받으며 한국 기업 1위, 글로벌 10위를 기록했다. 오픈웨이트 모델 기준으로는 글로벌 4위에 올랐다. 모티프테크놀로지스는 모티프 3를 허깅페이스에 오픈소스로 공개했다고 13일 밝혔다. 모티프 3는 회사가 정부 '독자 AI 파운데이션 모델' 사업 2차에 합류한 후 5개월 만에 사전학습부터 후처리까지 전 과정을 처음부터(from scratch) 개발한 모델이다. 총 3140억 개(314B) 파라미터, 활성 132억 개(13.2B) 파라미터의 전문가 혼합(MoE) 구조 LLM으로 구성됐다. 세부 벤치마크 결과에 따르면 모티프 3는 실제 업무 수행 능력을 측정하는 에이전틱 벤치마크가 가장 두드러진 성과를 냈다. 금융 업무 에이전트 과업 완수율 평가(τ³-Banking)에서 35.3점으로 딥시크 V4 프로(30.1점)·키미 K2.6(23.3점)·GLM-5.1(13.6점)·큐원-3.5(13.4점) 등 비교군 전원을 앞섰다. 터미널 환경 실전 코딩·시스템 작업 능력 평가(Terminal-Bench 2.1)에서도 74.9점으로 1위를 기록했다. 장문 추론 능력 평가(AA-LCR)에서는 72.3점으로 규모가 2~5배 큰 모델들과 대등한 수준을 보였다. 실물 경제 업무 수행 가치 평가(GDPval v2)에서는 38.7점으로 5배 규모인 딥시크 V4 프로(40.2점)를 뒤이었다. 모르는 내용을 아는 것처럼 지어내지 않는지를 측정하는 논-할루시네이션 지표(AA-Omniscience)에서는 71.6점으로 비교군 중 2위에 올랐다. 이 밖에 소프트웨어 엔지니어링(SWE-bench Verified) 76.2점, 전문가급 초고난도 지식 평가인 '인류 최후의 시험(Humanity's Last Exam)' 37.0점을 기록했다. 모티프테크놀로지스 측은 "총 1조 파라미터를 넘나드는 초대형 모델과의 경쟁 속 실제 서비스 비용을 좌우하는 활성 연산량을 최소 수준으로 유지하면서 프론티어급 성능에 도달한 것"이라며 "연산량 대비 지능(intelligence per FLOP) 관점에서 세계 최고 수준의 효율"이라고 강조했다. 모티프 3는 상업적 활용을 포함한 MIT 라이선스로 모델 가중치와 학습 코드, 라이브러리까지 전면 공개됐다. 모티프테크놀로지스는 자체 개발한 어텐션 구조 GDLA(Grouped Differential Latent Attention)를 비롯해 아키텍처, 옵티마이저, 후처리 등 모델 개발 전 계층에 걸쳐 자체 설계 기술을 적용했다. 언어모델 외에도 비전(7B), 오디오(0.7B), 비디오 VAE(1.2B) 등 3개 모달리티 인코더를 병행 개발해 총 4개 모듈을 완성했다. 자체 비전 인코더는 메타의 V-JEPA 2.1, DINOv3 등 해외 최신 비전 모델을 상회하는 성능을 보인 것으로 나타났다. 모티프테크놀로지스는 향후 모티프 3 고도화와 더불어 차세대 모델 '모티프 4'에서 글로벌 5위권 진입을 목표로 한다. 비전, 오디오, 비디오 모듈을 언어모델과 결합한 멀티모달 통합 모델로 확장할 계획이다. 임정환 모티프테크놀로지스 대표는 "모티프 3는 짧은 기간과 제한된 자원 속에서 독자 아키텍처만으로 글로벌과 경쟁할 수 있는 수준임을 증명한 시작점"이라며 "같은 조건이 주어졌을 때 우리가 어디까지 갈 수 있는지는 이제부터가 증명의 시간"이라고 말했다. 이어 "이번에 얻은 자신감을 바탕으로 미국과 중국 프론티어 모델들과 대등하게 경쟁할 수 있는 최고 수준의 AI 모델을 완성하겠다"고 덧붙였다.

2026.08.13 11:29이나연 기자

국가대표 AI 먼저 써 봤더니..."취지 환영, 이용 유인·안전성은 과제"

국가대표 인공지능(AI)을 뽑는 '독자 AI 파운데이션 모델 프로젝트(독파모)' 평가가 막바지에 접어들었다. 국민 200명이 정부 지원으로 개발된 모델을 직접 사용해 성능과 활용성을 평가한 가운데, 상용화 전인 국내 AI 모델을 일반 이용자가 직접 체험해볼 수 있다는 데 호응이 컸던 것으로 나타났다. 동시에 일부 평가자 사이에서는 한국어 특화 성능이 기대에 비해 아쉽다는 의견과 안전성 측면의 개선이 필요하다는 목소리도 나왔다. 12일 업계에 따르면 과학기술정보통신부와 정보통신산업진흥원(NIPA)은 지난 8일부터 11일까지 독파모 2차수 모델에 대한 국민평가단을 운영했다. 이르면 13~14일 전후로 발표될 2차 평가 결과를 앞두고 기존 벤치마크 및 전문가 평가와 함께 심사에 반영하기 위해서다. 국민평가단은 공모 시작 하루 만에 480명 이상이 신청한 것으로 집계됐다. 최종 선정된 200명은 LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 등 4개 개발팀의 AI 모델을 직접 사용한 뒤 5점 만점의 절대평가에 임했다. PC 환경에서 정부가 제공한 국민용 프롬프트 가이드라인을 참고해 모델을 체험하고 종합평가를 제출하는 방식이다. 이미지·영상 생성 등 텍스트 외 기능은 평가 대상에서 제외됐다. 실제 평가에 참여한 한 참가자는 "평소 챗GPT 등 생성형 AI를 자주 사용하지 않았지만 정부 지원으로 개발된 국산 AI 모델을 직접 사용해볼 수 있다는 데 호기심을 느껴 평가단에 지원했다"고 밝혔다. 이 참가자는 "사용자 인터페이스(UI) 편의성과 정보 정리 능력이 가장 좋았던 모델에 높은 점수를 줬다"면서도 "다만, 평소 AI를 사용하지 않던 입장에서는 각 모델에 대한 특장점을 파악하는 데 한계가 있었다"고 말했다. 이어 "더 뚜렷한 이용 유인이 있어야 국산 AI를 꾸준히 사용하게 될 것 같다"고 덧붙였다. 모델 전반의 완성도에 대해서는 다양한 반응이 나타났다. 일부 국민평가단 후기를 종합해 본 결과, 해외 빅테크 AI 대비 한국 대표 AI만의 차별점을 제시하는 것이 향후 과제가 될 것으로 보인다. 한국어 특화 성능에 대한 기대가 컸던 만큼 이에 아쉬움을 표하는 평가자도 있었다. 또 다른 참가자는 "국내 모델이라 한글에 특화된 창작성을 특히 기대했는데 결과물에서 아쉬운 인상을 받았다"며 "상용화를 위해서는 추가적인 연구와 개선이 이뤄져야 할 것 같다"고 말했다. AI 윤리와 안전성에 대한 가드레일(안전장치)이 강화돼야 한다는 지적도 나왔다. 이용자가 우회적인 표현으로 부적절한 답변을 유도하는 방식의 테스트를 진행한 결과, 필터링이 충분히 작동하지 않는 사례가 확인됐다는 것이다. 한 참가자는 "특정 요소를 가진 캐릭터를 만들겠다고 하면서 폭력적인 표현이나 욕설을 유도해보니 모델이 답변에서 욕을 했다"며 "더 엄격한 필터링 조치가 필요해 보인다"고 지적했다. 서비스 이용 과정과 평가 방식에 대한 개선 제안도 있었다. 이 참가자는 "안내된 프롬프트를 활용하는 과정에서 직접 자료를 찾아 가공해야 하는 등 입력이 수월하지 않았다"며 "사전에 제공된 심사 가이드라인은 구체적인데 평가는 종합 평가 하나 뿐인 점도 다소 아쉬웠다"고 평했다. 과기정통부는 앞서 일각에서 제기된 국민평가단 선발 과정의 공정성 논란에 대해 성별·연령별 쿼터 적용과 무작위 선정 방식을 통해 대표성과 절차적 공정성을 확보했다는 입장을 강조했다. 과기정통부 측은 "추후 이해관계가 확인될 경우 평가점수에서 배제하고 민형사상 조치 등이 가능하도록 동의서를 받았다"며 "신청자의 중복 여부 확인 등을 거쳐 최종 평가자를 선별하기 때문에 같은 사람이 중복 참여하는 것도 구조적으로 불가능하다"고 말했다.

2026.08.12 16:22이나연 기자

독파모 4개 팀 모두 해냈다…美 에포크AI '주목할 모델' 선정

정부가 추진하는 독자 인공지능(AI) 파운데이션 모델 프로젝트 4개 정예팀이 글로벌 인공지능(AI) 경쟁력을 인정받았다. 과학기술정보통신부는 4개 정예팀인 LG AI연구원, SK텔레콤, 업스테이지, 모티프의 올 상반기 독자 AI 파운데이션 모델이 미국 비영리 AI 연구기관 에포크AI '주목할 만한 모델'에 등재됐다고 11일 밝혔다. 올해 현재까지 에포크AI의 주목할 만한 모델을 배출한 국가는 미국과 중국 한국 등 3개국이다. 과기정통부는 이번 등재가 한국이 세계적 수준의 AI 경쟁력을 확보하고 있음을 보여주는 성과라고 평했다. 에포크AI의 주목할 만한 모델은 국가별 AI 기술 경쟁력을 살펴보는 주요 지표로 활용된다. 미국 스탠퍼드대 사람 중심 AI 연구소가 매년 발간하는 'AI 인덱스' 보고서에도 관련 수치가 포함된다. 스탠퍼드대의 'AI 인덱스 2026'에 따르면 지난해 국가별 주목할 만한 모델 수는 미국이 59개로 가장 많았다. 중국은 35개였으며 한국은 8개를 기록했다. 4개 정예팀은 글로벌 빅테크보다 상대적으로 제한된 자원과 여건에서 올해 상반기 독자 AI 파운데이션 모델의 성능을 끌어올렸다는 평을 받고 있다. 개발한 모델을 오픈소스로 공개해 국내 AI 경쟁력과 개방형 생태계 조성 역량도 입증했다는 것이 과기정통부 설명이다. 배경훈 부총리 겸 과기정통부 장관은 "대한민국 기술로 만든 독자 AI 모델이 글로벌 수준 기술력을 입증하며 저력을 보여주고 있다"며 "이제는 더 큰 무대에서 주요 선도국과 어깨를 나란히 하며 경쟁해야 하는 만큼 국민이 체감할 수 있는 성과를 이어 나갈 수 있도록 지원을 아끼지 않겠다"고 밝혔다.

2026.08.11 15:22김미정 기자

[안광섭 AI 진테제] 독파모 2차평가 눈앞...무엇을 '평가' 해야 하나

오는 8일부터 11일까지 나흘간 국내서 주목할만한 인공지능(AI) 행사가 열린다. 200명의 국민평가단이 국산 AI 모델 네 개를 직접 써보는 행사다. 이 행사를 위해 과기정통부는 10대부터 60대까지 성별·연령 인구 비율을 반영해 평가단을 뽑았다. 정부가 독자 파운데이션 모델 프로젝트(이하 독파모)를 시작한 이래, 일반 사용자의 체감이 평가 배점에 정식으로 들어가는 것은 이번이 처음이다. 평가 결과는 이르면 12일 나오고, 경연 대상인 네 팀 중 한 팀이 떨어진다. 업계 반응은 대체로 무덤덤하다. 이유는 짐작이 간다. 1차 때도 '글로벌 프런티어급'이라는 표현을 봤고, 이번에도 각 사 발표에는 해외 최상위 모델과 대등하다는 서술이 어김없이 등장한다. 그런데 정작 우리가 매일 쓰는 서비스에서 국산 모델을 만나기는 어렵다. 발표와 체감 사이의 이 간극이 반복되면서, 독파모는 중요도에 비해 주목도를 잃었다. 필자는 2차에 제출된 네 모델의 기술 리포트를 처음부터 끝까지 읽었다. 결론부터 말하면 이번엔 다르다. 필자가 말하는 '다르다'의 의미가 보도되는 방향과 조금 다른 곳에 가있다. 1. 44점이라는 좌표 가장 먼저 볼 것은 각 사가 스스로 만든 표가 아니라, 이해관계가 없는 제3자가 매긴 숫자다. 인공지능 모델 평가 기관 아티피셜 애널리시스(Artificial Analysis)의 지능지수(AAII)에서 모티프테크놀로지스의 '모티프 3 프리뷰'는 44점을 기록했다. 같은 표에서 미니맥스 M3가 44.4점, 딥시크 V4 프로 맥스가 44.3점, 문샷AI의 키미 K2.6이 44.2점을 얻었다. 즉 국내 모델이 중국 오픈웨이트 상위권과 소수점 단위로 겹치는 자리에 올라와 있다. 이것은 진짜 성취다. 특히 모티프는 30명 규모 조직이 GPU 700여 장으로 약 5개월 만에 이 지점에 도달했다. 1차 평가 때의 좌표와는 질적으로 다르다. 그런데 같은 표를 조금 더 위로 올라가면 풍경이 달라진다. 오픈웨이트 중 최고점인 즈푸AI의 GLM-5.2가 51.1점, 지수 1위인 클로드 오퍼스 5가 60.7점이다. 44점대와 60점대 사이에는 두 단계가 더 있다. 정리하면 이렇다. 국내 모델은 '세계 2군의 상단'에 진입했다. 훌륭한 성과이고, 축하할 일이다. 그런데 언론에서 읽히는 문장은 '2군 상단 진입'이 아니라 '빅테크 추월'이다. 이 차이는 어디서 일어날까. 2. 비교표에 없는 이름들 답은 각 사 기술 리포트의 비교군에 있다. SK텔레콤의 A.X K2는 큐원3.5-397B, 딥시크 V4 플래시, GLM-5.1, 키미 K2.6, 미니맥스 M2.7과 비교했다. LG AI연구원의 K-엑사원 2.0은 큐원3.5, GLM-5.1, 딥시크 V4 프로와 비교했다. 업스테이지의 솔라 오픈 2는 아예 비교군을 명시했다. '320B 미만 오픈 모델'과 '패스트 티어(fast-tier) 폐쇄형 API'다. 세 리포트의 공통점이 있다. GPT도, 클로드도, 제미나이도 없다. 오픈웨이트 최고점인 GLM-5.2도 없다. 비교 대상은 모두 중국계 오픈웨이트이거나, 폐쇄형 모델 중에서도 저가·고속 라인이다. 이것을 기만이라고 부를 생각은 없다. 오히려 반대다. 비슷한 파라미터 규모와 서빙 비용의 모델끼리 견주는 것은 기술 문서로서 정확한 태도이고, 업스테이지가 비교군의 조건을 범례에 대놓고 써둔 것은 정직한 표기다. 한 가지 사례가 이 구조를 잘 보여준다. 업스테이지는 한국어 벤치마크에서 폐쇄형 모델을 앞섰다고 밝혔는데, 그 대상은 'GPT-5.4 미니'와 '클로드 하이쿠 4.5'였다. 둘 다 각 사의 경량·저가 라인이다. 발표문은 정확했다. 그러나 이 문장이 몇 다리를 건너면 '오픈AI와 앤스로픽을 이겼다'가 된다. 문제는 그다음이다. GTM(Go To Market) 전략을 다뤄온 필자 관점에서 보면, 비교군을 정하는 일은 기술적 결정이 아니라 포지셔닝의 첫 결정이다. 어떤 체급과 나란히 설 것인지를 고르는 순간, 그 표에서 도출될 수 있는 결론의 범위도 함께 결정된다. 그리고 이 표가 홍보 자료와 기사로 넘어가는 과정에서 '동급 최고'는 '세계 최고'로, '빅테크의 저가 라인과 대등'은 '빅테크 추월'로 한 칸씩 미끄러진다. 독자가 느끼는 괴리감의 출처가 여기다. 리포트는 거짓말을 하지 않았는데, 리포트를 요약한 문장은 사실과 어긋난다. 3. 재현되는 것과 재현되지 않는 것 그렇다면 벤치마크 점수는 대체 얼마나 믿을 만한 숫자인가. 마침 좋은 자연 실험이 있었다. 세 회사가 비슷한 시기에 같은 해외 모델들을 각자의 평가 환경에서, 서로의 결과를 보지 못한 채 다시 측정했다. 겹치는 칸만 맞춰 보면 이렇다. • 딥시크 V4 플래시의 HLE: SK텔레콤 32.1점, 업스테이지 32.3점 • 딥시크 V4 플래시의 KMMLU-Pro: SK텔레콤 78.8점, 업스테이지 78.9점 • GLM-5.1의 CLIcK: SK텔레콤 88.8점, LG 88.7점 • GLM-5.1의 KMMLU-Pro: SK텔레콤 76.5점, LG 75.8점 • 큐원3.5의 KMMLU-Pro: SK텔레콤 78.4점, LG 77.4점 전부 1점 안에서 수렴한다. 벤치마크의 재현성은 필자가 예상했던 것보다 훨씬 높았다. 그런데 딱 한 칸이 벌어진다. GLM-5.1의 HLE다. LG 리포트는 이 칸에 개발사 공식 발표치 31.0점을 인용해 넣었다. 같은 벤치마크를 SK텔레콤이 직접 측정하니 28.0점이 나왔다. 3.0점 차이고, 공식치가 높은 쪽이다. 정리하면 이렇다. 재측정끼리는 붙고, 공식 발표치와 재측정은 벌어진다. 벤치마크가 못 미더운 것이 아니라, 만든 쪽이 스스로 발표한 숫자가 못 미더운 것이다. 그리고 우리가 기사에서 읽는 숫자는 대부분 후자다. 측정 조건이 결과를 어떻게 만드는지는 두 리포트에 더 구체적으로 남아 있다. LG는 자사 모델의 HLE를 텍스트 전용 문항으로 측정하면서, 같은 표에 들어간 큐원3.5의 인용치는 전체 문항 기준이라고 각주에 밝혔다. 나란히 놓였지만 같은 시험지가 아니다. SK텔레콤은 큐원3.5-397B만 출력 상한이 6만5536토큰으로 묶였다고 적었다. 다른 모델은 최소 12만8000토큰이었고, 상한에 걸린 응답은 전부 오답 처리된다. 두 회사 모두 이 사실을 숨기지 않고 각주에 써뒀다. 문제는 표만 옮겨 실은 기사에 그 각주가 따라가지 않는다는 점이다. 데이터를 가르치는 입장에서 강조하고 싶은 지점이 여기다. 벤치마크 점수는 '측정값'이 아니라 '측정 설계의 산물'이다. 조건을 밝힌 점수는 놀라울 만큼 잘 재현되고, 조건이 사라진 점수는 비교 자체가 성립하지 않는다. 소수점 몇 점으로 국가대표를 가리는 보도가 위태로운 이유는 벤치마크가 부실해서가 아니다. 그 숫자가 어떤 조건에서 나왔는지가 보도 과정에서 빠지기 때문이다. 4. 세계는 이미 다른 것을 재고 있다 더 중요한 변화는 무엇을 재느냐가 바뀌었다는 사실이다. 앞서 인용한 아티피셜 애널리시스 지능지수는 현재 GDPval, τ³-뱅킹(tau3-Banking), 터미널벤치(Terminal-Bench) 2.1, 사이코드(SciCode), HLE, GPQA 다이아몬드 등으로 구성된다. 앞의 세 개가 핵심이다. GDPval은 실제 직업에서 수행되는 업무를 모델이 얼마나 완수하는지, τ³-뱅킹은 금융 업무 환경에서 도구를 쓰며 다단계 과업을 끝내는지, 터미널벤치는 실제 터미널에서 작업을 완료하는지를 본다. 요컨대 지수의 무게중심이 '얼마나 똑똑한가'에서 '얼마나 일을 끝내는가'로 옮겨 갔다. 이 축에서 국내 모델의 성적은 이렇다. K-엑사원 2.0은 τ³-뱅킹 14.2점, 터미널벤치 2.1에서 43.8점이다. 솔라 오픈 2는 τ³-뱅킹 19.6점, APEX-Agents 16.6점이고, 실제 직업 과업을 다루는 GDPval-AA v2에서는 ELO 1128점으로 비교 대상 여섯 모델 중 3위다. 1위인 딥시크 V4 플래시가 1187점이다. A.X K2는 웹 탐색 과제인 브라우즈컴프(BrowseComp)에서 9.3점으로, GLM-5.1(29.1점)과 차이가 크다. 한편 A.X K2가 리포트에 실은 에이전트 지표는 τ²-벤치 텔레콤 98.0점이다. 지수에 들어간 것은 τ³인데 보고된 것은 그 전작인 τ²다. 잘하는 것을 앞세우는 것 자체는 나무랄 일이 아니고, SK텔레콤은 이 항목이 아티피셜 애널리시스 측정치라고 표에 표시해 뒀다. 다만 어떤 시험지를 고르느냐가 이미 절반의 답이라는 점은 짚고 갈 필요가 있다. 반대로 에이전트 축에서 국내 모델이 앞선 지표도 하나 있다. 업스테이지의 한국어 사무 과업 벤치마크 Ko-GDPval에서 솔라 오픈 2는 86.8점으로, 6배 이상 큰 딥시크 V4 프로(86.9점)와 사실상 동률이다. 자체 개발 벤치마크라는 한계는 분명하지만, '한국어 실무'라는 좁은 정의 안에서는 실제로 통한다는 근거다. 네 모델이 자신 있게 앞세운 축을 정리하면 수학, 한국어 지식, 한국 문화·상식, 장문 맥락, 그리고 자체 개발한 안전성 벤치마크다. 실제로 A.X K2의 AIME26 97.1점, CLIcK 91.6점은 인상적인 숫자다. 그런데 국내 모델이 가장 강한 축과, 지금 시장이 값을 치르는 축이 서로 어긋나 있다. 기업이 AI에 예산을 쓰는 이유는 수학 문제를 잘 풀어서가 아니라 업무를 대신 끝내주기 때문이다. 물론 이 영역은 전 세계가 다 못한다. τ³-뱅킹에서 딥시크 V4 프로도 25.8점에 그친다. 아직 아무도 확실히 앞서지 않은 구간이라면, 후발주자가 좌표를 바꿀 수 있는 거의 유일한 구간이기도 하다. 5. 다운로드는 되는데, 서비스에는 없다 마지막으로 확산 문제를 보자. 여기서 필자의 예상이 한 번 빗나갔다. '국산 모델은 아무도 안 쓴다'는 것이 업계의 통념이다. 그런데 데이터가 그렇게 말하지 않는다. 1차 모델인 A.X K1은 허깅페이스에서 최근 한 달 3만938회 다운로드됐다. 같은 기간 키미 K2 씽킹이 4만4964회다. 자릿수가 같다. K-엑사원 2.0과 A.X K2는 아파치 2.0 라이선스로 공개돼 상업적 이용에 제약이 없다. 모티프 3는 현재 공개된 베타가 비상업·연구용 라이선스이지만, 회사는 최종 모델의 오픈소스 공개를 예고했다. 라이선스는 이미 핵심 문제가 아니다. 그런데도 우리는 실제 서비스에서 국산 모델을 만나지 못한다. 다운로드는 되는데 서비스에는 없다. 이 간극이 진짜 질문이다. 답은 다운로드라는 지표 자체에 있다. 다운로드는 개발자의 호기심을 재는 숫자지 채택을 재는 숫자가 아니다. 채택을 재려면 파생 모델이 몇 개 만들어졌는지, 서드파티 추론 제공자가 몇 곳이나 이 모델을 서빙하는지, 그리고 기업이 이 모델을 돌리려면 GPU 비용을 얼마나 감당해야 하는지를 봐야 한다. 마지막 항목은 특히 결정적이다. A.X K2는 FP8 기준 최소 646GB의 서빙 메모리를 요구한다고 리포트 표에 명시했다. H200 여덟 장 규모다. 반면 솔라 오픈 2는 총 250B로 그 3분의 1을 조금 넘고, 업스테이지는 모델 공개 당시 "GPU 두 장으로 구동 가능하다"고 밝혔다. 다만 이 수치는 기술 리포트가 아니라 발표 자료 기준이라는 점은 함께 적어둔다. 앞 절의 이야기가 여기서도 그대로 반복된다. 성능표에서는 몇 점 차이지만, 도입 결재 서류에서는 전혀 다른 이야기가 된다. 이 관점에서 보면 업스테이지가 솔라 오픈 2를 다음(Daum) 포털에 대화형 에이전트로 얹겠다고 밝힌 것은 성능 발표보다 중요한 뉴스다. 벤치마크 순위가 아니라 트래픽이 걸린 자리에 모델을 올리는 일이기 때문이다. 확산은 라이선스를 푸는 것이 아니라, 사람이 이미 모여 있는 화면에 모델을 밀어 넣는 것으로 시작된다. 마무리 이번 2차는 다른가. 다르다. 44점대 진입은 1차와 질적으로 구분되는 좌표이고, 국내에 프런티어급 모델을 설계·학습·안정화할 수 있는 엔지니어링 조직이 최소 네 곳 생겼다는 사실은 그 자체로 자산이다. A.X K2의 사전학습은 엔비디아 B200 512장으로 약 70일간 이뤄졌다. SK텔레콤이 한계 항목에서 그 제약 탓에 더 큰 컴퓨트로 학습된 동급 모델보다 성능이 다소 부족했다고 스스로 밝힌 대목은, 어떤 홍보 문구보다 신뢰가 간다. 다만 기대의 대상은 바꿔야 한다. '모델'이 아니라 '조직'에 기대하는 편이 정확하다. 모델은 6개월이면 낡지만 조직은 남는다. 그리고 정부가 다음 라운드에서 물어야 할 질문도 바뀌어야 한다. 200명의 국민평가단을 나흘간 투입한 이번 시도는 방법론적으로 허술한 구석이 있다. 절대평가 나흘로 무엇을 알 수 있느냐는 지적은 타당하다. 한 언론 보도에 따르면 정부 관계자가 블라인드 테스트를 적용하지 않은 이유로 "AI에 '너의 모델 이름은 뭐야'라고 물어보면 보통 AI가 답을 해버린다"는 현실적 제약을 들었다. 측정 설계가 그만큼 어렵다는 뜻이다. 그럼에도 방향은 옳다. 벤치마크 점수만으로는 더 이상 아무것도 설명되지 않기 때문이다. 같은 관계자가 밝힌 이번 평가의 취지, 즉 "비전문가 입장에서 자유롭게 써보고 이 모델이 써볼 만하다는 평가를 내리는 게 중요"하다는 문장은 그동안 독파모를 둘러싼 논의에서 나온 가장 정확한 문제 제기다. 3차 평가는 여기서 한 걸음 더 나가야 한다. "당신 모델은 몇 점입니까"가 아니라 "당신 모델을 지난달 몇 곳이 실제로 서빙했고, 몇 개의 파생 모델이 만들어졌습니까"를 물어야 한다. 앞서 확인했듯 남이 다시 잰 숫자는 재현되지만 스스로 발표한 숫자는 재현되지 않는다. 유통 기록은 그 점에서 점수보다 정직하다. 무엇을 재느냐가 결국 무엇을 만드느냐를 결정한다.

2026.08.10 19:25안광섭 컬럼니스트

정부, 독파모 2차 평가 돌입…"데이터·비용·활용성 검증 관건"

정부가 독자 인공지능(AI) 파운데이션 모델 프로젝트 2차 단계평가에 들어가면서 평가체계 전반을 정교화해야 한다는 목소리가 커지고 있다. 벤치마크 점수뿐 아니라 모델이 답하는 데 들어가는 토큰과 추론 시간·비용, 한국어 데이터 활용 능력, 산업 현장 적용 가능성까지 구체적으로 봐야 한다는 지적이다. 7일 IT 업계에 따르면 정부는 2차 평가에서도 벤치마크 평가와 전문가 평가, 사용자 평가 등 기존 단계평가 틀을 유지할 방침이다. 글로벌 주요 리더보드에 활용되는 벤치마크를 선정하고, 전문가 평가에서는 모델 독자성을 세분화해 검증하는 방안도 검토하고 있다. 업계에서는 초기 데이터와 학습 로그를 보유했는지, 개발 과정서 발생한 문제를 외부 기술에 의존하지 않고 자체적으로 해결할 수 있는지가 독자성 판단 핵심 기준이 될 것이란 분위기다. 이는 1차 평가 과정서 독자 모델 정의와 평가 기준을 둘러싼 논란을 줄이려는 조치다. 다만 2차 평가가 또다시 성능 점수 중심으로 흐를 경우 독파모 사업의 정책적 목표를 충분히 반영하기 어렵다고 보고 있다. 국가대표 AI 모델을 선정하는 사업인 만큼 한국어와 국내 제도·문화에 대한 이해도, 공공·산업 분야 활용 가능성까지 종합적으로 검증해야 한다는 주장이다. 익명을 요청한 AI 업계 관계자는 "벤치마크 평가도 단일 점수를 비교하는 기존 방식에서 벗어나야 한다"며 "최근 추론형 모델은 답을 생성하는 데 사용하는 토큰 수와 연산 시간, 비용에 따라 성능 차이가 벌어질 수 있다"고 설명했다. 이어 "같은 문제를 맞힌 모델이라도 한쪽이 수십 배 많은 토큰과 연산 자원을 사용했다면 실제 서비스 운영 비용은 달라질 수 있다"며 "최고 성능만 보면 앞선 모델이더라도 속도와 비용을 고려하면 산업 현장에서는 경쟁력이 낮을 수 있다"고 덧붙였다. 앞서 노엄 브라운 오픈AI 리서치 부문 부사장도 최근 열린 '글로벌 AI 프론티어 심포지엄 2026'에서 AI 모델 평가에 추론 자원을 별도로 반영해야 한다고 주장했다. 그는 "추론 자원은 안전성 평가와도 연결된다"며 "짧은 시간과 적은 비용으로 시험할 때 나타나지 않았던 도구 오용이나 공격적 행동이 모델에 더 많은 시간과 연산 자원을 제공했을 때 드러날 수 있다"고 지적했다. 업계에서는 국민이 모델을 직접 사용해 평가하는 사용자 평가의 취지에는 공감하면서도 세부 설계가 중요하다는 목소리가 나온다. 일반 이용자가 체감하는 품질을 반영할 수 있지만 평가단 구성과 질문 유형, 모델별 응답 조건이 통제되지 않으면 기술력보다 브랜드 인지도나 화면 구성 등이 결과에 영향을 줄 수 있다는 지적이다. 국민평가가 단순한 선호도 조사나 인기투표로 흐르지 않도록 해야 한다는 의견도 제기된다. 평가 참여자의 연령과 직업, AI 이용 경험을 고르게 구성하고 모델별로 동일한 질문과 응답 시간, 사용 환경을 적용해야 평가 결과의 대표성과 신뢰성을 확보할 수 있다는 설명이다. 사실 정확성과 환각 발생 여부, 유해 답변 차단, 보안성 등 일반 이용자가 판단하기 어려운 항목은 전문가 평가로 보완해야 한다는 목소리도 나온다. 국민평가는 편의성과 자연스러운 대화 능력, 한국어 표현력 등 체감 요소에 집중하고 안전성과 기술적 완성도는 별도로 검증해야 한다는 주장이다. "성능만큼 데이터 확보 중요…국민 평가에 전문가 의견 보완" 국내 데이터 확보·활용 역량도 독파모 2차 평가 핵심 과제로 떠오르고 있다. 국내 공공데이터를 얼마나 효과적으로 학습하고, 한국어 맥락에 맞는 답을 내놓는지도 관건이라는 설명이다. 실제 독파모 참여 기업들은 국가AI전략위원회와 간담회를 열고 데이터 확보 방안을 논의한 바 있다. LG AI연구원과 업스테이지는 국립중앙도서관 도서 데이터화와 학습 목적 저작물 활용을 위한 텍스트·데이터 마이닝(TDM) 면책 규정 마련을 요청했다. SK텔레콤은 정부 데이터 정제 체계 고도화와 한국어 평가 데이터셋 확대를 제안했다. 모티프테크놀로지스는 대규모 한국어 사전학습 데이터를 국가 차원에서 구축하고 정제·분류·후처리까지 지원해야 한다고 강조했다. 당시 임문영 전 국가AI전략위원회 부위원장은 "기업은 모델 개발에 그치지 않고 제조·금융·공공·의료 등 산업 현장에서 실제 서비스로 확장할 수 있는지도 함께 살펴야 한다"고 강조한 바 있다. 업계에서는 국민이 모델을 직접 사용해 평가하는 사용자 평가 취지엔 공감하면서도 세부 설계가 중요하다는 목소리가 나온다. 일반 이용자가 체감하는 품질을 반영할 수 있지만 평가단 구성과 질문 유형, 모델별 응답 조건이 통제되지 않으면 기술력보다 브랜드 인지도나 화면 구성 등이 결과에 영향을 줄 수 있다는 제언이다. 한 AI 업계 관계자는 "평가 참여자 연령과 직업, AI 이용 경험을 고르게 구성하고 모델별로 동일한 질문과 응답 시간, 사용 환경을 적용해야 평가 결과 대표성과 신뢰성을 확보할 수 있을 것"이라고 언급했다. 이어 "사실 정확성과 환각 발생 여부, 유해 답변 차단, 보안성 등 일반 이용자가 판단하기 어려운 항목은 전문가 평가로 보완해야 한다"며 "국민평가는 편의성과 자연스러운 대화 능력, 한국어 표현력 등 체감 요소에 집중하고 안전성과 기술적 완성도는 별도로 검증해야 할 것"이라고 덧붙였다.

2026.08.07 10:51김미정 기자

'AI 국가대표' 뒷받침하는 NHN클라우드…'팩토리X 서울' 가동

NHN클라우드가 대형 그래픽처리장치(GPU) 인프라를 바탕으로 국내 산·학·연 인공지능(AI) 생태계 활성화와 정부의 '독자 AI 파운데이션 모델(독파모)' 개발을 뒷받침한다. 서울 도심에 구축한 AI 데이터센터 'NHN 팩토리X 서울'을 기반으로 4개 독파모 정예팀에 고성능 컴퓨팅 자원을 공급하는 한편, 국가 AI 데이터센터 운영 경험을 토대로 자체 AI 인프라 사업 확대에도 속도를 낸다는 목표다. 이일준 NHN클라우드 기술사업부장은 지난 6일 서울 영등포구 팩토리X 서울 데이터센터 투어에서 "현재 단일 데이터센터 안에 구축된 GPU 자원으로는 이곳이 국내 최대 규모"라며 "대규모 수랭식 냉각 기반으로 자원을 안정적으로 운영 중"이라고 밝혔다. 팩토리X 서울은 과학기술정보통신부와 정보통신산업진흥원(NIPA)이 지난해 추진한 'AI 컴퓨팅자원 활용기반 강화 사업'을 통해 조성된 AI 인프라로 올해 4월 개소했다. NHN클라우드는 글로벌 자산운용사 액티스의 양평 데이터센터 일부를 임차해 GPU 인프라를 구축했다. 정부 사업을 통해 엔비디아 엔비디아 AI 가속기 B200 GPU 총 7656장을 구축했으며 향후 5년간 해당 인프라 운영을 맡는다. 이 가운데 정부 AI 컴퓨팅 자원은 팩토리X 서울 3~5층에서 운영된다. 3~4층에는 B200 GPU 4080장을 통합 단일 클러스터로 묶은 대규모 연산 환경이 구축됐다. 대규모 AI 모델을 학습할 때 수천 개의 GPU가 하나의 시스템처럼 동시에 연산할 수 있도록 구성한 것이 특징이다. 데이터센터 6층에선 NHN클라우드 자체 AI 클라우드 서비스와 GPU 인프라를 운영 중이다. 정부가 진행 중인 독파모 프로젝트 선정 4개 정예팀도 조만간 이곳의 GPU 자원을 활용할 예정이다. 독파모에 공급되는 자원은 팩토리X 서울 4~5층을 중심으로 배정될 예정으로, NHN클라우드는 정부가 정한 자원 배분 계획에 따라 인프라 운영과 공급을 지원한다. 구체적인 팀별 GPU 배정 규모는 공개되지 않았다. 이 사업부장은 "정부가 산업체와 학교, 연구소 등에 자원을 배정하면 우리는 이에 맞춰 GPU를 공급·운영하는 역할"며 "실제 자원이 어떤 연구나 업무에 사용되는지는 이용 기관이 결정하고 우리는 안정적으로 자원을 사용할 수 있도록 운영을 지원한다"고 설명했다. 독파모에 투입되는 GPU 역시 특정 팀이 계속 점유하는 구조는 아니다. 정부가 이용 기간을 정해 자원을 배분하고 해당 기간이 끝나면 다시 다른 기업이나 대학, 연구기관 등에 공급하는 방식이다. 기존 산·학·연에 공급되는 GPU 자원 역시 일정 기간을 정해 배정되고 있다. 대규모 GPU를 하나로 묶는 클러스터 구축 역량도 팩토리X 서울의 핵심이다. NHN클라우드는 3~4층에 구축한 4080장의 B200 GPU를 510개 노드로 연결해 하나의 클러스터를 구성했다. 회사는 해당 클러스터를 대상으로 고성능 컴퓨팅 성능 측정인 HPL 테스트를 진행했으며 이를 기반으로 글로벌 슈퍼컴퓨터 성능 순위 '톱500'에서도 20위에 등재됐다. NHN클라우드는 앞서 광주 국가 AI 데이터센터도 구축해 H100·A100 등 약 1000장의 GPU를 기반으로 AI 연구개발을 지원해 왔다. 광주 센터에서 확보한 GPU 운영 경험과 자사 판교 데이터센터의 고밀도 인프라 설계 경험을 팩토리X 서울 구축에 반영했다. 정부 프로젝트를 넘어 민간 영역으로도 사업을 확대 중이다. 올해 크래프톤을 대상으로 엔비디아 블랙웰 울트라 1000개 규모 인프라를 공급하며 현재 판교 데이터센터를 기반으로 서비스를 제공 중이다. 향후 추가 GPU 인프라 구축에도 나설 계획이다. 특히 팩토리X 서울에는 대규모 B200 운영을 위해 수랭식 냉각 시스템이 적용됐다. 고집적 GPU에서 발생하는 열을 냉각수를 이용해 직접 처리하는 방식으로, 기존 공랭식 대비 냉각에 필요한 에너지를 줄이면서 GPU를 안정적인 온도로 유지할 수 있다. NHN클라우드에 따르면 수랭식 시스템 도입으로 공랭식 대비 약 15~20%의 에너지 절감 효과를 확보했다. 이 사업부장은 "기존 광주 센터는 100% 공랭 방식인데 이를 운영한 경험과 이곳에서 수랭식을 몇 달간 운영한 경험을 비교하면 수랭식에서 장비 장애가 발생하는 비율이 매우 적다"며 "운영 사업자 입장에선 비용도 고려해야 하지만 고객이 사용하는 서비스의 장애를 줄이는 것이 더 중요하다"고 말했다. 최근 AI 컴퓨팅 수요가 빠르게 늘면서 NHN클라우드는 추가 인프라 확보 방안도 검토하고 있다. 팩토리X 서울에서 회사에 배정된 자체 활용 자원은 현재 대부분 고객에게 공급된 상태다. 광주 국가 AI 데이터센터 역시 사실상 모두 가동되고 있어 외부 데이터센터 활용과 자체 데이터센터 투자 가능성을 함께 살펴보는 상황이다. 다만 구체적인 투자 규모와 시기는 아직 정해지지 않았다. 이 사업부장은 "AI 인프라 수요는 앞으로도 늘어날 것으로 보고 있다"며 "현재 자체 자원의 장기계약을 추진하는 등 보유한 GPU 인프라를 안정적으로 운영하고 지속적인 수요에 대응할 계획"이라고 밝혔다. 이어 "외부에서 활용할 수 있는 데이터센터를 계속 알아보는 한편 자체적인 데이터센터 투자도 검토 중"이라고 덧붙였다.

2026.08.07 10:22한정호 기자

KG스틸, SKT 독자 AI모델로 설비 오류 대응 30% 줄였다

KG스틸 철강 공장에 적용된 SK텔레콤 독자 AI 파운데이션 모델 A.X K2가 현장 설비 오류를 해결하는 시간을 크게 단축해 생산성을 향상시키고 있다. A.X K2는 6880억 개 매개변수를 갖춘 초거대 언어 모델로, 뛰어난 추론 능력에 한국어 이용 AI 에이전트다. SK텔레콤과 KG스틸은 지난 6월 A.X K2 현장 실증을 위한 업무협약을 맺고, 현장 데이터를 모델에 학습시키며 답변 정확도와 신뢰도, 활용성을 검증하고 있다. KG스틸은 실증이 마무리되는 오는 10월, 보안 안정성과 데이터 활용성이 뛰어난 온프레미스 방식으로 AI 에이전트 정식 도입을 검토한다는 방침이다. 독자 AI 모델이 연구실 밖으로 나와 산업 현장에 본격 쓰이게 되는 셈이다. 분산된 과거 기록을 실시간 매칭...한국어 특화 AI로 생산성 향상 KG스틸 당진 공장에서 실증을 담당하는 정춘호 기술연구소 선행연구팀장은 A.X K2 특장점으로 오류 해결 시간 단축을 꼽았다. 철강 공정 과정에서 설비 오류가 발생했을 때 라인이 멈추는 비가동 시간이 최소화돼 전체 공정 생산성이 향상된다는 설명이다. 정 팀장은 “공장에선 철판을 받아와 칼국수 반죽처럼 더 얇게 미는 냉간 압연 공정과 철판 부식을 방지하기 위해 아연도금을 하거나 페인트를 바르는 색상 도정을 거치는 연속 공정이 이뤄진다”면서 “이 과정에서 한 라인이 멈추면 전체 공장의 생산성이 떨어지는 문제점이 있다. 기존엔 문제가 발생했을 때 개인 PC, 네트워크, 내부 결제 문서 등 분산된 과거 조치 기록을 사람이 직접 찾고 기억에 의존해야 했다”고 운을 뗐다. 이어 “A.X K2 에이전트는 현장 실무자가 문제 상황을 자연어로 질문하면, 설비 오류에서 어떤 부품이 기능에 이상이 있는지 실시간으로 과거 데이터와 비교해 과거 유사 사례와 매칭해 우선 순위별 점검 가이드를 제시한다”며 “이로 인해 설비 비가동 해결 조치에 소요되는 전체 시간이 크게 단축되고 있다. 평균적으로 약 30% 정도 줄일 수 있다”고 설명했다. 한국어 사용이 편리한 점도 A.X K2 강점으로 꼽았다. 정 팀장은 “제조 현장에서 사용되는 단어는 영어, 독일어, 일본어가 많다. 현장 작업자는 외국어도 한국식으로 발음해 대화하고 문제를 해결한다”며 “한국어에 특화된 AI 에이전트가 제조 현장에 더 적합하다는 생각이다”고 말했다. 정확도 검증부터...향후 숙련자 암묵지 데이터화 현재는 현장 실증 단계인 만큼 학습 데이터의 양을 무작정 늘리기보다 답변의 정확도와 신뢰도, 활용성을 검증하는 데 초점을 맞추고 있다. 검증된 기존 데이터셋을 중심으로 학습시켜 AI 에이전트가 사실과 다른 답변을 생성하는 할루시네이션을 최소화한다는 방침이다. 숙련 기술자가 보유한 기술과 노하우는 실증을 마치고 모델의 정확도를 확보한 뒤 학습시킬 계획이다. 검증되지 않은 데이터를 한꺼번에 학습시키면 오류가 발생했을 때 원인을 찾기 어렵고, 경우에 따라 처음부터 데이터 학습을 다시 진행해야 할 수 있기 때문이다. 정 팀장은 “정확도가 확보되지 않은 상태에서 학습량만 늘려 할루시네이션이 발생하면 다시 되돌리기 어렵다”며 “그렇게 되면 처음부터 데이터 학습을 다시 시작해야 하기 때문에 먼저 정확도를 확인한 뒤 데이터셋을 확대하는 작업을 진행할 것”이라고 말했다. 제조 현장에서는 숙련자의 기술과 노하우가 문서가 아닌 개인의 경험과 기억에 의존하는 암묵지 형태로 남아 있는 경우가 많다. 숙련자가 갑자기 퇴직하거나 은퇴하면 설비 운영과 문제 해결에 필요한 지식이 함께 사라질 수 있다는 우려가 나온다. 정 팀장은 “제조업에서는 숙련자의 노하우가 사람에게 의존하는 암묵지 형태로 남아 있고, 이들이 갑자기 은퇴하면 현장 지식이 단절될 수 있다”며 “실증이 끝나면 현장 기술자의 머릿속에 있는 암묵지와 개인용 컴퓨터에 저장된 노하우를 조사해 표준화·데이터화하고 AI 에이전트에 학습시킬 예정”이라고 밝혔다. 보안·속도 모두 잡는 온프레미스 방식 구축 추진 KG스틸은 높은 데이터 처리 능력, 보안성을 지닌 온프레미스 방식으로 AI 에이전트를 구축한다는 구상이다. 온프레미스는 회사가 클라우드를 빌려 쓰는 게 아니라, 사내 전산실이나 자체 보유한 서버 장비에 직접 소프트웨어와 시스템을 설치·운영하는 방식을 뜻한다. 정 팀장은 “제조 현장에 실시간 데이터들과 연동을 해서 에이전트가 돌아가야 되기 때문에 클라우드 서비스를 하면 무리가 있고, 보안상의 이슈로 제조업에선 적합하지 않다고 본다”며 “현재는 계획은 온프레미스로 구축을 하는 방향으로 하되, 사내 그룹웨어 등엔 클라우드를 사용할 계획이다”고 했다. 현장엔 A.X K2 기반 플래그십 모델의 기술적 역량을 바탕으로, 제조 현장에 필요한 응답 속도와 보안, 운영 효율을 함께 고려한 경량 모델이 사용된다. 정 팀장은 “온프레미스로 모델을 구축을 해야되는데 GPU가 더 많이 필요한 모델보다는 날렵하면서 무겁지 않은 모델이 훨씬 더 효율성이 높다”고 말했다. 정 팀장은 비용 효율성과 데이터 보안 안정성을 갖춘 A.X K2를 통해 미국 빅테크 기술에 대한 종속과 중국 AI 모델의 보안 우려도 줄일 수 있다고 강조했다. 제조 공정을 제어하는 산업용 컴퓨터부터 설비 운영체제까지 외산 장비가 많은 상황에서 판단과 제어를 담당하는 AI 모델마저 해외 기업에 의존하면 비용과 기술 종속 문제가 더욱 커질 수 있다는 지적이다. 그는 “제조업은 공정 자동제어에 사용되는 산업용 컴퓨터부터 설비를 운영하는 운영체제까지 외산 장비가 많다”며 “설비를 제어하거나 판단하는 AI 모델까지 챗GPT나 제미나이 같은 미국 빅테크 기업의 AI 에이전트 기술에 종속되면 모든 과정을 외부에 의존할 수밖에 없고 비용 부담도 커진다”고 말했다. 이어 “중국 딥시크 계열의 AI 모델은 저렴하지만 데이터 보안 측면에서 불안한 부분이 있다”며 “SK텔레콤의 A.X K2는 비용이 합리적이면서 내부 데이터의 보안 안정성도 확보할 수 있다”고 밝혔다. 기피 업무 에이전트화...향후 자율제조·피지컬 AI 운영에도 적용 KG스틸은 AI 에이전트 도입에 대한 현장 직원들의 거부감을 줄이기 위해 충분한 공감대를 형성하며 적용 범위를 순차적으로 확대할 계획이다. AI 에이전트가 단순히 인력을 대체하는 기술로 인식되지 않도록 직원들이 꺼리는 업무를 우선 맡기는 방향을 검토하고 있다. 정 팀장은 “모든 직원에게 AI 에이전트를 도입한다고 해서 한순간에 변화가 나타나지는 않을 것이며 어느 정도 시간이 필요할 것”이라며 “AI 에이전트가 단순한 인력 대체 수단으로 오해받지 않도록 AI와 공존하면서 더 많고 좋은 일을 함께 만들 수 있다는 공감대를 형성하는 것이 우선”이라고 말했다. 이어 “직원들이 기피하는 업무부터 에이전트화하는 방향을 계획하고 있다”며 “현장의 필요와 구성원들의 의견을 반영하면서 적용 범위를 단계적으로 넓혀갈 것”이라고 설명했다. 10월 실증이 마무리되면 KG스틸은 A.X K2의 구축 방식과 구체적인 활용처를 확정할 예정이다. 회사는 현재 설비 단계에서 자율 제조를 위한 AI를 적용하고 있으며, 다이 공정에서는 피지컬 AI 도입을 실증하고 있다. 향후 A.X K2를 설비 오류 해결뿐 아니라 자율 제조와 피지컬 AI 운영에도 활용한다는 구상이다. 정 팀장은 “자율 제조와 피지컬 AI를 운영하려면 작업 지시를 내리거나 설정값을 입력할 때 단위 설비별로 분산된 시스템을 하나의 흐름으로 묶는 통합 제어가 이뤄져야 한다”며 “이러한 통합 제어 과정에서 AI 에이전트가 중요한 역할을 하게 될 것”이라고 말했다.

2026.08.06 09:41홍지후 기자

업스테이지, 하반기 AI 모델 2연타…상용 시장 공략 속도

업스테이지가 '솔라 프로4'를 선보이며 하반기 자체 인공지능(AI) 모델 라인업 확대에 나선다. 지난달 오픈웨이트 모델 '솔라 오픈2'를 공개한 데 이어 상용 거대언어모델(LLM)까지 선보이며 기업·개발자 시장 공략에 박차를 가하고 있다. 5일 업계에 따르면 업스테이지는 오는 6일 솔라 프로4 API를 공개한다. 지난달 공개한 솔라 오픈2 API 클로즈드 베타 서비스는 지난 3일 종료됐다. 기존 베타 참여자는 모델명을 솔라 프로4로 변경해 새로운 모델을 이용할 수 있다. 솔라 오픈2는 이달 2차 평가에 돌입하는 과학기술정보통신부 '독자 AI 파운데이션 모델(독파모)' 프로젝트를 통해 개발된 모델이다. 업스테이지는 모델 가중치를 공개하는 한편 개발자들이 직접 성능을 체험할 수 있도록 API 베타를 한시적으로 운영해왔다. 솔라 프로4는 독파모 사업과 별개로 업스테이지의 상용 모델 라인업인 '솔라 프로' 시리즈의 최신 모델이다. 지난 3월 공개한 '솔라 프로3'의 후속 모델로, 실제 업무 환경에서의 활용성을 높인 것이 특징이다. 김성훈 업스테이지 대표는 자신의 페이스북을 통해 "솔라 프로4는 문서 작업과 터미널 수행, 멀티턴 도구 사용에서 솔라 오픈2 대비 20~30% 성능이 향상됐다"며 "작은 사이즈지만 쓸 만한 좋은 모델"이라고 소개했다. 솔라 프로4는 데스크톱 AI 에이전트 '룸(Loom)'에도 기본 모델로 탑재됐다. 룸은 PC 내 업무 폴더를 기반으로 여러 문서와 엑셀, PDF 등을 동시에 읽고 실제 업무 결과물을 생성하는 AI 에이전트다. 업스테이지는 이용자들이 룸을 통해 프로4를 먼저 체험할 수 있도록 했다. 이달까지 룸에서 솔라 프로4가 무료 제공된다. 업스테이지는 지난 6월 업스테이지 컴퍼니 출범 기념 미디어데이에서 같은 달 말 '솔라 오픈2' 프리뷰를 공개하고 7월 말에는 '솔라 프로4'를 출시하겠다는 계획을 밝혔다. 이후 솔라 오픈2 공개와 API 클로즈드 베타를 거쳐 이번 솔라 프로4 API 공개로 후속 일정을 이어가게 됐다. 업스테이지 관계자는 "솔라 오픈2 API는 오픈웨이트 모델을 누구나 체험할 수 있도록 한 클로즈드 베타 서비스"라며 "상용 모델인 솔라 프로4가 출시되면서 정식 API는 프로 라인업으로 제공하게 됐다"고 말했다.

2026.08.05 11:25이나연 기자

개방형 국산 AI 출격…국가대표 4사4색 전략은

국가대표 인공지능(AI) 개발사들이 차세대 오픈웨이트(가중치 개방형) 모델을 잇달아 공개하며 본격적인 확산 경쟁에 돌입했다. 4일 업계에 따르면 모티프테크놀로지스, 업스테이지, SK텔레콤, LG AI연구원은 과학기술정보통신부가 추진하는 '독자 AI 파운데이션 모델(독파모)' 사업 2차 평가용 모델을 세계 최대 AI 오픈소스 플랫폼 허깅페이스에 차례로 공개했다. 1차 평가 이후 합류해 최종 버전이 아닌 프리뷰(베타) 모델을 선공개한 모티프테크놀로지스를 제외하면 나머지 3개 팀 모두 올해 초 1차 평가 당시 공개했던 초기 모델보다 성능을 높인 버전들이다. 정부는 이렇게 개발된 모델을 전 국민의 AI 문해력을 키우고 국산 모델 사용 기반을 확대하는 '모두의 AI' 사업에 활용한다는 계획이다. 체급부터 효율까지…같은 목표, 다른 해법 이번 공개는 단순한 모델 업데이트를 넘어 각 기업이 내세우는 독자 AI 개발 방향을 구체화했다는 점에서 의미가 있다. 1차 평가를 통과한 LG AI연구원과 SK텔레콤, 업스테이지는 각각 체급 확대와 산업 적용, 효율성 강화에 초점을 맞췄다. 올해 새롭게 합류한 모티프테크놀로지스는 독자 설계 기반 모델을 앞세워 경쟁에 뛰어들었다. LG AI연구원은 직전 모델보다 3배 이상 몸집을 키워 4개 팀 가운데 가장 큰 규모를 갖췄다. 기존 K-엑사원 가중치를 재활용하는 업사이클링 방식으로 'K-엑사원 2.0'을 7500억 개(750B) 매개변수(파라미터) 규모까지 키우면서다. 학습 비용을 줄이면서도 성능을 끌어올렸고 라이선스도 아파치 2.0으로 전환해 상업적 활용 범위를 넓혔다. SK텔레콤은 6880억 개(688B) 매개변수 규모 '에이닷 엑스 케이투(A.X K2)'를 공개하며 장문 추론과 에이전트 성능을 강화했다. 향후 조(兆) 단위 모델과 비전·음성 모델까지 확장하는 로드맵도 함께 제시했다. 라이선스 역시 아파치 2.0을 적용해 누구나 수정과 상업적 활용이 가능하도록 개방했다. 올해 합류한 모티프테크놀로지스는 자체 개발한 3140억 개(314B) 매개변수 규모 전문가혼합(MoE) 모델 '모티프3'를 선보였다. 프리뷰 모델은 글로벌 AI 평가기관 아티피셜 애널리시스 인텔리전스 지수(AAII)에서 44점을 기록했다. 정식 버전에는 MIT 라이선스를 적용해 상업적 이용 제한 없이 공개할 예정이다. 업스테이지는 2500억 개(250B) 매개변수 규모 '솔라 오픈 2'를 통해 효율성을 앞세웠다. MoE 구조를 기반으로 에이전트 성능과 한국어 경쟁력을 높였고 최대 100만 토큰 문맥 처리 능력을 구현했다. 특히 기업이 자체 인프라에서도 비용 부담을 줄여 활용할 수 있도록 설계했다. '잘 만든 AI'보다 '많이 쓰는 AI'로 독파모 프로젝트도 모델 성능뿐 아니라 개방성과 실제 활용성을 함께 평가하는 단계에 접어들었다. 초기에는 독자 모델 개발과 성능 확보가 핵심이었다면 이제 산업 적용과 생태계 확산 역량의 비중이 커지고 있다. 이에 맞춰 기업들도 서로 다른 모델 확산 및 서비스 전략을 내놓고 있다. 업스테이지는 올 상반기 인수한 포털 다음과 AI 에이전트 플랫폼을 기반으로 서비스 적용을 확대하고 있다. LG AI연구원은 공공 서비스 적용 경험을 바탕으로 대국민 체험 서비스를 준비 중이다. SK텔레콤은 제조·국방·바이오 등 산업 현장 실증과 '모두의 AI' 참여를 추진하고 있으며 모티프테크놀로지스는 금융·회계 분야 협력사를 중심으로 초기 상용 레퍼런스를 확보하는 데 집중하고 있다. 글로벌 경쟁 역시 치열해지고 있다. 오픈웨이트 모델이 AI 산업의 새로운 축으로 자리 잡으면서 개발자 생태계 확보 경쟁도 본격화되는 모습이다. 중국에서는 딥시크와 알리바바, 문샷AI, Z.AI(옛 지푸) 등이 공격적으로 오픈웨이트 모델을 공개하며 생태계를 넓히고 있다. 미국도 메타를 비롯해 구글, 오픈AI 등이 오픈웨이트 모델을 확대하며 전략을 다변화하고 있다. 모델 경쟁력의 기준도 단순 벤치마크 점수보다 얼마나 많은 개발자와 기업이 실제 활용하느냐로 옮겨가는 분위기다. 업계 관계자는 "2차 평가는 모델 성능뿐 아니라 실제 활용성과 생태계 확장 가능성이 중요한 평가 요소"라며 "결국 산업 현장에서 선택받고 개발자들이 지속적으로 활용하는 모델이 경쟁력을 갖게 될 것"이라고 말했다.

2026.08.04 10:25이나연 기자

"제조부터 국방까지"…SKT, '일하는 AI' 확산 시동

SK텔레콤이 독자 AI 파운데이션 모델 'A.X K2'를 공개하고 제조와 국방, 바이오 등 산업 현장 공략에 본격 나선다. AI로 단순 질의응답을 넘어 스스로 계획을 세우고 도구를 활용해 업무를 수행하는 '에이전틱 AI'를 구현하고, 이를 기반으로 한국형 소버린 AI 생태계를 구축하겠다는 전략이다. 김태윤 SK텔레콤 파운데이션모델담당은 4일 회사 뉴스룸 인터뷰에서 “A.X K2의 가장 큰 변화는 '답하는 AI'에서 '스스로 계획하고 실행하는 AI'로 진화한 것”이라며 “에이전틱 시대에 맞춰 추론 능력을 크게 강화했고 특히 수학과 한국어 영역에서 의미 있는 성과를 냈다”고 밝혔다. A.X K2, 문맥 제대로 알아듣는다 A.X K2는 총 6880억 개 매개변수를 갖춘 초거대언어모델(LLM)이다. 추론 과정에서는 330억 개(33B)의 매개변수만 활성화하는 MoE 구조를 적용해 모델 규모를 키우면서도 추론 비용은 기존 수준으로 유지했다. 매개변수를 늘리며 성능은 크게 향상됐다. 국내외 14개 벤치마크 평균 성능은 A.X K1 대비 32.2%p 높아졌고, 장문 이해와 AI 에이전트 관련 평가에서는 83.9%p 개선됐다. 초고난도 수학 벤치마크 'Apex' 점수는 1.0에서 45.8로 상승했으며, AIME26에서는 97.1점을 기록했다. 또 한국어 지식 평가(KMMLU-Pro)는 80.5점, 한국 문화 이해(CLIcK)는 91.6점을 기록했고, 통신 분야 에이전트 도구 활용 능력을 평가하는 τ²-Bench Telecom에서는 오픈웨이트 모델 가운데 최고 성능을 기록했다. 핵심 기술은 SK텔레콤이 자체 개발한 SGA(Sparse Gated Attention)다. AI 에이전트는 여러 차례 대화와 도구 호출, 긴 문서 참조를 반복하기 때문에 긴 문맥을 얼마나 효율적으로 처리하느냐가 중요하다. SGA는 이러한 환경에 최적화된 구조로, 입력 길이가 길어질수록 처리 속도와 안정성이 향상된다. 120K 토큰 입력 기준으로는 A.X K1 대비 토큰 처리량이 67.7% 개선됐다. “일하는 AI”...산업 국방 현장 적용 본격화 SK텔레콤은 텍스트 모델뿐 아니라 비전언어모델(VLM)과 오디오 음성 모델도 함께 선보였다. 제조 도면과 문서, 차트 등을 이해하는 'A.X K2 VL'과 상담·회의 음성을 분석하는 'A.X K2 ALM', 크래프톤과 공동 개발한 음성 모델 'A.X K2 라온스피치' 등을 통해 산업 현장에서 필요한 멀티모달 AI를 구현한다는 계획이다. 이에 따라 산업 현장 적용도 본격화하고 있다. 회사는 KG스틸, 자동차 부품업체 코넥과 함께 제조 특화 AI 에이전트를 실증하고 있다. 생산 라인의 과거 불량 사례를 학습한 AI가 불량 원인을 분석하고 조치 방안을 제안하는 방식이다. SK하이닉스에는 사내 AI 서비스 'LLM Chat'에 경량 모델을 적용해 반도체 지식 검색과 정보 정리 등을 지원하고 있다. 국방 분야도 주요 적용처다. SK텔레콤은 국방부에 A.X K1을 FP8·FP4·INT4 형태로 양자화해 공급했으며, A.X K2도 온프레미스 기반 폐쇄망 환경에서 제공할 계획이다. 민감한 데이터는 외부 학습에 활용하지 않고 기관 내부에서만 학습하도록 해 보안성을 확보했다. 해외 오픈소스 모델과 비교했을 때 A.X K2 경쟁력으로 ▲한국어와 국내 산업 환경에 최적화된 성능 ▲데이터 주권과 보안 ▲개방성을 꼽혔다. 김 담당은 “국내 업무 환경에서는 언어뿐 아니라 제도와 문화적 맥락을 이해하는 것이 중요하다”며 “국내 기업과 공공기관이 안심하고 활용할 수 있는 소버린 AI를 구현하는 것이 목표”라고 설명했다. 조 단위 매개변수 모델로 확장, 국산 NPU 적용 SK텔레콤은 A.X K2를 허깅페이스에 Apache 2.0 라이선스로 공개하고 API도 제공할 예정이다. 스타트업 액셀러레이팅 프로그램 '스케치 with AI'와 '모두의 챌린지 AX-LLM' 등을 통해 개발자와 스타트업이 상업적으로 자유롭게 활용할 수 있는 생태계도 확대한다. 향후에는 조(兆) 단위 매개변수를 갖춘 차세대 모델 개발도 추진한다. 먼저 정부 GPU 인프라와 자체 투자를 기반으로 모델 규모를 확대하는 동시에 에이전틱 강화학습과 사이버보안 역량을 고도화한다. 서울대, KAIST, 크래프톤 등과 차세대 아키텍처 연구도 병행한다. 컨소시엄 참여사인 리벨리온과는 국산 NPU 기반 모델 서빙 최적화와 상용 서비스 실증을 강화할 계획이다. 김 담당은 “A.X K2는 한국이 설계부터 학습까지 자체 기술로 개발한 AI 모델이 글로벌 최고 수준에 도달할 수 있다는 가능성을 보여준 사례”라며 “개방과 협력을 통해 국내 AI 생태계의 기반을 만들고 산업 현장과 국민이 체감할 수 있는 AI 서비스를 확대해 나가겠다”고 말했다.

2026.08.04 09:38박수형 기자

국가대표 AI 2차 선발 돌입…4개 팀, 이달 3팀으로

국가대표 인공지능(AI)을 선발하는 '독자 AI 파운데이션 모델 프로젝트(독파모)'의 2차 평가 결과가 이르면 오는 12일 전후로 나올 전망이다. 4개 개발팀이 최종 모델 개발을 마치면서 국민평가와 전문가 심사가 코앞으로 다가온 가운데, 4개 팀 중 3개 팀이 2차 관문을 통과하게 된다. 3일 업계에 따르면 모티프테크놀로지스는 오는 4일 과학기술정보통신부와 정보통신산업진흥원(NIPA)에 최종 AI 모델 '모티프 3'와 성과보고서를 제출한다. 앞서 LG AI연구원과 SK텔레콤, 업스테이지가 최종 모델을 제출한 데 이어 모티프테크놀로지스까지 개발을 완료하면서 2차 평가에 참여하는 4개 팀의 준비가 모두 마무리됐다. 정부는 오는 8일부터 11일까지 일반 국민 200명으로 구성된 국민평가단을 운영한다. 성별과 연령별 비율을 고려해 선발된 평가단은 4개 팀의 AI 모델을 직접 사용한 뒤, 절대평가 방식으로 점수를 부여한다. 국민평가 결과는 기존 벤치마크 평가와 전문가 평가 점수와 합산돼 2차 평가에 반영된다. 이번 평가는 실제 산업 현장과 서비스에서 활용 가능한 실증 기술과 활용성이 핵심 평가 요소로 꼽힌다. 각 개발팀도 서비스 적용 사례 확대에 집중하고 있다. SK텔레콤은 '에이닷엑스 케이투(A.X K2)'를 공개하며 장문 이해와 AI 에이전트 성능을 강화했다. LG AI연구원은 'K-엑사원(K-EXAONE) 2.0'을 포털 줌(ZUM)의 AI 검색과 제조 현장에 적용했다. 업스테이지는 '솔라 오픈2'를 포털 다음과 금융·제조 분야에 적용하고 있으며 모티프테크놀로지스는 '모티프 3'를 앞세워 글로벌 AI 평가에서 개방형 모델 경쟁력을 입증했다. 정부는 이번 2차 평가를 통해 4개 팀 가운데 3개 팀을 선발한 뒤 후속 평가를 거쳐 최종 2팀을 선정할 계획이다. 배경훈 부총리 겸 과학기술정보통신부 장관은 지난달 대통령 업무보고에서 "8월 AI 모델 2차 평가 결과가 나오면 기존 3위를 넘어 2위권에도 도전해 볼 수 있을 것으로 기대한다"고 밝혔다.

2026.08.03 16:43이나연 기자

[AI는 지금] LG, 더 크게 진화한 'K-엑사원'…확산 속도전

LG AI연구원이 국내 최대인 750B(7500억 개) 파라미터 규모 거대언어모델(LLM)을 오픈웨이트로 공개하며 소버린(주권) 인공지능(AI) 경쟁력 확보에 나섰다. 처음부터 다시 학습시키는 대신 전작의 가중치를 확장해 재사용하는 업사이클링 방식으로 몸집을 키웠다. LG AI연구원은 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모) 프로젝트' 2차수 모델인 'K-엑사원(K-EXAONE) 2.0'를 허깅페이스에 31일 공개했다. 라이선스는 상업적 이용까지 가능한 아파치 2.0으로 전환해 개방성을 높였다. 적은 자원으로 몸집 3배 불렸다…전작 대비 성능 10%↑ K-엑사원 2.0 테크 리포트에 따르면 이 모델은 처음부터 새로 학습시키지 않고 전작 K-엑사원의 가중치를 재사용해 구조를 확장하는 '업사이클링' 방식으로 개발됐다. LLM을 처음부터 학습시키면 이전 모델에 투입된 연산과 데이터, 학습 노하우를 모두 버리게 된다. LG AI연구원은 이를 그대로 이어받으면서 총 파라미터를 236B에서 750B로, 실제 작업 시 활성화되는 파라미터를 23B에서 37B로 늘렸다. 이 전략 덕분에 처음부터 다시 학습시키는 것보다 적은 자원으로 레이어를 48개에서 78개로, 레이어당 전문가 수를 128개에서 256개로 확장할 수 있었다는 설명이다. 종합 성능도 전작 대비 뚜렷한 향상을 보였다. LG AI연구원에 따르면 K-엑사원 2.0은 독파모 성능 평가 반영 항목을 포함한 9개 영역 24개 벤치마크에서 평균 70.1점을 기록해 전작(63.3점)보다 10% 이상 높은 성능을 냈다. 코딩·에이전틱 코딩 영역 주요 지표 3개 평균은 30% 상승했다. 장문 문맥 이해 평가(OpenAI-MRCR·Ko-LongBench)에서 GLM-5.1을 웃돌았고, 에이전틱 툴 사용 능력 평가(Tau3-Bench Banking)에서는 GLM-5.1과 큐원3.5를 모두 앞섰다. 지원 언어는 한국어·영어·스페인어·독일어·일어·베트남어 등 6개에 프랑스어·이탈리아어·포르투갈어·폴란드어를 더해 10개로 확장했다. LG AI연구원 관계자는 "국내 AI 파운데이션 모델 중 가장 많은 언어를 지원하는 것"이라며 "소버린 AI가 국내를 넘어 글로벌 시장까지 공략하는 발판을 마련했다"고 말했다. 엑사원, 정부 대국민 서비스 탑재…안전성 기준도 자체 확장 K-엑사원 2.0에 앞선 엑사원 계열 모델은 이미 정부기관의 대국민 서비스에 투입돼 가동 중이다. 비전언어모델(VLM) '엑사원 4.5'는 지난 4월 공개돼 행정안전부 'AI 안전신문고'의 분석 엔진으로 채택돼 하루 3만 9000건 이상의 안전 신고를 처리하고 있다. 식품의약품안전처의 '신약 심사 AI'에도 탑재돼 신약 허가 심사 기간 단축에 쓰이고 있다. LG AI연구원은 K-엑사원 2.0도 이 같은 실사용 궤도에 올리기 위한 준비를 진행하고 있다. 독파모 2차 심사 기간 실사용성 평가를 위한 대국민 평가 사이트 개발을 마무리하고 있다. 향후 전 국민이 K-엑사원 2.0을 직접 체험할 수 있는 서비스도 준비 중이다. 성능 못지않게 안전성 기준 자체를 확장하는 데도 공을 들였다. LG AI연구원은 유네스코 아시아태평양 국제이해교육원(APCEIU)과 협력해 세계시민교육 인증을 받은 교사 46명으로 구성된 자문위원회를 운영했다. 이들의 검토를 거쳐 기존 위험 영역 100여 개 판단 기준을 보완하고 70개를 새로 추가했다. 이에 따라 자체 안전성 분류체계인 'K-AUT'의 위험 영역은 226개에서 296개로 늘었다. 임우형 LG AI연구원 공동 연구원장은 "K-엑사원 2.0 성능은 완성된 결과가 아니라 글로벌 프런티어 스케일 모델의 잠재력을 본격적으로 끌어내기 위한 출발점"이라며 "데이터 품질 고도화와 후속 학습, 강화 학습, 추론 기술을 정교화해 K-엑사원 성능을 완성하겠다"고 강조했다.

2026.07.31 15:53이나연 기자

LG AI연구원, 국내 최대 AI 모델 'K-엑사원 2.0' 공개

LG AI연구원이 국내 최대 규모 인공지능(AI) 모델을 공개하며 독자 AI 생태계 확대에 속도를 낸다. LG AI연구원이 과학기술정보통신부 주관 '독자 AI 파운데이션 모델(독파모) 프로젝트' 2차수 모델인 'K-엑사원(K-EXAONE) 2.0'를 오픈소스 커뮤니티 허깅 페이스에 31일 공개했다. K-엑사원 2.0은 국내 최대인 750B(7500억 개) 파라미터 규모의 모델로 1차수 모델(236B) 대비 크기가 3배 이상 커졌다. 모델 라이선스 정책도 누구나 상업적 이용까지 가능한 아파치 2.0으로 전환하며 개방성을 높였다. LG AI연구원이 진행한 9개 영역 24개 벤치마크 평가에 따르면 K-엑사원 2.0은 평균 70.1점을 기록해 1차수 모델(63.3점)보다 10% 이상 높은 성능을 달성했다. 특히 코딩과 에이전틱 코딩 영역 주요 지표 3개의 평균 성능이 30% 상승했다. 장문 문맥 이해 평가, 에이전틱, 지시 이행 등 주요 영역에서 글로벌 선도 모델과 비교해 높거나 대등한 성능도 기록했다. K-엑사원 2.0은 장문 문맥 이해 영역에서 글로벌 장문 이해 능력 평가(OpenAI-MRCR)와 한국어 장문 이해 능력 평가(Ko-LongBench)에서 각각 94.4점과 89.6점을 달성했다. 이는 중국 지푸의 GLM-5.1(71.5점, 83.6점) 대비 높은 점수다. 주요 지표 3개(OpenAI-MRCR, AA-LCR, Ko-LongBench) 평균 점수 역시 10% 이상 앞섰다. 에이전틱 툴 사용 능력 평가(Tau3-Bench Banking)에서는 14.2점으로 GLM-5.1(11.5점), 큐원3.5(13.4점) 보다 우수한 결과를 냈다. 지시 이행 영역 평가(IFeval, IFBench)에서도 GLM-5.1, 딥시크 V4 프로 맥스, 큐원 3.5 등에 견주는 성능을 기록했다는 설명이다. K-엑사원 2.0은 직전 모델 대비 언어를 확장하며 국내 AI 파운데이션 모델 중 가장 많은 언어를 지원하게 됐다. 기존 한국어, 영어, 스페인어, 독일어, 일어, 베트남어에 프랑스어, 이탈리아어, 포르투갈어, 폴란드어를 추가한 총 10개 언어를 제공한다. 국내 특수성과 글로벌 윤리 기준을 준수하는 안정성을 높이는 데도 주력했다. K-엑사원 2.0은 한국의 특수성과 글로벌 윤리 기준 준수 평가(KGC-Safety), 지정학적 맥락 판단과 관련된 안정성 평가(ROK-Fortress)에서 평균 94.6점을 달성했다. GLM-5.1(71.3점), 딥시크 V4 프로 맥스(65.2점), 큐원3.5(89점)와 비교해 높은 안정성을 보였다. LG AI연구원은 다음 주 새로운 산업 특화 AI 파운데이션 모델을 추가로 공개하며 산업 현장과 일상을 혁신하는 '전문가 AI' 포트폴리오를 강화할 계획이다. 임우형 LG AI연구원 공동 연구원장은 "K-엑사원 2.0은 단순히 파라미터 수가 큰 모델이 아니라, 국내 연구진이 750B급 모델 설계부터 데이터 학습, 분산 학습, 추론 환경 구축까지 전 과정을 독자적으로 완수했다는 데 의미가 있다"며 "독자 AI 파운데이션 모델 프로젝트의 핵심 목표인 글로벌 프런티어 모델과 같은 체급에서 경쟁할 수 있는 역량을 확보한 것"이라고 말했다. 이어 "현재 성능은 완성된 결과가 아니라 글로벌 프런티어 스케일 모델의 잠재력을 본격적으로 끌어내기 위한 출발점"이라며 "데이터 품질 고도화와 후속 학습, 강화 학습, 추론 기술을 정교화해 K-엑사원 성능을 완성하겠다"고 부연했다.

2026.07.31 10:24이나연 기자

  Prev 1 2 3 4 5 6 7 8 9 Next  

지금 뜨는 기사

이시각 헤드라인

삼성전자, P5 첫 양산라인 구축 속도…장비 도입 내년 2분기로 앞당겨

AMD "BOE와 컴퓨팅·디스플레이 경험 함께 혁신"

퀄컴·삼성, '폰·워치·글래스' 삼각편대 구축…'하이브리드 AI' 생태계 연다

하정우 부위원장, AI 현장 소리 직접 듣는다…정책 토크쇼 개최

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.