정부, 독파모 2차 평가 돌입…"데이터·비용·활용성 검증 관건"
정부가 독자 인공지능(AI) 파운데이션 모델 프로젝트 2차 단계평가에 들어가면서 평가체계 전반을 정교화해야 한다는 목소리가 커지고 있다. 벤치마크 점수뿐 아니라 모델이 답하는 데 들어가는 토큰과 추론 시간·비용, 한국어 데이터 활용 능력, 산업 현장 적용 가능성까지 구체적으로 봐야 한다는 지적이다. 7일 IT 업계에 따르면 정부는 2차 평가에서도 벤치마크 평가와 전문가 평가, 사용자 평가 등 기존 단계평가 틀을 유지할 방침이다. 글로벌 주요 리더보드에 활용되는 벤치마크를 선정하고, 전문가 평가에서는 모델 독자성을 세분화해 검증하는 방안도 검토하고 있다. 업계에서는 초기 데이터와 학습 로그를 보유했는지, 개발 과정서 발생한 문제를 외부 기술에 의존하지 않고 자체적으로 해결할 수 있는지가 독자성 판단 핵심 기준이 될 것이란 분위기다. 이는 1차 평가 과정서 독자 모델 정의와 평가 기준을 둘러싼 논란을 줄이려는 조치다. 다만 2차 평가가 또다시 성능 점수 중심으로 흐를 경우 독파모 사업의 정책적 목표를 충분히 반영하기 어렵다고 보고 있다. 국가대표 AI 모델을 선정하는 사업인 만큼 한국어와 국내 제도·문화에 대한 이해도, 공공·산업 분야 활용 가능성까지 종합적으로 검증해야 한다는 주장이다. 익명을 요청한 AI 업계 관계자는 "벤치마크 평가도 단일 점수를 비교하는 기존 방식에서 벗어나야 한다"며 "최근 추론형 모델은 답을 생성하는 데 사용하는 토큰 수와 연산 시간, 비용에 따라 성능 차이가 벌어질 수 있다"고 설명했다. 이어 "같은 문제를 맞힌 모델이라도 한쪽이 수십 배 많은 토큰과 연산 자원을 사용했다면 실제 서비스 운영 비용은 달라질 수 있다"며 "최고 성능만 보면 앞선 모델이더라도 속도와 비용을 고려하면 산업 현장에서는 경쟁력이 낮을 수 있다"고 덧붙였다. 앞서 노엄 브라운 오픈AI 리서치 부문 부사장도 최근 열린 '글로벌 AI 프론티어 심포지엄 2026'에서 AI 모델 평가에 추론 자원을 별도로 반영해야 한다고 주장했다. 그는 "추론 자원은 안전성 평가와도 연결된다"며 "짧은 시간과 적은 비용으로 시험할 때 나타나지 않았던 도구 오용이나 공격적 행동이 모델에 더 많은 시간과 연산 자원을 제공했을 때 드러날 수 있다"고 지적했다. 업계에서는 국민이 모델을 직접 사용해 평가하는 사용자 평가의 취지에는 공감하면서도 세부 설계가 중요하다는 목소리가 나온다. 일반 이용자가 체감하는 품질을 반영할 수 있지만 평가단 구성과 질문 유형, 모델별 응답 조건이 통제되지 않으면 기술력보다 브랜드 인지도나 화면 구성 등이 결과에 영향을 줄 수 있다는 지적이다. 국민평가가 단순한 선호도 조사나 인기투표로 흐르지 않도록 해야 한다는 의견도 제기된다. 평가 참여자의 연령과 직업, AI 이용 경험을 고르게 구성하고 모델별로 동일한 질문과 응답 시간, 사용 환경을 적용해야 평가 결과의 대표성과 신뢰성을 확보할 수 있다는 설명이다. 사실 정확성과 환각 발생 여부, 유해 답변 차단, 보안성 등 일반 이용자가 판단하기 어려운 항목은 전문가 평가로 보완해야 한다는 목소리도 나온다. 국민평가는 편의성과 자연스러운 대화 능력, 한국어 표현력 등 체감 요소에 집중하고 안전성과 기술적 완성도는 별도로 검증해야 한다는 주장이다. "성능만큼 데이터 확보 중요…국민 평가에 전문가 의견 보완" 국내 데이터 확보·활용 역량도 독파모 2차 평가 핵심 과제로 떠오르고 있다. 국내 공공데이터를 얼마나 효과적으로 학습하고, 한국어 맥락에 맞는 답을 내놓는지도 관건이라는 설명이다. 실제 독파모 참여 기업들은 국가AI전략위원회와 간담회를 열고 데이터 확보 방안을 논의한 바 있다. LG AI연구원과 업스테이지는 국립중앙도서관 도서 데이터화와 학습 목적 저작물 활용을 위한 텍스트·데이터 마이닝(TDM) 면책 규정 마련을 요청했다. SK텔레콤은 정부 데이터 정제 체계 고도화와 한국어 평가 데이터셋 확대를 제안했다. 모티프테크놀로지스는 대규모 한국어 사전학습 데이터를 국가 차원에서 구축하고 정제·분류·후처리까지 지원해야 한다고 강조했다. 당시 임문영 전 국가AI전략위원회 부위원장은 "기업은 모델 개발에 그치지 않고 제조·금융·공공·의료 등 산업 현장에서 실제 서비스로 확장할 수 있는지도 함께 살펴야 한다"고 강조한 바 있다. 업계에서는 국민이 모델을 직접 사용해 평가하는 사용자 평가 취지엔 공감하면서도 세부 설계가 중요하다는 목소리가 나온다. 일반 이용자가 체감하는 품질을 반영할 수 있지만 평가단 구성과 질문 유형, 모델별 응답 조건이 통제되지 않으면 기술력보다 브랜드 인지도나 화면 구성 등이 결과에 영향을 줄 수 있다는 제언이다. 한 AI 업계 관계자는 "평가 참여자 연령과 직업, AI 이용 경험을 고르게 구성하고 모델별로 동일한 질문과 응답 시간, 사용 환경을 적용해야 평가 결과 대표성과 신뢰성을 확보할 수 있을 것"이라고 언급했다. 이어 "사실 정확성과 환각 발생 여부, 유해 답변 차단, 보안성 등 일반 이용자가 판단하기 어려운 항목은 전문가 평가로 보완해야 한다"며 "국민평가는 편의성과 자연스러운 대화 능력, 한국어 표현력 등 체감 요소에 집중하고 안전성과 기술적 완성도는 별도로 검증해야 할 것"이라고 덧붙였다.