• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
반도체
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'학습 데이터'통합검색 결과 입니다. (22건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

[AI는 지금] "LLM 키울 데이터가 없다"…中 AI, 중국어 부족에 비상등

중국 인공지능(AI) 기업들이 고품질 학습 데이터 확보에 비상이 걸렸다. 온라인에서 활용할 수 있는 중국어 데이터가 제한적인 데다 공개 데이터 고갈 우려까지 커지면서 차세대 대규모언어모델(LLM) 개발을 위한 데이터 확보 부담도 높아지고 있다. 8일 사우스차이나모닝포스트(SCMP)가 인용한 인터넷 통계업체 W3테크스(Techs) 자료에 따르면 이달 기준 전 세계 웹 콘텐츠에서 중국어가 차지하는 비중은 1.3% 수준이다. 영어는 전체의 절반에 가까운 비중을 차지했으며 스페인어와 독일어는 각각 6%, 일본어는 5%로 집계됐다. AI 업계 전반에선 모델 학습에 투입할 고품질 인간 생성 데이터가 빠르게 줄고 있다는 우려가 커지고 있다. 미국 연구기관 에포크AI는 공개적으로 이용할 수 있는 고품질 인간 생성 텍스트가 향후 6년 안에 사실상 소진될 수 있다고 전망했다. 오픈AI 공동창업자 안드레이 카파시도 2030년 전후 신뢰할 수 있는 신규 데이터를 충분히 공급하지 못하면 모델 성능 향상이 정체되는 '데이터 벽'에 부딪힐 수 있다고 경고했다. 이에 미국 AI 기업들은 웹 밖으로 데이터 확보 범위를 넓히고 있다. 워싱턴포스트가 법원 문서를 토대로 보도한 내용에 따르면 앤트로픽은 내부 프로젝트인 '프로젝트 파나마'를 통해 수천만 달러를 투입해 수백만 권의 실물 도서를 확보했다. 책의 제본을 제거한 뒤 모든 페이지를 스캔해 디지털화하는 방식으로 학습 데이터를 마련했다. 중국은 온라인에서 활용할 수 있는 자국어 콘텐츠 풀이 영어권보다 작아 데이터 고갈에 더 취약할 수 있다. 기존 웹 크롤링만으로 모델 규모와 성능을 계속 끌어올리기 어려워지면 도서와 전문 문헌, 산업 데이터, 음성·영상 등 아직 충분히 활용하지 못한 데이터 확보가 필요해질 것으로 보인다. 이 탓에 중국 정부는 고품질 데이터를 AI 경쟁력의 핵심 자원으로 보고 공급 체계 구축에 나섰다. 중국 국가데이터국은 지난 6월 AI 학습 데이터의 공급·유통·상용화를 확대하는 전국 단위 계획을 발표했다. 2028년까지 제조·에너지·의료·금융·농업을 비롯해 피지컬 AI, 자율주행, 저고도 항공 분야에서 활용할 수 있는 검증된 데이터셋 생태계를 구축한다는 목표다. 학계에선 중국어 코퍼스(언어 데이터) 자체를 넓혀야 한다는 요구도 커지고 있다. 디지털 도서뿐 아니라 역사 기록물과 지방지, 고문서, 과학 문헌 등 오프라인 자료를 체계적으로 디지털화하고 사전과 음성·영상 콘텐츠, 지역 방언까지 학습 자원으로 활용해야 한다는 주장도 나오고 있다. 이 같은 상황 속에 대안으로 합성 데이터와 시뮬레이션이 거론되고 있다. 알리바바그룹 산하 싱크탱크 알리리서치는 2024년 발표한 백서에서 알고리즘과 컴퓨팅 파워, 데이터를 AI 모델 개발의 3대 축으로 제시하고 생성형 AI 성능 향상을 위해 더 풍부하고 품질 높은 데이터가 필요하다고 밝혔다. 잡지와 프로그래밍 코드 등도 추가 데이터원으로 활용할 수 있다고 제안했다. 하지만 데이터 확보 범위가 출판물과 오프라인 자료로 확대되면서 저작권 갈등이 커질 가능성도 높아지고 있다. 중국 화샤출판사가 최근 출간한 고대 도교 경전 번역본에는 책 내용을 AI 학습에 사용하는 것을 금지하고 위반 시 법적 책임을 묻겠다는 문구가 실렸다. 출판사 측은 해외 저작권자 요청으로 해당 조항을 넣었다고 설명했지만, AI 학습 과정에서 실제 침해 여부를 적발하고 권리를 행사하기는 쉽지 않다고 강조했다. 업계에선 중국이 웹 중심의 데이터 확보 방식에서 벗어나려면 오프라인 지식의 디지털화와 산업별 데이터 구축, 저작권 처리 체계를 함께 마련해야 할 필요가 있다고 지적했다. 모델과 컴퓨팅 파워를 확보하더라도 학습에 투입할 고품질 중국어 데이터가 충분하지 않으면 AI 성능 경쟁을 지속하기 어렵기 때문이다. 쑨마오쑹 칭화대 교수는 "코퍼스는 대규모언어모델 발전에서 핵심적인 역할을 하며 AI 역량 고도화를 뒷받침하는 핵심 요소로 자리 잡았다"며 "과장해서 말하는 게 아니라 코퍼스가 없으면 언어모델도 없다"고 강조했다.

2026.08.08 19:46장유미 기자

현대차그룹, 한·미·중에 '로봇 학습센터' 세운다…"실증 데이터가 승부처"

현대차그룹이 한국, 미국, 중국 3국에 로봇 훈련 학습센터를 세우고 고품질 실증 데이터를 확보한다. 미국에 있는 그룹 계열사 보스턴다이내믹스와 로봇 핵심 설계 기술을 함께 개발하고, 중국에 설립한 로봇 법인에서 부품 공급망을 확보하는 '투 트랙 전략'을 추진한다. 다만 핵심 부품은 국산화해 국내 부품사와 함께 글로벌 시장에 진출한다는 구상이다. 송호득 현대차 상무는 6일 국회에서 열린 'K-피지컬 AI 강국 실현을 위한 포럼'에서 "2년 전부터 철저하게 준비 중인 로봇 훈련 학습센터를 한국·미국·중국에 설립해 다양한 애플리케이션에 적합한 고품질 실증 데이터를 빠르게 수집·가공하고 인공지능(AI) 모델을 고도화하는 데 활용할 것"이라고 밝혔다. 로봇 훈련 센터에서는 자동차 공장 등에서 발생되는 업무를 휴머노이드가 수행하면서 실증 데이터를 생산할 것으로 보인다. 송 상무는 현대차그룹 차별화 전략으로 한국·미국·중국의 지정학 특수성을 최대한 활용하는 방식을 제시했다. 미국과 중국 시장을 각각 다르게 공략하면서 한국을 로봇 사업의 글로벌 허브로 구축하겠다는 것이다. 그는 "미국 보스턴다이내믹스와 핵심 로봇 설계 분야에서 협업하고, 중국에 별도로 만든 로봇 법인과 오픈 공급망과 실증 데이터 확보 측면에서 협업을 추진하겠다"고 설명했다. 현대차그룹은 로봇 하드웨어 핵심인 부품 국산화도 함께 추진한다. 송 상무는 "최적의 성능과 원가를 달성하기 위해 로봇 전체에서 원가 비중이 가장 큰 고부가 품목 위주로 국산화를 추진할 것"이라며 "피지컬 AI의 필수 품목인 인지 센서 모듈과 그리퍼·핸즈 같은 품목을 개발하겠다"고 말했다. 이어 "이를 통해 국내 부품사들이 빠르게 경쟁력을 확보해 글로벌 시장에 동반 진출할 수 있는 기회를 만들 수 있을 것"이라고 덧붙였다. 송 상무는 최근 미국의 대중국 규제를 국내 부품 업계의 기회요인으로 지목했다. 그는 "며칠 전 미국 트럼프 행정부의 연방통신위원회(FCC)도 자국 안보를 위협하는 장비 목록에 첨단 로봇 완성품을 등재해 중국을 제재하고 나섰다"며 "우리 로봇 기업들이 빠르게 경쟁력을 확보하면 좋은 성장 발판을 만들 수 있을 것"이라고 말했다. 새만금 생산시설, 로봇 파운드리로 확장 제조 거점 전략도 공개됐다. 송 상무는 "시장 초기에는 소량 다품종 양산체계를 구축해 대응하고, 시장 수요 확대에 대비해 대량 생산체계로 빠르게 전환하도록 추진할 계획"이라고 밝혔다. 특히 새만금에 설립하는 로봇 제조시설에 대해서는 "초기에는 현대차그룹 로봇만 생산하는 구조로 시작하지만, 향후에는 제조 공장이 없는 다른 로봇 개발사들이 제품을 동시에 대규모 생산할 수 있도록 로봇 파운드리로 확장하려고 한다"고 설명했다. 현대차그룹은 확보한 기술과 제품을 그룹 내부 시설에 먼저 적용해 검증한 뒤 다른 자동차 제조사와 부품사, 물류 산업으로 수평 확산할 계획이다. 이후 전자와 에너지, 리테일, 건설 등 글로벌 타 산업군으로 표준화된 플랫폼을 통해 시장을 개척한다는 전략이다. "정부와 협력 필요…공공 수요 창출해야" 송 상무는 정부 역할을 강조했다. 그는 "새로운 비즈니스는 특정 기업만의 노력으로 절대 만들 수 없고, 각국 정부 정책과 발맞추는 것이 무엇보다 중요하다"고 말했다. 구체적으로 ▲핵심 거점 중심의 집중 성장을 위한 정책 동력 마련 ▲거점별 차별화 육성을 위한 선택적 판단 ▲새만금의 대량 생산시설 및 실증 데이터 기반 학습 클러스터 구축 ▲초기 시장 물량 확보를 위한 공공 수요 창출 등 네 가지를 제시했다. 송 상무는 "AI 로봇 산업이 빠르게 육성되기 위해서는 초기 시장의 안정적인 물량을 확보하는 것이 필수"라며 "초기에는 정부 주도의 공공 수요를 창출할 수 있는 다양한 정책을 마련해야 한다"고 주장했다.

2026.08.06 16:31진운용 기자

방송영상 AI 학습 데이터 117만 건, 국민에 개방

방송영상 이미지와 배경, 인물, 한글 서체와 자막 등 우리나라 정서와 문화적 요소를 반영한 방송영상 데이터 117만여 건이 국민에 개방된다. 방송미디어통신위원회와 한국전파진흥협회는 방송영상 AI 학습용 데이터 일부를 교육 연구용으로 국민 누구나 활용할 수 있도록 한국지능정보사회진흥원(NIA)의 '인공지능 허브 안심 구역'을 통해 정식 개방한다고 5일 밝혔다. 인공지능 허브 안심 구역은 관련 개발자와 국민이 제공된 데이터를 안전하게 사용할 수 있도록 제공된 보안 통제 환경으로, 사전에 안심 구역에 대한 이용 신청과 승인 절차를 거쳐 누구나 무료로 이용할 수 있다. 그간 AI 학습용 데이터로 방송영상에 대해 많은 수요가 있었으나 지식재산권, 초상권, 인접권 등의 문제로 이용이 어려웠는데 데이터 공개를 통해 개발자들이 걱정 없이 고품질의 영상 데이터를 활용해 다양한 인공지능 모델을 연구할 수 있게 됐다. 개방되는 데이터는 인공지능 허브 안심 구역 홈페이지에서 확인할 수 있다. 공개된 데이터는 ▲영상 이미지 이해 및 설명 ▲배경 및 인물, 객체 생성 ▲제작 환경 고도화 분야에서 배경, 인물, 객체, 서체, 자막 등 10개 유형으로 총 117만여 건이 제공된다. 천지현 방미통위 방송미디어진흥국장은 “방송영상은 한국적인 문화와 정서, 고도의 제작 기술과 전문성이 집약된 인공지능 산업의 핵심 자산”이라며 “앞으로도 다양한 산업 분야에서 방송영상이 활용될 수 있도록 고품질의 인공지능 학습데이터를 지속적으로 구축, 공개할 계획이다”라고 말했다.

2026.08.05 11:01박수형 기자

김윤덕 국토부 장관 "자율주행 AI 경쟁력 핵심은 데이터와 학습”

김윤덕 국토교통부 장관은 1일 “자율주행 산업의 핵심은 얼마나 많고 다양한 학습데이터를 확보하고, 얼마나 효과적으로 AI 모델이 학습하는지에 달려 있다”고 강조했다. 김 장관은 이날 정부세종청사에서 열린 '자율주행 AI 전문가 간담회'에서 “자율주행은 자동차와 AI가 결합된 피지컬 AI 대표산업”이라며 이같이 말했다. 이날 간담회는 자율주행 AI 연구개발 과정의 현장 애로사항을 청취하고, 실증도시를 중심으로 데이터 확보부터 AI 모델 개발·검증·상용화까지 이어지는 한국형 자율주행 AI 혁신생태계 구축방안을 논의하기 위해 마련됐다. 국토부는 광주광역시를 자율주행 실증도시로 조성해 자율주행 AI 개발에 필요한 대규모·고품질 학습데이터를 구축하고, 과학기술정보통신부와 협력해 E2E(End-to-End) 기술개발을 위한 AI 학습데이터 표준화도 추진하고 있다. 김 장관은 “자율주행 실증도시는 민간이 구축하기 어려운 대규모 고품질 데이터를 확보하고, AI 학습 인프라와 실증환경을 제공하는 사업”이라면서 “확보한 데이터를 공유해 AI 모델 개발로 연결하고, 다시 실증을 통해 성능을 개선하는 국가 차원의 데이터 플라이휠 생태계를 구축하는 것이 무엇보다 중요하다”고 말했다. 간담회에 참석한 전문가들은 “자율주행 AI의 경쟁력은 데이터 스케일링에 따라 실제 도로환경에서 확보한 데이터의 규모와 다양성에 의해 결정된다”며 “전국 어디서나 안전하게 운행 가능한 자율주행 AI를 개발하기 위해서는 광주 실증도시를 시작으로 다양한 지역과 도로 환경에서 데이터를 지속적으로 확보하고, 산학연이 이를 활용할 수 있는 개방형 생태계를 구축해야 한다”고 제안했다. 김 장관은 “하반기부터 실증도시에 자율차 200대가 순차 투입되는데 국토부와 대한민국 자율주행팀과 함께 총력을 다해 발전시켜 나간다면 우리나라의 세계적 자동차 제조 역량과 AI 기술력을 결합한 글로벌 경쟁력을 충분히 확보할 수 있다”고 말했다. 김 장관은 “더 많은 도시에서 고품질 학습데이터를 확보하고 AI 모델 연구개발과 실증, 상용화까지 이어지는 전 주기 구축을 위한 자율주행 AI 클러스터를 구축함으로써 대한민국 대도약 3대 메가 프로젝트에 발맞춰 피지컬 AI 기술발전을 선도하기 위한 혁신생태계를 조성하겠다”고 말했다.

2026.07.01 17:12주문정 기자

박민우 현대차·기아 본부장 "현실세계 데이터 잘 만들어야 피지컬AI 주인공"

박민우 현대차·기아 첨단플랫폼본부(AVP) 본부장 겸 포티투닷(42dot) 대표는 24일 “사람과 같이 현실세계에서 작동하는 피지컬 인공지능(AI)이 제대로 가려면 인터넷 세상에서만의 데이터가 아닌 현실이 반영된 데이터가 중요하다”고 밝혔다. 박 본부장은 이날 서울 삼성동 코엑스에서 열린 '2026 국토교통기술대전' 기조강연에서 “AI 모델과 연산 능력은 빠르게 범용화되고 있지만, 자율주행차와 로봇이 실제 환경에서 축적한 경험 데이터는 아직 부족하다”며 이같이 말했다. 박 본부장은 “올해 초에 등장한 에이전틱 AI로 AI가 더 강력해졌다”며 “일부 오류도 있지만 보완하는 기술도 발전하면서 우리의 생산성을 급속도로 높이면서 완전히 다른 차원으로 가고 있다”고 강조했다. 박 본부장은 “챗GPT나 제미나이 등 기존 AI가 질문을 읽고, 답하고 고민을 들어주고 설계해 주고 이미지 등을 만들어 냈다면 이제는 현실세계로 AI가 나와서 주변을 살피고 직접 상황을 파악하는 수준이 됐다”고 덧붙였다. 박 본부장은 “AI의 3가지 성장 축으로 새로운 계산 모델, 막대한 연산 자원, 대규모 고품질 데이터를 들 수 있는데 모델과 연산은 빠르게 범용화되고 있다”며 “피지컬 AI에 필요한 현실세계의 경험데이터는 아직 충분하지 않다”고 말했다. 이어 “현실세계 데이터는 자동차가 빗길에서 느끼는 미끄러움, 로봇이 느끼는 마찰과 압력 등 리액션이 어떻게 나올지 직접 경험해보지 않으면 알 수 없는 데이터를 말한다”고 설명했다. 박 본부장은 “얼어 있는 도로, 엉킨 불법주차 차량, 갑자기 튀어나오는 배달 오토바이 등 사람의 안전과 직결되는 다양한 예외 상황에 대한 데이터가 중요하다”고 말했다. 박 본부장은 국토부가 추진 중인 자율주행차 실증사업의 중요성도 거론했다. 그는 “현재 미국과 중국이 자율차 데이터와 관련해 매우 앞서 나가고 있지만 한국과 현대차도 기회가 있다고 본다”며 “그 이유는 차량·도로·국민·제도가 뒷받침된 한국의 실증체계가 있기 때문”이라고 했다. 박 본부장은 “테슬라가 지난 10년 동안 900만대의 차를 팔고 완전자율주행(FSD)을 탑재해 데이터를 축적했다고 하는데 현대차그룹은 매년 800만대의 차량을 양산하고 있다”며 “고성능컴퓨팅 프로그램과 첨단 산업체계를 표준화해 전 세계에서 생산되는 데이터를 받아 효과적으로 수집하고 사용할 수 있는 기반을 마련할 수 있을 뿐 아니라 그룹 브랜드와 파트너사 등의 데이터를 하나로 연결하는 데이터 연동을 구축해가고 있다”고 말했다. 이어 방대한 규모의 차량 데이터가 기하급수적으로 측정되고 현실 세계에서 어쩌다 한 번 마주치는 예외사항들을 더 많이 수집할 수 있다“고 덧붙였다. 그러면서 ”국토부가 기술이 세상과 만날 수 있는 든든한 장을 만들어 줬다“며 ”올해 광주광역시 전역에 200대의 자율차가 투입되는 만큼 가치 있는 실증 데이터가 축적되는 테스트베드가 될 것“이라고 말했다. 센서·데이터 인프라의 지속적이고 장기적인 투자도 강조했다. 박 본부장은 ”국토부의 선도적인 대규모 실증지원과 현대차 등의 탄탄한 양산체계가 결합될 때 도로 위에서 마주치는 수많은 변수와 예외사항을 고려한 학습데이터가 축적되고 자율주행은 더욱 똑똑해지고 안전해지며 편안해질 것“이라고 밝혔다. 한편, '2026 국토교통기술대전'은 26일까지 '미래를 바꾸는 기술(Move For Tomorrow)'을 주제로 열린다. 국토부와 국토교통과학기술진흥원(KAIA)이 공동 주최한 이번 행사에는 81개 기관이 참여해 모빌리티·스마트건설·AI시티·우주항공·혁신기업 등 5대 테마존과 주제관과 총 409개 부스를 운영한다. 개막 첫날 총 9217명의 관람객이 국토교통기술대전을 다녀갔다.

2026.06.25 08:21주문정 기자

[기고] AI 경쟁력 새 기준, 데이터 라이선싱

챗GPT 등장 이후 인공지능(AI)과 신기술, 혁신적인 서비스의 개발을 해하지 않으면서도 이용자의 권리와 개인정보를 보호하려면 어떤 것을 고려해야 할 지에 대한 논의가 최근 활발해진 분위기다. 급변하는 정보사회에서 AI와 개인정보 보호에 있어 우리 사회가 취해야 할 균형 잡힌 자세가 어떤 것인지에 대해 법무법인 태평양 AI팀에서 [AI 컨택]을 통해 2주 마다 다뤄보고자 한다. [편집자주] AI 데이터 학습을 둘러싼 저작권 논의는 기술 혁신을 위한 공정 이용과 창작자 권리 침해라는 이분법에 갇혀 있었다. 최근 글로벌 저작권 소송과 빅테크들의 데이터 계약 움직임은 이같은 접근 자체가 바뀌어야 함을 보여준다. AI 발전을 멈추거나 창작권을 희생하는 문제를 넘어, 데이터를 어떻게 안전하게 지속 가능한 방식으로 확보할 것인가라는 현실적인 질문에 답하고 있어서다. AI는 이미 기업의 핵심 인프라로 자리 잡고 있다. 거대언어모델의 고도화부터 특정 도메인에 특화된 버티컬 AI 에이전트의 구축에 이르기까지 서비스의 본질적 기능 상당 부분이 데이터 품질을 기반으로 재편되고 있다. 글로벌 주요 언론사와 콘텐츠 플랫폼들이 무단 크롤링에 제동을 걸며 데이터의 정당한 대가를 강조하는 배경 역시 여기에 있다. 그동안 AI 데이터 확보 논의는 주로 위험 통제나 침해 여부에 초점이 맞춰져 왔다. 현장에서는 어떤 데이터를 안심하고 써야 하는지, 향후 발생할 잠재적 저작권 리스크를 실제 운영 단계에서 어떻게 통제해야 하는지에 대한 혼란이 있었다. 기업 입장에서는 기존 개발 비용과 더불어 그 법적 부담감이 상당했던 것도 사실이다. 최근 급부상한 '데이터 라이선싱' 모델은 무분별한 스크래핑 제한보다 신뢰 가능한 데이터 유통 기준 마련에 방점을 찍는다는 점에서 이 간극을 메우려는 시도로 해석된다. 이는 기업 실무 관점에서도 의미가 크다. 기업이 AI 모델을 도입하거나 고도화할 때 가장 어려움을 겪는 부분은 알고리즘 자체의 성능이 아니라 데이터 출처에 따른 사후 책임과 내부 통제에 대한 불확실성이다. 합법적 데이터 라이선싱은 비용 지출 여부를 판단하는 기준을 넘어서 도입 이후 법적 안정성, 데이터의 독점적 사용 범위, 소비자 및 투자자 신뢰 확보 등 기업의 안정적 운영을 위한 관리 방법을 명확히 제시해 준다. 시장의 전향적 변화가 기업 한계를 제한하지 않고 오히려 예측 가능성을 높여 그 발전을 돕고 있는 셈이다. 이같은 접근은 본격 시행에 들어간 AI기본법과 데이터산업법, 저작권법 등 관련 법령 해석과 적용에서도 중요한 시사점을 제공한다. AI기본법이 산업 전반의 거버넌스와 위험관리 체계를 제시하는 보편적 규범이라면, 데이터 라이선싱 계약 표준은 지식재산권이라는 특정 영역의 위험 구조를 반영한 실무적 운영 기준에 가깝다. 향후 AI 생태계가 단일 법률에 의존해 모든 문제를 해결하기보다 공적 법제와 계약 질서가 상호 보완적으로 작동하는 방향으로 발전할 가능성을 시사한다. AI 경쟁력은 이제 알고리즘 성능이나 자체 기술 규모만으로 결정되지 않는다. AI 도입 과정에서 발생할 수 있는 저작권 분쟁, 영업비밀 유출, 데이터 오염 문제에 대한 제도적·시장적 신뢰가 없다면 빠른 기술 도입은 오히려 리스크다. 한국어 데이터의 절대적 양이 부족하고 자본력이 열세인 국내 AI 산업 특성상, 우리 실정에 맞는 상생 모델이 충분히 고려될 필요가 있다. 데이터 무단 학습 규율은 이 문제의식을 구체화한 결과다. 라이선싱 체제가 실효성을 갖기 위해서는 거래 투명성과 합리적인 단가 책정이 중요하다. 대형 플랫폼과 스타트업 간의 데이터 접근 격차가 존재하는 만큼 동일한 원칙이 현장에서 다양한 규모의 기업에 공정하게 구현될 가능성을 높여야 한다. 이 과정에서 정부의 표준 계약서 제정 지원과 업계 간의 지속적인 소통, 성공적인 데이터 거래 사례 축적이 필요하다. 라이선싱 제도가 경직된 규약이 아니라 살아 있는 기준으로 기능하려면 축적 과정이 필수적이다. 데이터 무단 학습의 종말과 라이선싱 시장의 부상은 한국의 AI 산업 논의가 새로운 단계로 접어들었음을 보여준다. 중요한 것은 데이터를 얼마나 자유롭게 긁어올 수 있는가의 문제가 아니라, 데이터를 산업 본질에 부합하도록 어떻게 계획하고 안정적으로 운영할 것인가다. 글로벌 전역에서 시작된 변화는 향후 국내 모든 정보기술(IT) 산업으로도 확산될 수밖에 없다. 기업에 필요한 것은 소송과 규제를 피하는 것보다 합법적 라이선싱을 운영의 언어로 이해하고 선제적으로 설계하는 전략일 것이다.

2026.06.19 17:29이수화 컬럼니스트

오케스트로 AGI, 경기도 AI 데이터 허브 구축한다

오케스트로 AGI가 데이터 통합 관리 역량을 기반으로 경기도가 추진하는 생성형 인공지능(AI) 행정서비스 고도화에 앞장선다. 오케스트로 AGI는 엑셈과 컨소시엄을 구성해 '경기 AI 학습데이터 통합 관리체계 구축사업'을 수주했다고 12일 밝혔다. 이번 사업은 경기도가 보유한 행정 데이터를 생성형 AI가 활용할 수 있는 고품질 학습데이터로 체계화하고 신뢰도 높은 AI 행정서비스 구현을 위한 데이터 기반을 구축하는 것이 목표다. 경기도 내 여러 부서와 시스템에 분산된 데이터 자산을 통합 관리하는 데 초점을 맞췄다. 경기도는 대규모 클라우드 시스템 구축을 추진해왔으며 최근 AI 전환(AX)을 위한 데이터 관리체계 구축에도 속도를 내고 있다. 오케스트로 그룹은 앞서 경기도 클라우드 시스템 구축사업을 수행한 데 이어 이번 사업까지 맡으며 경기도 AX 지원을 확대하게 됐다. 오케스트로 AGI는 경기도가 보유한 약 80종 정보시스템과 경기 생성형 AI 플랫폼 지식저장소에 축적된 비정형 학습데이터를 분석해 데이터 현황을 정비할 계획이다. 특히 글로벌 데이터 표준인 'DCAT 3.0' 기반 데이터 카탈로그를 구축하고 부서·시스템별로 분산된 데이터 구조와 관계를 체계화할 예정이다. 이를 통해 필요한 데이터를 보다 빠르게 탐색하고 연계할 수 있도록 지원한다. 또 데이터 생성부터 활용까지 전 과정을 추적할 수 있는 '데이터 리니지' 체계를 구축한다. 데이터 출처와 변경 이력을 관리하고 AI 기본법상 고영향 AI 관련 데이터를 식별·카탈로그화해 관련 가이드라인에 부합하는 안전성 확보를 지원할 방침이다. 아울러 기존 검색증강생성(RAG)에 데이터 카탈로그와 온톨로지를 연계한 검색 체계를 적용한다. 단순 유사도 기반 검색을 넘어 답변 근거 데이터를 사전에 선별·통제하고 데이터 간 관계를 반영해 검증 가능한 답변을 생성하는 것이 특징이다. 여기에 Q&A 검증·튜닝 기술도 적용해 근거 없는 답변 생성을 줄이고 AI 행정서비스의 정확성과 신뢰성을 높인다는 목표다. 오케스트로 AGI는 AI·데이터 플랫폼, 온톨로지 기반 지식관리체계 구축 사업을 수행하며 공공 AI 서비스 관련 역량을 확보해왔다. 한국교통안전공단·한국도로공사·국민건강보험공단 등 공공기관 AI 플랫폼 구축 경험을 바탕으로 공공 AI 데이터 관리 사업 확대에 박차를 가할 계획이다. 김영광 오케스트로 AGI 대표는 "공공부문에서 생성형 AI를 안정적으로 활용하려면 데이터의 양뿐 아니라 품질·구조·출처까지 체계적으로 관리할 수 있어야 한다"며 "이번 사업을 통해 경기도 AI 행정서비스 고도화를 지원하고 국가 데이터 스페이스 전략에 맞춰 신뢰도 높은 공공 AI 활용 대표 사례를 만들겠다"고 밝혔다.

2026.06.12 11:09한정호 기자

[AI 고속도로] AI 열풍 탄 '네오클라우드'…인프라 새 전장으로

인공지능(AI) 시대 핵심 자원 그래픽처리장치(GPU)를 전문적으로 공급·운영하는 '네오클라우드'가 글로벌 인프라 시장의 새로운 강자로 떠오르고 있다. AI 경쟁 무게중심이 모델 개발에서 인프라 확보로 이동하는 가운데, 국내 기업들도 차세대 AI 클라우드 시장 선점에 나서는 모습이다. 네오클라우드는 AI 모델 학습과 추론에 필요한 GPU를 서비스형(GPUaaS)으로 제공하는 AI 특화 클라우드 사업자를 뜻한다. 웹서비스와 기업 업무를 폭넓게 처리하는 기존 범용 퍼블릭 클라우드와 달리 AI 연산에 최적화된 구조를 갖춘 것이 특징이다. 네오클라우드가 주목받는 배경에는 폭발적으로 증가한 AI 연산 수요가 있다. 빅테크 기업들의 AI 데이터센터 투자와 소버린 AI 프로젝트 확대로 GPU 수요가 급증했지만 공급은 이를 따라가지 못하고 있다. 동시에 확보한 GPU조차 효율적으로 활용하지 못하는 문제가 나타나면서 AI 전용 인프라 필요성이 커지고 있다. 가격 경쟁력도 강점으로 꼽힌다. 업타임 인스티튜트 분석에 따르면 북미 기준 엔비디아 H100 GPU 온디맨드 사용 비용은 네오클라우드가 시간당 약 34달러로, 하이퍼스케일러 평균인 98달러 대비 크게 저렴한 것으로 나타났다. AI 워크로드에 불필요한 요소를 줄여 비용 효율을 높인 결과다. 글로벌 시장에선 코어위브, 람다랩스, 네비우스 등이 대표 사업자로 부상했다. 특히 코어위브는 오픈AI와 앤트로픽, 구글, 메타, 퍼플렉시티 등 주요 AI 기업에 GPU 인프라를 제공하며 시장을 선도하고 있다. 최근에는 AI 개발 플랫폼 기업 위츠앤바이어스(W&B)를 인수한 데 이어 에이전트 AI 기능까지 출시하며 단순 GPU 임대를 넘어 풀스택 AI 클라우드 기업으로 진화하고 있다. 네비우스 역시 AI 특화 클라우드 기업으로 빠르게 성장 중이다. 러시아 최대 검색엔진 얀덱스에서 분사한 뒤 AI 클라우드 기업으로 전환한 네비우스는 마이크로소프트와 메타, 엔비디아 등과 대형 계약을 체결하며 시장 영향력을 확대하고 있다. 올해 들어 주가가 130% 이상 급등하는 등 투자자들의 관심도 집중되고 있다. 글로벌 자본도 네오클라우드에 몰리는 상황이다. 블랙스톤과 칼라일 등 미국 주요 투자기관들은 코어위브와 람다, 크루소 등 네오클라우드 기업이 보유한 GPU를 담보로 대규모 자금을 공급하고 있다. 시장에선 GPU 자체가 새로운 인프라 자산으로 평가받기 시작했다는 분석도 나온다. 통신사들도 경쟁에 뛰어들고 있다. 일본 소프트뱅크는 엔비디아 GB200 NVL72 기반 네오클라우드 서비스를 올해 정식 출시할 예정이다. 자체 AI 클라우드 운영체제(OS) '인프리니아'를 결합해 학습부터 추론까지 통합 지원하는 구조를 내세우고 있다. 글로벌 통신사들이 AI 인프라 사업자로 영역을 확장하는 흐름이 뚜렷해지는 양상이다. 국내에선 베슬AI와 몬드리안에이아이 등이 대표 주자로 꼽힌다. 베슬AI는 연내 최신 GPU 1만 장 규모 인프라 구축을 추진하며 글로벌 데이터센터 네트워크를 확대하고 있다. 몬드리안에이아이는 AI 플랫폼과 인프라를 결합한 네오클라우드 전략을 내세우며 교육·연구 시장을 공략 중이다. 엘리스그룹 역시 모듈형 데이터센터와 GPU 스팟 요금제를 앞세워 시장 진입에 속도를 내고 있다. 업계에선 네오클라우드가 기존 하이퍼스케일러를 대체하기보다 AI 특화 워크로드를 처리하는 새로운 인프라 축으로 자리 잡을 것으로 보고 있다. 시장조사기관 ABI리서치는 네오클라우드 GPUaaS 시장이 2030년 수백조원 규모로 성장할 것으로 전망했다. 코리 샌더스 코어위브 제품 관리 담당 수석부사장은 최근 미국 IT 전문매체 AI 비즈니스 인터뷰에서 "AI 클라우드는 더 이상 GPU 임대 사업이 아니다"라며 "학습과 추론, 운영을 아우르는 풀스택 플랫폼 경쟁이 시작됐으며 이것이 차세대 AI 인프라 시장의 핵심이 될 것"이라고 강조했다.

2026.05.31 11:00한정호 기자

"제조업 AX 성패, 암묵지 표준화에 달렸다"

국내 제조업의 인공지능 전환(AX)을 고도화하기 위해 이질적 데이터를 규격화하고, 사후학습을 지원하는 신경망처리장치(NPU) 개발이 시급하다는 지적이 나왔다. 단순한 디지털 전환(DX)을 넘어 인공지능(AI) 중심 완전 자동화를 구현하려면 현장 숙련공의 노하우인 '암묵지'를 데이터화하고, 이를 저비용·고효율로 학습할 수 있는 국산 반도체 생태계가 뒷받침돼야 한다는 내용이다. 차석근 첨단제조표준화포럼 위원장은 27일 서울 양재에서 개최된 '2026 시스템-반도체 포럼'에서 "이제는 DX를 넘어 AX로 나아가야 할 때"라며 "AX 성패는 결국 생산현장에서 다이내믹하게 움직이는 유효 데이터를 어떻게 수집하고 활용하느냐에 달려 있다"고 강조했다. 차 위원장은 "센싱 기술로 현장에 숨어 있는 암묵지 데이터를 끌어올려야 하고, 이를 위해 제각각인 생산현장 데이터를 표준화하는 작업이 선행돼야 한다"고 설명했다. 현재 제조현장의 실제 의사결정은 표준작업지침서(SOP) 같은 형식지보다 오랜 경험을 가진 숙련자 감에 크게 의존하고 있다. 차 위원장은 "베테랑 작업자들은 설비에서 발생하는 미세한 진동음, 제품의 색상 변화, 당일 습도 등 정형화되지 않은 조건을 종합 판단해 공정 변수를 미세 조정한다"고 말했다. 문제는 이러한 판단의 근거가 문서화되지 않아 데이터화하기 까다롭다는 점이다. 불량 예측, 수율 최적화, 이상 탐지 등 AI를 통해 달성하고자 하는 고부가가치 자동화 영역이 바로 이 암묵지에 집중돼 있다는 점이 제조업 AX의 가장 큰 난제다. 차 위원장은 발표자료에서 "기존 형식지만 AI에 학습시킬 경우 현장의 단편적 공정만 자동화될 뿐, 제조업의 핵심 가치를 AI 모델에 담기 어렵다"고 덧붙였다. 업계는 암묵지를 기계가 인식할 수 있는 구조화·표준화된 데이터 형태로 번역하고, 이를 기반으로 생산공정을 100% 자동화하는 데 역량을 집중하고 있다. 제조 데이터의 높은 이질성은 걸림돌이다. 공장 내부에는 여러 벤더의 설비와 서로 다른 세대 장비가 혼재돼 있다. 통신 프로토콜과 단위, 샘플링 주기, 태그 명명 규칙 등이 제각각 얽혀 있다. 이에 따라 일정한 규격에 맞춰 암묵지를 정제하는 표준화 프로세스가 필수다. "피지컬 AI 시대, 학습 가능한 NPU가 핵심" 포럼에서는 '학습 기능'을 내장한 NPU 개발 필요성도 논의됐다. 장성준 한국전자기술연구원(KETI) 센터장은 "현재 시장에 나와 있는 NPU가 주로 추론 기능에 초점이 맞춰져 있는 것은 사실이지만, 미래에는 NPU가 학습 기능까지 수행하는 방향으로 나아가지 않을까 한다"고 전망했다. 장 센터장은 "로봇 파운데이션 모델은 범용 작업에 특화돼 새로운 작업에 직면했을 때는 제대로 대응하지 못할 가능성이 크다"며 "생산현장에서 발생하는 소량 샘플 데이터만으로도 실시간 학습을 수행할 수 있는 능력이 필수이고, 이때 온디바이스 NPU나 그래픽처리장치(GPU)가 경량 학습을 지원할 수 있어야 한다"고 짚었다. 아울러 제조현장 내 온프레미스 환경에서 사후학습과 파인튜닝(미세조정) 역할이 커지고 있다고 덧붙였다. 그는 "중앙 GPU 데이터센터에서 1차로 학습된 거대 모델을 가져와 각 팩토리의 고유 데이터에 맞게 파인튜닝하는 과정이 핵심"이라며 "이 과정에서 NPU가 같이 학습을 담당할 수 있으면 총소유비용(TCO)이 절감될 것"이라고 설명했다. 다만 장 센터장은 "현재 국내 반도체 생태계에는 학습 기능을 지원하는 토종 NPU가 전무한 실정"이라며 "아마존웹서비스(AWS)의 트레이니움이나 구글의 텐서처리장치(TPU)처럼 국내에서도 학습을 지원하는 NPU가 나와야 한다"고 말했다.

2026.05.27 14:09진운용 기자

방미통위, 2만여 시간 방송영상 AI 학습용 데이터 확보

방송미디어통신위원회는 한국전파진흥협회(회장 홍범식)와 함께 7일 서울에서 '25년 방송영상 인공지능 학습용 데이터 구축 사업 성과공유회'를 열고 그간 구축한 인공지능 학습용 데이터를 공개했다. 방미통위는 방송미디어 산업 인공지능 혁신을 위해서는 고품질의 학습용 영상 데이터 확보가 무엇보다 중요하다는 판단에 따라 방송사가 보유하고 있는 뉴스, 다큐멘터리, 드라마 등 방대한 방송영상 자료의 가치에 주목하고 이를 인공지능 학습을 위한 데이터로 전환하는 사업을 지난해 추진했다. 이번 사업에는 총 200억 원의 예산이 투입됐으며, 200만 시간이 넘는 방대한 방송 원본 데이터 중 4만여 시간을 엄선해 정제 및 가공을 거쳤다. 이후 데이터 품질 검증을 통해 최종적으로 인공지능 학습을 위한 고품질 영상 2만 3113시간, 약 460만 개의 데이터 세트를 구축했다. 방송사가 보유하고 있는 방송영상 자료는 우리 사회 역사와 문화를 바탕으로 언어, 행동, 소리, 이미지 등 복합적 상황 정보를 풍부하게 담고 있어 인공지능 학습을 위한 최적의 원천데이터로 평가받는다. 이번에 구축된 방송영상 인공지능 학습용 데이터는 방송콘텐츠 제작 현장의 효율성을 높일 수 있는 인공지능 관련 서비스 개발부터 제조, 의료, 재난, 교통 등 타 산업 전반의 인공지능 개발에 활용돼 국가 인공지능 경쟁력 강화에 기여할 전망이다. 박동주 방미통위 사무처장은 “이번 사업이 방송미디어 산업의 인공지능 혁신을 위한 소중한 첫걸음이 될 것”이라며 “앞으로도 국내 방송미디어 산업이 인공지능을 발판 삼아 재도약할 수 있도록 관련 정책과 사업을 지속 추진해 나가겠다”고 말했다. 한편, 이날 성과공유회에는 KBS, MBC, MBC충북, KT ENA 등 4개 주관 방송사들과 네이버 클라우드, LG AI연구원 등 인공지능 전문기업 관계자를 비롯해 관련 분야 전문가, 일반 국민 등 100여 명이 참석했다.

2026.05.07 16:28박수형 기자

공정위, 공정거래 AI·데이터 활용 아이디어 공모

공정거래위원회는 인공지능(AI) 기술을 활용해 공정거래 데이터를 국민 누구나 쉽게 활용할 수 있도록 '제2회 공정거래 AI·데이터 활용 공모전'을 개최한다고 9일 밝혔다. 이번 대회는 '의결서를 AI로 읽다'라는 주제로 공정위의 핵심 데이터인 의결서·사건정보 등을 활용해 혁신적인 서비스와 AI 모델을 발굴하는 데 목적을 뒀다. 지난해에 이어 두 번째 실시하는 공모전으로 대한민국 국민이면 누구나 단체(2인이상)로 공모전 누리집(공정위AI데이터공모전.kr)에서 참가할 수 있다. 공모 분야는 참가자 역량에 따라 ▲아이디어 기획 ▲AI 학습모델 개발 두 분야로 진행된다. 아이디어 기획은 공정거래 데이터를 활용한 창의적 서비스나 정책 아이디어를 제안하면 된다. 또 AI 학습모델 개발 분야는 공정거래 데이터를 활용한 AI 모델 개발·구현 방안을 제안하면 된다. 공모전은 9일부터 5월21일까지 진행되며 접수된 신청 내용에 대해 내·외부 전문가의 1차(서류)·2차(대면) 심사를 실시한다. 시상은 대상 총 2점(아이디어 기획 및 AI 학습모델 분야 각 1점), 우수상 총 5점(아이디어 3점, AI 학습모델 2점)에 대해 이뤄진다. 이번 공모전은 공정거래 데이터의 국민 활용 활성화, AI 기반 공공서비스 혁신 아이디어 발굴, 의결서 등 전문 데이터를 누구나 이해할 수 있도록 하는 AI 기술 확산, 스타트업 및 개발자의 AI 창업모델 창출 지원을 목표로 추진된다. 특히 기존에는 이해하기 어려웠던 법률·판례 중심의 의결서를 AI 기술을 통해 쉽게 검색하고 분석할 수 있는 환경을 조성하는 데 중점을 둔다. 공정위는 아이디어기획과 AI 학습모델 개발 각각의 수상자(단체)에 공정거래위원장상과 상금을 수여한다. 각 부분 최우수 수상작은 행정안전부에서 주관하는 '제14회 범정부 공공데이터 창업경진대회' 본선 진출권이 부여된다. 공정위는 이번 공모전을 계기로 공정거래 데이터의 AI 학습데이터 구축 및 개방을 확대해 국민체감형 AI 공공서비스를 지속적으로 추진해 나갈 예정이다.

2026.04.09 14:49주문정 기자

정부, AI 학습 '법적 족쇄' 푼다…형사면책·옵트아웃 실효성 거둘까

정부가 인공지능(AI) 학습 과정에서의 저작권 분쟁 위험을 해소하기 위해 형사면책과 선사용·후보상이란 제도적 해법을 내놨다. AI 기업들이 법적 불확실성에서 벗어나 고품질 데이터를 안정적으로 확보할 수 있도록 법적·심리적 안전장치를 마련한 셈이다. 이 제도가 현장에서 얼마나 실질적인 효력을 발휘할지가 AI 3대 강국(G3) 도약의 성패를 가를 전망이다. 27일 국가AI전략위원회에 따르면 전날 임문영 국가AI전략위원회 부위원장은 배경훈 부총리 겸 과학기술정보통신부 장관, 최휘영 문화체육관광부 장관과 긴급 회동을 다. 이는 지난 25일 국가AI전략위원회 제2차 전체회의에서 저작권 관련 과제를 포함한 '대한민국 AI 행동계획'이 의결된 데 따라 후속 조치다. 저작물 활용 촉진을 위한 4대 핵심 과제 등 실행 방향이 공개된 가운데, 업계 이목을 끈 건 '독자 AI 파운데이션 모델(독파모)' 개발사에 대한 형사책임 면제 검토다. 정부 주도의 국가대표 AI 프로젝트에 참여하는 기업들이 다양한 저작물을 학습하는 과정에서 발생할 수 있는 형사책임을 사전에 차단하겠다는 취지다. 실제 기업들은 저작권료 지불보다 저작권법상 '5년 이하의 징역'이란 형사처벌 위험을 더 큰 위협으로 느끼는 경우가 많다. 임 부위원장은 지난달 말 지디넷코리아와의 인터뷰에서 "기업이 AI 학습 단계에서 데이터를 자유롭게 활용할 수 있도록 길을 열어주되, 실제 수익이 발생하는 서비스 단계에서 창작자에게 공정한 대가를 지불하는 방식의 '전략적 딜'이 필요하다"고 밝혔다. 저작물 시장 성격에 따른 맞춤형 상생 모델이 실질적인 데이터 유통으로 이어질지도 관심이 모인다. 정부는 뉴스와 음악, 도서 등 이미 거래 질서가 확립된 분야는 기존 시장의 합리적 거래를 존중하되, 온라인 게시물처럼 거래 시장이 없는 영역엔 저작권자가 거부권을 행사하는 '옵트아웃(Opt-out)' 제도를 도입한다. 저작권자가 명시적으로 학습 거부 의사를 밝히지 않은 저작물은 적법한 접근하에 우선 활용(선사용)을 허용한다. 대신 추후 수익 발생 시 이를 공유(후보상)하는 방식을 취한다. 기업들을 위한 실질적인 인센티브도 강화된다. 정부는 학습용 데이터 구매 비용을 '연구개발(R&D) 세액공제 대상'에 포함해 기업들의 투자 부담을 낮추기로 했다. 공공기관이 보유한 고품질 데이터를 AI 학습에 안전하게 쓸 수 있도록 공공누리 '제0유형(조건 없는 이용)' 및 'AI유형'도 신설해 개방 범위를 확대했다. 저작권 권리 정보를 확인할 수 있는 통합 관리정보 데이터베이스(DB)도 구축한다. AI 사업자가 학습데이터의 권리자를 확인하는 데 드는 비용과 시간을 줄일 수 있도록 돕는다는 구상이다. 문체부가 발간한 '생성형 AI 저작물 학습에 대한 저작권법상 공정이용 안내서'는 위원회의 정책 방향을 법적으로 뒷받침하는 실무 지침서 역할을 한다. 안내서에 따르면 특정 저작물의 표현을 그대로 재현하는 것이 아니라, 범용적인 대화나 생성 능력을 구현하기 위한 학습은 '변형적 이용'으로서 공정이용에 해당할 가능성이 높다. 특히 AI가 특정 저작물 재현 요청을 시스템적으로 거절하는 기술적 조치를 취할 경우, 공정이용 인정에 유리하게 작용할 수 있다는 내용도 제시됐다. 이 같은 구체적인 기준은 기업들의 실무적 불확실성을 낮추는 데 기여할 것으로 보인다. 조준희 한국인공지능·소프트웨어산업협회(KOSA) 회장은 "옵트아웃 제도 도입은 글로벌 흐름에 발맞춘 것"이라며 "선사용·후보상 원칙과 함께 창작자 권리 보호와 AI 산업 발전이 상생할 수 있는 현실적인 균형점을 찾았다는 점에서 산업계에 실질적인 도움이 될 것"이라고 환영했다. 업계는 정부의 이런 행보를 반기는 분위기지만 제도의 정착을 위한 사회적 합의가 여전한 과제로 남아 있다. 임 부위원장은 지디넷코리아와의 인터뷰에서 "AI라는 거위가 황금알을 낳을 수 있을 만큼 먼저 성장해야 그 결실을 나눌 수 있다"며 "당장 수익 독촉보다 미래 가치를 함께 키우는 상생 모델을 통해 대한민국이 AI G3로 도약하는 발판을 마련해야 한다"고 강조했다.

2026.02.27 14:40이나연 기자

"AI 학습, 사진 2장이면 충분"…스누아이랩, 국제 권위 학회서 기술력 입증

단 2장의 사진으로 인공지능(AI)을 학습시킬 수 있는 방법을 제시한 국내 기업의 기술이 국제 권위 학회에서 인정받았다. 그동안 적게는 수천, 수만장의 데이터가 필요했던 AI 학습과정의 비용을 낮출 뿐 아니라 데이터가 부족한 분야도 보다 원할하게 AI를 도입할 수 있을 것으로 주목 받고 있다. 스누아이랩은 24일 이미지 노이즈 합성 모델 연구 논문이 '전미인공지능학회 2026(AAAI 2026)'에 채택됐다고 밝혔다. AAAI는 미국인공지능협회가 주관하는 학회 시리즈로, 전 세계 연구자와 기업이 최신 AI 연구 성과를 경쟁하는 대표 무대 중 하나로 꼽힌다. 이번 AAAI 2026에 2만3천680건의 논문이 제출됐고 4천167건이 채택돼 채택 비중이 약 18% 수준다. 단 2장의 이미지로 데이터 부족 해결…해법은 AI 합성 채택 논문 제목은 '가이드노이즈: 일반화된 노이즈 합성을 위한 단일 쌍 가이드 확산 모델(GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis)'이다. 핵심은 원본이미지 한장과 노이즈가 발생한 사진 1장만 있으면 카메라와 촬영 환경에서 나타나는 불필요한 요소(노이즈)를 더한 학습용 데이터를 만들 수 있다는 점이다. 이를 통해 데이터가 부족해도 데이터를 만들어 학습을 진행할 수 있는 구조다. 현실 세계에서 발생하는 노이즈는 생각보다 복잡하다. 카메라 센서 특성, 이미지 신호 처리(ISP) 과정, ISO 감도, 조명, 촬영 온도 같은 조건이 겹치면서 노이즈의 형태가 달라진다. 같은 카메라라도 설정이 바뀌면 패턴이 바뀐다. 예를 들어 CCTV나 스마트폰 카메라로 촬영한 영상은 밤이 되거나 조명이 어두우면 충분한 빛을 확보하지 못해 화질 저하가 발생한다. 또한 태양광, LED 조명 등 광원의 종류나 피사체의 재질에 따라 카메라 센서가 받아들이는 노이즈의 패턴과 색감은 미세하게 달라진다. 스누아이랩이 제시한 기술은 원본 이미지의 반사광이나 명암을 인식해 그 환경에 맞는 현실적인 노이즈를 입혀줌으로써 AI가 다양한 조명 환경에 적응하도록 돕는다. 그동안 이를 해결위해 현장에서 수천 장의 사진을 일일이 찍어 데이터를 모아야 했다. 비용과 시간이 막대하게 드는 만큼 제조 라인, 보안 관제, 의료 영상처럼 촬영 조건이 다양하고 미세한 영역일수록 비용과 시간이 부담이 됐다. 스누아이랩은 논문을 통해 자체 개발한 가이드노이즈 기술을 이용해 원본사진과 노이즈가 있는 사진 한쌍으로 해당 환경의 노이즈 특성을 완벽하게 분석해낼 수 있음을 증명했다. 반면 가이드노이즈는 확산모델 기반 생성 방식을 활용해, 메타데이터 없이도 '가이드 이미지 1쌍'에서 노이즈의 질감과 분포를 읽어내고 이를 다른 이미지로 전이하는 방식을 제안했다. 이 기술을 적용하면 AI는 2장의 샘플을 가이드 삼아 특정 카메라로 찍은 것과 동일한 품질의 노이즈 이미지를 무한대로 합성해낼 수 있다는 구상이다. 논문은 이를 위해 두 가지 기술을 결합했다. 먼저 가이드 인식 변형 기술(GAFM)은 가이드 이미지에서 추출한 노이즈 특징을 신경망 내부의 특징 맵 수준에서 조정해 깨끗한 입력 이미지에 자연스럽게 반영한다. 노이즈 인식 정제 손실 기술은 합성 결과가 실제 노이즈의 분포와 더 가깝게 맞춰지도록 학습 목표를 추가한다. 연구지는 결과가 최종 이미지에 수렴하는 마지막 단계에서 정제를 집중해 미세한 차이를 줄이려 했다고 밝혔다. 진짜 같은 노이즈 생성…기존 모델 대비 15% 이상 우위 연구팀은 가이드노이즈의 성능을 검증하기 위해 세계적으로 통용되는 노이즈 데이터셋인 SIDD 등을 활용해 비교 실험을 진행했다. 논문에 따르면 노이즈의 실제 유사도를 나타내는 지표인 '평균 쿨백-라이블러 발산(AKLD)' 평가에서 가이드노이즈는 0.113을 기록했다. 이 평가는 수치가 낮을수록 생성된 노이즈가 실제와 유사함을 뜻한다. 가이드노이즈의 기록은 기존 최신 기술인 NA플로우가 기록한 0.131나 NeCA의 0.133 대비 오차를 약 15% 이상 줄인 수치로 현존하는 모델 중 가장 실제에 가까운 노이즈를 생성한 것이다. 특히 합성된 데이터의 실용성이 돋보였다. 연구팀이 합성 데이터만으로 학습시킨 AI 모델의 이미지 복원 성능(PSNR)은 37.07 데시벨(dB)**을 기록했다. 이는 실제 데이터를 사용해 학습했을 때의 성능인 37.16dB과 비교해 차이가 0.1dB 미만에 불과한 수준이다. 값비싼 실제 데이터 수집 없이 합성 데이터만으로도 상용화 수준의 고성능 AI를 개발할 수 있다는 가능성을 수치로 증명한 것이다. 스누아이랩 측은 이 기술이 데이터 확보가 어려운 산업 현장에서 빛을 발할 것으로 전망했다. 데이터 반출이 힘든 반도체 제조 공장이나 개인정보 문제로 데이터 수집이 까다로운 의료 영상 분야에서도 소량의 샘플만으로 고성능 AI 모델을 구축할 수 있을 것이란 예상이다. 더불어 비전 AI의 전처리, 복원 품질을 끌어올리는 기반 기술이 될 수 있다고 보고 있다. 노이즈가 줄면 객체 탐지, 결함 분류, 문자인식(OCR), 이상 징후 탐지 등 후속 모델의 정확도도 함께 개선될 여지가 크다는 분석이다. 유명호 스누아이랩 대표는 "이번 AAAI 논문 채택은 스누아이랩의 연구 성과가 글로벌 무대에서 경쟁력을 인정받은 결과"라며 "현실 제약이 큰 산업 현장에서 저비용, 고효율로 성능을 끌어올릴 수 있는 비전 AI 기술을 지속적으로 고도화하겠다"고 밝혔다.

2025.12.24 10:01남혁우 기자

앤트로픽, 구글 TPU 핵심 파트너와 AI 데이터센터 구축 '박차'

인공지능(AI) 인프라 경쟁이 본격화되는 가운데, 앤트로픽이 구글의 핵심 파트너로 떠오른 네오클라우드 기업 플루이드스택과 초대형 데이터센터 구축에 박차를 가한다. 18일 월스트리트저널(WSJ)에 따르면 플루이드스택은 미국 루이지애나주에 건설되는 대규모 AI 데이터센터에서 앤트로픽이 활용할 고성능 컴퓨팅 클러스터 운영을 맡게 됐다. 해당 프로젝트는 단계별로 확장되는 구조로, 초기에는 약 245메가와트(MW) 규모의 연산 용량이 제공될 예정이다. 이 인프라는 앤트로픽이 대규모 언어모델(LLM)을 학습·운영·확장하는 데 활용된다 . 이번 협력에서 플루이드스택은 단순 임대 사업자를 넘어 AI 연산 인프라 운영의 중심 역할을 맡는다. 회사는 구글 텐서처리장치(TPU) 생태계의 핵심 파트너로, 최근 '제미나이 3' 학습용 TPU 인프라를 공급하며 급부상했다. TPU 중심 전략을 앞세워 AI 모델 개발사들의 엔비디아 그래픽처리장치(GPU) 의존도를 낮추는 동시에 대형 데이터센터와 AI 슈퍼컴퓨팅 인프라 구축에 속도를 내고 있다 . 플루이드스택은 현재 약 7억 달러(약 1조345억원) 규모의 신규 투자 유치를 추진 중이며 투자 성사 시 기업가치는 70억 달러(약 10조원)에 이를 것으로 전망된다. 구글과 골드만삭스가 투자 논의에 참여한 것으로 알려졌고 프랑스에 100억 유로(약 17조원) 규모의 AI 슈퍼컴퓨팅 센터를 구축하는 계획도 공개했다. 이는 글로벌 AI 인프라 수요가 급증하는 가운데, 기술 기업과 금융권이 결합한 새로운 데이터센터 투자 모델을 대표하는 사례로 평가된다. 앤트로픽 역시 공격적인 인프라 투자에 나서고 있다. 회사는 총 500억 달러(약 73조원)를 투입해 미국 내 맞춤형 AI 데이터센터를 구축할 계획이며 텍사스와 뉴욕을 시작으로 내년부터 순차 가동한다. 이 과정에서 플루이드스택과의 협력은 앤트로픽이 안정적인 연산 자원과 전력을 확보하는 핵심 축으로 작동할 전망이다. 업계에서는 앤트로픽의 대규모 인프라 투자가 오픈AI, 메타 등 경쟁사들의 초대형 프로젝트에 대응하기 위한 전략적 선택으로 보고 있다. 생성형 AI 성능 경쟁이 연산 능력과 전력 확보 경쟁으로 확산되면서 클라우드 사업자의 위상도 빠르게 높아지고 있다는 분석이 나온다. 플루이드스택이 단기간에 구글과 앤트로픽을 지원하는 글로벌 AI 인프라 핵심 사업자로 부상한 배경도 이같은 흐름과 맞물려 있다 . 앤트로픽은 "이번 데이터센터 구축을 통해 보다 강력하고 안전한 AI 시스템을 개발하고 과학적 발견과 산업 전반의 혁신을 가속화할 수 있을 것으로 기대한다"고 밝혔다.

2025.12.18 13:31한정호 기자

베일 벗은 카카오·오픈AI 첫 협업물…"추가 협업도 가능"

카카오가 오픈AI와의 첫 협업물로 카카오톡에 챗GPT를 탑재한 '챗GPT 포 카카오'를 출시한 가운데, 추가적인 협업 가능성을 내비쳤다. 챗GPT와 카나나의 카톡 채팅 학습 가능성에 대한 우려를 일축했을 뿐만 아니라 자사 서비스를 연동한 '카카오 툴즈'에 외부 대형 서비스 제휴 여지도 남겨뒀다. 유용하 카카오 AI에이전트플랫폼 성과리더는 28일 경기도 판교 카카오아지트에서 열린 기자간담회에서 “추후 더 추가적인 전용 API를 이용한 협업의 여지나 새로운 전용 서비스, 상품 출시도 충분히 가능할 것”이라며 “다만, 현재 서비스(챗GPT 포 카카오)가 어느 정도 안정화되고 방향성이 정해진 후 추진할 수 있을 것”이라고 이같이 말했다. 이날 카카오는 현장에서 카카오톡에 챗GPT를 적용한 '챗GPT 포 카카오'와 카톡 안 대화 맥락을 파악해 먼저 메시지를 보내주는 '카나나 인 카카오톡'을 소개했다. 챗GPT 포 카카오는 카톡 안에서 대화하면서 채팅탭 상단에 위치한 챗GPT 버튼을 클릭해 서비스를 사용할 수 있는 기능이다. 오픈AI의 최신 언어모델인 'GPT-5'를 적용해 검색, 이미지 업로드·생성과 같은 기능을 모두 제공한다. 챗GPT 포 카카오는 '카카오 툴즈'를 활용해 카카오의 다양한 서비스와 연동되는 것이 특징이다. 카카오 툴스 안에는 카카오맵, 카톡 예약하기, 카톡 선물하기, 멜론이 포함되며 이용자의 요청에 따라 해당 서비스들이 자동으로 연결되는 경험을 제공한다. 이 과정에서 발생할 수 있는 광고 상품 우선 노출 우려에 대해서는 선을 그었다. 강지훈 카카오 AI디스커버리 성과리더는 “선물하기 추천 기능은 사실 광고라고 보고 어렵고, 숨어 있는 선물을 추천하는 기능”이라며 “오히려 이용자 편의성 위주로 가게 되는 기능에 더 가깝다”고 언급했다. 카카오 내부 기능이 우선 탑재된 카카오 툴스와 외부 서비스와의 제휴 가능성도 열어뒀다. 유 성과리더는 “외부 파트너사의 경우 올해 프로젝트가 시작됐고 출시하기까지 굉장히 짧은 시간이었기 때문에 제휴까지 진행하기는 짧은 시간”이라면서도 “외부 서비스도 내년부터 순차적으로 적용할텐데 사용자들의 선택에 최대한 초점을 맞출 예정이고 새로운 패러다임으로 발전할 수 있는 대형 제휴사도 충분히 들어올 수 있을 것”이라고 답했다. 보안 관련해서 임원진들은 카톡에서 나눈 대화가 챗GPT 뿐만 아니라 자체 모델인 카나나의 학습에도 활용되지 않는다고 강조했다. 유 성과리더는 “챗GPT 포 카카오에서 사용되는 여러 내용은 자체 모델(카나나) 학습에 사용되지 않는다. 카톡에서의 대화와 챗GPT는 완전히 서비스적으로 분리돼 있기 때문에 대화가 임의로 넘어가는 경우는 절대 없다”며 걱정을 일축했다. 챗GPT 포 카카오는 이용자가 직접 대화 내용 저장 여부와 AI 학습 반영 여부를 자유롭게 선택할 수 있으며 모든 이용자 정보는 카카오와 챗GPT의 개인정보 보호 정책에 따라 보호된다는 설명이다. 챗GPT 포 카카오는 이날부터 출시되며, 현재 아이폰15 프로 이상의 모바일 기기를 지원하는 카나나 인 카카오톡은 베타테스트를 거쳐 내년 1분기 중 안드로이드로 서비스 확대 후 정식 서비스로 선보일 예정이다.

2025.10.28 16:01박서린 기자

AI 시대 '국가데이터처' 출범…업계 "정제·품질 관리가 관건"

통계청이 국무총리 산하 '국가데이터처'로 승격하며 범정부 데이터 컨트롤타워로 새출발한다. 인공지능(AI)·소프트웨어(SW) 산업계에서는 데이터 거버넌스 강화에 기대를 보이면서도 정제와 품질 관리가 뒷받침되지 않으면 실효성이 떨어질 수 있다는 지적이 나온다. 13일 업계에 따르면 국가데이터처 출범은 공공·민간에 흩어진 데이터를 통합 관리하고 활용 체계를 정비하려는 정책 방향을 구체화한 것으로 평가된다. 이번 승격으로 국가데이터처는 단순 통계 생산기관에서 벗어나 데이터 정책 전반을 총괄하는 기구로 확대된다. 이를 통해 정부는 부처 간 칸막이를 해소하고 국가 차원의 데이터 관리·연계·활용 기능을 강화한다는 구상이다. 그동안 공공데이터는 행정안전부, 개인정보는 개인정보보호위원회, 민간데이터는 과학기술정보통신부가 각각 관리하면서 효율성이 떨어진다는 지적이 이어져 왔다. 국가데이터처는 이런 구조를 조정할 실질적 권한을 확보해야 한다는 목소리가 나온다. SW 업계 관계자는 "그간 데이터 개방은 많았지만 정책적 체계가 미흡했다"며 "국가데이터처가 중심을 잡으면 민간의 데이터·AI 사업도 안정적으로 확장될 수 있을 것"이라고 말했다. 이와 관련해 AI 업계는 데이터 정제와 표준화 문제를 핵심 과제로 꼽는다. AI 학습용 데이터가 부정확하거나 형식이 제각각이라 품질이 낮다는 점이 반복적으로 지적돼 왔기 때문이다. 한 AI 스타트업 대표는 "AI 시대에는 데이터 양보다 질이 중요하다"며 "라벨링 오류와 형식 불일치 문제를 해결하지 않으면 AI 개발 효율이 떨어질 수 있다"고 지적했다. 공공데이터가 엑셀·PDF 등 비정형 형태로 제공돼 AI 학습에 직접 활용하기 어려운 현실도 문제점으로 제기되고 있다. 이에 국가데이터처가 표준화된 데이터 구조를 마련해 민간 활용도를 높여야 한다는 의견도 나온다. 정부는 국가데이터처를 중심으로 공공·민간 데이터를 아우르는 범정부 거버넌스를 구축하고 데이터 품질 관리와 연계 활성화를 동시에 추진한다는 방침이다. 이를 통해 데이터 경제의 경쟁력과 AI 산업 기반을 강화할 계획이다. 다만 업계에서는 실질적 권한과 예산이 보장되지 않으면 변화가 제한적일 수 있다는 우려도 있다. 한 관계자는 "간판만 바뀌면 또 다른 행정조직에 불과하다"며 "데이터 정책의 조정권과 실행력이 실제로 확보돼야 한다"고 말했다. 민관 협력을 통한 품질 검증 체계 마련도 필요하다는 목소리가 나온다. 데이터 정제와 품질 인증이 체계화돼야만 공공데이터가 산업 현장에서 바로 활용될 수 있다는 것이다. SW 업계 관계자는 "데이터 개방 정책은 AI 시대에 당연히 필요하지만 결국 산업에서 쓸 수 있는 형태로 정제되지 않으면 의미가 없다"며 "정부가 품질 검증과 표준화를 민간과 함께 추진해야 한다"고 제언했다. 국가데이터처는 향후 AI가 통계 데이터를 해석·추론할 수 있는 메타데이터 체계를 구축하고, 부처 간 데이터 연계 정책을 조정하는 역할을 맡게 될 전망이다. 정부는 공공·민간 데이터가 행정뿐 아니라 산업 전반에서도 활용될 수 있도록 지원한다는 방침이다. 업계 관계자는 "국가데이터처 출범이 국가 데이터 혁신의 출발점이 되길 기대한다"며 "정부가 민간과 협력해 신뢰할 수 있는 데이터 생태계를 만들어야 AI 시대 경쟁력을 확보할 수 있다"고 강조했다.

2025.10.13 17:20한정호 기자

앤트로픽, 사용자 대화로 AI 훈련…데이터 최대 5년 보관

앤트로픽이 자사 챗봇 서비스 '클로드' 이용자의 대화 데이터를 인공지능(AI) 학습에 활용하기로 하고, 다음 달 28일까지 '거부(옵트아웃)' 여부를 선택하는 정책을 도입한다. 29일 테크크런치 등 외신에 따르면 이번 정책 변경은 소비자용 서비스인 클로드 프리·프로·맥스·코드 이용자에게 적용된다. 그동안 클로드의 대화와 코드 입·출력은 30일 내 자동 삭제됐고 정책 위반이 의심되는 경우에만 최대 2년간 보관됐다. 그러나 이번 정책 변경으로 앞으로는 이용자가 옵트아웃하지 않을 경우 데이터가 최대 5년간 보관되며 모델 학습에도 활용된다. 앤트로픽은 공지를 통해 "이용자가 학습 참여를 허용하면 유해 콘텐츠 탐지 정확도와 코딩·분석·추론 성능이 개선된다"며 "미래 모델 발전에도 기여할 수 있다"고 설명했다. 업계는 이번 조치가 사실상 대규모 학습 데이터 확보 전략으로 보고 있다. 수백만 건에 달하는 사용자 대화를 학습에 반영해 오픈AI·구글 등 경쟁사 대비 우위를 확보하려는 의도로 풀이된다. 이번 변화는 업계 전반의 흐름과도 맞닿아 있다. 오픈AI는 최근 뉴욕타임스 등 언론사와의 소송과 관련해 법원으로부터 모든 소비자 대화 데이터를 무기한 보관하라는 명령을 받았다. 이에 따라 규제와 소송 환경 속에서 AI 기업들이 데이터 보관·활용 정책을 재정비할 수밖에 없다는 분석이 나온다. 다만 많은 이용자가 이러한 정책 변경을 제대로 인지하지 못한다는 점은 문제로 지적된다. 앤트로픽은 기존 이용자에게 '소비자 약관 및 정책 업데이트' 안내 팝업을 띄우는데 화면에는 '수락' 버튼이 크게 표시되는 반면, 데이터 학습 동의 여부를 설정하는 토글은 작게 배치돼 있으며 기본값이 '온(ON)'으로 설정돼 있다. 이 때문에 무심코 수락을 누르면 학습 동의까지 하게 되는 구조다. 미국 연방거래위원회(FTC)는 서비스 약관을 눈에 띄지 않게 바꾸거나 세부 조항을 하이퍼링크·법률 용어 속에 숨기는 행위에 대해 제재할 수 있다고 경고한 바 있다. 그러나 현재 FTC가 5명 중 3명 위원만 활동 중이라 이번 앤트로픽 조치에 실제로 개입할 가능성은 크지 않다는 전망이 나온다. 앤트로픽 측은 "이번 조치는 사용자들이 학습 참여 여부를 직접 선택할 수 있도록 한 것"이라며 "보다 안전하고 유용한 AI 모델을 만드는 데 기여할 것"이라고 밝혔다.

2025.08.29 10:28한정호 기자

구글, AI 학습 데이터 '1만 분의 1'로 줄이는 방법 찾았다

구글이 대규모 언어모델(LLM) 학습에 필요한 데이터를 획기적으로 줄이는 '액티브 러닝(Active Learning)' 기반 데이터 선별 기법을 지난 7일(현지시간) 자사 블로그에 공개했다. 기존에는 수십만 건 이상이 필요한 학습 데이터를 단 수백 건으로 줄이면서도, 모델 성능을 유지하거나 오히려 개선하는 결과를 얻었다는 설명이다. 이번 연구는 온라인 광고에서 '정책 위반'이나 '유해 콘텐츠'를 판별하는 모델 고도화를 목표로 했다. 광고 안전성 판별은 단순 키워드 필터링을 넘어, 문화·맥락을 이해하는 고급 해석 능력이 필요하다. 이런 복잡한 작업에는 LLM이 유리하지만, 고품질 학습 데이터 확보가 어렵고 비용이 많이 든다는 한계가 있었다. 특히 광고 정책이 바뀌거나 새로운 유형의 유해 콘텐츠가 등장하면, 방대한 데이터를 다시 수집·학습해야 하는 문제도 있었다. 구글이 제안한 방식은 '적은 양의 고품질 데이터'로도 모델을 빠르게 재학습할 수 있게 하는 것이 핵심이다. 먼저, 예시 몇 개만 제공한 초기 모델(LLM-0)로 광고를 분류한 뒤, 분류 결과를 비슷한 특성끼리 묶어(클러스터링) 모델이 혼동하는 영역을 찾는다. 이후 서로 다른 판정을 받은 비슷한 사례 쌍을 전문가에게 보내 정확한 판정을 받는다. 이렇게 선별된 데이터는 다양성과 정보성을 동시에 확보하며, 다음 학습에 활용된다. 이 과정을 반복해 모델과 전문가의 의견 일치율을 높인다. 성능 평가는 '코헨 카파(Cohen's Kappa)'라는 지표를 활용했다. 이는 정답이 명확하지 않은 분류 작업에서 두 명의 판정자가 우연 이상의 수준으로 얼마나 일치하는지를 나타낸다. 카파 값이 1에 가까울수록 의견 일치도가 높다. 실험 결과, 구글은 10만 건의 대규모 데이터 대신 250~450건의 전문가 판정 데이터만으로도 기존과 같은 수준, 혹은 65% 향상된 모델 정합도를 달성했다. 특히 파라미터가 큰 모델일수록 데이터 절감 효과가 극대화돼, 실서비스에서는 최대 1만 배 적은 데이터로도 품질을 유지하거나 개선할 수 있었다고 밝혔다. 구글은 이번 방식이 광고 안전성뿐 아니라 정책이 자주 변하거나 위험 요소가 빠르게 진화하는 다른 분야에도 적용 가능하다고 보고 있다. 구글 측은 “LLM의 폭넓은 탐색 능력과 전문가의 정밀한 판별을 결합해 데이터 병목 현상을 해소할 수 있다”며 “앞으로도 데이터 품질과 효율성을 동시에 높이는 연구를 이어갈 것”이라고 말했다.

2025.08.10 08:58백봉삼 기자

'소재 실험 데이터' 표준화된다…소재 기업 AI 활용 지원

소재 기업의 인공지능(AI) 활용 지원을 위해 '소재 실험 데이터' 양식을 표준화한다. 산업통상자원부 국가기술표준원은 소재 실험 시 생성되는 데이터(조성–공정–물성)의 공통 구조와 수집 양식에 대한 국가 표준(KS)을 제정했다고 24일 밝혔다. 이번 KS 제정은 산업부가 추진 중인 '가상공학플랫폼구축 사업(소재 데이터 사업)'의 하나로 AI 기반 소재 개발의 필수 요건인 '연구자 간 데이터 호환성'을 확보하기 위해 추진됐다. 소재 산업은 신제품을 개발할 때 장기간 반복 실험이 수반되면서 양질의 데이터가 축적되는 특성을 갖고 있다. 다만 데이터 표준이 업어 기관 간 데이터 공유와 AI를 활용한 협업 연구로 확장되기에는 현실적 제약이 있었다. 산업부는 선진국 보다 업력이 짧은 국내 소재 기업의 데이터·AI 기반 소재 개발을 촉진하기 위해 소재 데이터 국가 표준화를 추진했다. 국표원이 제정한 KS는 4개 소재 분야(화학·금속·세라믹·섬유) 개발 과정이 '조성–공정–물성' 3단계로 구분돼 있다. 원료명·투입량 등 총 60개의 데이터 구조·항목이 표준화됐다. 또, 각 단계별 필수 입력값과 단위·데이터 유형 등이 정의돼 실험 조건과 측정 결과를 체계적으로 기록할 수 있도록 구성됐다. 소재 기업은 이 표준을 활용해 고품질 데이터를 생성하고, 이를 AI 모델의 학습 데이터로 활용해 최적의 원료 조합과 공정 조건을 도출할 수 있다. 김대자 산업부 국가기술표준원장은 “이번 표준은 기업의 소재 개발 기간을 단축하고, 개발 효율성과 성공률을 높이는데 기여할 것으로 기대된다”면서 “앞으로도 다양한 산업에서 AI 활용이 확산할 수 있도록 필요한 표준화를 적극 추진해 나가겠다”고 밝혔다.

2025.07.24 09:32주문정 기자

KT, 한국적 AI 위한 'K 데이터 얼라이언스' 출범

KT는 16일 서울 송파구 소피텔 앰배서더 서울에서 'K 데이터 얼라이언스' 협약식을 개최했다고 밝혔다. 이는 한국적 AI 경쟁력의 핵심인 고품질 데이터를 신뢰성 있게 교류하고자 한국 대표 기업, 공공기관, 학계 간 협력을 본격화하는 취지다. 이날 협약에는 KT를 비롯해 고려대 민족문화연구원, 두산디지털이노베이션, 아이스크림에듀, 중앙일보, EBS, 한글학회 등 7개 기관이 참여해 'K 데이터 얼라이언스' 출범을 공식화했다. 이어 AI 데이터 생태계 구축에 대한 논의도 진행됐다. KT는 주관사로서, 한국어 고유 표현과 사회·문화적 맥락, 사용자 목적을 반영한 고품질 데이터의 중요성을 강조했다. 또한, 각 기관이 보유한 한국적 데이터 공유의 의미와 가치를 역설했다. 이번 얼라이언스 결성은 한국적 AI의 구현과 활용을 넘어, 협력과 개방을 통한 생태계 확산과 글로벌 경쟁력 확보를 위한 공감대에서 출발했다. 참여 기관들은 앞으로 ▲한국적 AI를 위한 데이터 구축 ▲도메인별 선도 사례 창출 ▲성과 홍보 및 대외 확산 ▲인문·사회 분야 연구를 위한 협력 등을 추진할 계획이다. KT는 한국의 언어, 문화, 지식 등 정체성을 담은 AI 개발을 위해 교육, 인문, 역사, 언론 등 각 분야 대표 콘텐츠를 보유한 기관들과의 연합을 주도해 왔다. 각 기관의 콘텐츠는 고품질 데이터로 가공·구조화돼, KT의 독자 모델 '믿:음 2.0', 마이크로소프트 협력 기반 GPT, 오픈소스 모델 등 다양한 한국형 AI 학습에 활용된다. 특히, EBS의 질문-답변형 학습 콘텐츠는 AI의 추론 능력을 높이는 핵심 자원이며, 중앙일보의 뉴스 콘텐츠는 한국 사회와 문맥을 깊이 이해하는 데 유용한 학습 기반으로 평가된다. 앞으로 KT는 정기 협의체 운영, 성과 공유, 신규 과제 발굴 등을 통해 얼라이언스의 실행력을 강화하고, 참여 기관을 확대해 데이터·모델·서비스로 이어지는 정교한 한국형 AI 생태계를 구축할 방침이다. 이날 행사에 참여한 허은 고려대학교 민족문화연구원 원장은 “한국적 AI 발전을 위해 높은 수준의 한국학 전문 자료를 AI 학습용 데이터로 활용하는 것은 필수”라며 “K 데이터 얼라이언스는 이를 현실화하는 데 중요한 플랫폼이 될 것”이라고 강조했다. 유규오 EBS 디지털학교교육본부 본부장은 “EBS는 교육공영방송사로서 다양한 플랫폼을 통해 교육 격차를 줄이고 배움의 문턱을 낮추는 데 집중해왔다”며 “이러한 가치를 지닌 EBS 데이터가 KT의 신뢰성 높은 데이터 처리 기술과 연결될 때 학생 개개인의 학습 성장을 지원하는 새로운 길을 여는 계기가 될 것”이라고 전망했다. 남길임 한글학회 연구이사 교수는 “검색어를 입력하던 시대를 넘어 인공지능과 직접 문답하는 시대가 열린 지금 한국어와 한국인의 정서에 담긴 언어문화, 맥락, 공동체 윤리 등을 제대로 이해하고 책임있게 응답하는 인공지능이 필요하다”며 “한글학회가 쌓아 온 한국어 연구와 자원을 토대로 한국어의 사회·문화적 맥락과 윤리적 가치를 제대로 이해하고 생성하는 인공지능으로 나아가는데 협력할 것”이라고 전했다. 오승필 KT 기술혁신부문 부사장은 “한국적 AI는 국가의 AI 경쟁력을 높이는 동시에 기업의 AI 혁신을 촉진하고 국민이 일상 속에서 체감할 수 있는 실용적 가치로 이어져야 한다”며 “K 데이터 얼라이언스가 한국적 AI의 지속적인 고도화와 실용화에 있어 핵심 동력이 될 수 있도록 힘을 모아 협력해 나갈 것”이라고 밝혔다.

2025.07.16 10:35진성우 기자

  Prev 1 2 Next  

지금 뜨는 기사

이시각 헤드라인

네카오 'AI 수익화' 시점 변했다...네이버는 시작, 카카오는 내년

갤럭시 워치9·울트라2, 이통3사 지원금 비교해보니

中 키미 K3, 인터넷 무단접속→정답 확인…보안 강화해야

빅테크는 ASIC, 범용은 엔비디아…좁아지는 K-NPU 입지

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.