• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'데이터 부족'통합검색 결과 입니다. (2건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

[AI는 지금] "LLM 키울 데이터가 없다"…中 AI, 중국어 부족에 비상등

중국 인공지능(AI) 기업들이 고품질 학습 데이터 확보에 비상이 걸렸다. 온라인에서 활용할 수 있는 중국어 데이터가 제한적인 데다 공개 데이터 고갈 우려까지 커지면서 차세대 대규모언어모델(LLM) 개발을 위한 데이터 확보 부담도 높아지고 있다. 8일 사우스차이나모닝포스트(SCMP)가 인용한 인터넷 통계업체 W3테크스(Techs) 자료에 따르면 이달 기준 전 세계 웹 콘텐츠에서 중국어가 차지하는 비중은 1.3% 수준이다. 영어는 전체의 절반에 가까운 비중을 차지했으며 스페인어와 독일어는 각각 6%, 일본어는 5%로 집계됐다. AI 업계 전반에선 모델 학습에 투입할 고품질 인간 생성 데이터가 빠르게 줄고 있다는 우려가 커지고 있다. 미국 연구기관 에포크AI는 공개적으로 이용할 수 있는 고품질 인간 생성 텍스트가 향후 6년 안에 사실상 소진될 수 있다고 전망했다. 오픈AI 공동창업자 안드레이 카파시도 2030년 전후 신뢰할 수 있는 신규 데이터를 충분히 공급하지 못하면 모델 성능 향상이 정체되는 '데이터 벽'에 부딪힐 수 있다고 경고했다. 이에 미국 AI 기업들은 웹 밖으로 데이터 확보 범위를 넓히고 있다. 워싱턴포스트가 법원 문서를 토대로 보도한 내용에 따르면 앤트로픽은 내부 프로젝트인 '프로젝트 파나마'를 통해 수천만 달러를 투입해 수백만 권의 실물 도서를 확보했다. 책의 제본을 제거한 뒤 모든 페이지를 스캔해 디지털화하는 방식으로 학습 데이터를 마련했다. 중국은 온라인에서 활용할 수 있는 자국어 콘텐츠 풀이 영어권보다 작아 데이터 고갈에 더 취약할 수 있다. 기존 웹 크롤링만으로 모델 규모와 성능을 계속 끌어올리기 어려워지면 도서와 전문 문헌, 산업 데이터, 음성·영상 등 아직 충분히 활용하지 못한 데이터 확보가 필요해질 것으로 보인다. 이 탓에 중국 정부는 고품질 데이터를 AI 경쟁력의 핵심 자원으로 보고 공급 체계 구축에 나섰다. 중국 국가데이터국은 지난 6월 AI 학습 데이터의 공급·유통·상용화를 확대하는 전국 단위 계획을 발표했다. 2028년까지 제조·에너지·의료·금융·농업을 비롯해 피지컬 AI, 자율주행, 저고도 항공 분야에서 활용할 수 있는 검증된 데이터셋 생태계를 구축한다는 목표다. 학계에선 중국어 코퍼스(언어 데이터) 자체를 넓혀야 한다는 요구도 커지고 있다. 디지털 도서뿐 아니라 역사 기록물과 지방지, 고문서, 과학 문헌 등 오프라인 자료를 체계적으로 디지털화하고 사전과 음성·영상 콘텐츠, 지역 방언까지 학습 자원으로 활용해야 한다는 주장도 나오고 있다. 이 같은 상황 속에 대안으로 합성 데이터와 시뮬레이션이 거론되고 있다. 알리바바그룹 산하 싱크탱크 알리리서치는 2024년 발표한 백서에서 알고리즘과 컴퓨팅 파워, 데이터를 AI 모델 개발의 3대 축으로 제시하고 생성형 AI 성능 향상을 위해 더 풍부하고 품질 높은 데이터가 필요하다고 밝혔다. 잡지와 프로그래밍 코드 등도 추가 데이터원으로 활용할 수 있다고 제안했다. 하지만 데이터 확보 범위가 출판물과 오프라인 자료로 확대되면서 저작권 갈등이 커질 가능성도 높아지고 있다. 중국 화샤출판사가 최근 출간한 고대 도교 경전 번역본에는 책 내용을 AI 학습에 사용하는 것을 금지하고 위반 시 법적 책임을 묻겠다는 문구가 실렸다. 출판사 측은 해외 저작권자 요청으로 해당 조항을 넣었다고 설명했지만, AI 학습 과정에서 실제 침해 여부를 적발하고 권리를 행사하기는 쉽지 않다고 강조했다. 업계에선 중국이 웹 중심의 데이터 확보 방식에서 벗어나려면 오프라인 지식의 디지털화와 산업별 데이터 구축, 저작권 처리 체계를 함께 마련해야 할 필요가 있다고 지적했다. 모델과 컴퓨팅 파워를 확보하더라도 학습에 투입할 고품질 중국어 데이터가 충분하지 않으면 AI 성능 경쟁을 지속하기 어렵기 때문이다. 쑨마오쑹 칭화대 교수는 "코퍼스는 대규모언어모델 발전에서 핵심적인 역할을 하며 AI 역량 고도화를 뒷받침하는 핵심 요소로 자리 잡았다"며 "과장해서 말하는 게 아니라 코퍼스가 없으면 언어모델도 없다"고 강조했다.

2026.08.08 19:46장유미 기자

'SGI 해킹' 랜섬웨어 그룹 "13.2TB 데이터 곧 공개"

13.2테라바이트(TB) 규모의 SGI서울보증 데이터를 탈취했다고 주장했던 랜섬웨어 그룹이 인력 부족 등의 이유로 분석하지 못했던 데이터에 대한 분석을 다시 시작했다고 주장했다. (☞ 해커 "SGI서울보증 13.2TB 탈취" 주장…다크웹 들어가보니) 19일 본지 취재를 종합하면 랜섬웨어 공격 그룹 '건라'(Gunra)는 자신들의 다크웹 사이트에 SGI서울보증과 관련한 내용을 새로 업데이트하며, "SGI서울보증의 13.2TB 규모의 핵심 데이터베이스에 대한 분석을 시작했다"며 "곧 모든 데이터를 공개할 예정"이라고 경고했다. 앞서 지난 5일 '건라'(Gunra)는 자신들의 다크웹 사이트에 SGI서울보증을 피해자로 등록하며 13.2TB 규모의 오라클 데이터베이스를 탈취했다고 주장했던 바 있다. 당시 건라는 샘플 등 세부 데이터를 공개하지 않아 SGI서울보증의 데이터를 실제로 탈취한 것이 맞는지 확인이 불가능했다. 건라 측은 "방대한 (SGI서울보증의)데이터를 보유하고 있지만, 이를 분석할 인력이 충분하지 않다"며 "원한다면 이 데이터베이스를 함께 분석하자"는 글을 올려 데이터를 공개하지 않은 배경에 대해 인력 부족을 꼽았었다. 이런 가운데 곧 데이터 분석을 끝내고 모든 데이터를 공개하겠다는 예고를 해커가 남긴 것이다. 한편 지난 5일 건라 측의 주장이 공개됐을 당시 SGI서울보증 측은 "현재까지 고객정보를 포함한 대용량 내부 정보가 유출된 정황은 확인된 바가 없다"며 "SGI서울보증은 고객정보 등 민감정보 유출이 확인 될 경우 관계법령 및 정보보호 매뉴얼 등에 따라 관계 기관과 투명하게 정보를 공유하고 필요한 대응조치를 신속히 수행할 예정이며, 민감정보 유출로 정보주체의 손해가 발생할 경우 이를 전액 보상할 방침"이라고 밝혔다.

2025.08.19 14:55김기찬 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

"구글·오픈AI부터 퍼플렉시티까지"…빅테크 AI 거물 한 자리 모인다

BYD는 PHEV 꺼냈는데…현대차, 日心 잡을까

신소재 개발부터 양산성까지...LG엔솔, 35년 배터리 기술 AX에 녹인다

'정책통' 엄열·'실행력' 김경만…국가 AI 컨트롤타워 실무 투톱 구축

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.