• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
국감2026
AI페스타26
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'AI 토큰'통합검색 결과 입니다. (35건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

LGU+, AI 토큰 처리량 4배 높였다...GPU·전력 효율화

LG유플러스가 같은 GPU에서 AI가 처리할 수 있는 토큰량을 최대 4배까지 높이는 기술을 개발했다. AI 서비스 확대로 GPU와 전력 비용이 늘어나는 가운데 모델 성능을 유지하면서 인프라 운영비를 줄이는 기술 확보에 나선다. LG유플러스는 AI 모델 최적화 전문기업 옵트에이아이와 '토큰 최적화' 기술을 공동 연구한다고 2일 밝혔다. 토큰은 AI가 질문을 이해하고 답변을 만드는 과정에서 처리하는 데이터의 기본 단위다. 양사는 AI 모델의 연산 구조를 실제 서비스 환경에 맞게 개선해 동일한 GPU에서 처리할 수 있는 토큰량을 기존 대비 최대 4배 높이는 초기 성과를 확보했다. 앞으로 같은 GPU 자원으로 더 많은 이용자 요청을 처리하는 데 초점을 맞춰 기술을 고도화한다. LG유플러스는 실제 AI 서비스 환경에서 기술을 검증하고 적용하는 역할을 맡는다. 옵트에이아이는 모델 경량화와 연산 효율을 높이는 기술 개발을 담당한다. GPU와 전력 사용량을 낮추면서 AI 응답 속도와 서비스 품질을 유지하는 것이 목표다. 양사는 앞서 온디바이스 AI 분야에서도 협력했다. '엑사원(EXAONE)' 기반 소형언어모델(sLM)을 스마트폰의 AI 전용 반도체인 NPU에서 구동하도록 최적화해 기존 중앙처리장치(CPU) 방식과 같은 수준의 성능을 유지하면서 전력 소모를 78%, 모델 크기를 82% 줄였다. 공동 연구 범위는 스마트폰에서 서버 GPU 환경으로 넓어진다. 양사는 지난 1일 'Efficient AI 테크 세미나'를 열고 퓨리오사AI, 베슬에이아이, 한국전자기술연구원(KETI), 한양대학교 등과 AI 모델 최적화와 AI 반도체, 서비스 적용 사례를 공유했다. LG유플러스는 공동 연구를 통해 확보한 기술을 자사 AI 서비스와 대규모 AI 인프라에 단계적으로 적용할 계획이다. 이상엽 LG유플러스 최고기술책임자는 “AI 경쟁력은 단순히 성능을 높이는 것을 넘어 같은 자원으로 얼마나 많은 토큰을 효율적으로 처리할 수 있느냐에 달려 있다”며 “옵트에이아이를 비롯한 다양한 파트너들과 협력해 토큰 최적화 기술 연구를 확대하고 실제 서비스에 적용할 수 있는 성과를 만들어 나가겠다”고 말했다. 이재호 옵트에이아이 대표는 “생성형 AI 시대에는 높은 성능만큼이나 운영 효율을 확보하는 것이 중요해지고 있다”며 “LG유플러스와 실제 서비스 환경에서 검증 가능한 AI 최적화 기술을 고도화하겠다”고 말했다.

2026.10.02 12:28박수형 기자

신정규 래블업 대표 "AI도 전기처럼 쓰는 시대…복잡한 인프라 쉽게 바꿀 것"

"인공지능(AI)과 인프라는 갈수록 복잡해지고 있습니다. 래블업은 이 복잡한 운영을 직관적이고 간단하게 바꿔 누구나 지능을 계량하고 필요할 때 사용할 수 있도록 만들겠습니다." 신정규 래블업 대표는 29일 서울 코엑스에서 열린 연례 기술 컨퍼런스 'lab | up > /conf/6'에서 AI 산업 변화와 기술 전략에 대해 이같이 밝혔다. 신 대표는 AI가 연구·개발을 넘어 실제 산업과 서비스에 활용되면서 단순히 좋은 모델이나 그래픽처리장치(GPU)를 확보하는 것만으로는 충분하지 않다고 진단했다. 다양한 AI 모델과 가속기, 클라우드와 자체 인프라를 연결하고 사용량과 비용까지 하나의 환경에서 관리하는 역량이 중요해졌다는 설명이다. 특히 AI가 만들어내는 지능을 측정하고 관리하는 기준으로 토큰과 전력, 모델 자체의 지능을 제시했다. 같은 작업이라도 어떤 모델을 사용하느냐에 따라 필요한 토큰과 비용이 달라지는 만큼 AI를 산업적으로 활용하려면 이를 측정할 수 있어야 한다는 분석이다. 신 대표는 "동일한 토큰으로 얼마나 더 많은 지능을 압축해서 제공할 수 있는지가 굉장히 중요한 시점"이라며 "필요한 지능 수준과 문제 해결에 투입해야 하는 토큰량을 함께 계산할 수 있어야 한다"고 설명했다. 래블업은 이를 위한 핵심 제품으로 '백엔드닷AI'와 '컨티넘'을 제시했다. 백엔드닷AI는 다양한 AI 가속기와 대규모 클러스터에서 AI 모델의 학습과 서비스를 통합 운영·관리하는 AI 인프라 플랫폼이다. 컨티넘은 여러 AI 모델로 들어가는 요청을 한곳에서 관리하는 라우터와 이를 통합 관리하는 허브로 구성된다. 클라우드와 자체 구축한 AI 모델을 연결하고 요청을 자동으로 배분하는 동시에 조직과 팀별 토큰 사용량과 비용 등을 확인하도록 지원한다. 컨티넘 라우터의 단독 솔루션은 다음 달 공개할 예정이다. 신 대표는 "토큰이 전기처럼 사용된다고 하면 결국 계량기가 필요한 상황"이라며 "얼마나 절약됐는지, 어느 팀이 토큰을 얼마나 사용하고 있는지 확인할 수 있어야 한다"고 말했다. AI 에이전트 확산에 대응한 새로운 기술 개발에도 나선다. 래블업은 여러 AI 에이전트가 서버 자원을 안정적으로 나눠 사용할 수 있도록 마이크로 가상머신(VM)과 컨테이너를 결합한 '누빔(Neuvm)'을 개발 중이다. 기존 컨테이너 환경에서 발생하는 디스크 입출력(I/O)과 네트워크 대역폭 격리 문제를 해결하는 것이 목표로, 올해 말 베타 버전 공개를 준비 중이다. 사람과 여러 AI 에이전트가 함께 일할 수 있는 자체 AI 에이전트 플랫폼도 개발하고 있다. 에이전트 생성과 운영을 자동화하고 외부 서비스 호출과 자격 증명 등을 중앙에서 관리하는 구조다. 이를 활용해 사람과 AI 에이전트가 한 공간에서 협업할 수 있는 형태의 업무 공간 '스페이스(Space)'도 구현했다. 신 대표는 "갈수록 복잡해지는 AI의 수면 아래에서 일어나는 것들을 더 직관적이고 간단하게 바꿀 것"이라며 "모두가 지능을 계량하고 원할 때 사용할 수 있도록 하는 일을 지속 추진해 나가겠다"고 강조했다.

2026.09.29 11:27한정호 기자

[AI는 지금] 비싼 오픈AI·앤트로픽…美 기업들, 오픈 모델로 눈 돌린다

미국 기업들이 오픈AI와 앤트로픽의 최첨단 인공지능(AI) 모델 대신 비용이 저렴한 오픈웨이트 모델로 눈을 돌리고 있다. AI 활용이 늘면서 기업의 관련 비용도 빠르게 불어나자 자체 인프라에서 운영하고 목적에 맞게 조정할 수 있는 오픈 모델이 대안으로 떠오르는 모습이다. 27일(현지시간) 파이낸셜타임즈에 따르면 미국 기업들 사이에서 오픈웨이트 AI 모델 도입이 빠르게 확산되고 있다. 기술기업뿐 아니라 금융사 PNC파이낸셜서비스, 물류기업 CH로빈슨, 산업기업 지멘스 등 다양한 업종에서 최근 오픈웨이트 모델 활용을 논의 중인 것으로 전해졌다. 오픈웨이트 모델은 AI 모델을 구성하는 핵심 매개변수를 공개해 기업이 직접 내려받아 자체 하드웨어에서 구동하거나 필요에 맞게 미세조정할 수 있는 모델이다. 모델 개발사에 사용량에 따른 토큰 비용을 계속 지불해야 하는 폐쇄형 모델과 비교해 운영비를 크게 낮출 수 있다는 점이 강점으로 꼽힌다. 기업들의 관심도 빠르게 높아지고 있다. 시장조사업체 알파센스에 따르면 지난 8~9월 기업 실적발표와 투자자 행사에서 오픈웨이트 또는 오픈소스 모델이 언급된 횟수는 전년 동기 대비 6배 증가했다. 클라우드 플랫폼 기업 버셀의 AI 게이트웨이에서 처리된 전체 토큰 가운데 오픈웨이트 모델 비중도 지난해 12월 7%에서 올해 8월 56%까지 상승했다. 특히 중국 AI 기업들이 오픈웨이트 시장에서 영향력을 확대하고 있다. 딥시크와 지푸AI 등이 대표적이며 프랑스 미스트랄과 미국 리플렉션AI, 싱킹머신스랩 등도 개방형 방식의 모델을 개발 중이다. 오픈AI와 앤트로픽도 중국 기업들과 가격 경쟁이 치열해지자 최근 주력 모델의 저가형 제품을 내놨다. 기업들이 오픈 모델을 찾는 가장 큰 이유는 비용이다. 매치그룹이 운영하는 데이팅 앱 틴더는 AI 비용을 관리하기 위해 일부 비기술 사용자들의 요청을 오픈웨이트 모델로 처리하기 시작했다. 틴더의 AI 관련 지출 속도는 지난 1월 연간 100만 달러 수준에서 7월 1000만 달러 수준으로 불과 반년 만에 10배 뛰었다. 통신업계에선 오픈 모델 활용 비중을 더 공격적으로 높이고 있다. AT&T는 현재 전체 AI 워크로드의 약 40%를 오픈 모델로 운영 중이며 향후 1년 안에 이를 70%까지 높일 계획이다. 하루 처리량이 450억 토큰에 달하는 만큼 모델 사용 비용을 낮추는 것이 중요한 과제로 떠올랐기 때문이다. AT&T는 자사 데이터를 활용해 오픈 모델을 미세조정하는 방식도 활용 중이다. 특정 업무에선 조정한 오픈 모델이 폐쇄형 모델과 비슷하거나 더 높은 성능을 낼 수 있다는 설명이다. 기업 입장에선 모든 업무에 고성능 모델을 사용하는 대신 작업 난도와 비용에 따라 여러 오픈웨이트 AI 모델을 선택할 수 있는 여지가 커졌다. 비용뿐 아니라 데이터 보안과 주권 문제도 오픈 모델 확산을 이끌고 있다. 데이터센터 기업 디지털리얼티는 자체 인프라에서 오픈웨이트 모델을 구동하는 내부 챗봇을 구축했다. 업무 민감도와 복잡성에 따라 오픈 모델과 상용 폐쇄형 모델을 함께 사용 중이며 고객 데이터 등 민감한 정보는 외부 최첨단 모델에 입력하지 않는다는 방침이다. 앤디 마커스 AT&T 최고데이터·AI책임자는 "하루 450억개의 토큰을 처리하는 규모에선 비용이 매우 중요하다"며 "정확도를 유지할 수 있다면 비싼 폐쇄형 모델 대신 훨씬 저렴한 오픈 모델을 적극 활용할 것"이라고 밝혔다.

2026.09.28 10:58한정호 기자

"비트 관리에서 토큰 가치 관리로"...中통신사 사업모델 전환

데이터 사용량을 비트 단위로 관리해온 통신사들이 생성형 AI 시대를 맞아 토큰을 새로운 사업 단위로 주목하고 있다. 아직 상당수 글로벌 통신사가 AI 토큰 사업에 신중한 가운데 중국 통신 3사는 토큰의 생산부터 유통과 정산까지 직접 아우르는 사업모델 구축에 속도를 내고 있다. 24일(현지시간) 라이트리딩닷컴에 따르면 차이나텔레콤은 AI 토큰을 향후 통신산업을 이끌 새로운 성장동력으로 보고 관련 사업을 확대하고 있다. 지난 5월 세계 통신사 가운데 처음으로 AI 토큰 판매를 시작했고 차이나모바일과 차이나유니콤도 뒤를 이었다. AI 토큰은 생성형 AI가 이용자의 명령을 이해하고 결과를 만들어내는 과정에서 처리하는 데이터의 기본 단위다. AI 서비스 이용이 늘수록 소비되는 토큰도 증가한다. 중국 통신사들은 이를 단순한 AI 이용량 측정 수단을 넘어 새로운 서비스와 과금 체계를 구성하는 단위로 바라보고 있다. 리쉐룽 차이나텔레콤 AI연구소(TeleAI) 책임자는 “업계는 현재 전통적인 비트 트래픽 관리에서 토큰 가치 관리로 전환하고 있다”고 말했다. 그는 통신사들이 AI 토큰의 생산과 스케줄링, 정산에 이르는 전 과정을 지원하는 엔드투엔드 구조를 구축하고 있다고 설명했다. 차이나텔레콤은 자체 토큰 관리 허브에 170개 대규모 AI 모델을 모아 대규모 토큰 생산을 지원하고 있다. 정부와 교통, 제조 등 산업별로 특화된 AI 에이전트도 420개 구축했다. 단말과 토큰 플랫폼을 연결하는 작업도 진행 중이다. 리쉐룽 책임자는 “차이나텔레콤이 단말 엣지 클라우드 구조를 기반으로 토큰 플랫폼과 이용자 단말 사이의 병목을 줄이고 AI 전송과 애플리케이션을 하나로 연결하는 구조를 만들었다”고 설명했다. 실제 서비스에서 발생하는 토큰 소비량도 상당하다. 차이나텔레콤이 지난 7월 출시한 업무용 AI 비서 '텔레에이전트(TeleAgent)'는 이용자 120만 명을 확보했고 하루 토큰 소비량은 2000억 개를 넘어섰다. 중국 통신 3사의 움직임은 국가 AI 전략과도 맞물려 있다. 차이나텔레콤과 차이나모바일, 차이나유니콤은 AI 데이터센터와 클라우드 컴퓨팅 인프라를 구축하는 동시에 이를 기반으로 AI 서비스를 시장에 확산시키는 역할까지 맡고 있다. 당장 수익성이 최우선 목표인 것은 아니다. 중국 통신사들은 장기적으로 AI 서비스 확산에 따른 사업 기회를 기대하고 있지만 토큰 사용량 증가가 오히려 통신사의 비용 부담으로 돌아올 가능성도 있다. 글로벌 컨설팅 회사인 베인앤컴퍼니는 최근 보고서에서 AI 이용량 증가 속도가 관련 비용의 하락 속도를 앞지르고 있다고 지적했다. 통신사가 AI를 대규모로 도입할수록 이미 높은 기존 운영비에 토큰 비용까지 추가될 수 있다는 것이다. 베인앤컴퍼니는 “AI 모델 가격이 매년 약 10분의 1 수준으로 낮아지더라도 실제 업무 하나를 처리하는 비용은 비슷하게 유지될 수 있고, 이용량이 증가하면 전체 토큰 비용은 예측하기 어려울 정도로 불어날 수 있다”고 분석했다. 중국산 LLM이 상대적으로 저렴하더라도 모델 비용은 AI 서비스를 운영하는 전체 비용 가운데 하나에 불과하다는 설명이다. 이에 베인앤컴퍼니는 통신사가 AI와 에이전틱 AI를 확대할 때 단순한 토큰 단가보다 업무 하나를 처리하는 데 실제로 얼마가 드는지 측정해야 한다고 강조했다. 아울러 AI 컴퓨팅에 들어가는 비용을 별도로 관리할 수 있도록 전용 예산을 마련할 필요가 있다고 내다봤다.

2026.09.25 08:00박수형 기자

답변 대신 선택하는 AI '제브' 돌풍…개발자들이 주목한 이유

글을 쓰지 않는 인공지능(AI) 모델이 개발자들 사이에서 빠르게 확산되고 있다. 질문에 문장으로 답하거나 코드를 생성하는 대신 정해진 선택지에서 하나를 고르거나 점수를 매기는 데 특화한 모델이다. 범용 AI가 사람과의 대화와 콘텐츠 생성에 집중하는 것과 달리, 소프트웨어가 직접 사용할 수 있는 AI를 만들겠다는 접근이다. 21일 업계에 따르면 미국 AI 스타트업 타입세이프 AI는 지난 15일(현지시간) 첫 모델인 '제브(Jev)'를 공개했다. 오픈AI 연구원 출신인 디오고 알메이다가 설립한 타입세이프 AI는 모델 출시와 함께 4000만 달러의 투자 유치 소식도 알렸다. 알메이다 타입세이프 AI 최고경영자(CEO)가 엑스(X·옛 트위터)에 올린 제브 소개 게시물은 이날 기준 3800만회가 넘는 조회수를 기록했다. 개발자 플랫폼 기업 버셀은 18일(현지시간) 제브 출시 24시간 만에 유료 사용팀의 약 13%가 이를 사용했다며 자사 AI 게이트웨이 역사상 가장 빠르게 채택된 모델이라고 발표했다. 얼리 액세스 형태로 제공 중인 제브는 거대언어모델(LLM)과 비교해 출력 자체가 다르다. 일반적인 LLM이 텍스트를 생성하면 소프트웨어는 생성된 결과에서 필요한 값을 다시 추출해야 한다. 제브는 처음부터 소프트웨어가 사용할 수 있는 구조화된 값을 반환한다. 입력된 상태를 바탕으로 최대 255개 선택지 중 하나를 고르거나 2~10단계 점수를 매길 수 있다. 특정 진술이 참일 확률을 반환하는 것도 가능하다. 모든 결과에는 확률과 신뢰도가 제공된다. 이같은 설계는 모델 속도와 비용을 낮추는 데 기여한다. 타입세이프 AI에 따르면 제브의 입력 가격은 100만 토큰당 0.042달러이며 출력 토큰은 무료다. 응답 시간은 70~500밀리초(ms·1000분의 1초) 수준이다. 회사 자체 평가에서는 기존 모델보다 최대 193.6배 빠르고 444.6배 저렴한 것으로 나타났다. 제브는 범용 생성형 AI를 대체하기보다 소프트웨어 내부의 판단을 맡는 모델을 지향한다. 고객 문의를 분류하거나 적절한 경로로 전달하고 대규모 데이터에서 특정 정보를 추출하는 작업이 대표적이다. 다른 AI 모델의 결과를 검증하거나 위험도를 판단하는 데도 활용할 수 있다. 타입세이프 AI는 이를 AI 기반 워크플로와 실시간 애플리케이션에 적용할 수 있다고 설명한다. 다만 구조화된 출력을 보장한다고 해서 판단 자체의 정확성까지 보장되는 것은 아니다. 실제 업무 환경에서 성능과 비용 효율이 유지되는지는 추가 검증이 필요하다. 타입세이프 AI는 공식 홈페이지에서 "AI에는 소프트웨어가 의존할 수 있는 인터페이스가 필요하다고 믿기에 회사를 시작했다"며 "새로운 활용 사례가 커뮤니티와 경제 전반으로 확산되기를 기대한다"고 말했다.

2026.09.21 14:50이나연 기자

질문 난이도 따라 LLM 골라 쓴다…라이너, 모델 API 출시

라이너가 질문 난이도에 따라 적합한 거대언어모델(LLM)을 자동 배정해 답변 품질을 유지하면서 토큰 비용을 50% 이상 줄이는 모델 응용 프로그램 인터페이스(API)를 출시했다. 라이너는 AI 오케스트레이션 솔루션 '라이너 모델 API'를 출시했다고 15일 밝혔다. 기존에는 답변 품질을 높이기 위해 모든 질문을 고가의 프런티어급 모델로 처리하는 경우가 많았다. 하지만 질문마다 난이도가 다른 만큼 간단한 질의까지 고성능 모델로 처리하면 불필요한 비용이 발생할 수 있다. 라이너는 자체 AI 서비스를 운영하며 축적한 모델 평가 경험을 정밀 오케스트레이션 기술에 활용했다. 앞서 회사는 라이너 검색, 라이너 스콜라, 라이너 라이트, 라이너 파이낸스 등 다양한 AI 에이전트 제품을 운영하며 서로 다른 LLM 성능을 다각도로 비교·검증해왔다. 라이너의 실사용 환경 자체 데이터 평가 결과, 고성능 모델로 배정된 질의 비중은 약 43%로 나타났다. 코딩과 수학, 복합 추론이 필요한 고난도 질의는 상위 모델을 적용하고 나머지 57%의 일반 질의에는 효율적인 모델을 배정해 비용 절감 효과를 높였다. 이 과정에서 라이너는 실제 이용자의 다양한 질의 패턴을 반영하기 위해 비식별 처리한 대표 질의 데이터셋도 구축했다. 일상적인 탐색부터 업무 처리와 학술 연구까지 다양한 이용 패턴을 분석해 모델 배정 알고리즘을 최적화했다. 라이너 모델 API는 기존 API를 교체하는 방식으로 적용할 수 있도록 설계됐다. 기업이 새로운 LLM이 나올 때마다 모델별 성능과 비용을 직접 비교하고 교체해야 하는 부담도 줄이는 것을 목표로 한다. 김진우 라이너 대표는 "모든 질문을 상위 모델로만 처리하는 방식은 간단한 계산에 매번 슈퍼컴퓨터를 동원하는 것과 같다"며 "끊임없이 쏟아지는 신규 모델 성능과 단가를 개발사가 매번 검증하고 교체해야 하는 번거로움을 라이너 모델 API가 해결할 것”이라고 말했다. 이어 "기업들이 비용 부담과 모델 선택의 피로감에서 벗어나 핵심 업무 혁신에만 몰입할 수 있는 환경을 만들겠다"고 부연했다.

2026.09.15 11:45이나연 기자

美 "中 AI 기업, GPT·클로드서 수십억 토큰 빼내 자사 모델 학습"

미국 정보·사이버보안 당국이 중국 인공지능(AI) 기업들이 GPT, 클로드 등 미국 최첨단(프런티어) AI 모델에서 수십억 개 토큰을 추출해 자사 AI 모델 학습에 활용했다고 지적했다. 그러면서 이를 미국 AI 기술 리더십과 국가안보를 위협하는 '산업적 규모의 증류' 활동으로 규정했다. 미국 국가안보국(NSA), 연방수사국(FBI), 사이버보안·인프라보안국(CISA)은 8일(현지시간) '미국 AI 기업을 대상으로 산업적 규모의 증류 캠페인을 수행하는 중국 AI 기업'이라는 제목의 공동 사이버보안 권고문을 발표했다. 권고문에서 미국 당국이 지목한 중국 AI 기업은 딥시크, 문샷AI, 알리바바, 미니맥스, 스텝펀, Z.AI 등 6곳이다. 이들 기업은 2024년 말부터 클로드, GPT, 제미나이, 그록 등 미국 프런티어 AI 모델에 수백만 건의 요청을 보내 수십억 개 토큰을 추출한 것으로 조사됐다. 증류는 성능이 뛰어난 AI 모델 출력물을 다른 AI 모델이 학습해 성능을 높이는 방식이다. 미국 당국도 증류 자체는 합법적이고 유용한 AI 개발 기법이라고 전했다. 다만 중국 AI 기업들이 미국 AI 기업의 이용약관과 지역 제한을 우회하면서 독점적인 기능과 역량을 대규모로 추출한 점이 문제라고 비판했다. 특히 딥시크는 2024년 말부터 미국 AI 모델을 대상으로 조직적인 증류 캠페인을 벌여 R1·V3 모델 개발에 필요한 데이터를 확보한 것으로 알려졌다. 법률 특화 기능과 연쇄적 사고(CoT) 기반 추론, 에이전트 기능, 소프트웨어 등 특정 기능과 역량을 집중적으로 추출했다는 것이다. 중국 AI 기업들은 미국 AI 모델에 접근하기 위해 응용 프로그램 인터페이스(API)와 원격 클라우드, 제3자 API 집계업체 등을 이용한 것으로 전해졌다. 지역 제한을 우회하기 위해 '트랜스퍼 스테이션'으로 불리는 회색시장 프록시도 활용한 것으로 나타났다. 여러 계정과 경로를 분산 운영하고 프롬프트 인젝션과 탈옥 기법을 이용해 미국 AI 모델의 CoT 추론 과정까지 추출하려 했다는 게 당국 설명이다. 미국 당국은 이같은 대규모 증류가 중국 AI 기업의 모델 개발 기간과 비용을 줄이고 미국 기업의 경쟁우위를 훼손할 수 있다고 봤다. 여러 미국 프런티어 모델에서 각각 뛰어난 기능을 골라 추출해 자사 모델에 활용하는 행위가 미국의 기술 리더십을 위협한다고도 평가했다. 미국 당국은 자국 AI 기업에 비정상적인 계정·프롬프트·네트워크와 대규모 사용 패턴을 탐지하고, 증류가 의심되는 요청에는 응답의 추론 깊이나 품질을 낮출 것을 권고했다. 또 AI 모델 사업자와 클라우드·API 업체 간 의심 계정과 공격 패턴 등의 정보를 공유할 것을 제안했다. NSA·FBI·CISA는 "산업적 규모의 증류에 대응하려면 미국 정부와 민간 기업, 동맹국을 아우르는 협력과 정보 공유가 필요하다"고 강조했다.

2026.09.09 14:44이나연 기자

에이수스, AI 인프라 키워드로 '토큰 경제학' 제시

에이수스가 지난 해 두바이에 이어 올해 서울에서 AI 인프라 전략을 제시했다. AI 모델의 성능뿐 아니라 이를 구동하는 데이터센터와 서버, 전력·냉각 인프라의 효율을 높여야 한다는 것이 핵심이다. 에이수스는 3일 오후 서울 여의도 콘래드호텔에서 아태지역 IT 업계 관계자와 의사 결정권자 300여 명이 참여한 가운데 '에이수스 AI테크 서밋 서울'을 개최했다. 이날 폴 주 에이수스 인프라 솔루션 비즈니스 그룹(ISG) 총괄 수석부사장은 "AI가 더 이상 연구실이나 실험실에 머무는 기술이 아니라 이미 우리 삶의 일부가 됐다"고 강조했다. 이어 "특히 AI가 생성하는 결과물인 '토큰'을 얼마나 효율적으로 생산하느냐에 따라 인프라 경쟁력이 좌우될 수 있다"며 '토큰 경제학'을 주요 화두로 제시했다. 엔비디아 "데이터센터, 토큰 생산하는 AI 팩토리로 진화" AI 인프라를 둘러싼 에이수스와 엔비디아의 협력도 확대되고 있다. 정소영 엔비디아코리아 대표는 "양사는 PC와 컨슈머 사업을 중심으로 협력했지만 코로나19 이후 데이터센터 사업으로 영역을 넓혔으며, AI 발전과 함께 협력 범위가 더욱 커지고 있다"고 설명했다. 정소영 대표는 이날 데이터센터의 역할 자체가 바뀌고 있다고 진단했다. 과거 데이터센터가 서버를 수용하고 운영하는 공간이었다면, 이제는 AI 연산을 통해 끊임없이 토큰을 만들어내는 'AI 팩토리'로 전환되고 있다는 설명이다. 토큰은 생성형 AI가 텍스트 등을 처리하고 결과를 만들어내는 과정에서 사용하는 기본 단위다. AI 활용이 확대될수록 필요한 토큰의 양도 증가하기 때문에, 동일한 전력과 컴퓨팅 자원으로 얼마나 많은 토큰을 처리·생성할 수 있는지가 데이터센터의 효율성과 비용을 좌우하는 요소로 부상하고 있다. 이민형 엔비디아코리아 솔루션 아키텍트는 에이전틱 AI의 확산이 이러한 데이터센터 수요를 더욱 키울 것으로 전망했다. 에이전틱 AI는 단순히 질문에 답하는 데 그치지 않고 사용자가 부여한 목표를 달성하기 위해 여러 작업을 반복하고 필요한 도구를 호출하며 결과를 검증하는 방식으로 작동한다. AI가 수행하는 작업이 복잡해질수록 필요한 연산량과 토큰 사용량도 늘어날 수 있다는 의미다. 엔비디아는 이를 뒷받침하기 위한 데이터센터 설계 개념으로 'AI 팩토리'와 DSX 플랫폼을 제시했다. 데이터센터 규모가 수십~수백MW에서 GW급으로 확대되는 상황에서 전력·냉각·네트워크·스토리지 등 인프라 전체를 하나의 시스템으로 설계해야 한다는 접근이다. 고전력 GPU 시대, 전력·냉각이 AI 인프라 경쟁력 에이수스 역시 AI 서버의 연산 성능만으로는 인프라 경쟁력을 설명하기 어렵다고 봤다. AI 연산에 필요한 전력과 냉각 비용이 함께 증가하는 만큼, 결국 핵심은 토큰 하나를 생성하는 데 필요한 비용과 에너지 효율이라는 설명이다. 에이수스는 고전력 GPU를 안정적으로 구동하기 위한 전력 전달 기술과 HVDC 기술을 연구하고 있다. GPU의 전력 소비가 증가할수록 전력 공급과 변환 과정에서 발생하는 손실을 줄이는 것이 데이터센터 운영 효율을 높이는 중요한 요소다. 냉각 분야에서는 GPU에 가까운 위치에서 열을 제거하는 마이크로채널 콜드 플레이트를 비롯해 100% 수랭식 서버와 메가와트급 냉각을 지원하는 CDU 등을 개발하고 있다. 고밀도 GPU 서버에서 발생하는 열을 효율적으로 제거해 전력 소비와 냉각 부담을 낮추겠다는 전략이다. 앨버트 우 에이수스 솔루션 사업 총괄은 "AI 인프라의 경쟁력은 AI 서버와 스토리지, 네트워크를 통합하는 하드웨어에 소프트웨어 스택과 전문 서비스를 결합하는 '골든 트라이앵글' 전략으로 AI 인프라 구축부터 운영과 최적화까지 지원하겠다"고 밝혔다. 에이수스, 제조·자동차·로봇까지 엣지 AI 확대 에이수스는 대규모 데이터센터뿐 아니라 실제 데이터가 생성되는 현장에서 AI를 처리하는 엣지 컴퓨팅 전략도 공개했다. 엣지 컴퓨팅은 네트워크를 통해 전송해야 하는 데이터량을 줄일 수 있고, 처리 지연시간을 낮춰 실시간 대응이 필요한 산업 현장에 적합하다. 외부로 전송되는 데이터를 줄여 보안성과 운영 효율을 높일 수 있다는 점도 장점이다. 에이수스는 이날 제조 현장의 머신비전이나 자동차의 영상·센서 데이터를 현장에서 즉시 처리할 수 있는 엣지 컴퓨팅 솔루션도 함께 공개했다. 에이수스 관계자는 "에이수스의 최종 목표는 기업이 단순히 AI에 투자하는 것을 넘어 비즈니스 전반의 운영 과정에 지능을 내재화할 수 있도록 돕는 것"이라고 밝혔다. 이어 "앞으로도 글로벌 기술 생태계와의 협력을 강화하고, 확장 가능한 성장을 위한 AI 팩토리 구축 및 운영 역량을 지속적으로 고도화해 나갈 것"이라고 부연했다.

2026.09.04 09:30권봉석 기자

[현장] 이용석 스노우플레이크 신임 지사장 "AI 도입 성패, 비용 관리에 달렸다"

이용석 스노우플레이크 신임 한국지사장의 취임 후 첫 메시지는 '인공지능(AI) 비용'이었다. 이 지사장은 27일 서울 코엑스에서 열린 '스노우플레이크 월드 투어 서울'에서 토큰 사용량이 통제 없이 치솟는 '토큰 맥싱'을 관리 도구로 잡아내겠다고 밝혔다. 지난주 취임 후 처음으로 대규모 고객 행사 무대에 오른 자리다. 토큰 맥싱은 무분별한 AI 활용으로 토큰 소비와 비구조적 데이터 비용이 통제 불능 수준으로 치솟는 현상을 뜻한다. 최근 기업 내에서 다수 직원과 에이전트가 제각각 거대언어모델(LLM)을 호출하며 비용이 통제 없이 불어나고 있다. 관리자 입장에서는 누가 어떤 모델을 얼마나 사용하는지조차 파악하기 어려운 실정이다. 이 지사장은 해법으로 스노우플레이크의 '코텍스 AI 게이트웨이'를 소개했다. 지난 7월 공개된 이 기능은 기업이 쓰는 AI 에이전트와 여러 LLM 사이에 놓여 요청을 중개하는 관문 역할을 한다. 여러 에이전트가 어떤 모델에 접속할지 한곳에서 통제하고 요청을 성격에 맞는 모델로 배분해 사용량을 최적화한다. 어떤 팀이 어떤 모델에 얼마를 쓰는지 추적하고 팀·에이전트별로 사용 한도와 예산도 설정할 수 있다. 스노우플레이크는 지난 18일 '동적 모델 라우팅' 기능도 공개했다. 작업 성격에 맞춰 품질과 비용의 균형이 가장 좋은 모델을 자동으로 골라주는 기능이다. 단순하고 반복적인 작업은 저렴하고 효율적인 모델로 깊은 추론이 필요한 작업은 최고 성능의 프런티어 모델로 보낸다. 스노우플레이크는 자체 테스트에서 이 방식으로 일부 작업의 토큰 비용을 최대 3분의 1 수준까지 줄였다고 설명했다. 이 지사장은 "얼마나 많은 LLM을 누가 사용하는지도, 어떤 데이터에 어떻게 접근하는지도 모르는 상황에서 비용과 성능·성과를 적절히 조합하기 위해 코텍스 AI 게이트웨이를 출시했다"고 말했다. AI 도입이 좌초하는 근본 원인으로는 데이터와 비용 문제를 지목했다. 그는 "많은 기업이 AI를 시도하지만 대부분 개념검증(PoC) 단계에서 멈춘다"며 "데이터를 밖으로 옮기고 별도 환경을 구축하고 보안을 다시 검증하는 사이에 처음의 동력을 잃기 때문"이라고 말했다. 이어 "사내 데이터를 밖으로 옮기지 않고 그 자리에서 AI를 구축해 PoC에 머무르지 않고 실제 운영으로 빠르게 전환하도록 지원하겠다"고 덧붙였다. 이 지사장은 한국 시장의 가파른 성장세도 소개했다. 2021년 11월 한국 지사 출범 후 4년 만에 매출 18배 성장을 기록하고 실사용 고객 수도 10배 이상 늘었다고 밝혔다. 국내 10대 그룹 중 8개 엔터프라이즈 그룹이 스노우플레이크를 쓰고 있고 넥슨·카카오·토스 등 디지털 네이티브 기업도 고객사로 참여하고 있다고 했다. 이 지사장은 엔터프라이즈 소프트웨어 분야에서 20년 이상 경력을 쌓은 영업·사업 전문가다. 스노우플레이크 합류 전 2020년부터 약 6년간 구글클라우드에서 대기업 고객을 대상으로 디지털전환(DX)과 시장진입 전략을 담당했고 이전에는 한국마이크로소프트에서 16년간 근무했다. 그는 "산업 전방위에 걸쳐 쌓아온 경험을 스노우플레이크의 기술력과 결합해 국내 기업 고객과 파트너사가 함께 성장하는 협업 생태계를 구축하고 데이터와 AI를 실질적인 비즈니스 성과로 연결하는 데 힘쓰겠다"고 말했다.

2026.08.27 15:08김동원 기자

토큰 단가 내렸는데 비용 고민 커져…'토크노믹스' 전략 다각화

기업들의 인공지능(AI) 에이전트 도입이 늘면서 토큰 사용량과 함께 비용 관리의 중요성이 커지고 있다. 업계에서도 자체 칩 개발부터 모델 가격 경쟁, 비용 측정 표준화, 관리 플랫폼 구축까지 전방위로 토큰 비용을 통제하려는 노력을 이어가는 모습이다. 앤트로픽이 지난해 공개한 다중 에이전트 연구 시스템 구축 사례에 따르면 AI 에이전트는 일반적인 채팅 방식보다 약 4배, 여러 에이전트가 동시에 작동하는 멀티 에이전트 시스템은 약 15배 많은 토큰을 사용하는 것으로 나타났다. 계획 수립과 검색, 도구 호출, 결과 검증을 반복하는 에이전트 구조 특성상 토큰 소비량이 늘어나면서다. 최근 시장에서는 AI 사용량 확대에 초점을 맞춘 '토큰맥싱'을 넘어 토큰 생산 원가와 사용량, 업무별 비용을 관리하는 '토크노믹스'가 화두로 부상했다. AI 추론 과정에서 토큰을 생성하는 단위 비용을 낮추려는 움직임은 하드웨어에서부터 나타나고 있다. 오픈AI는 브로드컴과 추론에 최적화한 자체 칩 '할라페뇨'를 공개했고 마이크로소프트도 추론 가속기 '마이아200'을 새로 선보였다. 구글 역시 자체 텐서처리장치(TPU) 생태계를 확장하며 범용 그래픽처리장치(GPU) 의존도를 낮추고 있다. 모델 가격 경쟁도 거세지고 있다. 앤트로픽은 최상위 모델 '클로드 페이블5'에 근접한 성능을 저렴하게 제공하는 '클로드 오퍼스5'를 내놨다. 오퍼스5의 개발자용 가격은 100만 토큰당 입력 5달러, 출력 25달러로 페이블5의 절반 수준이다. 앤트로픽은 모델 성능뿐 아니라 업무 하나를 끝내는 데 들어간 작업당 비용도 비교 지표로 제시하고 있다. 중국 문샷AI도 100만 토큰당 입력 3달러, 출력 15달러로 책정된 오픈웨이트 모델 '키미 K3'를 출시하며 맞불을 놨다. 다만 토큰 단가가 낮아진다고 전체 AI 비용까지 줄어드는 것은 아니다. 단위 비용이 낮아지면서 기존에는 비용 부담 때문에 적용하지 못했던 업무까지 AI 활용 범위가 넓어지고 전체 토큰 사용량이 오히려 증가할 수 있어서다. 토큰 비용을 공통 기준으로 측정하려는 움직임도 구체화되고 있다. 리눅스재단은 지난 6월 AI 인프라 비용 관리를 위한 표준 마련 계획을 밝힌 뒤 이달 초 '토크노믹스 재단'을 설립했다. 모델과 공급업체별 토큰 효율을 비교할 수 있는 표준·벤치마크·모범 사례를 마련한다는 구상이다. 클라우드 비용 관리에 쓰이던 핀옵스 역시 AI 영역으로 확대되는 추세다. 곡물기업 카길은 모델·에이전트별 비용을 산정하고 예산 통제 기준을 마련하는 'AI 플랫폼 핀옵스 시니어 엔지니어'를 채용했고, 서비스나우도 AI 지출의 재무 관리를 전담하는 '핀옵스 AI 거버넌스 리드'를 모집 중이다. AI 비용이 개발 조직만의 문제가 아니라 재무와 경영 관리의 영역으로 확대됐음을 보여준다. 이 같은 흐름 속에 관련 플랫폼 역할도 세분화되고 있다. 해외에서는 클라우드제로와 밴티지가 추론·모델·기능별 비용을 팀 단위로 배분하는 기능을, 랭스미스와 데이터독은 에이전트 실행 과정과 토큰 사용량을 함께 추적하는 기능을 각각 앞세우고 있다. 국내에서도 바운드포가 AI 요청 실행 전 예산 초과를 사전 차단하는 토큰 지출 관리 서비스 '파레토'를 선보였다. 씽킹AI는 사용자·모델·날짜별 토큰 소비량을 추적해 한도를 넘으면 사용을 제한하는 기능을 제공하고 있다. 이들 기업 모두 AI 모델 사용에 따른 토큰 비용을 사후 정산이 아닌 사전 통제의 영역으로 끌어들이려는 전략으로 풀이된다. 업계 관계자는 "AI를 도입했다는 사실보다 에이전트가 어떤 비용으로 어떤 일을 끝냈고 실제로 어떤 성과를 냈는지를 확인하는 단계로 이동하고 있다"며 "토큰 비용은 줄여야 할 지출이 아니라 배분하고 회수해야 할 투자에 가깝다"고 말했다.

2026.08.14 11:02이나연 기자

바운드포, AI 토큰 지출 관리 미리 해준다

바운드포(대표 황인호)는 자사 AI 데이터 운영 플랫폼 '드로파이'에 AI 토큰 지출 관리 서비스 '파레토'를 추가했다고 12일 밝혔다. AI 사용량이 빠르게 늘면서 기업의 비용 부담도 새로운 과제로 떠오르고 있다. 대부분 기업은 월말 청구서를 받은 뒤에야 지출 규모를 확인할 수 있어 예산 초과나 비효율적인 사용을 사전에 관리하기 어려운 상황이다. 사람이 직접 사용하는 AI 서비스는 근무 시간이라는 자연스러운 사용 한계가 있지만, 자동화 시스템은 24시간 작동할 수 있어 예상하지 못한 비용이 빠르게 누적될 가능성이 크다. 파레토는 이런 문제 해결을 위해 개발된 서비스다. 관리자가 설정한 예산 한도를 초과하는 AI API 요청을 실행 전에 차단하고, 팀별 사용 현황과 예상 지출을 실시간으로 제공해 비용 발생 이전부터 예산을 관리할 수 있도록 지원한다. 이로써 드로파이는 AI 데이터 운영부터 토큰 지출 관리까지 아우르는 플랫폼으로 기능을 확대했다. 파레토는 기업이 정한 예산과 정책을 API 호출 과정에 적용해 불필요한 비용 발생을 사전에 차단하고, AI 에이전트와 자동화 시스템이 설정된 예산 범위 안에서 운영될 수 있도록 지원한다. 또 월 단위 사용 데이터를 분석해 불필요한 지출이 발생하는 주요 패턴을 자동으로 파악한다. 실패한 호출이 반복되며 비용이 쌓이는 재시도 누적, 사실상 동일한 요청이 반복 처리되는 중복 요청, 더 가벼운 모델로 수행할 수 있는 작업에 고성능 모델을 사용하는 과사양 모델 사용 등을 탐지해 절감 가능한 영역을 리포트 형태로 제공한다. 황인호 바운드포 대표는 "파레토는 피지컬 AI 현장에서 바운드포가 직접 겪은 문제를 해결하는 과정에서 탄생한 서비스"라며 "로봇과 디바이스가 24시간 AI를 호출하는 환경에서는 비용을 사후에 분석하는 방식만으로는 한계가 있었다"고 설명했다. 이어 "앞으로도 현장에서 검증한 운영 경험을 서비스로 고도화해 AI 데이터 관리부터 비용 통제까지 기업의 AI 운영 전반을 지원해 나가겠다"고 강조했다.

2026.08.12 10:02백봉삼 기자

[AI는 지금] 中 AI 초저가 공세에 '균열'…딥시크, 가격 인상 압박받는 이유는

중국 인공지능(AI) 기업들의 저가 공세로 글로벌 AI 추론 비용이 올해 최저 수준까지 떨어진 가운데 사용량 급증과 서버·컴퓨팅 비용 부담이 새로운 변수로 떠오르고 있다. 초저가 전략을 앞세워 시장을 넓혀온 딥시크 등 중국 AI 업체들도 가격 인상 가능성이 높아진 모습이다. 11일 홍콩 사우스차이나모닝포스트(SCMP)에 따르면 투자은행 제프리스는 미국 리서치 업체 실리콘데이터 자료를 인용해 지난 6~8일 AI 평균 추론 가격이 100만 토큰당 1.16~1.18달러를 기록했다고 밝혔다. 올해 들어 가장 낮은 수준이다. 평균 추론 가격은 지난 5월 31일 2.04달러에서 7월 말 1.45달러로 낮아진 뒤 이달 초 1.2달러 아래로 내려왔다. 실리콘데이터 지수는 소프트웨어 개발자들이 이용하는 기업용 애플리케이션 프로그래밍 인터페이스(API) 사업자와 오픈웨이트 추론 플랫폼 가격을 추적한다. 가격 하락을 이끈 축 가운데 하나는 중국 AI 업체다. 특히 딥시크가 최근 선보인 'V4-플래시(Flash)-0731'은 작업당 비용이 0.03달러 수준으로, 중국과 해외 주요 경쟁 모델보다 낮게 책정됐다. 이 같은 낮은 가격은 사용량 확대로 이어졌다. 실제 여러 AI 모델을 제공하는 플랫폼 오픈라우터에서 딥시크의 토큰 처리량 비중은 10일 기준 27%를 넘어 구글의 25%를 앞섰다. 특히 V4-플래시-0731은 지난주 오픈라우터에서 8조 2200억 토큰을 처리해 가장 많이 사용됐다. 텐센트 'Hy3'가 7조 1300억 토큰, 지난 4월 출시된 딥시크 V4-플래시 이전 모델이 6조 500억 토큰으로 뒤를 이었다. 사용량이 빠르게 늘면서 중국 AI 업체들의 비용 부담도 커지고 있다. 추론 요청이 증가할수록 그래픽처리장치(GPU)와 서버 자원 투입이 늘어나는 만큼 초저가 수준을 유지하면서 급증한 수요를 감당하기가 쉽지 않아서다. 가격 변화는 이미 일부 최신 모델에서 나타나고 있다. 제프리스가 AI 벤치마크 플랫폼 아티피셜 애널리시스 자료를 인용한 데 따르면 딥시크와 즈푸AI, 미니맥스, 문샷AI 등이 최근 내놓은 모델은 올해 초 출시된 제품보다 높은 가격에 제공되고 있다. 이 중 즈푸AI는 지난 2월 'GLM-5'를 입력 토큰 100만 개당 1달러, 출력 토큰 100만 개당 3.20달러에 출시했다. 이후 선보인 'GLM-5.2'는 입력 1.40달러, 출력 4.40달러로 각각 가격이 올랐다. 딥시크도 기업용 서비스 가격 인상을 예고했다. SCMP에 따르면 딥시크는 최근 V4-플래시 사용 증가로 서버 용량 부담이 커졌다며 기업 고객들에게 향후 큰 폭의 가격 인상 가능성을 알리고 예산 조정을 요청했다. 이런 중국 AI 업체들의 가격 조정은 글로벌 AI 가격 경쟁에도 영향을 줄 수 있다. 중국산 저가 모델이 가격 하락을 주도하면서 미국 AI 업체들도 가격을 낮춰온 만큼, 중국 기업의 비용 부담 확대가 현재의 초저가 경쟁 강도에 변화를 줄 가능성이 있다. 제프리스는 "미국과 중국 기술 생태계 모두에서 비용 효율성에 대한 관심이 높아지고 있다"고 밝혔다.

2026.08.11 10:55장유미 기자

오픈AI, 저비용 AI 모델 경쟁 나서…"GPT-5.6 요금 최대 80%↓"

오픈AI가 중국 저가 인공지능(AI) 모델 경쟁에 대응하기 위해 최신 모델 2종 가격을 대폭 인하했다. 30일(현지시간) 테크크런치 등 외신에 따르면 오픈AI는 GPT-5.6 시리즈 중간급 모델 'GPT-5.6 테라' 가격을 20%, 경량·고속 모델 'GPT-5.6 루나' 요금을 80% 각각 낮췄다고 밝혔다. 두 모델이 공식 추시된 지 약 3주 만에 나온 발표다. 테라 이용료는 입력 토큰 100만개당 2달러와 출력 토큰 100만개당 12달러로 조정됐다. 루나는 입력 토큰 100만개당 0.2달러와 출력 토큰 100만개당 1.2달러로 낮아졌다. GPT-5.6 시리즈는 최고 성능 모델 솔을 비롯한 중간급 모델 테라 처리 속도를 앞세운 루나 등 3종으로 이뤄졌다. 솔 이용료는 기존과 동일하게 유지된다. 이번 가격 인하는 기업들이 AI 도입 비용을 줄이기 시작한 상황에서 나왔다. 기업들은 투자수익을 명확히 확인하기 어려운 고가 AI 모델을 대규모 업무에 적용하는 데 이전보다 신중한 태도를 보이고 있는 추세다. 챗GPT 출시 초기에는 기업들이 직원들에게 비용을 걱정하지 말고 AI를 적극적으로 사용하도록 권장하는 이른바 '토큰맥싱' 흐름이 확산했다. 이후 AI 이용료가 빠르게 늘고 일부 기업 지출이 수십억 달러에 이르면서 비용 통제 필요성이 커졌다는 지적이 나왔다. CNBC는 중국 기업들이 자체 AI 인프라에서 실행할 수 있는 오픈웨이트 모델을 잇달아 내놓은 점도 오픈AI 모델 가격 인하에 영향을 미친 것으로 나타났다. 오픈웨이트 모델은 이용자가 내려받아 수정하고 직접 운영할 수 있어 모델 이용료를 줄일 수 있는 대안으로 평가받고 있다. 중국 스타트업 문샷AI는 이달 초 오픈웨이트 모델 '키미 K3'를 공개했다. 키미 K3는 일부 산업 벤치마크에서 미국 오픈AI와 앤트로픽 모델보다 높은 성능을 기록하며 미국 AI 기업 대응을 촉발했다. 앤트로픽은 이후 '클로드 오푸스 5'를 출시하고 코딩과 지식 업무에서 높은 비용 효율성을 제공한다고 강조했다. 이 모델은 비슷한 성능을 내는 고급 모델 '클로드 페이블 5'보다 가격이 절반 수준이다. 마이크로소프트와 구글도 저비용 모델 경쟁에 가세했다. 마이크로소프트는 저렴하면서 성능을 확보한 사이버보안 모델을 내놨다. 구글은 '제미나이 3.6 플래시'를 포함한 신규 모델 3종을 공개하고 작업당 비용이 중국 모델보다 낮다고 강조했다. 오픈AI는 "우리 전략은 역량과 효율성을 모두 발전시키는 데 계속 초점을 맞췄다"며 "각 세대 모델이 더 낮은 비용으로 더 많은 업무를 수행할 수 있도록 할 것"이라고 밝혔다.

2026.07.31 14:40김미정 기자

[AI 리더스] "AI TCO, 데이터·인프라서 갈린다"…클라우데라 韓 지사장이 제시한 해법은?

"인공지능 전환(AX)은 디지털 전환(DX)과 다릅니다. 인공지능(AI)을 쓴다고 기업 데이터를 모두 퍼블릭 클라우드로 옮길 필요는 없습니다." 최승철 클라우데라코리아 지사장은 31일 지디넷코리아와 만나 기업들이 과거 DX 당시의 클라우드 이전 전략을 AX에도 그대로 적용해서는 안 된다고 강조했다. 내부 데이터를 외부 클라우드로 옮긴 뒤 AI 모델과 연결하면 데이터 이동·저장 비용이 늘고 보안과 규제 대응도 복잡해질 수 있어 데이터가 있는 환경으로 모델을 가져오는 방식이 더 효율적이라고 봐서다. 이 같은 부담은 AI를 실제 서비스로 확장하는 과정에서 더 커진다. 도입 초기에는 전문인력 부족과 빠른 기술 변화에 따른 불확실성이 크고, 운영 단계에 들어서면 모델 호출량과 데이터 전송량이 늘면서 비용 예측도 어려워진다. 민감 데이터를 외부 모델과 연결할 경우 데이터 유출과 감사 추적, 규제 준수 부담까지 가중될 수 있다. 이에 최 지사장은 모델을 직접 개발하는 사업자와 이미 학습된 모델을 업무에 활용하는 일반 기업이 인프라 전략을 각각 구분해야 한다고 봤다. 대규모 학습을 수행하는 모델 개발사와 달리 일반 기업은 외부 모델을 호출하거나 오픈소스 모델을 내부 환경에서 구동할 수 있어서다. 그는 "ERP·CRM 등 핵심 업무 데이터가 이미 사내에 있는데 모델을 사용한다는 이유만으로 이를 외부 클라우드로 옮기는 방식은 비용과 보안 측면에서 다시 계산해야 한다"며 "기업은 외부 상용 모델과 오픈소스 모델, 자체 모델을 업무별로 선택할 수 있는 구조를 준비해야 한다"고 말했다. 모델보다 데이터 먼저…준비 부족에 재작업 반복 많아 최 지사장은 AI 프로젝트를 실제 업무로 확장하려면 모델을 선택하기에 앞서 사내 데이터의 품질과 활용 여건부터 점검해야 한다고 강조했다. 데이터가 여러 부서와 시스템에 흩어져 있으면 정제와 통합, 접근 권한 설정에 추가 시간과 비용이 들 수 있어서다. 실제 기업 현장에서도 데이터 준비 부족이 AI 프로젝트의 운영 전환을 가로막는 요인으로 나타나고 있다. 클라우데라와 하버드비즈니스리뷰 애널리틱서비스 조사에 따르면 AI에 완전히 준비된 데이터를 갖춘 기업은 7%에 그쳤다. 또 데이터 품질과 접근 권한이 일관되게 관리되지 않아 AI 프로젝트를 실제 운영으로 확장하는 데 어려움을 겪는 기업이 많았다. 클라우데라가 국내 기업을 대상으로 진행한 조사에서도 AI 프로젝트가 기대한 성과를 내지 못한 원인으로 데이터 품질 문제가 32%를 차지했다. 데이터 통합과 접근·관리 문제도 각각 20% 안팎으로 집계됐다. 이를 두고 최 지사장은 국내 기업들이 데이터의 위치와 품질을 확인하기 전에 특정 모델부터 선택하는 경향이 있다고 지적했다. 또 모델 성능부터 시험한 뒤 업무 시스템과 연결할 경우 데이터 정제와 권한 설정, 시스템 통합 작업을 다시 해야 해 비용과 시간이 중복될 수 있다고 봤다. 그는 "좋은 모델도 정확한 기업 데이터를 공급받지 못하면 원하는 결과를 내기 어렵다"며 "어떤 데이터가 어디에 있고 누가 접근할 수 있는지 파악한 뒤 업무에 맞는 모델을 골라야 한다"고 설명했다. 최 지사장은 이를 해결하기 위해 모든 데이터를 하나의 플랫폼으로 옮길 필요는 없다고 주장했다. 또 기존 업무 시스템을 유지하면서 필요한 데이터만 공통된 권한과 관리 체계 아래 연결하는 방식이 비용과 운영 부담을 줄일 수 있다고 강조했다. 이 같은 구상에 따라 클라우데라는 아파치 아이스버그와 폴라리스 카탈로그를 활용해 여러 환경에 분산된 데이터를 불필요하게 복제하지 않고 관리하는 전략을 추진하고 있다. 여기에 모델컨텍스트프로토콜(MCP)을 적용해 AI 에이전트가 권한에 따라 필요한 데이터와 업무 도구에 접근할 수 있도록 지원하고 있다. 최 지사장은 "기업의 모든 데이터를 한곳에 옮기는 것은 현실적으로 쉽지 않다"며 "데이터가 여러 시스템에 남아 있더라도 공통된 권한과 거버넌스 아래 AI가 필요한 정보를 활용할 수 있는 구조를 갖춰야 한다"고 밝혔다. SaaS별 AI 확산…데이터·비용 다시 쪼개질 수도 최 지사장은 AI 에이전트가 고객관계관리(CRM)와 전사적자원관리(ERP), IT서비스관리 등 여러 업무 시스템을 넘나드는 만큼 특정 서비스형 소프트웨어(SaaS) 안에 데이터를 모으는 방식도 재검토해야 한다고 주장했다. 각 SaaS 공급사가 자체 데이터 플랫폼과 AI 에이전트를 결합하면 해당 제품 안에서는 데이터 활용과 업무 자동화가 쉬워질 수 있지만, 기업 전체로는 데이터가 공급사별로 다시 나뉠 수 있다고 봐서다. 또 기본 구독료에 AI 사용료와 데이터 처리비, 시스템 간 연동 비용까지 더해지면 비용 구조도 복잡해질 수 있다고 지적했다.최 지사장은 이 같은 움직임이 SaaS 기업들의 사업 방어 전략과도 관련이 있다고 분석했다. AI 에이전트가 여러 업무 시스템을 넘나들기 시작하면서, 공급사들이 기존에 확보한 업무 영역의 주도권을 유지하기 위해 데이터 관리 기능과 업무 흐름을 자사 플랫폼 안에서 강화하고 있다고 본 것이다. 또 그는 SaaS 기업들이 범용 데이터 플랫폼 시장에 직접 진출하기보다 고객관계관리(CRM)와 전사적자원관리(ERP) 등 기존에 확보한 업무 영역의 경쟁력을 높이는 데 초점을 맞추고 있다고 진단했다. 기업 입장에선 개별 SaaS의 AI 기능만 비교하기보다 여러 업무 시스템의 데이터를 함께 활용할 수 있는지 살펴야 한다고 강조했다. 최 지사장은 "SaaS 기업들이 데이터 영역을 강화하는 것은 자신들이 가진 업무 영역을 AI 에이전트로부터 지키기 위한 움직임"이라며 "범용 데이터 플랫폼 사업에 직접 뛰어들기보다 기존 사업의 경쟁력을 높이기 위한 수직계열화에 가깝다"고 말했다. "프라이빗 AI, 모델 설치 넘어 전 과정 통제해야" 최 지사장은 프라이빗 AI를 기업 데이터센터에 거대언어모델(LLM)을 설치하는 수준으로 봐서는 안 된다고 강조했다. 모델과 데이터, GPU 인프라, 접근 권한, 감사 기록, 추론과 에이전트 운영까지 하나의 통제 체계 안에서 관리해야 실제 기업 업무에 적용할 수 있다는 것이다. 기업 내부에서도 임직원과 협력사, 외주 인력에 따라 접근할 수 있는 정보가 다른 만큼 AI에도 같은 통제 원칙이 적용돼야 한다고 설명했다. 질문자의 권한에 따라 AI가 활용하는 데이터 범위를 제한하고 답변에 사용된 정보의 출처와 이동 경로도 추적할 수 있어야 한다는 판단에서다. 또 최 지사장은 기업의 데이터 민감도와 인프라 여건에 따라 퍼블릭과 프라이빗 환경을 함께 활용할 수 있다고 봤다. 퍼블릭 클라우드에서 소규모 검증을 진행한 뒤 애플리케이션을 자체 환경으로 옮기거나, 민감 데이터는 내부에 두고 외부 모델만 선택적으로 호출하는 방식이다. 클라우데라는 이러한 하이브리드 구조를 지원하는 한편, 중소·중견기업을 대상으로 서버와 데이터 플랫폼, 모델, 운영 도구를 묶은 'AI 인 어 박스' 사업도 국내 파트너와 추진하고 있다. 더불어 그는 비용을 판단할 때도 모델 호출료만 비교해서는 안 된다고 지적했다. AI 총소유비용(TCO)에는 GPU와 전력, 운영인력, 개발과 시스템 연동 비용까지 포함해야 하고 업무 특성에 따라 모델을 나눠 쓰는 방식이 필요하다고 봐서다. 이는 고난도 추론에 상용 모델을 활용하고, 반복 업무나 민감 데이터 처리에 오픈소스 또는 자체 모델을 적용하는 식이다. 최 지사장은 "초기 프로젝트나 수요 변동이 큰 업무는 퍼블릭 클라우드가 유리할 수 있지만 사용량이 많고 장기간 지속되는 추론 업무는 프라이빗 환경의 경제성이 높아질 수 있다"며 "업무별 사용량과 데이터 민감도에 따라 모델과 인프라를 조합해야 한다"고 밝혔다.그러면서 "AI 비용은 토큰과 GPU 인프라, 서비스 개발 등 세 가지 측면에서 함께 최적화해야 한다"며 "클라우데라는 상용·오픈소스·자체 모델을 유연하게 선택하고 인프라 활용과 개발 생산성을 높일 수 있도록 지원해 기업의 전체 AI TCO를 낮추는 데 집중할 것"이라고 덧붙였다. 이 같은 전략을 바탕으로 클라우데라코리아는 앞으로 제조와 방산, 금융 등 데이터 반출 제한과 보안 요구가 높은 산업을 중심으로 국내 프라이빗 AI 사업을 확대할 계획이다. 또 국내 파트너의 구축 역량을 강화하고 데이터 준비부터 추론과 운영까지 연결해 파일럿 단계에 머문 AI 프로젝트를 실제 서비스로 전환하는 데 집중한다는 방침이다. 그는 "기업들이 AI의 전체 구조를 이해하고 단계적으로 도입할 수 있도록 국내 파트너의 전문성을 높이는 데 힘쓸 것"이라며 "데이터와 모델, 인프라를 함께 연결해 기업의 AI 프로젝트가 실제 운영으로 이어지도록 지원하겠다"고 마무리했다.

2026.07.31 09:38장유미 기자

[AI TCO 함정①] 토큰 비용이 전부 아냐…기업 예산 갉아먹는 '데이터 통합'

기업의 인공지능(AI) 도입 비용이 토큰 사용료를 넘어 소프트웨어 구독료와 데이터 통합, 인프라 운영비 전반으로 번지고 있다. AI 기능이 기존 서비스형 소프트웨어(SaaS)에 추가되면서 사용량에 따라 비용이 달라지고 예산 예측도 어려워지는 분위기다. 데이터 정비와 검색증강생성(RAG) 구축, 사내 시스템 연동 비용도 AI 도입 부담을 키우는 요인으로 꼽힌다. AI 서비스 이용이 늘면서 서버와 스토리지, 네트워크 등 인프라 운영비까지 동반 상승하고 있다. 이에 지디넷코리아는 기업들이 AI 도입 과정에서 놓치기 쉬운 비용 구조와 예산 관리의 사각지대를 3회에 걸쳐 살펴본다. [편집자주] 기업들이 인공지능(AI) 에이전트 비용을 줄이기 위해 토큰 사용료에 몰두하고 있지만, 정작 더 큰 부담은 에이전트를 도입하기 전 데이터 관리·통합 단계에서 발생한다는 지적이 나오고 있다. 흩어진 사내 데이터를 정리하고 검색증강생성(RAG)을 구축해 기존 업무 시스템과 연결해야 하는 만큼 사실상 기업 AI 예산은 첫 토큰을 쓰기 전부터 투입되는 셈이다. 28일 글로벌 조사기관과 IT업계 자료를 종합하면 기업들은 AI 총소유비용(TCO)을 산정할 때 데이터 정제·통합과 RAG 구축, 기존 업무 시스템 연동에 드는 비용보다 토큰 사용료에 관심이 쏠려 있는 것으로 나타났다. 토큰은 AI 모델이 문장을 이해하고 답변을 생성하기 위해 텍스트를 잘게 나눈 기본 처리 단위다. AI 서비스 이용료는 일반적으로 입력·출력 토큰 사용량에 단가를 곱해 산정된다. 기업은 이를 통해 모델별 호출 건수와 사용량, 비용을 바로 확인할 수 있다. 이 과정에서 토큰 비용은 청구서와 관리 화면에 즉시 수치로 나타난다. 여러 부서 인력과 시간에 분산되는 데이터 통합 비용보다 눈에 잘 띄는 이유다. 토큰 사용량이 AI 전체 도입 비용을 대표하는 지표처럼 인식된다는 설명이다. 최근 기업 내 기술비용 관리 조직도 AI 비용을 파악하기 위해 토큰 사용량에 주목하고 있는 것으로 나타났다. 올해 핀옵스재단 조사에서는 응답자 98%가 AI 관련 지출을 관리한다고 답했다. 이들은 가장 필요한 관리 도구 기능으로 토큰 사용량과 거대언어모델(LLM) 요청 건수를 세부적으로 추적하는 기능을 꼽았다. 업계 관계자들은 기업이 토큰 비용에만 지나치게 몰두한 점을 지적했다. 토큰 비용에 앞서 AI 에이전트 구축을 위한 데이터 관리와 시스템 통합 비용을 간과했다간 TCO 운영에 차질을 빚을 수 있다는 설명이다. 익명을 요청한 한 글로벌 IT 업계 관계자는 "토큰 비용은 AI 모델을 호출한 뒤 발생하는 비용으로 전체 AI TCO 한 파트를 담당하는 선에 그친다"며 "기업들은 모델 호출에 앞서 필요한 데이터를 찾고 정제한 뒤 기존 시스템과 연결해야 하는 작업을 거쳐야한다는 점을 명심해야 한다"고 말했다. 이어 "이 작업 과정에는 개발자와 데이터 엔지니어뿐 아니라 데이터 의미와 업무 규칙을 아는 현업 담당자, 외부 시스템통합(SI) 인력까지 투입된다"며 "이같은 인건비와 작업 시간은 토큰 사용 명세서에 드러나지 않는다"고 덧붙였다. 실제 지난 5월 던앤드브래드스트리트가 32개국 기업 1만 곳을 조사한 결과 97%가 AI를 도입하거나 관련 프로젝트를 추진하고 있었다. 이 중 내부 데이터가 AI 활용에 완전히 준비됐다고 답한 기업은 5%에 그쳤다. 언앤드브래드스트리트는 "조사 기업들은 데이터 관리·통합 비용에 가장 큰 어려움을 호소했다"며 "이런 비용이 현실적인 AI 에이전트 걸림돌로 인식되기 시작한 것"이라고 지적했다. 첫 토큰 전 쌓이는 비용…데이터 정제·RAG·시스템 연동 다수 기업 데이터는 AI가 바로 이용할 수 있는 형태로 정리돼 있지 않다. 동일한 고객이나 제품도 부서마다 다르게 표기되고, 오래되거나 중복된 정보가 여러 저장소에 흩어져 있어서다. 이에 AI 에이전트를 도입하려면 우선 필요한 데이터 위치를 파악해야 한다. 이후 오류와 중복을 제거하고 형식을 통일한 뒤 최신성과 정확성을 검증해야 한다. 개인정보와 영업기밀 등 민감정보를 분류하고 사용자별 접근 권한을 설정하는 작업도 필요하다. 클라우데라와 하버드비즈니스리뷰 애널리틱서비스가 진행한 조사에서는 응답 기업 73%가 AI용 데이터를 처리하고 준비하는 데 어려움을 겪었다고 답했다. 데이터 사일로와 서로 다른 데이터 소스의 통합 문제를 지목한 비율은 56%였으며, 데이터 품질과 편향 문제도 41%로 뒤를 이었다. 클라우데라는 "기업은 데이터 정제 규칙과 파이프라인을 구축하고 지속적으로 관리해야 한다"며 "업무 데이터가 바뀔 때마다 처리 규칙을 수정하고, 오래되거나 잘못된 정보가 AI에 공급되지 않도록 점검할 개발·운영 인력 비용도 필요하다"고 보고서에서 밝혔다. 기업이 AI 에이전트에 RAG를 투입할 때도 벡터DB와 임베딩 이용료만 따져서는 안 된다는 목소리도 나오고 있다. 데이터 수집·정제와 권한 동기화, 검색 품질 평가, 색인 갱신에 투입되는 개발·운영 인력까지 포함해야 실제 비용을 파악할 수 있다. 한 AI 업계 관계자는 "기업은 문서를 수집·변환하고 검색에 적합한 크기로 나눈 뒤 임베딩·색인을 생성해야 한다"며 "데이터가 바뀔 때마다 색인 갱신 작업도 필요하다"고 설명했다. 이어 "이런 비용까지 인지해야 RAG 총 도입비용이 책정될 수 있다"고 말했다. 또 다른 관계자는 "AI 에이전트가 실제 업무를 수행하려면 RAG를 넘어 고객관계관리(CRM)와 전사적자원관리(ERP), 결재·메일·그룹웨어 등 핵심 업무 시스템에도 연결돼야 한다"며 "시스템마다 데이터 구조와 응용프로그램인터페이스(API), 인증 방식이 달라 개별 연동 작업이 필요하고, 이 과정에 추가 비용이 들 수 있다"고 설명했다. 외신들은 SAP 같은 레거시 업무 시스템은 복잡한 데이터 모델과 독자적인 업무 로직, 기업별 맞춤 설정을 갖고 있어 AI 에이전트를 단순히 연결하기 어렵다고 지적했다. 표준 API가 없는 시스템에는 별도 연결 프로그램을 개발하고 접근 권한과 감사 기록도 마련해야 한다는 설명이다. 미국 IT 전문매체 CIO는 "결국 기업이 놓치기 쉬운 비용은 토큰 사용료가 아니라 AI가 데이터를 이해하고 기존 시스템 안에서 움직일 수 있도록 만드는 인력과 기술 비용"이라고 보도했다. PoC 끝나자 숨은 비용 불어나…'업무 한 건 총비용' 봐야 AI 에이전트 비용은 개념검증(PoC)을 실제 운영으로 전환하는 과정에서 본격적으로 늘어나는 것으로 전해졌다. 시험 단계에서는 드러나지 않았던 시스템 연동과 보안·규제 대응, 모니터링, 유지보수 비용이 추가돼서다. PoC는 소수 인력이 미리 정제한 일부 데이터를 이용해 실제 업무 시스템과 분리된 환경에서 진행할 수 있다. 데이터 품질이나 접근 권한, 시스템 간 연동 문제를 충분히 검증하지 않고도 모델의 기능과 정확도를 시험할 수 있다는 의미다. 운영 단계에서는 상황이 달라진다. AI 에이전트를 기존 시스템과 연결하고 사용자별 권한을 적용해야 한다. 보안과 규제 준수, 성능 감시, 장애 대응, 데이터 갱신과 지속적인 유지보수 체계도 마련해야 한다. 올해 딜로이트가 24개국 기업 임원 3235명을 조사한 결과 AI 실험 40% 이상을 실제 운영 환경으로 전환한 기업은 전체의 25%에 그쳤다. AI 도입은 빠르게 늘고 있지만 이를 대규모 업무 환경으로 확장하는 기업은 많지 않다는 의미다. 운영 전환에 실패해 PoC를 반복하면 매몰비용도 발생하기도 한다. 여러 모델과 활용 사례를 시험하는 데 투입한 개발 인력과 클라우드 인프라, 컨설팅 비용을 회수하기 어렵다. 데이터 구조와 시스템 연동 방식을 다시 설계하면 재작업 비용까지 더해진다. CIO는 AI 에이전트 경제성을 판단하려면 업무당 토큰 사용량과 추론 비용을 계산하고, 이를 같은 업무에 투입되는 인건비와 비교해야 한다고 분석했다. 경우에 따라 AI 에이전트의 업무당 비용이 사람이 직접 처리할 때보다 커질 수 있다는 이유에서다. 비즈니스인사이더는 "기업이 따져야 할 것은 토큰 100만 개 가격만이 아니다"며 "AI 에이전트가 업무 한 건을 정확하고 안전하게 완료하는 데 투입되는 데이터·시스템·인력 비용을 모두 합산해야 실질적인 비용 경쟁력을 판단할 수 있다"고 내다봤다.

2026.07.28 12:35김미정 기자

이동수 에이투시스 대표 "국가 AI 경쟁력, GPU 확보보다 통합 운영 역량"

국가 인공지능(AI) 컴퓨팅 전략이 그래픽처리장치(GPU) 확보에 치우져선 안 된다는 주장이 나왔다. 에이전틱 AI 환경에 맞는 AI 반도체와 메모리, 데이터센터, 소프트웨어(SW)를 통합 구축해야 된다는 설명이다. 이동수 에이투시스 대표는 20일 국가AI전략위원회가 서울스퀘어에서 개최한 '에이전틱 AI 시대 국가 컴퓨팅 전략' 세미나에서 이같이 밝혔다. 이 대표는 AI전략위에서 기술혁신·인프라 분과위원으로도 활동 중이다. 이 대표는 GPU 보유량보다 다양한 연산 자원을 효율적으로 배분·운영하는 역량이 중요하다고 진단했다. 에이전틱 AI 환경에서는 검색과 분석, 코딩 등에 특화된 여러 모델과 에이전트가 하나의 업무를 나눠 처리한다는 이유에서다. 이 과정에서 서로 다른 요청이 불규칙하게 들어오면, 특정 모델에 맞춰 구축한 GPU 활용률이 떨어질 가능성이 높다. 이 대표는 에이전틱 AI 시대에 메모리 기술 중요성이 높아질 것으로 내다봤다. 여러 에이전트가 작업 결과와 대화 맥락을 주고받으려면 메모리를 효율적으로 활용해야 한다는 이유에서다. 그는 "에이전트가 이미 처리한 정보를 케이브이(KV) 캐시에 저장해 다시 쓰면 같은 내용을 반복해서 계산하는 작업을 줄일 수 있다"고 설명했다. KV 캐시는 모델이 앞서 읽은 문맥을 임시 보관하는 단기 기억장치다. 에이전트가 외부 도구를 실행한 뒤 모델을 재호출할 때 기존 문맥을 캐시에서 불러오면 GPU 연산량과 응답 지연을 줄일 수 있다. 이 대표는 서비스 특성과 모델별 수요에 맞춰 연산과 메모리 자원을 탄력적으로 배분하는 운영 체계가 필요하다고 강조했다. GPU 성능뿐 아니라 고대역폭메모리(HBM)와 네트워크, 중앙처리장치(CPU), 캐시 관리 기술을 함께 최적화해야 하는 이유에서다. 그는 AI 인프라 평가 기준도 달라져야 한다고 주장했다. 기존 AI 팩토리는 가격이나 전력당 얼마나 많은 토큰을 생성하는지를 중심으로 평가했지만, 에이전틱 AI에서는 작업 완료까지 걸린 시간과 전체 비용, 전력 소비, 성공률을 함께 살펴야 한다는 것이다. 이 대표는 "토큰 가격이 저렴한 모델이라도 같은 작업을 여러 차례 반복하면 최종 비용이 더 커질 수 있다"며 "토큰 단가가 높은 모델이 적은 시행착오로 업무를 빠르게 끝내면 전체 비용은 낮아질 수 있어 토큰당 가격만으로 효율을 판단하기 어렵다"고 말했다. 그는 "결국 에이전틱 AI 시대 컴퓨팅 경쟁력은 GPU를 얼마나 많이 확보했는지보다 주어진 업무를 얼마나 적은 비용과 시간으로 끝내는지에 달렸다"고 덧붙였다.

2026.07.20 17:17김미정 기자

AI산업 4대 키워드는 '에이전트·인프라 병목·피지컬AI·수익화'

본격적인 인공지능(AI) 에이전트 시대에 접어들며 디지털 세상의 AI가 물리 세계에서 실현되는 피지컬AI가 화두로 떠올랐다. 급속한 AI 확산에 GPU를 비롯해 전력과 메모리반도체 부족 현상이 극심해졌고, 투자 경쟁에서 AI가 수익성을 증명해야 하는 시대에 접어들었다. SK텔레콤 AI정책연구원이 분석한 올해 상반기 AI 산업의 트렌드를 정리한 내용이다. 15일 SK텔레콤 뉴스룸에 따르면 회사 AI 정책연구원은 올해 상반기 AI 산업을 관통하는 4대 키워드로 ▲AI 에이전트 ▲AI 인프라 ▲피지컬AI ▲수익화 등을 제시했다. “말하는 AI에서 행동하는 AI로” 올해 초부터 글로벌 빅테크는 일제히 AI 에이전트를 차세대 핵심 전략으로 내세웠다. 엔비디아는 GTC 2026에서 '에이전틱 AI'를 핵심 화두로 제시했고, 구글은 24시간 동작하는 개인 AI 에이전트 '제미나이 스파크'를 공개했다. 애플도 WWDC에서 차세대 애플 인텔리전스와 '시리 AI'를 선보이며 AI 전략을 본격화했다. 기업들의 구호에 그치지 않고 이용자 경험도 빠르게 변화하는 모양새다. 구글 AI 검색 모드는 월간 이용자 10억 명을 돌파했고, 검색은 키워드를 입력해 링크를 찾는 방식에서 AI가 맥락을 이해하고 작업을 수행하는 형태로 진화하고 있다. 아울러 국내기업도 계획 수립부터 실행, 피드백까지 수행하는 에이전틱 AI를 업무에 도입하고 있다. “GPU 넘어 메모리·전력 확보 경쟁” AI 경쟁은 모델 성능보다 인프라 확보가 더 중요한 시대에 접어들었다는 평가다. 인프라 투자 수요가 공급을 훨씬 뛰어넘기 때문이다. 그간 엔비디아 GPU 확보가 투자 경쟁을 좌우하는 요소로 꼽혔는데 GPU 공급 외에도 인프라 투자에 대한 병목이 동시 다발로 발생하고 있다. 연구원은 이에 따라 올해 AI 인프라 경쟁을 '칩, 메모리, 전력' 등 삼중 병목으로 규정했다. 추론형 AI 확산으로 GPU 수요가 급증했고, 이에 따라 HBM을 비롯한 메모리 공급 부족도 심화됐다. 시장조사업체 IDC는 메모리 부족 현상이 최소 2027년까지 이어질 것으로 내다봤다. 전력 문제도 줄곧 화두다. 미국에서는 향후 5년간 추가 전력 수요 절반 이상이 AI 데이터센터에서 발생할 것으로 예상되고 있다. 이에 따라 AI 경쟁은 GPU 확보를 넘어 메모리와 전력, 냉각까지 포함한 종합 인프라 경쟁으로 확대되고 있다. “AI가 현실 물리 세계로 나온다” AI 활동 무대가 디지털을 넘어 현실 세계로 확장되고 있다. 피지컬AI 이야기다. 올 상반기를 넘어 앞으로 오랜 기간 AI 산업을 관통할 이슈로 꼽힌다. 먼저 올해 CES와 GTC에서는 휴머노이드 로봇과 자율주행, 스마트 제조 등 피지컬 AI 기술이 핵심 화두로 떠올랐다. 엔비디아는 실제 환경 대신 가상 공간에서 학습 데이터를 만드는 피지컬 AI 데이터 팩토리를 공개하며 산업 적용을 가속화하고 있고, 각국 여러 기업을 대상으로 우군을 늘리고 있다. SK텔레콤은 GTC에서 엔비디아 에이전트 툴킷을 활용한 에이전틱 디지털 트윈 모델링 기술을 선보였는데, 이는 제조 현장 데이터를 AI가 이해할 수 있는 형태로 자동 변환해 디지털 트윈 구축을 지원하는 기술이다. 피지컬AI를 실제 산업 현장에 적용하려는 시도에 따라 제조 현장의 휴머노이드 도입과 물류 자동화를 중심으로 피지컬AI 실증이 본격화되고 있다. 본격적인 산업 재편이 이뤄질 수 있다는 전망도 힘을 얻는다. “AI 투자, 이제는 돈을 벌어야” AI 산업은 이제 투자 경쟁을 넘어 수익성을 입증해야 하는 단계에 들어섰다. 알파벳과 아마존, 마이크로소프트, 메타 등 빅테크 4사의 올해 AI 관련 자본지출은 약 7250억 달러에 이를 것으로 예상된다. 다만 이같은 막대한 자본 투자가 실제 기업의 매출로 이어지는 부분에 대해서는 여전히 물음표가 남아있다. 그러면서 토큰 이코노미 논의가 시작됐다. 예컨대 구글은 월 100달러의 'AI 울트라' 플랜을 내놓으며 프로 플랜 대비 사용 한도를 5배 높였고, 애플은 시리 AI를 일정량까지 무료로 제공하되 초과 사용분은 아이클라우드+ 유료 구독으로 연결하는 구조를 택하고 있다.

2026.07.15 15:55박수형 기자

딥시크 가격 75% 내려도 기업 부담 여전…"AI 에이전트 토큰 폭증"

딥시크의 대폭적인 모델 가격 인하에도 기업용 인공지능(AI) 업계 수익성 문제가 해소되지 않을 수 있다는 분석이 나왔다. AI 에이전트 토큰 사용량이 모델 가격 하락 속도보다 더 빠르게 늘고 있다는 이유에서다. 12일(현지시간) 벤처비트 등 외신에 따르면 마이트레이 차터지 선임 소프트웨어(SW) 엔지니어와 데반시 아가르왈 머신러닝(ML) 엔지니어는 딥시크가 'V4-프로' 모델 가격을 75% 내렸지만 기업용 AI 서비스 비용 부담은 여전히 크다고 주장했다. 이들은 AI 에이전트가 기존 챗봇보다 최대 수백 배 많은 토큰을 소비하는 현상을 지적했다. 일반 챗봇은 사용자 질문 하나를 한 차례 모델 호출로 처리하지만, AI 에이전트는 계획 수립과 정보 검색, 도구 사용, 결과 검증, 요약을 거치며 여러 차례 모델을 호출하고 있어서다. 이 과정에서 사용자는 답변 하나만 받지만 서비스 제공업체는 전체 처리 과정에서 발생한 토큰 비용을 부담해야 한다. 모델 가격이 낮아져도 질문 하나가 수십 차례 유료 작업으로 이어지면 운영비 절감 효과는 제한적일 수밖에 없다. 차터지 선임 SW 엔지니어는 "단일 대화형 챗봇은 사용자 입력 1토큰당 약 5토큰이 청구된다"며 "에이전트는 이 비율이 1대700 이상까지 높아질 수 있다"고 설명했다. 이어 "에이전트는 50토큰짜리 질문에 검색 문맥을 불러오고 도구를 실행한 뒤 결과를 요약할 수 있다"며 "약 3만5천개 입력 토큰이 청구될 수 있다"고 말했다. 그는 이런 구조가 사용자당 월정액을 받는 서비스형 소프트웨어(SaaS) 사업 모델에도 부담을 준다고 지적했다. 월 40달러 요금제 이용자가 하루 50차례 이상 에이전트를 실행하면 추론 비용이 해당 사용자의 구독 매출을 넘어설 수 있다는 설명이다. 아가르왈 ML 엔지니어는 비용 절감을 위해 질문 난도에 따라 적절한 모델을 배정하는 '비용 인식형 라우팅'과 프롬프트 캐싱을 도입해야 한다고 제안했다. 불필요한 문맥과 도구 출력값을 줄이고 에이전트의 도구 사용 횟수에 제한을 둬야 한다는 점도 강조했다. 아가르왈 ML 엔지니어는 "AI 기업 경쟁력은 가장 저렴한 모델을 사용하는 것보다 에이전트의 작업 경로와 비용을 얼마나 정교하게 통제하는지에 달릴 것"이라고 밝혔다.

2026.07.13 09:53김미정 기자

KT가 'AI 토큰 경제'에 자신있게 뛰어든 이유

박윤영 KT 대표가 취임 후 처음 열린 언론 대상 간담회에서 회사 신사업으로 '토큰 팩토리'를 제시했다. AI 토큰 기반 경제에서 새로운 AI 과금 체계로 수익을 일으켜 회사의 대표적인 AI 사업으로 삼겠다는 것이다. 무엇보다 AI 사업 모델의 발전에서 최대 병목으로 꼽히는 토큰 비용 처리를 두고 KT라는 통신사가 가장 잘할 수 있는 사업 모델이란 이유를 들어 이목을 끌었다. 박 대표는 6일 열린 AX플랫폼컴퍼니 비전 발표 자리에서 “연결을 중심으로 하는 통신사에서 이전까지의 단위는 비트(bit) 였고, AI 경제에서 기본 단위는 토큰으로 완성됐다”면서 “AI를 제공하는 회사들이 토큰 사용량이 폭증하면서 월 구독료 모델에 변화를 두고 있고 AI를 이용하던 기업도 고민이 생겼는데, 이를 해결할 수 있는 게 바로 '토큰 팩토리'”라고 말했다. 이어 “토큰팩토리 비즈니스 모델로 KT는 최적의, 그리고 가장 효율적으로 적합한 파운데이션 모델과 보안을 사용하는지 총제적인 답을 만들어 제공하겠다”며 “빠른 시간에 작동하는 모습을 보여주겠다”고 밝혔다. 토큰은 AI 모델에서 텍스트나 이미지를 처리할 때 쓰는 기본 단위를 일컫는다. AI 이용 확산으로 토큰 사용량은 걷잡을 수 없이 증가하는 추세다. 이처럼 폭발적으로 증가하는 토큰 사용량에 따라 기존 정액제 형태의 모델이 변화할 수밖에 없게 됐다. KT는 이 지점에서 새로운 사업 모델을 만들어 AI를 제공하는 기업이나 이용하는 이들의 수요를 모두 맞추겠다는 것이다. 즉, 토큰 이용량에 따라 과금을 통합하고 운영하는 플랫폼 '토큰팩토리'를 내세워 토큰 경제를 주도하겠다는 전략이다. 구체적으로는 통신 네트워크를 통한 연결의 중심에 있는 KT는 AI 토큰이 오가는 길목에서 게이트웨이 역할을 맡는다. 전국에 포진된 KT 데이터센터와 토큰 최적화 엔진을 바탕으로 토큰의 생성, 중개, 과금 지원이 가능한 게이트웨이가 KT가 말하는 토큰팩토리다. 토큰팩토리에서 중요한 핵심은 AI 토큰을 얼마나 효율적으로 사용하냐의 문제다. 이에 관련해 박상원 KT AX사업부문장은 “GPU와 NPU 등 토큰을 가장 싸게 생산해서 공급할 수 있도록 최적화하는 것을 시작으로 최적의 모델을 컨텍스트 기반으로 자동 라우팅을 통해 토큰 사용을 최소화할 수 있다”고 설명했다. 이어 “하네스와 루프 엔지니어링 등 다양한 최적화 기술을 적용해 토큰 사용량을 줄이고, 가장 저렴하고 효율적으로 AI 서비스를 제공할 수 있는 모델을 만들겠다”고 덧붙였다. 토큰 사용 효율화와 함께 KT가 자신하는 부분은 '과금'이다. 통신사는 과거 음성통화부터 현재 데이터 이용까지 개인별 과금에 뛰어난 역량을 갖고 있는데, 토큰 중심의 경제에서는 이같은 통신사 역량이 빛을 낼 수 있다는 것이다. 박 대표는 “게이트웨이의 더 중요한 문제는 개인별로 과금하게 되는데, 과금은 통신사만큼 잘하는 곳이 없다”면서 “AI 회사들이 경험하지 못해 결핍된 과금 영역은 통신사가 가장 잘하기 때문에 새로운 비즈니스가 될 수 있다”고 강조했다. 이어 “토큰팩토리를 갖추게 되면 AI데이터센터 인프라에서 필요에 따라 추론과 같은 수익 마진을 낼 수 있다”며 “각 파운데이션 모델이 다른 토큰을 쓸 때 모델을 제공하는 회사들과 협약을 통해 비즈니스 구조를 만들어갈 수 있다”고 덧붙였다. KT는 토큰팩토리 사업을 회사 AX 사업의 대표적인 모델로 키워낼 방침이다. 아울러 토큰팩토리와 함께 신사업으로 꼽은 스테이블코인, 그간 역량을 키워온 피지컬AI를 결합한 사업 청사진도 그리고 있다. 이를 통해 한국 시장을 넘어 동남아 신흥 시장까지 사업 권역을 공략한다는 계획이다.

2026.07.06 15:48박수형 기자

화웨이-차이나모바일 후베이, 'AI 추론 가속 솔루션' 상용망 검증

화웨이가 장문 AI 추론의 토큰 처리량을 최대 3.7배 끌어올리는 AI 추론 가속 솔루션을 중국 통신 업계 최초로 상용망에서 검증하는 데 성공했다. 화웨이는 지난 24일부터 26일까지 중국 상하이에서 열린 'MWC 상하이 2026'에서 차이나모바일 후베이와 이같은 성과를 공개했다고 30일 밝혔다. 솔루션은 화웨이 오션스토(OceanStor) A800 스토리지와 어센드 A3 슈퍼팟, 통합 캐시 관리자(UCM)가 기반이다. 이를 통해 통신사가 AI 컴퓨팅 서비스를 배포할 수 있는 토대를 마련했다. 화웨이는 지난해 UCM을 선보였다. 기존 온칩 메모리와 D램의 제한적 용량이 KV 캐시 적중률을 떨어뜨려 AI에이전트 전체 성능을 저하시키는 문제를 해결하기 위해서다. UCM은 외부 고성능 스토리지를 활용해 온칩 메모리와 D램의 용량 한계를 넘어선 페타바이트(PB)급 KV 캐시를 구현한다. KV 캐시를 전 주기에 걸쳐 계층적으로 관리·스케줄링함으로써 단일 대화의 컨텍스트 창을 크게 넓힌다. 멀티턴 대화에선 과거 KV 캐시를 재사용해 중복 연산을 없애 더 낮은 비용으로 최적화된 추론 경험을 제공한다. 검증은 차이나모바일 후베이의 상용망 환경에 'vLLM-Ascend' 프레임워크를 배포하고, '미니맥스 M2.5'와 'GLM-5.1' 등 주요 모델에 8K부터 190K 토큰에 이르는 장문 입력을 시뮬레이션하는 방식으로 이뤄졌다. 결과적으로 미니맥스 M2.5는 UCM 적용 시 첫 토큰 생성 시간(TTFT)이 26%에서 62%까지 개선되고 NPU당 초당 토큰 수(TPS)가 크게 향상됐다. 시퀀스 길이별로는 64K에서 TPS가 58%, 128K 장문 환경에서 78% 높아졌다. GLM-5.1은 TTFT가 51%에서 93%까지 개선되고 TPS가 56%에서 372%까지 향상됐으며, 64K에서 313%, 128K 장문 환경에서 372% 상승했다. 이 결과는 컨텍스트 길이가 길어질수록 AI 추론 가속 솔루션의 강점이 더욱 뚜렷해진다는 점을 보여준다. 솔루션은 장문 추론에서 KV 캐시 용량 병목을 해소한다. 화웨이는 검증이 통신사의 AI 컴퓨팅 인프라 최적화에서 의미 있는 진전으로, 글로벌 AI 산업에 복제 가능한 기술 모델을 제시했다고 설명했다. 차이나모바일 후베이 관계자는 “AI 에이전트 상호작용과 코드 생성 같은 시나리오에서 AI 추론 가속 솔루션은 처리량을 50% 이상 높일 수 있어, 차이나모바일 후베이 AI 서비스의 대규모 배포를 위한 견고한 기반을 마련했다”고 밝혔다. 마이클추 화웨이 글로벌 데이터 스토리지 마케팅·솔루션 세일즈 부문 사장은 “AI 추론 가속 솔루션은 TTFT를 크게 줄일 뿐 아니라 토큰 비용 절감에도 기여해, 통신사가 효율적이고 친환경적인 AI 컴퓨팅 인프라를 구축하도록 지원한다”고 말했다.

2026.06.30 17:41홍지후 기자

  Prev 1 2 Next  

지금 뜨는 기사

이시각 헤드라인

AI 현재와 미래는...‘AI 페스타’서 직접 보고 체험한다

[AI는 지금] 챗GPT·클로드 추격할까…'제미나이4' 띄운 구글, 기술·가격·마케팅 총공세

[AI 리더스] 모리타 준 퍼플렉시티 APAC "연내 韓 법인 설립, AI 선택지 넓혀"

"신한 공격 추정 AI 해킹도구 아르텍스, 한국서 4개 발견"

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.