• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'KV캐시'통합검색 결과 입니다. (3건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

퓨리오사AI "에이수스와 NPU 카드 넘어 AI 인프라로 협력 확대"

"에이전틱 AI의 핵심은 결국 파운데이션 모델입니다. 최근 다양한 오픈소스 기반 프론티어 모델이 부상하고 있는 만큼, 퓨리오사AI는 이런 모델을 최대 성능과 효율로 구동할 수 있는 해결책을 제공하는 데 주력하고 있습니다." 지난 3일 서울 여의도 콘래드호텔에서 지디넷코리아와 만난 백준호 퓨리오사AI 대표는 에이전틱 AI 시대의 AI 인프라 경쟁력으로 '추론 효율성'을 꼽았다. 퓨리오사AI는 2017년 설립된 국내 1세대 NPU 기업이다. 자체 개발한 NPU와 소프트웨어 기술력을 바탕으로 데이터센터 AI 추론 시장을 공략하고 있으며, 2세대 NPU 레니게이드를 통해 국내외 고객사로 공급 범위를 확대하고 있다. 백준호 대표는 "2세대 NPU '레니게이드(RNGD)'는 에이전틱 AI로 늘어난 연산 비용을 낮출 수 있는 AI 추론 솔루션이며 에이수스와 고효율 AI 추론 인프라 공급을 위해 협력할 것"이라고 밝혔다. "레니게이드 NPU, GPU 대체할 고효율 솔루션" AI가 실험 단계를 넘어 실제 서비스에 대규모로 적용되면서 기업들이 가장 크게 직면한 문제는 비용이다. AI 서비스 이용량과 추론 규모가 급증하면서 GPU 중심의 인프라 비용과 전력 비용이 전체 서비스 비용에서 차지하는 비중도 커지고 있다. 퓨리오사AI는 이런 문제를 해결할 수 있는 대안으로 올해부터 공급에 들어간 2세대 NPU '레니게이드(RNGD)'를 내세웠다. 기존 GPU 대비 전력 및 인프라 비용을 낮추고, 동일한 AI 서비스를 보다 효율적으로 운영하는 것이 목표다. 백 대표는 "레니게이드는 GPU의 보완재가 아닌 대체재다. 자체 추산 결과 레니게이드는 비용 효율 면에서 엔비디아 H200(호퍼) 등 GPU 대비 약 1.3~2배 더 효과적"이라고 설명했다. 이어 "삼성SDS 클라우드 인스턴스에 레니게이드가 도입돼 기업 고객 대상 상용 서비스 중이며 업스테이지 등 AI 네이티브 기업도 활용중이다. LG 엑사원 등 프론티어 모델을 비롯해 공공·금융·발전소 등 다양한 산업 분야에서도 도입이 진행중"이라고 말했다. "긴 문맥·반복 추론 부담 더는 솔루션에 집중" 챗봇이나 거대언어모델(LLM) 등 기존 생성 AI는 이용자의 요청에 대한 응답을 생성하는 데 목적이 있다. 반면 에이전틱 AI는 목표를 달성할 때까지 여러 차례 추론을 반복하고, 긴 문맥을 유지하면서 지속적으로 토큰을 생성한다. 이 과정에서 긴 문맥을 유지하고 대규모 토큰을 생성하면서 추론 비용도 증가할 수 있다. 백준호 대표는 "에이전틱 AI 확산에 따라 추론 연산이 늘어나며 관련 비용이 급증하는 만큼 이를 효율적으로 처리할 수 있는 AI 반도체와 인프라가 반드시 필요하다"고 강조했다. 이어 "퓨리오사AI는 반복적인 추론 과정에서 발생하는 KV 캐시를 효율적으로 관리하고, 소프트웨어 스택 차원에서 전체 문맥을 효과적으로 유지·관리하는 하드웨어 및 소프트웨어 최적화에 집중하고 있다"고 설명했다. "1세대 NPU 상용화부터 에이수스와 협력" 퓨리오사AI는 1세대 '비전NPU' 상용화 단계부터 대만 컴퓨팅·인프라 기업인 에이수스와 협력해 왔다. 백준호 대표는 "레니게이드 NPU 탑재 카드의 상용화와 대량 생산 과정에서 에이수스의 역할이 컸다"고 말했다. 설계한 실리콘을 실제 서버에 탑재할 수 있는 복잡한 카드 제품으로 구현하고, 대량 생산 단계까지 안정적으로 연결하는 과정에서 에이수스가 보유한 제조·양산 경험과 노하우가 결정적인 역할을 했다는 것이다. 폴 주 에이수스 인프라 솔루션 비즈니스 그룹(ISG) 총괄 수석부사장은 "에이수스는 퓨리오사AI의 성장 가능성과 잠재력을 보고 협력에 나섰다"고 설명했다. 퓨리오사AI가 칩과 아키텍처 설계에 강점을 갖고 있다면 에이수스는 시스템 설계와 제조, 부품 조달 및 글로벌 공급망에서 강점을 갖고 있다. 양사는 서로 다른 역량을 결합해 실제 제품을 시장에 공급하는 데 초점을 맞췄다. 폴 주 부사장은 "에이수스는 시스템 레벨 특화, 퓨리오사AI는 칩 면에서 장점이 있다. 부품 선정 등에 있어서도 서로 장점을 결합할 수 있다고 판단했다"고 설명했다. "에이수스와 글로벌 AI 인프라 시장 공략 확대" 양사는 단순한 NPU 카드 제조와 공급을 넘어 서버와 시스템, 나아가 수백 MW(메가와트)에서 수 GW(기가와트) 급 AI 인프라 구축으로 협력 영역을 확대중이다. 폴 주 에이수스 수석부사장은 "글로벌 시장 확대에는 기술력뿐 아니라 현지 영업, 제품 공급, 판매 후 유지보수까지 고객이 요구하는 전체 공급망을 구축하는 것이 중요하다"고 설명했다. 이어 "1세대 협력에서는 에이수스가 크게 드러나지 않았지만 시스템과 랙 차원에서 강점이 있는 만큼 앞으로 더 많은 리소스를 제공하며 협력할 것"이라고 말했다. 에이수스는 이에 따라 글로벌 영업망과 제조·조달 역량을 활용해 레니게이드 기반 서버 솔루션의 시장 확대를 지원할 계획이다. 백준호 대표는 "양사 협력은 이제 시작 단계다. 2세대 레니게이드 NPU 탑재 카드 상용화를 시작으로 양사의 기술·제조·공급망 역량을 결합해 서버와 랙, 데이터센터 단위의 AI 인프라로 확장할 것"이라고 말했다.

2026.09.10 09:37권봉석 기자

디노티시아, 메모리 병목 해결할 KV 캐시 20배 압축기술 'STAR-KV' 공개

AI 인프라 전문기업 디노티시아가 거대언어모델(LLM) 추론의 최대 병목으로 꼽히는 메모리 용량과 처리 속도 문제를 획기적으로 해결할 수 있는 신기술을 세계적 학회에서 선보인다. 디노티시아는 UC 샌디에이고(UCSD) VVIP 랩과 함께 연구한 KV 캐시(KV Cache) 압축 기술인 'STAR-KV' 논문과 소스코드를 공개했다고 2일 밝혔다. 해당 논문은 세계 최상위 머신러닝 학회인 'ICML 2026'의 스포트라이트 논문으로 전격 채택됐다. KV 캐시는 LLM이 이전에 읽은 문맥을 다시 계산하지 않도록 메모리에 저장해 두는 임시 기억 공간이다. 최근 AI가 대화 이력, 검색 결과 등 방대한 컨텍스트를 동시에 처리하는 에이전트형 시스템으로 진화하면서, KV 캐시는 그래픽처리장치(GPU) 메모리 사용량과 추론 비용을 좌우하는 핵심 병목으로 부상했다. 실제로 LLaMA-3.1-8B 모델이 배치 크기 4로 128K 토큰의 긴 컨텍스트를 처리할 경우, KV 캐시가 전체 GPU 메모리의 약 81%를 차지할 정도다. 이번에 공개된 STAR-KV는 저랭크 압축만으로 KV 캐시를 최대 75% 줄였으며, 혼합정밀도 양자화 기법을 결합해 전체 용량을 최대 20배까지 압축하는 데 성공했다. 특히 용량 압축에 그치지 않고 맞춤형 GPU 커널을 활용한 실행 최적화를 통해 연산 속도까지 끌어올렸다. 어텐션 연산 속도는 최대 6.9배, 전체 생성 처리량은 최대 3.1배 향상시키면서도 기존 압축 방식보다 높은 정확도를 유지했다. STAR-KV 논문이 발표될 ICML은 NeurIPS, ICLR과 함께 AI·머신러닝 분야의 최고 권위 학회로 꼽히며, 올해는 오는 7월 6일부터 11일까지 서울 코엑스에서 개최된다. 올해 심사에 들어간 2만3918편의 논문 중 6352편이 채택됐으며, 디노티시아의 논문이 선정된 '스포트라이트' 세션은 전체 심사 논문의 상위 약 2.2%(536편)에만 허락된다. 디노티시아는 향후 STAR-KV가 실제 AI 서비스 환경에 적용될 수 있도록 기술을 고도화하는 한편, vLLM을 비롯한 주요 오픈소스 LLM 추론 프레임워크에 이를 통합할 계획이다. 정무경 디노티시아 대표는 “AI가 더 긴 맥락을 더 낮은 비용으로 빠르게 처리할 수 있도록 돕는 기술이 중요해지고 있다”라며 “STAR-KV는 핵심 병목인 KV 캐시 용량과 처리 속도 문제를 실질적으로 해결하는 기술이며, 소스코드 오픈소스화를 통해 글로벌 AI 추론 생태계 발전에 기여하겠다”고 말했다.

2026.07.02 09:17전화평 기자

메모리 1/6로 줄인다고?…구글 터보퀀트 쇼크의 치명적 착각

구글 리서치가 발표한 대규모 언어모델(LLM) 메모리 압축 기술 '터보퀀트(TurboQuant)'에 글로벌 반도체 시장이 요동쳤다. 이 기술이 AI가 문맥을 기억하는 KV캐시(Key-Value Cache) 용량을 최대 6분의 1로 압축한다는 소식에, 고대역폭메모리(HBM) 등 메모리 반도체 수요가 급감할 것이란 우려가 덮치며 관련 기업들의 주가가 일제히 크게 하락한 것이다. 하지만 국내 AI 반도체 및 아키텍처 전문가들의 진단은 정반대 방향을 가리키고 있다. 시장은 터보퀀트를 '수요 파괴자'로 오해했다. 하지만 기술의 본질과 최신 인공지능(AI) 서비스 트렌드를 뜯어보면 오히려 다가올 '메모리 폭발'을 지탱하기 위한 산소호흡기이자, AI 생태계를 확장할 강력한 촉매제라는 분석이다. 워킹 메모리의 확장…"책상 안 줄이고 참고서 늘린다" 전문가들은 가장 큰 착각으로 '압축의 목적'을 꼽았다. 기업들이 메모리를 압축하려는 이유는 돈을 아끼기 위해서가 아니라, AI를 더 똑똑하게 만들기 위해서라는 것이다. 정무경 디노티시아 대표는 'KV캐시'를 사람이 복잡한 문제를 풀 때 당장 머릿속에 지식을 임시로 얹어두는 '워킹 메모리(Working Memory)'에 비유했다. 예컨대 어려운 문제를 풀 때 지식을 바로바로 꺼내 쓰기 위해 넓게 펼쳐두는 '책상'과 그 위의 '참고서' 같은 역할이다. 당장 풀어야 할 문제가 복잡할수록 책상 위에 참고서를 많이 올려둘 수 있어야 답변의 퀄리티가 높아진다. 현재 AI 업계의 최대 화두인 AI가 한 번에 읽고 기억할 수 있는 문맥(컨텍스트)의 길이를 어떻게든 늘리는 것도 이 때문이다. 문제는 그동안 물리적인 HBM 메모리의 용량이 턱없이 부족해 방대한 지식을 한 번에 올려놓지 못했다는 점이다. 이때 터보퀀트 같은 기술로 데이터 크기를 6분의 1로 압축하게 되면 어떤 일이 벌어질까. 기업들은 '이제 책상 크기를 줄여 비용을 아끼자'고 생각하지 않는다. 역설적으로 기존 책상 크기를 그대로 유지한 채, 2권밖에 못 놓던 참고서를 12권이나 꽉 채워 올려둔다. 같은 하드웨어 공간에 6배 더 많은 지식을 밀어 넣어 AI의 지능을 극대화하는 쪽을 택한다는 전망이 우세하다. 정 대표는 "6배로 압축했다가 아니고 6배 많이 올려놓을 수 있다, 이렇게 생각해야 한다"며, "성능이 좋아지면 이제 작은 하드웨어로도 구동이 되기 때문에 디멘드(수요)가 없어질 거라고 착각하는 경우가 되게 많다"고 꼬집었다. 효율이 높아질 수록 (메모리)수요가 줄어드는 게 아니라 오히려 더 늘어나게 된다는 말이다. 학계 주장도 이를 뒷받침한다. 김지훈 한양대 융합전자공학부 교수는 "메모리 요구량이 줄어드는 만큼 구매에 여유가 생기기 때문에, 더 다른 큰 모델과 시퀀스를 쓰거나 확장하게 된다"고 설명했다. '에이전틱 AI'가 부른 데이터 폭증 그렇다면 작년 4월에 이미 공개됐던 이 논문 기반의 기술이 왜 하필 지금 뜨거운 감자가 되었을까. 그 배경에는 최근 AI 시장의 게임 체인저로 떠오른 '에이전틱 AI(Agentic AI)'의 등장에 있다는 게 전문가들의 분석이다. 과거의 단순 문답형 LLM에서는 한 번의 추론에 한정된 KV캐시만 필요했다. 하지만 에이전틱 AI는 스스로 단계별 논리 전개를 수행하며 루프를 반복한다. 루프는 프로그래밍이나 AI 작동 과정에서 특정 목표를 달성할 때까지 생각과 행동 과정을 계속해서 되돌아가며 반복하는 것을 말한다. 카이스트 교수인 정명수 파네시아 대표는 "에이전트랑 LLM이 루프로 돌아가는 그 구조는 KV캐시를 훨씬 많이 더 쌓는다"고 지적했다. 정 대표는 에이전트가 동작하며 루프 백(Loop back)을 돌게 되면 KV캐시 요구량이 "몇 십 배, 몇 백 배 막 늘어난다"고 설명했다. 결국 에이전틱 AI 시대로 접어들면서 메모리 요구량이 기하급수적으로 폭증하자, 드웨어를 물리적으로 추가해 수습하던 기존 방식이 한계에 달했다는 지적이다. 터보퀀트와 같은 극단적인 소프트웨어 압축 기술은 이러한 데이터 폭발을 견뎌내기 위한 필수불가결한 고육지책일 뿐, 결코 장기적인 메모리 수요를 꺾을 수 없다는 것이 현업 전문가들의 중론이다. 정확도 하락에 연산 병목까지…결론은 영원한 '다다익램' 극단적인 압축 기술이 공짜로 얻어지는 마법도 아니다. 구글은 터보퀀트가 성능 하락 없이 데이터를 압축한다고 발표했지만, 현장의 시각은 더 냉정하다. 양자화(Quantization) 기술의 본질 자체가 소수점 이하의 세밀한 데이터를 덜어내는 '손실 압축'이기 때문이다. 정명수 대표는 이를 과거 슈퍼컴퓨터의 기후 예측 시뮬레이션에 빗대어 설명했다. 메모리 용량을 아끼기 위해 숫자의 정밀도를 낮추면 결국 일기예보가 틀리듯, 극단적인 메모리 축소는 필연적으로 AI 서비스의 정확도(품질) 하락이라는 또다른 청구서를 내밀 수밖에 없다는 지적이다. 아울러 추가 연산 병목 문제까지 더하면, 터보퀀트가 물리적 메모리를 완벽히 대체할 수 없다는 한계는 명확해진다. 이진원 하이퍼엑셀 CTO는 "메모리 저장은 3비트로 하더라도 꺼내서 연산할 때 4비트로 변환한 다음에 해야 한다”며, 현재 하드웨어 구조상 3비트 연산기가 부재한 현실을 꼬집었다. 즉, 터보퀀트 기술은 저장 공간만 줄여줄 뿐 실제 연산 효율에는 이득이 없다는 뜻이다. 오히려 데이터를 다시 역양자화(압축 해제)하는 과정에서 추가 연산 오버헤드가 발생한다. 이를 병목 없이 매끄럽게 처리할 최적화 커널이 뒷받침되지 않는다면, 최악의 경우 메모리 사용량은 줄이더라도 AI 구동 속도는 오히려 느려질 수 있다는 치명적인 딜레마를 안고 있는 셈이다. 결과적으로 효율성 혁신은 메모리 반도체의 파이를 갉아먹는 것이 아니라 오히려 거대하게 키울 가능성이 더 많다는 관측이다. 이 CTO는 경제학의 '제본스의 역설'을 인용하며 "사람들은 '예전보다 10배 효율성이 높아지게 됐으니까 우리 이제 하드웨어를 10분의 1만 쓰자'라고 절대 그렇게 안 한다"며 “오히려 10배 더 많이 사용해보자는 쪽으로 이야기가 나올 것”이라고 말했다. 그러면서 "이것(터보퀀트) 때문에 메모리가 덜 팔리거나 이럴 일은 절대 없다"고 단언했다. AI가 더 긴 문맥을 이해하고 스스로 추론하는 시대로 나아가는 이상, 메모리는 그 진화의 속도를 받쳐줄 유일한 토대라는 것이다. 김지훈 교수의 한 마디는 반도체 시장을 향한 섣부른 위기론을 관통한다. "이미 시장에 메모리 공급이 너무 모자란 상황에서, 메모리는 많으면 많을수록 좋다는 '다다익램(多多益RAM)'의 법칙은 절대 깨지지 않습니다.”

2026.03.27 15:27전화평 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

"스마트폰 다음은 XR"…퀄컴·삼성·구글, 차세대 폼팩터 3자 연합 구축

LG전자, AI 데이터센터 냉각 솔루션 영토 확장

검찰, 카카오 김범수 2심서도 징역 15년 구형..."불법·부정 지시 없었다"

미중 정상회담 D-1…AI 개발 속도·안전관리 접점 찾을까

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.