• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
반도체
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'GB300'통합검색 결과 입니다. (7건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

[AI는 지금] GPU만 빠르면 끝?…AI 에이전트 시대, '추론 SW'가 판 바꾼다

인공지능(AI) 에이전트 확산으로 AI 인프라 경쟁의 무게중심이 그래픽처리장치(GPU) 연산 성능에서 추론 소프트웨어와 서빙 시스템 전반으로 넓어지고 있다. 대화형 AI보다 훨씬 긴 컨텍스트를 유지하고 도구 호출과 반복 추론을 수행하는 AI 에이전트가 늘면서 KV 캐시 관리와 요청 스케줄링, 모델 병렬화 같은 소프트웨어 기술이 실제 서비스 성능과 비용을 좌우하는 요소로 떠오르고 있다. 26일 엔비디아에 따르면 차세대 AI 시스템 '베라 루빈 NVL72'는 세미애널리시스의 에이전틱 AI 벤치마크 '에이전트X'를 이용한 자체 시험에서 GB300 NVL72보다 메가와트당 AI 처리량이 최대 30배 높았다. 이번 수치는 엔비디아가 측정한 프리뷰 결과로, 현재 세미애널리시스의 검토를 기다리고 있다. 현재 세대인 GB300 NVL72에서도 성능 격차가 확인됐다. 딥시크 V4 프로 1.6T를 구동했을 때 H200 NVL8 대비 메가와트당 처리량이 최대 15배 높았으며, 키미 K3 2.8T에서는 비슷한 인터랙티브 성능을 기준으로 최대 80배까지 격차가 벌어졌다. 엔비디아는 GB300 NVL72를 사용할 경우 일부 조건에서 H200 NVL8보다 100만 토큰당 비용도 최대 10분의 1 수준으로 낮출 수 있다고 설명했다. 이번 결과에서 주목할 부분은 GPU 세대별 연산 성능 차이만은 아니다. 에이전트X가 기존 AI 벤치마크와 달리 실제 코딩 에이전트가 작동하는 방식을 재현하면서 AI 소프트웨어의 역할을 성능 평가에 본격적으로 끌어들였기 때문이다. 기존 추론 벤치마크는 8K 입력과 1K 출력처럼 길이가 정해진 요청을 반복해 GPU의 처리 성능을 측정하는 경우가 많았다. AI 에이전트는 이전 작업을 기억하면서 컨텍스트가 계속 길어지고 추론 도중 외부 도구를 호출하거나 다른 에이전트에 작업을 넘기기도 한다. 이를 두고 세미애널리시스는 "장문·멀티턴·높은 프리픽스 재사용과 서브에이전트 실행이 실제 AI 서비스 트래픽에서 중요해졌다"며 "그러면서 고정 길이 평가만으로 하드웨어와 소프트웨어 성능을 측정하기 어려워졌다"고 설명했다. 에이전트X는 이를 반영해 실제 클로드 코드 세션에서 발생한 요청 패턴을 재생한다. 턴이 진행될수록 컨텍스트가 누적되는 과정뿐 아니라 도구 호출로 모델이 대기하는 시간까지 반영하고 여러 에이전트가 동시에 작동할 때 처리량과 응답 속도가 어떻게 변하는지도 측정한다. 이에 따라 GPU 자체의 연산 속도뿐 아니라 추론 엔진과 캐시, 라우터가 얼마나 효율적으로 움직이는지가 결과에 영향을 미친다. 세미애널리시스는 에이전트X를 이용한 최적화 과정에서 vLLM의 프리픽스 캐시 적중률이 일부 조건에서 95%를 넘었으며 CPU로 KV 캐시를 오프로딩하는 방식에서는 재연산 대비 출력 처리량이 81.7% 높아진 사례도 공개했다. 세미애널리시스는 "실제 환경은 멀티턴·긴 컨텍스트와 높은 프리필 재사용, 서브에이전트 실행과 수많은 도구 호출로 구성된다"고 설명했다. 이번 일로 AI 소프트웨어 업체에도 향후 변화가 예상된다. 기존에는 쿠다(CUDA) 같은 GPU 프로그래밍 플랫폼과 vLLM·SGLang·텐서RT-LLM 등 추론 엔진의 연산 최적화가 주요 경쟁 영역이었다면, 에이전틱 AI에선 여러 소프트웨어 계층을 하나의 시스템으로 묶어 운영하는 능력이 중요해지고 있어서다. 특히 KV 캐시 관리가 핵심으로 부상하고 있다는 점은 눈여겨 볼 요소다. AI 에이전트가 작업을 수행할 때 이전 컨텍스트를 반복해서 다시 계산하지 않고 캐시에 저장된 데이터를 활용하면 GPU 연산량과 응답 시간을 줄일 수 있어서다. 반대로 동시에 많은 에이전트가 움직이면서 캐시를 제대로 관리하지 못하면 필요한 정보를 삭제하거나 같은 내용을 다시 계산하면서 GPU를 추가해도 성능이 충분히 나오지 않을 수 있다. 요청을 적절한 GPU로 배분하는 라우터와 스케줄러의 역할도 커지고 있다. 세미애널리시스의 에이전트X 시험에서는 엔비디아 추론 오케스트레이션 소프트웨어 '다이나모'의 라우팅 방식을 개선한 뒤 일부 조건에서 출력 처리량이 22.2% 증가했다. 다른 최적화에선 에이전트 세션 재생 시간이 20% 이상 단축됐다. 이는 하드웨어 교체 없이 소프트웨어 최적화만으로도 에이전틱 AI 추론 효율을 끌어올릴 수 있다는 점이 확인된 것으로 평가된다. 엔비디아도 이런 변화에 맞춰 하드웨어와 소프트웨어를 함께 묶는 전략을 강화하고 있다. GB300 NVL72의 72개 GPU를 NV링크로 연결하고 다이나모를 통해 프리필과 디코드 작업을 나누는 동시에 KV 캐시 상태와 서버 부하를 고려해 요청을 배분하는 방식이다. 이를 통해 엔비디아는 SGLang·vLLM·텐서RT-LLM과 MoE 최적화 기술까지 결합해 GPU 한 장의 성능보다 랙 단위 추론 효율을 높이는 데 초점을 두고 있다. 이에 따라 클라우드와 AI 서비스 사업자의 인프라 투자 기준도 달라질 가능성이 있다. 에이전트가 일반 챗봇보다 더 많은 토큰과 컴퓨팅 자원을 사용하는 만큼, GPU 도입 가격뿐 아니라 동일한 전력에서 얼마나 많은 사용자와 에이전트를 동시에 처리할 수 있는지가 서비스 비용을 좌우할 수 있어서다. 에이전트X도 초당 토큰 수에 더해 첫 토큰 생성 시간과 전체 지연시간, 사용자당 인터랙티브 성능, 메가와트당 처리량을 함께 평가하도록 설계됐다. 세미애널리시스는 추론 엔진과 라우터, KV 캐시 관리자, 데이터 전송 라이브러리, 클러스터 제어기가 서로 연동되는 구조를 새로운 AI 추론 환경의 핵심으로 보고 있다. 엔비디아 다이나모뿐 아니라 레드햇의 llm-d, AMD 인페라 등도 여러 추론 소프트웨어를 묶어 분산형 AI 시스템을 운영하는 방향으로 개발되고 있다. 세미애널리시스는 "에이전틱 추론은 칩이나 커널 수준의 문제가 아니라 시스템 전체의 문제"라고 강조했다.

2026.08.26 09:17장유미 기자

오픈AI 첫 AI 추론칩 공개…전력 효율·응답 속도 엔비디아 앞서

오픈AI가 자체 개발한 첫 번째 인공지능(AI) 맞춤형 추론 프로세서 '할라피뇨(Jalapeño)' 테스트 결과를 공개했다. 비교 결과 할라피뇨는 전력 효율과 응답 속도에서 엔비디아의 GB200과 GB300 기반 시스템보다 우수한 성능을 보였다. 오픈AI는 26일 GPT-OSS 120B, 딥시크(DeepSeek) R1 670B, 키미(Kimi) K2.5 1T 등 3개 공개 모델을 대상으로 자체 테스트를 진행한 결과를 공식 홈페이지를 통해 발표했다. 오픈AI는 세미애널리시스(SemiAnalysis)의 공개 벤치마크인 인퍼런스엑스(InferenceX)를 활용해 테스트를 진행했다. 그 결과 할라피뇨는 최대 처리량 기준으로 전력당 AI 처리량이 비교 시스템보다 1.51.9배 높았으며, 종단 간 응답 지연시간은 1.73.6배 낮았다고 밝혔다. 사용자와의 상호작용이 많은 워크로드에서는 성능 격차가 더 커졌다. 할라피뇨의 사용자당 디코딩 처리량은 비교 시스템보다 2.1~4.1배 높았다. 디코딩은 AI가 답변을 토큰 단위로 생성하는 과정으로, 사용자 입장에서는 응답 속도와 직접적으로 연결되는 지표다. 모델별로 보면 GPT-OSS 120B 테스트에서 할라피뇨의 전력당 최대 처리량은 초당 8만5448토큰으로, 엔비디아 GB200 기반 비교 시스템의 초당 4만4960토큰보다 1.9배 높았다. 종단 간 응답 지연시간은 1.03초로, 비교 시스템의 1.80초보다 짧았다. 딥시크 R1 670B 테스트에서는 할라피뇨의 전력당 처리량이 비교 시스템보다 1.7배 높았고, 종단 간 응답 지연시간은 3.6배 낮았다. 사용자당 디코딩 처리량은 초당 700토큰으로, 비교 시스템의 초당 169토큰보다 4.1배 높았다. 가장 큰 공개 모델인 키미 K2.5 1T 테스트에서도 할라피뇨는 비교 시스템보다 전력당 최대 처리량이 약 1.5배 높았고, 종단 간 응답 지연시간은 3.4배 낮았다. 사용자당 디코딩 처리량은 약 2.1배 높았다고 오픈AI는 설명했다. 오픈AI는 단순한 칩 단위 성능보다 전력 1킬로와트당 얼마나 많은 AI 작업을 처리할 수 있는지가 실제 서비스 환경에서 더 중요한 기준이라고 강조했다. 특히 AI 에이전트는 하나의 작업을 수행하기 위해 여러 차례 추론을 연속으로 실행하기 때문에 각 단계의 지연시간이 누적될 수 있다. 전력 효율과 응답 속도를 함께 개선하면 더 빠른 응답과 안정적인 서비스 제공이 가능하다는 설명이다. 할라피뇨의 성능 향상은 프로세서 자체뿐 아니라 메모리, 네트워크, 소프트웨어, 서버 시스템을 함께 설계한 결과라고 오픈AI는 밝혔다. AI 추론은 입력된 프롬프트를 처리하는 프리필(prefill) 단계와 답변을 토큰 단위로 생성하는 디코드(decode) 단계로 나뉘는데, 두 단계의 병목이 서로 다르다. 프리필 단계에서는 연산 능력이 중요하지만, 디코드 단계에서는 메모리 대역폭과 데이터 이동이 더 큰 영향을 미친다. 오픈AI는 할라피뇨가 모델 상태와 답변 생성 과정에서 활용되는 케이브이 캐시(KV cache)를 필요한 위치에 가깝게 유지하고, 프로세서 간 데이터 이동과 통신 지연을 줄이는 방식으로 설계됐다고 설명했다. 오픈AI는 할라피뇨 개발 과정에 AI를 직접 활용했다고도 밝혔다. 초기 설계부터 테이프아웃까지 9개월 만에 진행했으며, AI를 활용해 설계안 탐색과 구현, 측정, 검증 과정을 단축했다는 설명이다. 산술 회로 최적화에도 AI를 활용해 제한된 일정 안에 더 많은 연산 성능을 구현할 수 있었다고 덧붙였다. 또한 오픈AI는 코드 생성 도구 코덱스(Codex)와 GPT-아스트라(GPT-Astra)를 활용해 당초 생산 계획에 포함되지 않았던 3개 공개 모델을 두 달 안에 높은 성능으로 구동했다고 밝혔다. GPT-OSS의 일부 어텐션과 전문가 혼합 구조 블록에서는 AI가 생성한 구현이 기존 전문가가 작성한 구현보다 1.5~1.8배 빠르게 실행됐다. 다만 이 수치는 전체 모델이 아닌 일부 블록에 해당한다고 오픈AI는 설명했다. 오픈AI는 올해 말부터 자체 컴퓨팅 인프라에 할라피뇨를 배치할 계획이다. 현재 생산 적격성 검증과 소프트웨어 고도화, 대규모 운영 준비를 진행하고 있으며 더 많은 모델을 대상으로 성능을 검증할 예정이다. 2세대 할라피뇨는 개발이 상당히 진행된 상태이며, 3세대 제품도 설계에 들어갔다고 밝혔다. 다만 오픈AI는 엔비디아와의 협력을 중단하지는 않을 방침이다. 학습과 추론 작업 모두에서 엔비디아를 비롯한 여러 파트너사의 가속기를 계속 폭넓게 활용할 계획이라고 밝혔다. 오픈AI는 "할라피뇨 발표 이후 칩과 이를 중심으로 구축한 시스템에 대한 테스트를 지속해왔다"며 "이번 결과는 유의미한 성능 진전을 보여준다. 할라피뇨는 전력 단위당 더 많은 AI 작업을 처리하면서도 더 빠르게 응답을 반환할 수 있다"고 밝혔다. 이어 "고객 입장에서는 더 빠른 응답, 더 반응성 높은 에이전트, 수요가 늘어나도 더 안정적인 접근성을 의미할 수 있다"며 "이러한 개선은 갈수록 성능이 높아지는 AI를 더 저렴하고 더 폭넓게 이용할 수 있도록 하는 데 기여할 것"이라고 말했다.

2026.08.26 09:17남혁우 기자

에이수스, 엔비디아 GB300 NVL72 서버 출하 성과 공개

[타이베이(대만)=권봉석 기자] 에이수스는 '컴퓨텍스 타이베이 2026' 개막을 하루 앞둔 1일(현지시간) 업계 주요 인사를 대상으로 'ISBG VIP 쇼케이스'를 진행하고 엔비디아 GB300(블랙웰 울트라) NVL72 기반 AI 서버의 조기 출하 성과를 공개했다고 밝혔다. 에이수스가 최근 조기 출하에 들어간 엔비디아 GB300 NVL72 기반 랙 스케일 시스템 '에이수스 AI포드 XA GB721-E2'는 Arm 기반 그레이스 CPU 32개, 블랙웰 울트라 GPU 72개와 5세대 NV링크 기술을 탑재해 대규모 AI 추론과 학습을 동시 지원한다. 조셉 루 에이수스 인프라솔루션 비즈니스그룹(ISBG) 이사는 "에이수스 AI포드 XA GB721-E2는 고객사의 첫 토큰 산출 시간 단축과 AI 서비스 신속 출시를 지원한다"고 밝혔다. 이어 "엔비디아 HGX B300 탑재 'XA NB3I-E12' 서버도 전 세계 출하를 시작했다"고 덧붙였다. 에이수스는 2011년부터 엔비디아 M2070 기반 '포모사4' 부터 2025년 엔비디아 H200/GB200 NVL72 기반 81.55 페타플롭급 서버 '나노4'에 이르기까지 대만 국가고속네트워크센터(NCHC) 프로젝트를 지속 수주했다. 조셉 루 이사는 이날 "대만 NCHC 프로젝트 수주 성과를 바탕으로 최근 UAE, 베트남, 미국 등 글로벌 시장으로 영역을 확장하고 있다"고 설명했다. 에이수스는 단순 서버 제조업체를 넘어 자체 연구개발 역량을 바탕으로 하드웨어 설계부터 바이오스/펌웨어, 소프트웨어까지 모든 과정을 내재화했다. 또 이를 뒷받침하는 RD 랩, QTR 랩, 열역학 랩 등 3대 전문 검증 시설을 자체 운영중이다. RD 랩은 공랭과 수랭 등이 혼합된 하이브리드 환경에서 실제 데이터센터 조건을 재현해 엔비디아 GB300 NVL72 등 고집적 GPU 랙을 풀 스케일로 검증한다. 조셉 루 이사는 "기존 7°C 냉각기 대신 20°C 냉각 전용 시스템 도입으로 연간 전력 사용량을 약 30% 절감하는 성과를 거뒀다"고 설명했다. QTR 랩에서는 영하 40°C에서 영상 85°C, 습도 10~98% 범위의 극한 환경에서 신뢰성을 검증하며, 열역학 랩은 핫/콜드 아일랜드 구성을 시뮬레이션해 냉각 효율성을 최적화한다. 에이수스는 이날 원클릭 자동화 배포를 지원하는 '에이수스 인프라 배포 센터(AIDC)', HPC/AI/엔터프라이즈 인프라를 단일 콘솔에서 관리할 수 있는 '에이수스 컨트롤 센터(ACC) 데이터센터 에디션'도 함께 시연했다. 조셉 루 이사는 "AIDC와 ACC 등 소프트웨어 솔루션에 더해 전략 컨설팅부터 성능 튜닝, 라이프사이클 관리까지 포괄하는 '에이수스 프로페셔널 서비스'를 통해 엔드투엔드 지원 체계를 갖췄다"고 밝혔다. 에이수스코리아 관계자는 "이번 VIP 쇼케이스를 통해 에이수스가 설계-검증-운영-서비스를 아우르는 'AI 인프라 플랫폼 기업'으로 전환하고 있음을 입증했다"고 설명했다. 이어 "에이수스는 엔비디아 DSX와 연계한 AI 팩토리 솔루션을 앞세워 글로벌 AI 데이터센터 시장 공략에 속도를 낼 것"이라고 덧붙였다.

2026.06.03 07:00권봉석 기자

엔비디아, 12분기 연속 매출 신기록…AI 데이터센터 매출 92% 폭증

세계 인공지능(AI) 칩 시장을 장악하고 있는 엔비디아가 12분기 연속 역대 최대 매출 기록을 또 갈아치웠다. 지난주 기업공개(IPO)를 마친 세레브라스 시스템즈와 AMD 등 경쟁사 등장과 최근 AI 모델과 추론용 자체 개발 칩을 공개한 구글 등 경쟁이 격화하는 상황에서 호실적을 기록한 셈이다. 엔비디아는 20일(현지시간) 올 1분기(2~4월, 회계연도 기준 2027년 1분기) 매출은 816억 1500만 달러(약 122조 2503억원)로 전년 동기(440억 달러, 약 65조 9072억원) 대비 85% 증가했다고 발표했다. 지난 2월 자체 전망치인 780억 달러(약 116조 8354억원), 시장 전망치인 787억 달러(약 117조 8839원)를 30억 달러 이상 넘어섰다. 영업이익은 535억 달러(약 80조 1371억원)로 전년 동기(187억 달러, 약 28조 105억원) 대비 세 배 이상 증가했다. 엔비디아는 올 1분기부터 사업 실적을 '데이터센터'와 '엣지 컴퓨팅' 등 두 개 시장으로 구분해 발표한다. 현재와 미래 성장 동력을 보다 명확히 반영하기 위해서라는 것이다. 데이터센터 부문은 ▲ 글로벌 클라우드 기업과 대형 인터넷 기업 매출을 포함한 '하이퍼스케일(Hyperscale)' ▲ AI 클라우드, 산업, 기업 부문을 일컫는 'ACIE'로 구분된다. 데이터센터 부문 매출은 752억 달러(약 112조 6413억원)로 전년 동기(391억 달러, 약 58조 5675억원) 대비 두 배 가까운 92% 폭증했다. 또 1분기 전체 매출의 92%가 데이터센터 부문에서 나왔다. 엔비디아는 "블랙웰 GB300 생샨량 증가와 함께 NV링크, 스펙트럼-X 네트워킹 등 수요 증가에 따른 결과"라고 설명했다. 단 작년 1분기 대비 중국 시장에서 매출은 전혀 발생하지 않았다. 엣지 컴퓨팅 부문은 PC, 게임 콘솔, 워크스테이션, AI-RAN 기지국, 로보틱스, 오토모티브(자동차) 등 에이전틱 AI 및 피지컬 AI용 기기를 포함한다. 이 부문의 1분기 매출은 64억 달러(약 9조 5865억원)이며 전년 동기 대비 29% 늘어났다. 엔비디아는 "메모리와 완제품 가격 상승으로 일반 소비자용 PC 수요가 줄고 있지만 RTX 프로 6000 블랙웰 워크스테이션 등 강력한 수요로 달성한 결과"라고 밝혔다. 엔비디아는 오는 6월 26일 배당금을 주당 기존 1센트에서 25센트로 상향해 지급한다고 밝혔다. 배당락은 6월 4일이다. 엔비디아는 올해 2분기(5~7월) 910억 달러(약 136조 3080억원) 수준으로 예상했다. 다만 이는 중국 시장 매출을 전혀 반영하지 않은 수치다. 실적 발표 이후 주가는 시간 외 거래에서 종가(223.47달러) 대비 1% 내외로 등락을 이어가고 있다.

2026.05.21 07:33권봉석 기자

류제명 차관 "엔비디아, 내년 양산 GPU 한국에 우선 공급"

류제명 과학기술정보통신부 제2차관이 12일 “엔비디아에서 (블랙웰 아키텍처 기반 AI 서버용) GB300을 한국에 조기에 공급하고, 2027년 양산 계획인 베라루빈을 한국에 우선 공급을 추진한다”고 밝혔다. 류 차관은 미국 라스베이거스에서 열린 CES 출장을 마치고 한국에 돌아와 이날 자신의 페이스북 계정에 “하정우 청와대 AI미래기획수석 의견대로 제가 베라루빈은 한국에 제일 먼저 공급해 주면 좋겠다고 했는데 (엔비디아에서) 그렇게 하겠다고 답했다”며 이같이 적었다. 이어, “최신 GPU를 가장 먼저 써볼 수 있다는 것도 AI 모델 경쟁에 매우 중요한 역할을 하는 상황이라 큰 의미가 있는 일”이라고 평가했다. 류 차관은 또 “국내 엔비디아 연구소 설립 문제도 젠슨황 CEO가 직접 챙기고 있다고 학인했다”며 “스탠포드대 교수이자 세계적인 AI 석학인 최예진 교수가 엔비디아 연구팀에 합류해 핵심적인 역할을 하고 있다. 조만간 가시적 일정이 구체화 될 것”이라고 했다. 그러면서 “피지컬AI가 급진전되고 있는 상황에서 이를 주도하는 엔비디아가 국내에 관련 연구소를 세우기로 한 것은 엔비디아가 피지컬AI 시대에 한국을 얼마나 중요하게 생각하는지 보여주는 일”이라고 강조했다. CES를 둘러본 결과 주요 특징으로는 AI의 전면화, AI 생태계 자체의 고도화를 키워드로 꼽았다. 류 차관은 “CES에서 가장 많이 들은 단어가 피지컬AI”라며 “피지컬AI 파운데이션 모델 경쟁, 관련 반도체 경쟁, 그리고 자율주행차와 휴머노이드 등 피지컬AI를 둘러싼 기술개발이 급진전되고 있다”고 진단했다. 아울러 “엔비디아다 자율주행차용 AI 모델인 알파마요를 개발하고 벤츠와 협력해 1분기에 세계 최초로 추론형 AV를 미국시장에 내놓기로 하는 등 피지컬AI 풀스택을 완성했다고 하고, 모바일 시대를 주도한 퀄컴이 자율주행차와 휴머노이드 피지컬AI 반도체에 사활을 걸고 투자를 하는 것도 인상적이었다”고 덧붙였다. 아마존 자율주행차 죽스(ZOOX)와 구글 웨이모 탑승 경험을 이야기하면서 “현대차가 국내 규제 때문에 미국서 시험 운행을 하고 있다는 이야기에 안타까움과 한국이 자율주행차 시대에 낙오하거나 도태까지 되겠다는 절박한 생각이 들었다”고 전했다.

2026.01.12 23:27박수형 기자

젠슨 황 "최대 1조개 매개변수 AI 모델 처리 개인 워크스테이션 출시"

[타이베이(대만)=권봉석 기자] "앞으로 모든 공장은 전기와 데이터를 투입해 토큰(Token)을 생산하는 'AI 팩토리'로 재탄생할 것이다. 엔비디아는 GPU 뿐만 아니라 소프트웨어 등 AI 팩토리에 필요한 모든 인프라를 제공하는 기업이 될 것이다." 아시아 최대 IT·컴퓨팅 전시회 '컴퓨텍스 2025' 개막 전날인 19일(현지시간) 오전 타이베이 뮤직센터에서 젠슨 황 엔비디아 CEO는 기조 연설을 통해 PC용 그래픽카드, 기업·개인용 AI 하드웨어 신제품과 대만 현지에 새로운 지사 설립 등 AI 생태계 강화 전략을 공개했다. PC용 지포스 RTX 5060 GPU 공개 젠슨 황 CEO는 이날 "지포스 RTX 50 시리즈는 지포스 역사상 가장 성공적인 출시를 보여주었으며 오늘 데스크톱 PC와 노트북용 새 GPU인 지포스 RTX 5060을 정식 출시할 것"이라고 설명했다. 지포스 RTX 5060은 올 초부터 시작된 블랙웰 아키텍처 기반 지포스 RTX 50 시리즈 GPU 중 보급형 시장을 담당하는 제품이다. 게임 화면 업스케일 기술 DLSS 4와 레이트레이싱 등을 지원한다. 데스크톱용 그래픽카드 시작 가격은 299달러(약 42만원)로 책정됐다. 레노버, HP와 MSI, 에이수스 등 주요 노트북 제조사도 RTX 5060 탑재 노트북을 출시 예정이며 이들 제품 가격대는 1천99달러(약 153만원)부터 시작한다. 블랙웰 울트라 GB300, 내부 구조 개선으로 성능 1.5배↑ 엔비디아는 지난 해 컴퓨텍스에서 매년 새로운 AI 가속용 GPU를 공개할 것이라고 밝힌 바 있다. 올해는 GB200에 이어 성능을 개선한 GB300을 하반기에서 연말 내에 출시할 예정이다. 이날 젠슨 황 CEO는 "GB300은 2018년 세계 3위 수준 성능을 갖춘 슈퍼컴퓨터 '시에라' 전체 성능을 단일 노드로 구현할 수 있으며 추론 성능과 메모리 용량을 1.5배 향상시켰다"고 말했다. AI 워크스테이션·기업용 GPU 서버 신제품 공개 엔비디아는 올 초 CES 2025에서 공개한 'DGX 스파크'에 이어 워크스테이션급 성능을 갖춘 'DGX 스테이션'을 시장에 출시하겠다고 설명했다. DGX 스테이션은 새로운 GPU인 GB300 기반으로 작동하며 DGX 스파크의 20배에 달하는 20페타플롭스(PFLOPS)급 연산 성능을 갖췄다. 최대 1조 개의 매개변수(패러미터)를 갖춘 AI 모델을 처리할 수 있다. RTX 프로 서버는 기존 x86 프로세서 기반 응용프로그램과 함께 GPU를 활용하는 응용프로그램까지 구동해야 하는 기업을 겨냥한 GPU 서버다. x86 프로세서(인텔 제온으로 추정)에 RTX 6000 GPU를 8개 탑재하며 이미 주요 제조사를 통해 제공 중이다. 엔비디아, 새 대만 지사 '컨스털레이션' 만든다 엔비디아는 반도체 위탁생산을 담당하는 TSMC, 엔비디아 GPU 기반 서버를 생산하는 폭스콘, 위스트론 등의 본거지인 대만에 상당한 양의 투자를 진행하고 있다. 이날 젠슨 황 CEO는 "엔비디아는 30년 전부터 대만에서 사업을 전개했고 주요 파트너사의 고향"이라고 소개했다. 이어 "폭스콘과 TSMC 등과 협력해 대만 학생과 연구자, 스타트업을 위한 AI 인프라스트럭처를 구축할 것"이라고 설명했다. 엔비디아는 이날 타이베이 시 북쪽 베이터우(北投) 구 인근에 새로운 사옥인 '컨스털레이션'을 건립할 것이라고 설명했다. 젠슨 황 CEO는 "대만에서 근무하고 있는 엔지니어의 수가 늘어나고 있고 현재 사무실의 한계를 넘어서기 위한 것"이라고 취지를 설명했다.

2025.05.19 15:45권봉석 기자

엔비디아, SOCAMM 적용 '루빈'으로 연기…삼성·SK도 공급 전략 수정

엔비디아가 차세대 저전력 D램 모듈인 '소캠(SOCAMM, Small Outline Compression Attached Memory Module)' 상용화 시점을 미룬 것으로 파악됐다. 당초 목표였던 '블랙웰' 시리즈가 아닌 '루빈'부터 채용될 전망이다. 최근 AI 가속기의 성능 고도화로 안정적인 수율 확보가 어려운 가운데, 안정성을 최대한 확보하려는 전략으로 풀이된다. 국내 삼성전자와 SK하이닉스, 미국 마이크론도 SOCAMM 공급 일정을 조정한 것으로 알려졌다. 14일 업계에 따르면 엔비디아는 SOCAMM의 적용 시점을 'GB300'에서 차세대 제품으로 변경하는 계획을 주요 메모리 협력사에 통보했다. SOCAMM은 엔비디아가 독자 표준으로 개발해 온 차세대 메모리 모듈이다. 저전력 D램인 LPDDR을 4개씩 집적해 전력 효율성을 높였다. 또한 기존 LPDDR 단품을 온보드(납땜)로 붙이는 방식과 달리 메모리를 탈부착할 수 있어, 성능 업그레이드 및 유지보수에 용이하다. 데이터 전송 통로인 I/O(입출력단자) 수는 694개에 달한다. 모바일 PC 등에서 활용되는 또 다른 LPDDR 기반 모듈인 LPCAMM(I/O 수 644개) 대비 대역폭이 높아, 고용량의 데이터 처리가 필요한 AI 연산에 적합할 것으로 평가받고 있다. 엔비디아는 SOCAMM을 당초 올 하반기 출시할 예정인 GB300에 탑재할 계획이었다. GB300은 엔비디아의 블랙웰 울트라 GPU와 그레이스 CPU, 12단 HBM3E 등을 탑재한 차세대 AI 가속기다. GB300 칩의 기판 역할을 담당하는 보드도 기존 '비앙카(Bianca)'에서 '코델리아(Cordelia)'로 변경하기로 했다. 비앙카는 1개의 CPU와 2개의 GPU를 결합한 방식이다. 코델리아는 2개의 CPU와 4개의 GPU를 결합한 구조로, 인터페이스 구조나 설계 등도 모두 다르다. 그러나 엔비디아는 최근 GB300의 보드를 코델리아가 아닌 비앙카 방식으로 복귀시켰다. 아울러 저전력 D램 모듈 역시 SOCAMM이 아닌 기존 LPDDR을 온보드하는 방식으로 변경했다. 이는 최신 블랙웰 칩이 설계 및 패키징 수율 확보 과정에서 지속적으로 난항을 겪어 온 만큼, 무리한 기술적 진보를 지양하려는 것으로 풀이된다. 실제로 코델리아 보드는 데이터 손실, SoCAMM은 방열 특성 등에서 신뢰성 문제가 있었던 것으로 알려졌다. 이에 따라 삼성전자와 SK하이닉스, 미국 마이크론 등 주요 메모리 기업들도 차세대 메모리 양산 전략을 다소 조정할 것으로 전망된다. 사안에 정통한 관계자는 "기술적 문제가 매우 심각한 수준은 아니지만, 엔비디아가 신제품 출시 일정 및 필요성 등을 고려해 SOCAMM 적용 시기를 미뤘다"며 "이를 삼성전자, SK하이닉스, 마이크론 등 메모리 3사에 공지한 것으로 안다"고 말했다. 또 다른 관계자는 "엔비디아가 GB300에서 공급망을 늘리면서 수율 관리에 어려움을 겪고 있어, 최대한 기존 플랫폼을 활용하는 기조를 보이고 있다"며 "삼성전자, SK하이닉스 등도 SOCAMM 양산 일정을 연기하는 것으로 가닥을 잡았다"고 설명했다.

2025.05.14 14:34장경윤 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

오픈AI 첫 AI 추론칩 공개…전력 효율·응답 속도 엔비디아 앞서

비상시 문 안 열리는데…테슬라 '매립형 손잡이' 韓 안전기준은 공백

울산시 AX 시동…"AX, 기술 아니라 산업체계 바꾸는 것"

퀄컴 "새 오라이언 CPU, 모바일 최초 작동클록 5GHz 돌파"

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.