• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
반도체
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'디퓨전젬마'통합검색 결과 입니다. (2건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

엔비디아, 구글 '디퓨전젬마' 지원…"로컬 AI 추론 속도 높여"

엔비디아가 구글딥마인드 디퓨전 언어 모델을 그래픽처리장치(GPU)와 개인용 인공지능(AI) 시스템에 최적화했다. 엔비디아는 구글딥마인드 '디퓨전젬마'를 지포스 RTX GPU와 RTX 프로 플랫폼, DGX 스파크 시스템 전반에서 더 빠르게 실행할 수 있도록 최적화했다고 12일 밝혔다. 디퓨전젬마는 텍스트를 한 단어씩 순차 생성하는 기존 자기회귀 방식과 달리 여러 단어를 병렬로 생성한다. 각 단계에서 최대 256개 토큰을 디노이징해 텍스트 블록 전체를 출력하는 구조다. 이 방식은 대화형 채팅과 에이전틱 루프, 온디바이스 어시스턴트처럼 응답 속도가 중요한 단일 사용자 작업에 적합하다. 개발자와 연구자, AI 사용자는 로컬 기기에서 기존보다 빠른 텍스트 생성을 활용할 수 있다. 디퓨전젬마는 젬마 4 기반으로 구축됐다. 젬마 4는 260억 개 파라미터를 갖춘 전문가 혼합 모델이며, 단계마다 38억 개 파라미터를 활성화한다. 엔비디아는 디퓨전젬마가 동급 자기회귀 모델보다 최대 4배 빠른 성능을 제공한다고 설명했다. 단일 엔비디아 H100 텐서 코어 GPU에서는 초당 1천 개 토큰, DGX 스파크에서는 초당 150개 토큰, DGX 스테이션에서는 최대 초당 2천 개 토큰 성능을 낸다. 구글딥마인드는 디퓨전젬마를 연구·실험 목적용이라고 당부했다. 속도와 병렬 생성에 초점을 맞춘 만큼 전체 출력 품질은 기존 자기회귀 기반 젬마4 모델보다 낮다고 밝혔다. 디퓨전젬마는 아파치 2.0 라이선스 기반 오픈 웨이트 모델로 제공된다. RTX와 DGX 스파크에서 완전히 실행될 수 있으며 클라우드나 토큰당 비용 없이 허깅페이스 트랜스포머, vLLM, 언슬로스에서 기본 지원된다. 엔비디아는 DGX 스파크와 RTX 프로 6000 워크스테이션, DGX 스테이션에서 디퓨전젬마 실행을 지원한다. 지포스 RTX 그래픽처리장치에서는 향후 라마.cpp 지원도 추가될 예정이다. 개발자는 허깅페이스 트랜스포머를 통해 지포스 RTX 5090이나 DGX 스파크에서 디퓨전젬마를 테스트할 수 있다. 더 높은 처리량이 필요한 경우 vLLM을 활용할 수 있으며 언슬로스와 엔비디아 네모 프레임워크를 통해 파인튜닝도 가능하다.

2026.06.12 11:13김미정 기자

"텍스트 생성 더 빠르게"…구글, '디퓨전젬마' 공개

구글이 기존보다 4배 빠른 텍스트 생성 속도를 갖춘 '젬마' 버전을 내놨다. 구글딥마인드는 10일(현지시간) 텍스트 디퓨전 방식을 적용한 오픈소스 실험 모델 '디퓨전젬마(DiffusionGemma)'를 출시했다고 공식 블로그에 밝혔다. 이 모델은 '아파치 2.0 라이선스'로 배포되며 전체 260억개 파라미터 규모전문가혼합(MoE) 구조를 기반으로 이뤄졌다. 디퓨전젬마의 핵심은 기존 거대언어모델(LLM)처럼 토큰을 한 개씩 순차 생성하지 않는다는 점이다. 256개 토큰 블록을 한 번에 생성한 뒤, 여러 차례 수정과 보완을 거쳐 최종 결과를 만드는 텍스트 디퓨전 방식으로 작동한다. 이를 통해 그래픽처리장치(GPU)에서 최대 4배 빠른 텍스트 생성 속도를 구현했다. 구글딥마인드는 "이 모델은 단일 엔비디아 'H100'에서는 초당 1000개 이상 토큰을 생성한다"며 "엔비디아 '지포스 RTX 5090'에서는 초당 700개 이상 토큰을 처리할 수 있다"고 밝혔다. 해당 모델은 전체 260억개 파라미터를 갖고 있지만 실제 추론 과정에서는 38억개 파라미터만 활성화한다. 양자화 기준으로 18기가바이트(GB) 비디오램(VRAM) 환경에서도 구동할 수 있어 고급 소비자용 GPU에서도 활용 가능한 셈이다. 또 모든 토큰이 서로를 참조하는 양방향 어텐션 구조를 적용했다. 인라인 편집과 코드 인필링, 아미노산 서열 생성, 수학 그래프 생성 등 비선형 작업에 강한 것으로 알려졌다. 디퓨전젬마는 생성 과정에서 전체 텍스트를 한 번에 검토하며 오류를 수정하는 자기 정제 기능도 갖췄다. 복잡한 마크다운 형식을 정확하게 마무리하거나 코드 생성과 렌더링을 거의 실시간으로 수행할 수 있는 셈이다. 구글딥마인드는 디퓨전젬마를 연구·실험 목적용이라고 당부했다. 속도와 병렬 생성에 초점을 맞춘 만큼 전체 출력 품질은 기존 자기회귀 기반 젬마4 모델보다 낮다고 설명했다. 또 디퓨전젬마 성능 이점으로 로컬 또는 낮은 동시성 환경에서 가장 크게 나타난다고 밝혔다. 대규모 클라우드 서비스 환경에서는 자기회귀 모델도 높은 연산 활용률을 확보할 수 있어 속도 우위가 줄어들 수 있다고 덧붙였다. 구글딥마인드는 "이번 모델은 속도가 중요한 인터랙티브 로컬 워크플로를 탐색하는 연구자와 개발자를 위해 설계됐다"고 밝혔다.

2026.06.11 09:35김미정 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

반도체·AIDC 협력...샌프란서 삼성·SK·현대차·네이버 대규모 협력 발표

정의선 회장 "현대차그룹, 자동차 넘어 피지컬 AI 기업으로"

"한번 뜨면 50대 격추"…초강력 드론 킬러 나왔다

삼성·SK, 글로벌 AI 공급망 핵심축으로…빅테크와 1389조원 협력 시동

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.