• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'AI 추론칩'통합검색 결과 입니다. (2건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

오픈AI 첫 AI 추론칩 공개…전력 효율·응답 속도 엔비디아 앞서

오픈AI가 자체 개발한 첫 번째 인공지능(AI) 맞춤형 추론 프로세서 '할라피뇨(Jalapeño)' 테스트 결과를 공개했다. 비교 결과 할라피뇨는 전력 효율과 응답 속도에서 엔비디아의 GB200과 GB300 기반 시스템보다 우수한 성능을 보였다. 오픈AI는 26일 GPT-OSS 120B, 딥시크(DeepSeek) R1 670B, 키미(Kimi) K2.5 1T 등 3개 공개 모델을 대상으로 자체 테스트를 진행한 결과를 공식 홈페이지를 통해 발표했다. 오픈AI는 세미애널리시스(SemiAnalysis)의 공개 벤치마크인 인퍼런스엑스(InferenceX)를 활용해 테스트를 진행했다. 그 결과 할라피뇨는 최대 처리량 기준으로 전력당 AI 처리량이 비교 시스템보다 1.51.9배 높았으며, 종단 간 응답 지연시간은 1.73.6배 낮았다고 밝혔다. 사용자와의 상호작용이 많은 워크로드에서는 성능 격차가 더 커졌다. 할라피뇨의 사용자당 디코딩 처리량은 비교 시스템보다 2.1~4.1배 높았다. 디코딩은 AI가 답변을 토큰 단위로 생성하는 과정으로, 사용자 입장에서는 응답 속도와 직접적으로 연결되는 지표다. 모델별로 보면 GPT-OSS 120B 테스트에서 할라피뇨의 전력당 최대 처리량은 초당 8만5448토큰으로, 엔비디아 GB200 기반 비교 시스템의 초당 4만4960토큰보다 1.9배 높았다. 종단 간 응답 지연시간은 1.03초로, 비교 시스템의 1.80초보다 짧았다. 딥시크 R1 670B 테스트에서는 할라피뇨의 전력당 처리량이 비교 시스템보다 1.7배 높았고, 종단 간 응답 지연시간은 3.6배 낮았다. 사용자당 디코딩 처리량은 초당 700토큰으로, 비교 시스템의 초당 169토큰보다 4.1배 높았다. 가장 큰 공개 모델인 키미 K2.5 1T 테스트에서도 할라피뇨는 비교 시스템보다 전력당 최대 처리량이 약 1.5배 높았고, 종단 간 응답 지연시간은 3.4배 낮았다. 사용자당 디코딩 처리량은 약 2.1배 높았다고 오픈AI는 설명했다. 오픈AI는 단순한 칩 단위 성능보다 전력 1킬로와트당 얼마나 많은 AI 작업을 처리할 수 있는지가 실제 서비스 환경에서 더 중요한 기준이라고 강조했다. 특히 AI 에이전트는 하나의 작업을 수행하기 위해 여러 차례 추론을 연속으로 실행하기 때문에 각 단계의 지연시간이 누적될 수 있다. 전력 효율과 응답 속도를 함께 개선하면 더 빠른 응답과 안정적인 서비스 제공이 가능하다는 설명이다. 할라피뇨의 성능 향상은 프로세서 자체뿐 아니라 메모리, 네트워크, 소프트웨어, 서버 시스템을 함께 설계한 결과라고 오픈AI는 밝혔다. AI 추론은 입력된 프롬프트를 처리하는 프리필(prefill) 단계와 답변을 토큰 단위로 생성하는 디코드(decode) 단계로 나뉘는데, 두 단계의 병목이 서로 다르다. 프리필 단계에서는 연산 능력이 중요하지만, 디코드 단계에서는 메모리 대역폭과 데이터 이동이 더 큰 영향을 미친다. 오픈AI는 할라피뇨가 모델 상태와 답변 생성 과정에서 활용되는 케이브이 캐시(KV cache)를 필요한 위치에 가깝게 유지하고, 프로세서 간 데이터 이동과 통신 지연을 줄이는 방식으로 설계됐다고 설명했다. 오픈AI는 할라피뇨 개발 과정에 AI를 직접 활용했다고도 밝혔다. 초기 설계부터 테이프아웃까지 9개월 만에 진행했으며, AI를 활용해 설계안 탐색과 구현, 측정, 검증 과정을 단축했다는 설명이다. 산술 회로 최적화에도 AI를 활용해 제한된 일정 안에 더 많은 연산 성능을 구현할 수 있었다고 덧붙였다. 또한 오픈AI는 코드 생성 도구 코덱스(Codex)와 GPT-아스트라(GPT-Astra)를 활용해 당초 생산 계획에 포함되지 않았던 3개 공개 모델을 두 달 안에 높은 성능으로 구동했다고 밝혔다. GPT-OSS의 일부 어텐션과 전문가 혼합 구조 블록에서는 AI가 생성한 구현이 기존 전문가가 작성한 구현보다 1.5~1.8배 빠르게 실행됐다. 다만 이 수치는 전체 모델이 아닌 일부 블록에 해당한다고 오픈AI는 설명했다. 오픈AI는 올해 말부터 자체 컴퓨팅 인프라에 할라피뇨를 배치할 계획이다. 현재 생산 적격성 검증과 소프트웨어 고도화, 대규모 운영 준비를 진행하고 있으며 더 많은 모델을 대상으로 성능을 검증할 예정이다. 2세대 할라피뇨는 개발이 상당히 진행된 상태이며, 3세대 제품도 설계에 들어갔다고 밝혔다. 다만 오픈AI는 엔비디아와의 협력을 중단하지는 않을 방침이다. 학습과 추론 작업 모두에서 엔비디아를 비롯한 여러 파트너사의 가속기를 계속 폭넓게 활용할 계획이라고 밝혔다. 오픈AI는 "할라피뇨 발표 이후 칩과 이를 중심으로 구축한 시스템에 대한 테스트를 지속해왔다"며 "이번 결과는 유의미한 성능 진전을 보여준다. 할라피뇨는 전력 단위당 더 많은 AI 작업을 처리하면서도 더 빠르게 응답을 반환할 수 있다"고 밝혔다. 이어 "고객 입장에서는 더 빠른 응답, 더 반응성 높은 에이전트, 수요가 늘어나도 더 안정적인 접근성을 의미할 수 있다"며 "이러한 개선은 갈수록 성능이 높아지는 AI를 더 저렴하고 더 폭넓게 이용할 수 있도록 하는 데 기여할 것"이라고 말했다.

2026.08.26 09:17남혁우 기자

MS, 차세대 AI 추론칩 '마이아 200' 공개…"아마존보다 3배 빨라"

마이크로소프트가 자체 개발한 2세대 인공지능(AI) 가속기를 공개했다. 경쟁사 보다 높은 성능을 강조하며 AI 인프라 시장 리더십 강화에 나설 전망이다. 이번 신제품은 AI 추론(Inference) 효율성을 극대화하는 데 초점을 맞췄으며 오픈AI의 최신 모델인 'GPT-5.2'를 지원하는 핵심 동력이 될 것으로 주목받고 있다. 26일 마이크로소프트는 자사 블로그를 통해 TSMC의 3나노(nm) 공정을 기반으로 제작된 새로운 AI 칩 '마이아200(Maia 200)'을 발표했다. 마이아 200은 대규모언어모델(LLM) 구동의 핵심인 '토큰 생성' 비용을 절감하는 데 방점을 두고 설계됐다. TSMC의 3나노(nm) 공정을 적용해 칩 하나에 1천400억 개 이상의 트랜지스터를 집적해 연산 밀도를 극대화했다. 메모리 아키텍처 또한 대규모 모델 처리에 최적화됐다. 초당 7테라바이트(TB)의 데이터 전송 속도를 자랑하는 216GB 고대역폭메모리(HBM3e)를 탑재했으며 272MB의 온칩 SRAM을 더해 데이터 병목 현상을 최소화하고 처리 속도를 높였다. 연산 성능은 750와트(W) 전력 소모 범위 내에서 4비트(FP4) 정밀도 기준 10 페타플롭스(PFLOPS), 8비트(FP8) 기준 5 페타플롭스 이상의 성능을 발휘한다. 마이크로소프트 측은 마이아 200은 아마존웹서비스(AWS)의 '트레이니움(Trainium) 3세대' 대비 4비트 성능에서 3배 앞서며 구글의 '7세대 TPU'보다 뛰어난 8비트 연산 능력을 확보하며 추론 가속기 시장의 새로운 기준을 제시했다고 강조했다. 마이크로소프트 클라우드 및 AI 그룹의 스콧 거스리 수석 부사장은 "마이아 200은 하이퍼스케일러가 만든 칩 중 가장 강력한 성능을 자랑하는 퍼스트 파티 칩"이라며, "오늘날 가장 큰 모델을 쉽게 구동할 뿐만 아니라 미래의 더 거대한 모델까지 감당할 수 있는 여유 성능을 갖췄다"고 강조했다. 마이아 200은 출시 후 마이크로소프트의 거대 AI 생태계를 지탱하는 중추적인 역할을 맡게 된다. 오픈AI 최신 모델인 GPT-5.2를 포함한 다양한 모델을 서비스하는 데 투입되며 마이크로소프트 파운드리와 마이크로소프트 365 코파일럿의 가격 대비 성능 효율을 크게 개선할 예정이다. 또 마이크로소프트 초지능팀은 마이아 200을 활용해 차세대 자체 모델을 위한 합성 데이터 생성 및 강화 학습을 수행한다. 고품질의 도메인 특화 데이터를 더 빠르고 효율적으로 생성하여 AI 모델 훈련 파이프라인을 가속화하겠다는 전략이다. 시스템 수준에서의 혁신도 돋보인다. 마이아 200은 표준 이더넷 기반의 독자적인 2계층 스케일업 네트워크 설계를 도입했다. 칩당 2.8TB/s의 양방향 대역폭을 제공하며, 최대 6,144개의 가속기를 하나의 클러스터로 묶어 효율적인 대규모 추론 작업을 가능케 한다. 마이크로소프트는 개발자들을 위한 마이아 소프트웨어 개발 키트(SDK) 프리뷰도 함께 공개했다. 이 SDK는 파이토치(PyTorch) 통합, 트리톤(Triton) 컴파일러, Maia 전용 저수준 프로그래밍 언어 등을 포함하여 개발자가 하드웨어 성능을 최대로 끌어내면서도 이기종 하드웨어 간 모델 이식을 쉽게 할 수 있도록 돕는다. 마이아200은 미국 아이오와주 디모인 인근의 'US 센트럴' 데이터센터 리전에 이미 배치되었으며 이어 애리조나주 피닉스 인근의 'US 웨스트 3' 리전으로 확장될 예정이다. 이번 마이아200의 출시는 AI 인프라 시장에서 엔비디아 의존도를 낮추고 자체 칩 경쟁력을 통해 AI 서비스의 수익성을 극대화하려는 마이크로소프트의 강력한 의지가 반영된 것으로 풀이된다. 스콧 거스리 부사장은 "마이아 200은 칩 설계부터 데이터센터 배포까지 엔드-투-엔드(End-to-End) 검증을 통해 실리콘 출시 후 며칠 만에 실제 AI 모델을 구동하는 데 성공했다"며 "이는 타사 대비 절반 이하의 시간으로 단축된 획기적인 성과"라고 밝혔다.

2026.01.27 09:46남혁우 기자

  Prev 1 Next  

지금 뜨는 기사

이시각 헤드라인

삼성전자, 차세대 D램 'D0a' 로드맵 수정…하이브리드 본딩 앞당긴다

기술전시 넘어 '돈 되는 AI'로…AI페스타, 역대급 사업기회 연다

[AI는 지금] 속도조절론 속 쏟아진 신모델…AI 3사 승부처는

검찰, 카카오 김범수 2심서도 징역 15년 구형..."불법·부정 지시 없었다"

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.