100조 파라미터 시대…화웨이, 수천개 칩 '한 대처럼' 묶는다
AI 모델이 5년 안에 100조개 파라미터 규모로 커지고 하루 처리하는 토큰도 100경개에 이를 것으로 예상된다. 화웨이는 개별 칩 성능을 높이거나 서버를 단순히 늘리는 방식으로는 이 같은 폭발적인 컴퓨팅 수요를 감당하기 어렵다고 보고, 수천~수만개의 가속기와 CPU, 메모리, 스토리지를 하나의 거대한 컴퓨터처럼 연결하는 방식으로 대응하고 있다. 브랜든 우 화웨이 아시아태평양(APAC) 최고기술책임자(CTO)는 7일 서울 삼성동 코엑스에서 열린 'AI 페스타 2026' 퓨처테크컨퍼런스에서 기조연설을 맡아 “대규모 모델과 AI 에이전트, 온디바이스 AI가 지속적으로 발전하면서 AI 인프라에 요구되는 규모와 성능, 안정성, 에너지 효율에 대한 기준도 높아지고 있다”고 밝혔다. 우 CTO는 “2020년 1750억개 수준이던 모델 파라미터가 앞으로 5년 안에 100조개까지 늘어날 것”이라며 “2년 전 하루 100억개 수준이던 토큰은 현재 5000억개로 늘었고, 5년 뒤에는 100경개에 이를 것으로 예상한다”고 말했다. 문제는 AI 모델이 커지는 만큼 컴퓨팅 자원을 늘리는 것만으로 성능이 따라오지 않는다는 점이다. 수만개의 가속기를 연결하면 실제 계산보다 장치끼리 데이터를 주고받는 데 상당한 시간이 쓰이기 때문이다. 우 CTO는 “수백조개 파라미터를 다룰 때는 거대한 시스템이 필요하고, 이런 호스팅 서비스를 전통적인 기술로 운영하면 문제에 직면하게 된다”며 “10조개 파라미터 모델에 10만개의 카드를 사용한다고 하면 실제 컴퓨팅에 사용되는 시간은 44% 수준”이라고 설명했다. 이어 “나머지는 통신을 위한 것”이라며 “학습 시간의 절반가량이 다른 장치 간 통신을 처리하는 데 소요된다”고 말했다. 수천개 칩을 하나의 컴퓨터처럼 화웨이가 이 같은 한계를 넘기 위해 제시한 것이 '슈퍼팟(SuperPoD)' 컴퓨팅 아키텍처다. NPU와 GPU, CPU, 메모리, 스토리지 등 서로 다른 컴퓨팅 자원을 고속으로 연결해 여러 장치가 하나의 거대한 시스템처럼 움직이도록 하는 것이 핵심이다. 우 CTO는 “슈퍼팟 아키텍처가 필요한 이유”라며 “서로 다른 이기종 컴퓨팅 자원의 통합과 피어투피어(P2P) 연결, 풀메시 통신, 통합 프로토콜과 메모리 어드레싱 등이 핵심 요건”이라고 말했다. 그는 “통일된 프로토콜로 통신해야 한다”며 “프로토콜을 변환하면서 발생하는 오버헤드를 막기 위해 하나의 언어로 소통해야 한다”고 말했다. 이어 “통합된 메모리 어드레싱이 필요하고, 노드가 추가되더라도 이런 구조를 유지해야 한다”며 “소규모 배포에서 대규모 배포까지 선형적으로 확장할 수 있는 시스템이 필요하다”고 설명했다. 장치 사이의 거리가 멀어질수록 광통신의 역할도 커진다. 우 CTO는 “장거리 연결을 위해서는 광 연결이 필요하다”며 데이터센터 내부의 서버와 랙뿐 아니라 더 큰 규모의 컴퓨팅 클러스터를 연결하기 위한 광 기반 상호연결 기술을 강조했다. 화웨이는 지난해 9월 첫 슈퍼팟 컴퓨팅 아키텍처를 선보인 뒤 시스템 규모를 확대하고 있다. 우 CTO는 수천개의 가속기를 하나의 시스템으로 묶는 '아틀라스 950' 수냉식 슈퍼팟을 소개하며, 대규모 환경에서 기존 방식보다 높은 컴퓨팅 효율을 확보할 수 있다고 설명했다. 그는 “5만개의 카드를 투입한다고 했을 때 슈퍼팟과 같은 시스템을 사용하면 전통적인 시스템보다 3배 높은 성능을 달성할 수 있다”고 말했다. 이 같은 접근법은 AI 가속기에만 적용되지 않는다. 범용 컴퓨팅에서도 여러 CPU를 하나의 거대한 CPU처럼 사용할 수 있도록 하는 '쿤펑(Kunpeng) 범용 슈퍼팟'을 적용한다. 우 CTO는 “AI 컴퓨팅도 그렇지만 일반 컴퓨팅도 똑같다”며 “마치 하나의 거대한 CPU처럼 작동할 수 있는 수천개의 CPU가 필요하다”고 설명했다. 메모리·스토리지까지 함께 바꾼다 모델 규모와 함께 컨텍스트 윈도가 길어지면서 메모리와 스토리지 역시 새로운 병목으로 떠오르고 있다. 특히 AI 추론 과정에서 이전 대화와 데이터를 기억하기 위한 KV 캐시가 빠르게 증가하고 있다. 우 CTO는 “이런 모델은 긴 컨텍스트 윈도를 사용하기 때문에 훨씬 큰 캐시가 필요하다”며 “적어도 페타바이트 규모를 이야기하고 있다”고 말했다. 모든 데이터를 고대역폭메모리(HBM)나 D램에 올려놓는 방식 대신 메모리와 고속 스토리지를 계층적으로 활용해야 한다는 설명이다. 화웨이는 이를 위해 '다중 계층 KV 캐싱' 구조를 도입했다. 우 CTO는 “단순히 모든 데이터를 HBM이나 D램에 저장하는 것이 아니라 새로운 대규모 고속 스토리지를 활용한다”며 대규모 추론 환경을 위한 '오션스토어(OceanStor) M900'을 소개했다. 그는 이 시스템을 통해 최대 64페타바이트(PB) 규모의 스토리지를 구성할 수 있다고 설명했다. 가속기 간 연결에는 NPO(Near-Packaged Optics) 방식의 광학 기술도 적용한다. 대규모 AI 클러스터에서 연결 효율을 높여 컴퓨팅 자원의 활용률을 끌어올리고 지연시간을 줄이기 위한 기술이다. 슈퍼팟 하나를 넘어 여러 시스템을 다시 연결하는 방안도 추진한다. 우 CTO는 “8천개나 10만개의 카드로도 충분하지 않다면 어떻게 해야 하느냐”며 “50만개의 GPU가 필요한 시스템을 구축할 수도 있다”고 말했다. 이어 2계층 교차 네트워킹을 활용하면 여러 슈퍼팟을 다시 연결해 시스템을 확장할 수 있다며 궁극적으로 100만개 이상의 가속기까지 늘릴 수 있는 구조를 제시했다. 화웨이가 강조하는 것은 특정 칩 하나의 성능보다 컴퓨팅과 네트워크, 메모리, 스토리지를 하나의 시스템으로 설계하는 방식이다. AI 모델과 서비스가 커질수록 개별 장비의 성능보다 전체 자원을 얼마나 효율적으로 묶어 사용할 수 있느냐가 중요해진다는 판단이다. 우 CTO는 “화웨이는 AI 인프라에 집중해 컴퓨팅, 네트워크, 스토리지 등 기술 혁신과 시스템 아키텍처 최적화를 통해 고객에게 다양한 컴퓨팅 파워 선택지와 유연한 온프레미스 배포 및 클라우드 서비스 방안을 제공하고 있다”고 말했다. 이어 “오픈소스 개방형 컴퓨팅 생태계 구축을 지속 추진하며 주요 모델 적용과 애플리케이션 혁신을 지원하고, 산업 파트너와 함께 다양한 시나리오에 맞는 AI 배포 방식을 모색하고 있다”고 덧붙였다. 그는 “한국 고객 및 파트너와의 기술 교류 협력을 강화해 AI 인프라가 실제 비즈니스 수요를 충족하고 각 산업의 지능화를 착실히 지원할 수 있기를 기대한다”고 밝혔다.