[AI 리더스] 엘리스그룹 "GPU 확보 넘어 '잘 쓰는 기술'로…국가 AI 생태계 뒷받침할 것"
엘리스그룹이 교육·클라우드 기업을 넘어 인공지능(AI) 데이터센터 구축부터 그래픽처리장치(GPU) 운영, AI 서비스까지 직접 연결하는 'AI 풀스택 기업'으로 사업 영역을 확장한다. 정부의 대규모 GPU 확충 사업을 발판으로 AI 인프라 구축 경험을 쌓는 동시에, 자체 클라우드 인프라 소프트웨어(SW)와 모듈형 데이터센터 기술을 결합해 국내 AI 인프라 시장에서 입지를 넓힌다는 목표다. 박정국 엘리스그룹 최고기술책임자(CTO)는 26일 서울 강남구 본사에서 지디넷코리아와 만나 "앞으로는 GPU를 얼마나 많이 가지고 있느냐 자체가 경쟁력이 되기는 어렵다"며 "GPU와 AI 모델 사이를 얼마나 효율적으로 연결하고 자원을 활용해 결과물을 만들어내느냐가 인프라 경쟁의 핵심이 될 것"이라고 밝혔다. 회사는 이같은 시장 변화에 맞춰 데이터센터부터 AI 서비스까지 단일 기술 체계로 연결하는 전략을 추진 중이다. 데이터센터 구축과 GPU 서버 조달·운영, 네트워크·스토리지, 클라우드 운영 SW를 자체적으로 연결하고 실제 AI 모델 개발과 서비스 운영 경험까지 인프라 설계에 반영하는 방식이다. 인프라와 서비스 사업을 별개로 키우기보다 각 수요와 경험을 다시 기술 개발에 반영하는 선순환 구조를 만든다는 방침이다. 박 CTO는 "AI 서비스를 직접 개발하면 어떤 인프라가 필요한지 알 수 있고 반대로 인프라가 고도화되면 이를 기반으로 새로운 서비스를 개발할 수 있다"며 "우리 AI 서비스와 교육 사업에서 발생하는 수요가 인프라를 발전시키고 인프라의 발전이 다시 새로운 서비스를 만드는 구조를 만들고 있다"고 강조했다. GPU 운영 넘어 데이터센터 구축까지…정부 사업서 경험 축적 이러한 전략의 핵심 무대로는 정부 AI 인프라 사업이 꼽힌다. 엘리스그룹은 올해 과학기술정보통신부가 추진한 총 2조 805억원 규모 'AI컴퓨팅자원 활용기반 강화사업' 수행기관으로 선정돼 엔비디아 B300 GPU 2560장을 구축한다. 정부는 사업자 선정 과정에서 GPU 확보뿐 아니라 대규모 클러스터 구축·운영, 전력·냉각, 네트워크 설계 등 AI 인프라 전반의 역량을 평가했다. 엘리스그룹은 B300 2560장을 4개 모듈형 AI 데이터센터에 각각 640장씩 구축할 계획이다. 직접수랭식(DLC)에 40도 이상의 냉각수를 활용하는 온수 냉각과 외기 냉각을 적용하고 데이터센터 전력사용효율(PUE) 1.1 수준을 목표로 한다. 고집적·고전력 GPU 환경에 대응할 수 있도록 네트워크와 전력까지 함께 최적화할 계획이다. 박 CTO는 정부 사업에서 엘리스그룹이 보유한 경쟁력을 '엔드투엔드 AI 인프라'로 설명했다. 데이터센터 구축에서 시작해 GPU 서버 조달·설치·운영, 자원을 효율적으로 활용하기 위한 SW, 실제 모델 학습과 추론 서비스를 위한 기술 지원까지 전 영역을 연결할 수 있다는 것이다. 특히 이번 사업은 엘리스그룹이 AI 인프라 사업을 한 단계 확대하는 계기도 될 전망이다. 박 CTO는 "기존에는 GPU를 운영·공급하는 레퍼런스가 중심이었다면 이번에는 데이터센터 구축부터 시작한다는 점에서 새로운 경험과 노하우를 확보하게 될 것"이라고 말했다. 이어 "AI 인프라처럼 초기 비용이 큰 산업에선 새로운 시도를 한 기업이 실제로 구축하고 운영해본 경험을 확보하는 것이 중요하다"며 "정부가 새로운 기술을 시도하는 기업의 첫 고객이 돼주기에 이를 기반으로 민간과 해외 시장까지 확대할 수 있을 것"이라고 덧붙였다. PMDC·ECI 결합…"GPU 제대로 쓰는 기술이 경쟁력" 엘리스그룹의 AI 인프라 전략을 뒷받침하는 기술은 모듈형 AI 데이터센터 'AI PMDC'와 자체 클라우드 인프라 SW 'ECI'다. PMDC는 전력·냉각·IT 장비·관제 시스템을 하나의 모듈로 통합해 공장에서 제작한 뒤 현장에 설치하는 방식이다. 시설을 먼저 짓고 서버를 배치하는 기존 방식과 달리, 어떤 AI 워크로드와 GPU를 사용할지를 먼저 정하고 이에 맞춰 데이터센터를 종합적으로 설계한다는 점이 강점으로 평가된다. 또 최신 GPU 세대가 빠르게 바뀌는 만큼 모듈형 데이터센터로 빠르게 검증·도입하는 능력 자체도 경쟁력으로 꼽았다. 박 CTO는 "B200 GPU를 수용하는 수랭식 환경을 구축한 바 있으며 B300용 데이터센터도 설계·검증해왔다"며 "엔비디아 GPU뿐만 아니라 국산 신경망처리장치(NPU), AMD GPU 등 다양한 이기종 AI 가속기 환경 대응 역량도 갖춰왔고 앞으로도 관련 기술을 지속 고도화할 것"이라고 밝혔다. 구축된 GPU의 실제 활용 효율을 높이는 ECI도 회사 핵심 자산이다. 이는 GPU 스케줄링으로 유휴 시간을 줄이는 한편 네트워크와 스토리지를 GPU 특성에 맞춰 최적화해 고가의 GPU가 제 성능을 낼 수 있도록 지원한다. 범용 클라우드 인프라 관리보다 대규모 AI 학습과 GPU 클러스터 운영에 특화됐다는 설명이다. 엘리스그룹은 PMDC와 ECI를 결합해 데이터센터 구축과 GPU 운영을 단일 체계로 연결했다. ECI는 클라우드 서비스 보안인증(CSAP) 서비스형 인프라(IaaS) 인증을 확보했으며 엘리스클라우드를 통해 공급되는 GPU 자원에도 적용되고 있다. 향후 공공뿐 아니라 민간 AI 서비스까지 AI 인프라 사업 영역을 확대한다는 방침이다. 박 CTO는 "최신 GPU를 확보해도 기존 스토리지나 네트워크를 그대로 사용하면 데이터가 늦게 전달되면서 GPU 가동이 저조해지는 일이 생긴다"며 "GPU만 최신 기술을 도입하는 것이 아니라 전체 인프라를 효율적인 GPU 운영에 맞춰 설계해야 실제 성능을 끌어낼 수 있다"고 말했다. "AI 인프라는 '토큰 공장'…소버린 AI까지 연결한다" 박 CTO는 향후 AI 인프라 산업의 중심이 하드웨어(HW) 확보에서 '토큰 생산성'으로 옮겨갈 것으로 전망했다. AI 학습 중심이던 컴퓨팅 수요가 추론과 서비스 영역으로 이동하고 GPU와 각종 AI 가속기 공급도 늘면서 단순한 HW 보유량만으로는 차별화하기 어려워지고 있다는 판단이다. 그는 GPU와 데이터센터, 운영 SW 모두 궁극적으로 AI 서비스를 위한 토큰을 생산하는 기반 시설이라고 짚었다. GPU 숫자보다 얼마나 빠르고 효율적으로 인프라를 구축하고 적절한 모델을 배치하며 컴퓨팅 자원을 최대한 활용할 수 있는지가 AI 인프라 경쟁력을 평가하는 새로운 기준이 될 것으로 내다봤다. 이같은 전망은 엘리스그룹이 추진하는 소버린 AI 구상과도 연결된다. 박 CTO는 특정 GPU나 AI 반도체를 국산화하는 것만으로 소버린 AI를 구현했다고 보기는 어렵다고 밝혔다. 데이터센터 구축부터 SW 운영·개발, AI 모델 개발과 서빙, 실제 서비스 이용까지 전체 생태계를 통제하고 관리할 수 있는 역량이 필요하다는 것이다. 박 CTO는 "우리는 AI가 사회에서 더 널리 쓰이고 유용하게 활용되면서도 자원이 낭비되지 않도록 하기 위해 필요한 기술을 다각도로 지원한다"며 "AI 모델과 데이터센터의 효율화부터 최신 AI 인프라 기술, 소버린 AI까지 AI가 국가와 사회에서 제대로 활용될 수 있도록 뒷받침하는 기업으로 성장할 것"이라고 강조했다.