[AI 리더스] 권경민 이노그리드 CTO "AI 인프라 경쟁력, GPU보다 운영 기술에 달렸다"
"그래픽처리장치(GPU)를 많이 확보했느냐보다 자원을 얼마나 효율적으로 운영하느냐가 앞으로 AI 인프라 경쟁력을 결정할 것입니다." 권경민 이노그리드 최고기술책임자(CTO)는 20일 서울 중구 본사에서 지디넷코리아와 만나 AI 인프라 시장 변화와 운영 기술 전략에 대해 이같이 밝혔다. 최근 정부와 기업들은 대규모 AI 인프라 구축을 목표로 최신 GPU 확보에 나서고 있다. 하지만 고가의 최신 GPU를 확보한 것 자체보다 이 자원을 다양한 워크로드에 맞춰 효율적으로 운영할 수 있는지가 새로운 경쟁력으로 떠오르고 있다는 게 권 CTO의 진단이다. 이노그리드는 이 변화에 맞춰 GPU 운영 효율화 기술을 개발하는 국책 과제 'GRIM-GPU' 프로젝트를 수행 중이다. 단순한 GPU 공유 기술을 넘어 가상머신(VM)과 컨테이너가 혼재된 환경에서 GPU를 유연하게 분할·재구성하고 성능 간섭을 최소화하는 AI 인프라 운영 기술을 확보하는 것이 목표다. GPU 확보 경쟁 다음 단계는 '운영 효율화' 권 CTO는 최근 2~3년 동안 AI 인프라 시장이 급격하게 변화했다고 짚었다. 그는 "초기 AI 시장에선 GPU를 빨리 수급하는 것이 경쟁력이었지만 최근에는 공급 부족 현상이 다소 완화되고 있다"며 "이제는 GPU를 어떤 서비스와 워크로드에 배치하고 기존 장비를 어떻게 효율적으로 활용할 것인지가 더 중요한 시점"이라고 설명했다. 그러면서 글로벌 빅테크와 같은 방식의 AI 인프라 경쟁은 국내 기업이 선택할 수 있는 전략이 아니라고 강조했다. 그는 "국내 소프트웨어(SW) 기업이 글로벌 기업처럼 막대한 자본을 투입해 GPU를 확보하는 방식으로 경쟁하기는 쉽지 않다"며 "기업과 기관이 이미 보유한 GPU를 효율적으로 활용할 수 있도록 지원하는 운영 기술에 집중해야 한다"고 말했다. 이에 이노그리드는 과학기술정보통신부와 정보통신기획평가원(IITP)이 추진하는 GRIM-GPU 프로젝트에 주관기관으로 참여해 GPU 공유와 재구성 기술 연구에 앞장서고 있다. VM·컨테이너 혼재 환경 해결하는 'GRIM-GPU' GRIM-GPU는 정부가 추진하는 AI 클라우드 경쟁력 강화 기술개발 사업 가운데 하나로, VM과 컨테이너가 혼재된 단일 노드 환경에서 GPU를 유연하게 공유하는 기술을 개발하는 것이 주 목적이다. 현재 AI 인프라는 크게 VM 기반 환경과 컨테이너 기반 환경으로 나뉜다. 문제는 두 환경의 GPU 활용 방식이 다르다는 점이다. 공공·금융 분야는 보안성과 격리 수준이 높은 VM을 선호하는 반면, AI 학습과 추론 환경은 쿠버네티스 기반 컨테이너를 중심으로 운영되는 경우가 많은 것으로 알려졌다. 이에 대해 권 CTO는 "기존에는 GPU를 활용하기 위한 VM과 컨테이너 환경을 각각 별도로 구성해야 했지만, GRIM-GPU는 워크로드 특성에 따라 단일 환경에서 GPU를 동적으로 할당하는 기술을 목표로 하고 있다"고 밝혔다. 특히 동적 재구성 기술이 이번 과제의 핵심 연구 분야다. 통상 업무를 하는 주간에는 추론 서비스에 GPU를 사용하다가 야간에는 대규모 AI 학습에 활용하는 구조로 자원 활용 방식을 빠르게 전환할 수 있어야 한다는 관점이 담겼다. 성능 간섭을 최소화하는 스케줄링 기술도 함께 개발 중이다. GPU 메모리와 SM, L2 캐시 등 다양한 자원의 사용 패턴을 분석해 워크로드 간 충돌을 사전에 예측하고 이를 완화하는 방식이다. 권 CTO는 "기존의 엔비디아 MIG 기술을 활용하면 자원 격리 수준은 높일 수 있지만, 다양한 서비스 환경에서 GPU를 빠르게 재구성하는 것은 또 다른 문제"라며 "이번 과제에선 GPU 재구성을 5초 이내에 수행하는 것을 주요 성능 지표(KPI) 가운데 하나로 설정했다"고 말했다. 이어 "GPU 한 장을 하나의 작업에만 사용하는 방식에서 벗어나 여러 워크로드를 동시에 안정적으로 운영할 수 있도록 구성할 것"이라고 덧붙였다. GRIM-GPU는 정부 공개SW 연구개발 과제로 추진되고 있다. 이에 따라 과제 결과물은 오픈소스로 공개된다. 이노그리드는 프로젝트 컨소시엄 차원의 깃허브 저장소를 운영 중이며 올해 하반기에는 초기 기술 버전을 공개할 예정이다. 공개된 기술은 개발자와 연구기관, 기업 등이 자유롭게 활용할 수 있도록 개방할 계획이다. GPUaaS·AI 데이터센터까지…통합 AI 인프라 플랫폼 확장 이노그리드는 이번 연구개발 성과를 단순 국책과제로 끝내지 않고 서비스형 GPU(GPUaaS)와 AI 클라우드 관리 플랫폼(CMP) 등 자사 솔루션으로 확장할 계획이다. 권 CTO는 "GRIM-GPU를 통해 확보한 GPU 공유와 스케줄링, 경량 모니터링 기술을 실제 제품에 적용할 예정"이라며 "궁극적으로는 GPU를 서비스 형태로 제공하는 GPUaaS의 기술적 기반이 될 것"이라고 밝혔다. 최근 NHN인재아이엔씨 합병 이후 회사의 AI 인프라 전략도 더욱 구체화되고 있다. 이노그리드는 프라이빗 클라우드 구축 역량을, NHN은 대규모 인프라 운영 경험을 각각 보유하고 있는 만큼 양사 강점을 결합해 리전형·모듈형 AI 데이터센터 시장을 공략하겠다는 구상이다. 현재 이노그리드는 서비스형 인프라(IaaS)부터 플랫폼(PaaS), 거대언어모델 운영관리(LLM옵스) 등 AI 인프라를 구성하는 솔루션 라인업을 갖췄다. 향후에는 GPU를 비롯한 신경망처리장치(NPU), 양자처리장치(QPU) 등 다양한 연산자원 운영과 AI 에이전트 관리 역량도 키운다는 목표다. 권 CTO는 "3년 안에 AI 데이터센터의 클라우드 영역부터 AI 가속기, 데이터 관리, 에이전트 운영까지 모두 아우를 수 있는 특화 플랫폼을 구축할 것"이라고 강조했다. 끝으로 그는 "GRIM-GPU 국책과제를 통해 얻은 성과를 오픈소스로 공공에 다시 환원할 것"이라며 "국내 AI 개발자와 연구기관이 모두 활용할 수 있는 AI 인프라 생태계를 구축하겠다"고 덧붙였다.