• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
국감2026
AI페스타26
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'AI 추론'통합검색 결과 입니다. (107건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

리사 수 CEO "韓 AI 협력, NPU 등 생태계 전반으로 확대"

리사 수 AMD 최고경영자(CEO)가 지난 3월 이후 7개월만에 한국을 다시 찾아 국내 AI 생태계 주요 업체와 만나며 경쟁력 강화를 모색했다. 당초 거론되던 신경망처리장치(NPU) 뿐만 아니라 향후 더 넓은 영역에서 협력이 예상된다. 7일 과학기술정보통신부에 따르면 리사 수 AMD CEO는 이날 오전 서울 광화문 포시즌스 호텔에서 반도체 기업과 소프트웨어, 메모리·스토리지, 네트워크, 클라우드, AI 모델 관련 스타트업 13곳과 만났다. 협력 대상도 당초 거론되던 퓨리오사AI, 딥엑스, 모빌린트 등 NPU 팹리스 3곳 뿐만 아니라 하이퍼엑셀, 망고부스트, 파네시아, 디노티시아, 모레, 노타AI, 래블업, 파두, 엘리스그룹, 업스테이지 등으로 확대됐다. 지난 3월 방한→7월 샌프란시스코 회동 거쳐 리사 수 CEO의 올해 한국 방문은 이번이 두 번째다. 리사 수 CEO는 지난 3월 하순 첫 공식 방한 당시 임문영 국가AI전략위원회 부위원장, 하정우 청와대 AI·미래기획수석(당시) 등과 만나 글로벌 개방형 AI 생태계 구축을 위한 협력 방안을 논의했다. 이후 7월 말 미국을 방문한 배경훈 부총리 겸 과기정통부 장관과 AMD CPU·GPU와 국산 NPU를 연계한 이기종 AI 연산 인프라 구축을 위한 양해각서를 체결했다. AI 연구센터(CoE) 설립 추진도 협력 방안에 포함됐다. 과학기술정보통신부는 7월 양해각서 체결 후속으로 이날 오전 양측 간 협력 과제를 점검하고 국내 AI 반도체 기업과의 구체적인 협력 기회를 모색하기 위한 간담회를 진행했다. 7월 MOU 후속 단계 논의...AI 연구센터·인재 양성 추진 류제명 과학기술정보통신부 제2차관은 이날 리사 수 CEO와 별도 면담을 갖고 지난 7월 체결된 양해각서 협력 과제의 추진 현황을 점검했다. AMD AI 연구센터(CoE)를 연내 설립하고 AI 분야 대학원 인재 양성 등 협력 과제도 차질 없이 추진하기로 했다. 특히 국내에서 AMD의 CPU·GPU와 국산 신경망처리장치(NPU)를 결합한 이기종 AI 연산 인프라를 실증하고, 이를 향후 글로벌 시장에서 활용할 수 있는 레퍼런스 모델로 발전시키는 방안이 주요 협력 과제로 거론됐다. 리사 수 CEO는 "한국은 AMD의 중요한 협력 파트너이며 한국이 AI 분야 경쟁력을 높여가는 과정에서 국내 우수 기업들과 AMD가 새로운 협력 기회를 만들어가겠다"고 밝혔다. 엔비디아 독주에 AMD '이기종 AI' 전략으로 대응 AMD가 국내 NPU 기업들과 협력을 확대하는 배경에는 엔비디아가 장악하고 있는 AI 가속기 시장에서 경쟁력을 높이려는 의도가 있다. AMD는 엔비디아의 차세대 GPU인 '베라 루빈'에 맞서 올해 3분기 말부터 서버용 차세대 프로세서 '에픽 베니스'와 '인스팅트 MI450' AI GPU 가속기 공급에 나서고 있다. 그러나 AI 학습·추론 시장에서 엔비디아의 높은 점유율을 단기간에 따라잡기는 쉽지 않다. 이에 AMD는 상대적으로 비용 효율성과 전력 효율을 앞세울 수 있는 분야에서 국내 NPU 기업들과의 협력을 통해 GPU 중심의 AI 인프라를 보완하는 전략을 추진하는 것으로 보인다. AMD의 CPU·GPU와 국산 NPU를 함께 활용하는 이기종 구조를 통해 특정 AI 연산에는 NPU를, 범용 연산이나 고성능 작업에는 GPU를 활용하는 방식으로 AI 인프라의 비용과 전력 효율을 높일 수 있기 때문이다. NPU, 추론 비용 부담 상승에 GPU 보완재로 부상 NPU는 학습과 추론을 모두 수행할 수 있는 GPU에 비해 범용성은 떨어지지만 특정 AI 연산과 추론 작업에서 저전력으로 높은 성능을 낼 수 있다는 장점이 있다. 특히 에이전틱 AI 확산으로 추론 과정에서 처리해야 할 토큰 규모가 급증하면서 전력과 비용 부담이 커지는 만큼, NPU가 GPU 중심 AI 인프라의 보완재로 자리 잡을 가능성이 커지고 있다. 하정우 국가AI전략위원회 부위원장은 6일 오후 열린 'AI 페스타 2026' AI산업정책토크쇼에서 "현재 세계 시장에서 엔비디아 GPU가 독점에 가까운 상황"이라며 "에이전틱 AI로 막대한 토큰을 사용하는 추론에 대한 비용 부담이 크기 때문에 국산 NPU가 전력 효율성과 가격 경쟁력을 확보하면 충분히 기회를 얻을 것"이라고 말했다. 정부도 GPU 보완재로 국산 NPU 육성 정부 역시 GPU의 보완재로 국산 NPU를 육성한다는 방침을 여러 차례 밝혀왔다. 특정 기업의 GPU에 AI 연산을 과도하게 의존할 경우 공급망 위기 등 유사시 대응에 어려움이 생길 수 있다는 판단에서다. 이에 따라 국산 NPU 기술을 육성하는 동시에 GPU와 NPU를 함께 활용할 수 있는 이기종 AI 인프라를 구축해 국내 AI 반도체 생태계의 경쟁력을 높인다는 전략이다. 이날 류제명 차관은 "지난 7월 MOU를 계기로 시작된 AMD와의 협력이 리사 수 CEO의 이번 방한을 통해 우리 기업들과의 직접적인 만남으로 한 단계 더 나아갔다"고 평가했다.

2026.10.07 10:53권봉석 기자

AI 승부, GPU만으론 안 된다…클라우드 빅테크 한자리에

인공지능(AI) 인프라 경쟁의 무게중심이 그래픽처리장치(GPU) 확보에서 AI 데이터센터(AIDC)와 클라우드·플랫폼을 결합한 서비스 경쟁으로 이동하고 있다는 분석이 나왔다. AI 활용이 학습에서 추론과 에이전트로 확대되는 만큼 전력·냉각·네트워크뿐 아니라 실제 AI 서비스를 안정적으로 운영할 수 있는 소프트웨어 역량까지 갖춰야 한다는 제언이다. 공용준 KT클라우드 전무는 1일 서울 양재 엘타워에서 열린 'AI-클라우드 빅테크 2026'에서 "현재 AI 인프라의 가장 큰 병목은 데이터센터와 전력"이라며 "GPU를 확보하는 것만으론 AI 서비스를 구현하기 어려운 만큼 클라우드와 플랫폼까지 함께 갖춰야 한다"고 강조했다. 공 전무는 최근 AI 인프라 시장의 병목이 GPU에서 데이터센터로 이동하고 있다고 진단했다. GPU 공급 상황은 개선되고 있지만 데이터센터를 구축하는 데 최소 2~3년이 걸리는 만큼 GPU를 확보하기에 앞서 데이터센터 용량을 선점하려는 움직임이 나타나고 있다는 설명이다. AIDC의 경쟁 기준도 달라질 것으로 전망했다. 단순히 전력과 GPU를 확보하는 데 그치지 않고 AI 서비스를 위한 클라우드와 운영 플랫폼, 네트워크, 안정성 등을 함께 갖춰야 한다는 것이다. AI 서비스가 일상과 기업 업무에 깊숙이 들어오면서 장애 대응과 GPU 스케줄링, 서비스 모니터링 등 운영 역량의 중요성도 커지고 있다. 공 전무는 "AI 서비스가 우리 삶의 한 축으로 자리 잡으면서 기존 IT에서 중요했던 서비스 연속성도 중요해지고 있다"며 "GPU를 효율적으로 스케줄링하고 AI 서비스를 모니터링하는 것은 물론 장애에 대비한 복구 체계까지 마련해야 한다"고 말했다. 박운영 HPE 상무는 AI 시장이 학습 중심에서 추론과 실제 서비스 적용 단계로 이동하면서 기업의 인프라 구축 방식도 달라질 것으로 내다봤다. 기업들이 더 많은 GPU를 확보하는 것보다 AI를 실제 서비스에 적용하고 투자 대비 성과를 만드는 방안을 고민해야 할 시점이라는 설명이다. 특히 에이전틱 AI 확산에 따라 토큰 사용량과 비용 부담이 늘면서 퍼블릭 클라우드에서 시작한 AI 워크로드 일부를 온프레미스나 하이브리드 환경으로 옮기려는 수요가 늘어날 것으로 전망했다. 기업 데이터 보호와 AI 주권에 대한 요구 역시 프라이빗 AI 인프라 수요를 키우는 요인으로 꼽았다. 박 상무는 "이제는 더 많은 GPU를 사야 할지를 고민하기보다 AI를 어떻게 실제 양산에 적용할 수 있을지, 무엇이 문제인지 살펴봐야 할 시점"이라며 "AI에 투자한 비용을 실제 성과로 연결하는 것이 중요해지고 있다"고 말했다. 네이버클라우드도 추론 수요 확대가 AIDC와 AI 팩토리 시장의 성장을 이끌 것으로 전망했다. 김지훈 네이버클라우드 이사는 대규모 GPU 수요가 과거 AI 모델 학습을 중심으로 발생했다면, 최근에는 실제 서비스를 위한 추론 영역으로 빠르게 확대되고 있다고 밝혔다. AI 에이전트와 피지컬 AI 확산까지 더해지면서 AIDC 수요가 일시적인 흐름에 그치지 않을 것이라는 관측이다. 네이버클라우드는 이를 겨냥해 엔비디아와 AI 팩토리 사업을 확대할 계획이다. 대규모 GPU와 고속 네트워크를 제공하는 AI 클라우드 역량에 기존 클라우드의 인증·네트워크·스토리지와 AI 모델·서비스 운영 경험을 결합한다는 전략이다. 글로벌 AI 기업에는 대규모 전용 인프라를, 국방·금융 등 보안 요구가 높은 분야에는 폐쇄형 클라우드 환경을 제공하는 방식이다. 김 이사는 "AI 팩토리는 국가 전체의 AI 수요를 감당하고 경제·산업·사회 전반에 필요한 지능을 대규모로 생산하는 핵심 인프라"라며 "AI 팩토리를 확보했는지, 누가 그 주도권을 갖고 있는지가 한 나라의 경쟁력을 좌우할 것"이라고 강조했다.

2026.10.01 14:16한정호 기자

"분산형 AI, 2035년 한국서 연 68조원 가치 창출 전망"

AI 보편화로 추론 수요가 증가하는 가운데, 클라우드와 엣지·온디바이스·온프레미스 등 여러 컴퓨팅 환경을 연결하는 '분산형 AI'가 2035년 한국에서 연간 500억 달러(약 68조원) 상당 경제적 가치를 만들어낼 것이라는 전망이 나왔다. 글로벌 기술정책 컨설팅 기업 액세스 파트너십은 이같은 내용을 담은 보고서 '클라우드에서 엣지로: 한국의 분산형 AI가 창출하는 가치'를 공개했다. 보고서에 따르면 분산형 AI는 한국이 직면한 인구절벽, 노동력 부족, 높은 수출 의존도 등 구조적 과제에 대응하는 동시에 2035년 기준 연간 500억 달러(약 68조원) 이상의 경제적 가치를 창출할 수 있을 것으로 전망된다. 액세스 파트너십은 또 보고서에서 "이런 경제적 가치 창출을 위해서는 향후 10년간 약 180억 달러(약 24조원)의 추가 투자가 필요하다"고 분석했다. 디지털 강국 한국, 인구·노동력·수출 '3중 과제' 보고서는 한국이 2024년 OECD 국가 가운데 5G 관련 지표 1위를 기록하고, ICT 산업이 2023년 GDP의 13%를 차지하는 등 높은 수준의 디지털 인프라와 기술 생태계를 갖췄다고 평가했다. 정부도 온디바이스·피지컬 AI, 산업 AI 전환, AI 반도체와 컴퓨팅 인프라, 6G 등에 대한 투자를 확대하고 있다. 반면 인구 고령화와 노동력 부족, 높은 수출 의존도는 구조적 위험 요인으로 꼽힌다. 보고서는 2050년 한국 인구의 약 40%가 고령층에 해당하고, 2025년 제조 중소기업의 61%가 인력 채용에 어려움을 겪고 있다고 분석했다. 무역의존도 역시 GDP 대비 91% 수준으로 높다. AI 추론 수요 2030년 30배 증가...데이터센터 5배 필요 AI 확산에 따라 컴퓨팅 수요도 급증할 전망이다. 액세스 파트너십은 한국의 AI 추론 컴퓨팅 수요가 2030년까지 현재의 약 30배로 증가할 수 있다고 분석했다. 이를 클라우드 중심으로 충당하려면 데이터센터 용량을 약 5배 확대해야 하지만, 현재의 데이터센터 투자 추세가 이어질 경우 필요한 AI 추론 처리 역량의 약 86%가 부족할 수 있다고 전망했다. 피지컬 AI 확산은 문제를 더욱 복잡하게 만든다. 로봇·자동차·제조설비 등은 주변 환경을 인식하고 실시간으로 판단·제어해야 해 네트워크를 거쳐 중앙 데이터센터의 추론 결과를 기다리는 방식에 한계가 있다. 제조 데이터나 생체정보처럼 민감한 데이터를 클라우드로 전송하는 과정에서는 보안과 개인정보 보호 문제도 고려해야 한다. 클라우드 한계 보완할 '분산형 AI', 엣지·온디바이스로 추론 분산 보고서는 클라우드 위주 AI 처리 대안으로 클라우드와 엣지, 온디바이스, 온프레미스 등 다양한 위치에서 AI를 처리하는 '분산형 AI'를 대안으로 제시했다. 대규모 연산과 복잡한 AI 처리는 클라우드의 확장성을 활용하는 한편, 즉각적인 판단이 필요한 작업은 사용자나 산업 현장과 가까운 엣지 또는 기기 자체에서 처리해 지연 시간과 전력 소모 등 비용을 줄일 수 있다는 것이다. 특히 피지컬 AI 시대에는 이러한 구조의 중요성이 더욱 커진다. 로봇이나 자율 시스템처럼 실제 환경을 인식하고 실시간으로 판단·행동해야 하는 AI는 네트워크 연결 상태나 중앙 데이터센터의 응답을 기다리는 방식만으로는 한계가 있기 때문이다. 자율형 산업·수출 경쟁력·돌봄 로봇서 68조원 가치 전망 액세스 파트너십은 분산형 AI의 활용 가능성과 경제적 효과를 분석해 ▲자율형 산업 운영 ▲분산형 AI를 통한 수출 경쟁력 강화 ▲동반자·보조 로봇 등 분야의 경제적 가치를 제시했다. 먼저 자율형 산업 운영 분야에서는 2035년 연간 230억 달러(약 31조원) 이상의 경제적 가치를 창출할 수 있을 것으로 전망했다. 산업용 로봇, 건설 로봇, 위험 작업용 휴머노이드 로봇, 자율 점검 로봇, 예지정비 등에 분산형 AI를 적용하면 인력 부족 보완, 생산성 강화와 설비 중단 시간 단축, 작업장 안전사고 감소 등 효과가 기대된다. 분산형 AI를 통한 수출 경쟁력 강화에서는 연간 210억 달러(약 28조원) 이상의 경제적 가치가 예상된다. 스마트폰, 스마트 가전, 가정·서비스용 로봇, XR 기기 등 한국 기업이 경쟁력을 보유한 제품에 온디바이스 및 분산형 AI 기능을 확대하면 제품의 부가가치를 높이고 글로벌 시장점유율을 확대하는 동시에 새로운 제품군을 창출할 수 있다는 분석이다. 인구 절벽 대응을 위한 동반자·보조 로봇 분야에서도 연간 59억 달러(약 8조원) 이상의 경제적 가치를 창출할 수 있을 것으로 전망됐다. 이동 지원, 낙상 감지 및 안전 모니터링, 대화형 동반 로봇 등에 분산형 AI를 활용하면 고령자의 독립적인 생활을 지원하는 동시에 돌봄 인력 부족과 관련 비용 부담을 완화할 수 있다. 세 가지 핵심 활용 사례를 종합하면 분산형 AI는 AI 도입에 따른 생산성 향상, 시장 확대에 따른 기업 추가 매출, 비용 절감 등으로 2035년 국내에서 연간 500억 달러(약 68조원) 규모 가치를 창출할 것으로 기대된다. 연간 2조원 이상 투자와 표준·6G·규제 정비 제안 보고서는 한국이 메모리·파운드리 등 반도체 제조 역량과 온디바이스 AI용 NPU, 5G 네트워크, AI 컴퓨팅 인프라 등 분산형 AI 확산에 필요한 산업 기반을 갖췄다고 평가했다. 다만 잠재력을 실제 경제적 가치로 연결하려면 추가 투자가 필요하다. 액세스 파트너십은 2026년부터 2035년까지 약 180억 달러(약 24조원), 연평균 약 20억 달러(약 2조 7100억원) 추가 투자가 필요할 것으로 추산했다. 산업 AI 도입 지원, 인력·기술 역량 전환, 분산형 AI 인프라·연결성, 반도체·하드웨어 생태계, R&D 및 수출 경쟁력 강화 등이 주요 투자 분야다. 정책 과제로는 ▲주요국과의 표준 협력을 통한 글로벌 상호운용성 강화 ▲공급자 다양성과 데이터 이동성 확보 ▲분산형 AI와 연계한 6G·차세대 네트워크 투자 ▲제조·모빌리티·헬스케어 분야의 안전·성능 기준 마련 등 4가지를 제시했다. 아울러 국내 기술·산업 역량과 글로벌 협력을 결합하는 'Korea-Along' 전략도 제안했다. 한국을 분산형 AI의 실증 환경으로 활용하면서 국제표준과 글로벌 시장에서의 협력을 확대해야 한다는 취지다.

2026.09.30 15:51권봉석 기자

세미파이브, 美 팹리스와 703억 규모 AI 가속기 개발 계약

글로벌 AI 맞춤형 반도체(ASIC) 설계 전문 기업 세미파이브가 미국 AI 팹리스(반도체 설계전문)와 약 703억원(미화 5200만 달러) 규모의 차세대 AI 추론 가속기 개발 계약을 체결했다고 29일 밝혔다. 이번 수주는 세미파이브가 북미 시장에서 확보한 첫 '스펙 핸드오프(Spec Hand-off)' 사업이다. 단일 계약 규모만 지난해 연간 수주액(1684억원)의 40%를 상회하는 역대 최대 성과이자 글로벌 AI 반도체 맞춤형 시장에서 기술 경쟁력을 입증했다는 평가다. '스펙 핸드오프'는 고객사가 원하는 핵심 성능과 사양(스펙)만 제시하면 상세 설계부터 패키징, 테스트, 양산, 소프트웨어 개발까지 전 과정을 전담하는 최상위 맞춤형 서비스다. 기존 턴키 방식이 완성된 설계도 기반의 위탁 생산 중심이었다면, 스펙 핸드오프는 요구사양 단계부터 ASIC 기업이 주도해 칩을 완성한다. 구글·아마존 등 빅테크가 브로드컴, 마벨 등과 협력해 온 것과 같은 선진 개발 방식이다. 이번 프로젝트에는 대규모 AI 모델 추론 시 전력 부담과 총소유비용(TCO)을 낮추기 위한 최신 기술이 집약된다. 차세대 저전력 D램인 LPDDR6와 고속 인터페이스인 PCIe Gen5를 적용해 메모리 전력 효율을 높이고 데이터 전송 병목을 최소화한다. 또한 다수의 빅다이(Big Die) 프로젝트 경험을 바탕으로 단일 칩의 연산 처리량과 동작 안정성을 동시에 확보할 계획이다. 양사는 2027년 상반기 테이프아웃을 거쳐, 2028년부터 글로벌 하이퍼스케일러와 클라우드 서비스 제공업체(CSP)를 대상으로 본격 양산에 돌입한다. 조명현 세미파이브 대표는 "AI 추론 시장 성장에 따라 맞춤형 반도체 수요가 확대되고 있다"며 "이번 가속기를 성공적으로 상용화해 글로벌 하이퍼스케일 인프라 시장에서 대체 불가능한 핵심 파트너로 자리매김하겠다"고 강조했다.

2026.09.29 14:07전화평 기자

AI 모델 성능만으론 부족…CTO들이 꼽은 경쟁력은 최적화

국내 주요 기술기업의 최고기술책임자(CTO)들이 인공지능(AI) 에이전트 확산으로 AI 산업의 경쟁 축이 단순 모델 성능에서 추론 비용과 인프라 효율성으로 빠르게 이동할 것이란 전망을 내놨다. AI 반도체와 모델이 다양해지면서 특정 하드웨어의 성능만 높이기보다 모델부터 반도체, 소프트웨어, 실제 워크로드까지 함께 최적화하는 역량이 중요해질 것이란 분석이다. 이진원 하이퍼엑셀 CTO는 29일 서울 코엑스에서 열린 래블업 기술 컨퍼런스 'lab | up > /conf/6'에서 "AI 시장의 무게중심이 학습에서 추론으로 빠르게 이동하고 있다"며 "추론 시장에서는 결국 비용을 얼마나 절감할 수 있느냐가 중요하다"고 밝혔다. 그는 AI 활용처가 늘어날수록 단일 반도체가 모든 요구를 충족하기 어려워질 것으로 내다봤다. 빠른 응답 속도가 필요한 서비스가 있는 반면, 비용 효율성이 중요한 서비스도 있어 워크로드에 따라 필요한 반도체와 인프라 구성이 달라진다는 설명이다. 이 CTO는 "AI 반도체는 속도와 전력 효율, 비용 등 모든 지표를 동시에 최고 수준으로 끌어올리기 어렵다"며 "각 요소가 트레이드오프 관계에 있는 만큼 목표로 하는 AI 서비스에 맞춰 전략적으로 선택해야 한다"고 말했다. AI 모델 개발 단계에서도 추론 최적화가 핵심 과제로 떠오르고 있다. 이활석 업스테이지 CTO는 엔비디아·AMD·퓨리오사AI 등 서로 다른 AI 반도체를 활용하면서 범용적인 최적화만으로는 한계가 있다고 설명했다. 모델이 실제 어떤 서비스에서 어떻게 사용되는지까지 파악해야 하드웨어 성능을 제대로 끌어낼 수 있다는 진단이다. 이활석 CTO는 "애플리케이션 정보가 칩까지 흘러가야 경쟁력이 생길 수 있다"며 "워크로드 성격부터 고객의 특성, 칩의 특성까지 각 레이어를 연결해 AI를 최적화해야 한다"고 말했다. 모델과 반도체 사이를 연결하는 최적화 기술의 역할도 커질 전망이다. 김태호 노타AI CTO는 데이터 보안과 비용, 특정 업무에 특화된 AI 수요 등으로 향후 AI 생태계가 더욱 다변화될 것으로 내다봤다. 다양한 모델을 서로 다른 AI 반도체에서 효율적으로 구동할 수 있도록 연결하는 기술이 중요해진다는 설명이다. 그러면서 AI가 기존 기술을 조합해 모델을 최적화하는 능력은 빠르게 향상되고 있지만, 새로운 모델 구조와 워크로드에 맞는 최적화 기법을 만드는 데는 여전히 한계가 있다고 봤다. 인프라 운영 단계에선 서로 다른 하드웨어와 워크로드의 조합이 급증하는 양상이 새로운 병목으로 꼽혔다. 김준기 래블업 CTO는 오케스트레이션 미들웨어가 하위의 다양한 하드웨어와 상위의 워크로드·애플리케이션을 연결해야 하는 만큼 지원해야 할 조합 자체가 빠르게 늘어나고 있다고 짚었다. 김 CTO는 "AI 하드웨어와 워크로드가 다양해지면서 이를 연결해야 하는 조합도 빠르게 늘고 있다"며 "결국 얼마나 다양한 조합과 실제 서비스 환경, 사용자 시나리오에서 검증했는지가 중요해질 것"이라고 말했다. 이날 CTO들은 AI 추론 효율을 높이기 위해 어느 하나의 기술만 개선해선 한계가 있다고 입을 모았다. 모델과 소프트웨어, 메모리와 AI 반도체, 오케스트레이션에 이르는 각 영역을 실제 서비스의 특성에 맞춰 연결하는 역량이 AI 인프라 경쟁력을 좌우할 수 있다는 분석이다. 이진원 CTO는 "AI 기술이 빠르게 고도화되면서 앞으로는 AI를 위한 모델과 사람이 사용하는 모델이 서로 다른 방향으로 발전할 수 있다"며 "이를 뒷받침하는 AI 인프라 역시 용도에 따라 분리되는 시대가 올 것"이라고 전망했다.

2026.09.29 13:04한정호 기자

비드래프트 '다윈-180B-RSI', 허깅페이스 5개 벤치마크 1위

비드래프트의 최신 추론 모델 '다윈-180B-RSI'가 수학·과학·멀티모달 등 고난도 인공지능(AI) 추론 성능을 평가하는 허깅페이스 주요 벤치마크에서 상위권 성적을 기록했다. 비드래프트는 다윈-180B-RSI가 허깅페이스가 공인한 5개 리더보드에서 각 1위에 올랐다고 28일 밝혔다. 특히 AIME 2026과 HMMT 2026에서는 각각 100% 만점을 기록했으며 GPQA 다이아몬드에서는 94.44%의 점수를 기록했다. AIME와 HMMT는 수학 올림피아드 수준의 문제를 다루는 평가다. 비드래프트에 따르면 두 리더보드에서 기존 최고점은 각각 97.1%, 92.7%였다. GPQA 다이아몬드에서는 94.44%로 키미-K3(93.5%)를 앞섰다. MMLU-프로와 MMMU-프로에서도 각각 88.12%, 79.48%를 기록했다. GPQA 다이아몬드는 박사급 전문가가 출제한 과학 문제를 평가하며 MMLU-프로는 법·의학·경제 등 14개 분야의 문제를 다룬다. MMMU-프로는 도표와 악보, 의료 영상 등 시각 정보를 활용해 문제를 푸는 대학 수준의 멀티모달 평가다. 비드래프트는 이번 성과에 자체 기술인 다윈과 재귀적 자가개선(RSI), 'ZTC(Zero-Token Confidence)'를 적용했다고 설명했다. 다윈은 모델의 층과 전문가(Expert) 단위별 성능을 분석한 뒤 여러 모델에서 강점이 있는 부분을 선별해 결합하는 선택적 병합 기술이다. 비드래프트는 모델별 강점을 조합하면서 3970억개 파라미터급 초대형 모델에도 기술을 확장했다. RSI는 모델이 문제를 직접 풀고 정답 여부를 검증한 뒤 검증된 추론 결과를 다시 학습하는 방식이다. 개선된 모델이 다음 학습의 풀이자가 되는 과정을 반복해 스스로 성능을 높이는 구조다. 비드래프트는 이번 모델에서 같은 정확도를 유지하면서 추론 길이를 11% 줄였다. ZTC는 모델이 답변을 생성하기 전에 내부 정보를 분석해 정답 확률을 산출하는 기술이다. 비드래프트는 이를 활용해 모델의 확신도가 낮을 경우 스스로 답변을 중단하도록 설계했다고 설명했다. 김민식 비드래프트 대표는 "스스로 배우고 스스로 확신도를 아는 AI가 세계 최고 수준을 입증했다"며 "사람의 개입 없이 계속 성장하는 AI를 만들겠다"고 말했다.

2026.09.28 17:05이나연 기자

[AI 고속도로] AI 시대 다시 뜨는 '쿠버네티스'…GPU·서비스 운영 핵심으로

생성형 인공지능(AI) 확산으로 기업들이 대규모 그래픽처리장치(GPU)를 확보하면서 이를 효율적으로 나누고 관리하는 기술의 중요성이 커지고 있다. 클라우드 시대 수많은 애플리케이션을 관리하는 표준으로 자리 잡았던 '쿠버네티스'가 이제는 GPU부터 AI 모델의 학습·추론까지 관리하는 AI 인프라의 핵심 플랫폼으로 영역을 넓히는 모습이다. 23일 업계에 따르면 글로벌 클라우드 기업과 국내 플랫폼 기업들은 쿠버네티스를 기반으로 AI 인프라와 서비스를 운영하기 위한 기술 개발을 확대 중이다. 클라우드네이티브컴퓨팅재단(CNCF)이 올해 발표한 연례 조사에 따르면 생성형 AI 모델을 운영하는 조직 가운데 66%가 일부 또는 전체 추론 워크로드를 쿠버네티스에서 운영하는 것으로 나타났다. 컨테이너 관리하던 쿠버네티스…이젠 GPU까지 쿠버네티스는 수많은 서버와 그 안에서 실행되는 프로그램을 알아서 배치하고 관리해주는 오픈소스 플랫폼이다. 과거에는 단일 서버에 애플리케이션을 직접 설치했다면 클라우드 환경에선 프로그램과 실행에 필요한 요소를 '컨테이너'라는 작은 단위로 묶어 여러 서버에 나눠 실행한다. 쿠버네티스는 이 컨테이너를 어느 서버에서 실행할지 정하고 이용자가 몰리면 수를 늘리거나 장애가 발생하면 다른 곳에서 다시 실행하는 작업을 자동으로 수행한다. AI 시대에는 쿠버네티스가 관리해야 할 대상이 한층 넓어졌다. 과거에는 중앙처리장치(CPU)와 메모리를 중심으로 애플리케이션을 배치했다면, 이제는 가격이 비싼 GPU와 신경망처리장치(NPU) 등 다양한 AI 가속기를 여러 개발팀과 서비스가 효율적으로 나눠 사용하도록 해야 한다. 이에 최신 버전 쿠버네티스는 동적 자원 할당(DRA) 기능이 도입돼 GPU와 같은 하드웨어의 특성을 파악하고 필요한 작업에 자원을 보다 세밀하게 배분하는 방향으로 발전하고 있다. AI 모델을 실제 서비스에 적용하는 추론에서도 역할이 커지고 있다. 이용자가 AI에 질문하면 적합한 GPU가 있는 서버를 찾아 요청을 보내고 이용량이 급증하면 자원을 늘리는 방식이다. 글로벌 빅테크부터 국내 기업까지 활용 확산 대표적으로 구글클라우드는 구글 쿠버네티스 엔진(GKE)에서 GPU를 이용해 대규모언어모델(LLM)을 배포·서비스할 수 있도록 지원하고 있다. 최근에는 여러 지역에 흩어진 GPU와 자사 텐서처리장치(TPU) 클러스터를 하나의 자원처럼 활용해 AI 요청을 적절한 곳으로 보내는 기술도 확대 중이다. 국내에서도 쿠버네티스를 기반으로 AI와 클라우드 플랫폼을 고도화하려는 움직임이 이어지고 있다. 오케스트로는 쿠버네티스 기반 서비스형 플랫폼(PaaS) '비올라'를 통해 컨테이너 워크로드의 배포부터 운영까지 생애주기를 관리하고 멀티 클러스터와 데브옵스 환경을 지원하고 있다. 이노그리드 역시 쿠버네티스 기반 'SE클라우드잇'을 통해 여러 쿠버네티스 클러스터를 통합 관리하고 있으며 GPU·NPU·CPU 등 이기종 자원을 AI 워크로드에 활용하는 방향으로 사업 영역을 넓히고 있다. 나무에이엑스는 쿠버네티스를 AI 모델 추론까지 연결 중이다. 자체 AI 플랫폼에서 vLLM과 쿠버네티스 기반 분산 추론 기술 등을 활용해 여러 GPU에서 AI 추론 작업을 분산 처리하는 방식이다. 멀티·하이브리드 클라우드 관리 플랫폼 '스페로'에도 GPU 사용량과 정책, 스케줄링을 관리하는 기능을 적용해 AI 워크로드 운영 효율을 높이고 있다. 맨텍솔루션은 쿠버네티스의 활용 영역을 데이터센터 밖 엣지까지 확대 중이다. 자체 쿠버네티스 플랫폼 '아코디언 엣지'를 통해 중앙 클라우드에서 개발한 AI 모델을 공장 등 여러 현장에 배포하고 각 현장에서 독립적으로 추론 서비스를 운영할 수 있도록 지원하고 있다. GPU·모델·데이터 연결…AI 네이티브 플랫폼으로 진화 AI 시대에는 고가의 GPU를 비롯한 컴퓨팅 자원을 효율적으로 운영하는 것이 비용 경쟁력과 직결된다. 이에 쿠버네티스를 기반으로 GPU 자원 관리와 모델 배포·추론, 데이터 연계 등을 통합하는 AI 네이티브 플랫폼의 중요성도 커지고 있다. 기존 PaaS가 애플리케이션의 개발·배포를 지원했다면 AI 시대에는 관리 영역이 AI 인프라와 서비스 전반으로 넓어지는 셈이다. 한국인공지능클라우드산업협회(KACI)도 최근 기존 PaaS 지원분과위원회를 AI 네이티브 플랫폼(ANP) 분과위원회로 개편하고 관련 생태계 확대에 나섰다. 기존 클라우드 네이티브 기술을 AI 환경으로 확장하고 국내 플랫폼 기업의 기술 고도화와 금융·제조·공공 등 산업별 적용 사례를 확대한다는 목표다. 정철 KACI ANP 분과위원회 위원장은 "쿠버네티스처럼 개방형 표준을 기반 기술로 활용하면 특정 클라우드나 AI 모델에 종속되지 않고 필요에 따라 인프라와 서비스를 바꿀 수 있다"며 "AI 시대에는 GPU와 모델을 확보하는 것뿐 아니라 이를 효율적으로 나누고 배분해 실제 기업 서비스로 연결하는 플랫폼의 역할이 더욱 중요해질 것"이라고 밝혔다.

2026.09.23 10:43한정호 기자

애피어, 기업용 에이전틱 AI 실효성 높인다…글로벌 연구 성과 공개

애피어가 에이전틱 AI의 신뢰성과 글로벌 도입을 위한 평가 기준을 제시하는 두 편의 연구 논문을 발표했다. 10일 회사에 따르면, 이번 연구는 거대언어모델(LLM)이 검색된 정보만으로 답변할 수 없는 상황을 인식하는 과정과 추론 언어 선택이 다국어 사용자 지원에 미치는 영향을 심층 분석했다. 에이전틱 AI가 기업의 의사결정을 효과적으로 지원하기 위해서는 불확실성을 스스로 관리하고 각 과업에 가장 적합한 추론 방식과 언어를 유연하게 선택해야 한다는 점을 입증했다. 첫 번째 논문은 정보 부족을 인식하는 AI의 '모르는 것을 아는 역량'을 다뤘다. 28종의 주요 LLM을 대상으로 실험한 결과, '해당 사항 없음'이 정답인 경우 모델의 정확도가 30~50% 하락했다. 연구팀은 모델이 해당 상황을 정확히 인식하도록 지도 미세조정(SFT)과 직접 선호 최적화(DPO) 방식을 적용했다. 그 결과 정답과 오답의 차이를 함께 학습하는 DPO 적용 시, 정답이 없는 문제를 식별하는 정확도가 약 30%포인트 향상되며 AI의 정보 부족 인식 능력이 강화됨을 확인했다. 두 번째 논문은 대규모 추론 모델(LRM)의 다국어 입력과 추론 경로를 분석했다. 영어 등 고자원 언어는 수학·지식 기반 과업에서 높은 성능을 보인 반면, 현지 언어로 추론할 경우 해당 지역의 문화적 맥락 반영과 유해·불법 질문 식별 등 안전성 판단에 더욱 효과적인 것으로 나타났다. 연구팀은 이를 바탕으로 과업 유형과 지역·문화적 맥락에 따라 최적의 추론 언어를 동적으로 선택하는 '추론 언어 라우팅'의 활용 가능성을 제시했다. 회사는 향후 연구 성과를 애드·개인화·데이터 클라우드 등 핵심 제품군에 적용해, 기업이 에이전틱 AI를 확장 가능한 실질적 비즈니스 가치로 전환할 수 있도록 지원할 계획이다. 치한 위 애피어 최고경영자는 "이번 두 연구는 AI를 평가하는 기준을 새롭게 정의한다. AI가 단순히 질문에 답하는 단계를 넘어 자율적으로 의사결정을 내리기 시작하면서 모델이 정답을 내놓는지만 평가해서는 충분하지 않다"며 "정보가 부족한 상황을 스스로 인식하고 그에 맞춰 행동을 조정할 수 있는지, 각 과업에 가장 적합한 추론 방식을 선택할 수 있는지도 함께 평가해야 한다"고 말했다. 이어 "이런 역량은 에이전틱 AI가 단순히 명령을 수행하는 수준에서 벗어나 현실의 복잡한 상황에 대응할 수 있는 신뢰도 높은 의사결정 시스템으로 발전하는 데 기여할 것"이라며 "애피어는 지속적인 기초 연구를 통해 이러한 핵심 과제를 측정하고 개선할 수 있는 AI 역량으로 발전시켜, 다양한 시장과 언어 환경의 기업들이 에이전틱 AI를 더욱 신뢰하며 활용할 수 있도록 지원할 것"이라고 덧붙였다.

2026.09.10 09:53백봉삼 기자

AI '데이터 벽'에 갇힌다...SKT, 사후학습·추론으로 돌파구

AI 모델 성능을 높이는 데 필요한 학습 데이터가 부족해지는 '데이터 벽(Data Wall)' 문제가 현실이 되고 있다. 단순히 공개된 데이터의 고갈에 그치지 않고 웹 접근 제한과 합성 데이터의 품질 문제까지 겹치면서 AI 경쟁 방식도 달라질 것이란 분석이다. 7일 SK텔레콤 뉴스룸에 따르면 회사 AI정책연구원은 기고를 통해 AI 업계가 맞닥뜨린 데이터 제약을 ▲공개 텍스트의 물량 ▲웹 데이터 접근성 ▲합성 데이터 품질 등 세 가지로 구분했다. 먼저 데이터 총량에는 한계가 있다. 미국 AI 연구기관 에포크AI는 인간이 작성한 고품질 공개 텍스트를 약 300조 토큰으로 추산했다. 현재와 같은 AI 확장 추세가 이어지면 2032년 이내에 소진될 가능성이 있다. 학습 방식과 데이터 활용 효율에 따라 시점은 크게 달라질 것으로 봤다. 중요한 것은 고갈 시점보다 데이터의 한계효용이다. 데이터를 계속 늘리는 것만으로 얻을 수 있는 성능 향상에는 한계가 나타나고 있어 앞으로는 같은 데이터에서 얼마나 높은 학습 효율을 끌어내느냐가 중요해진다는 설명이다. 웹에 있는 데이터를 자유롭게 가져다 쓰기도 어려워지고 있다. 클라우드플레어는 오는 15일부터 광고가 게재된 페이지에서 AI 학습 에이전트용 크롤러를 기본 차단하고 검색과 학습을 함께 수행하는 크롤러에 대한 관리도 강화한다. 데이터가 웹에 존재하는 것과 AI 기업이 실제 사용할 수 있는 것은 별개의 문제가 된 셈이다. AI가 만든 합성 데이터도 완전한 대안은 아니다. 네이처에 게재된 연구에서는 모델이 생성한 데이터로 후속 모델을 반복 학습하면 희귀 사례와 예외적 패턴이 사라지면서 성능이 퇴화하는 '모델 붕괴' 가능성이 제기됐다. 수학이나 코딩처럼 결과 검증이 쉬운 분야에서는 유용하지만 인간이 만든 데이터를 전면적으로 대체하기는 어렵다는 분석이다. 이 같은 변화로 데이터의 경제적 가치도 달라지고 있다. 오픈AI는 악셀 슈프링어와 뉴스코프 등 미디어 기업과 계약을 맺고 콘텐츠 이용 접근 권한을 확보하고 있다. 레딧도 실시간 데이터 API를 AI 기업에 제공한다. 데이터를 한 번 판매하는 데 그치지 않고 지속적인 접근권을 제공하는 라이선싱 방식이 중요해지고 있다. AI를 활용하는 일반 기업에는 공개 데이터 고갈보다 내부 데이터를 얼마나 제대로 활용할 수 있느냐가 더 중요한 문제다. 거래 운영 로그와 고객 상담 기록, 설계 정비 이력, 현장 계측치 등 외부에서 구하기 어려운 데이터의 상대적 가치가 높아지기 때문이다. 데이터를 많이 보유했다고 곧바로 AI 경쟁력이 생기는 것은 아니다. 여러 시스템에 흩어진 데이터를 정제하고 활용 목적과 권리관계를 명확히 한 뒤 실제 업무와 연결할 수 있어야 한다. 처음부터 모델 학습에 투입하기보다 검색증강생성(RAG)으로 데이터를 활용하고 효과가 확인된 분야부터 사후학습을 확대하는 방식도 대안으로 제시됐다. 그런 가운데 SK텔레콤은 모델, 데이터, 인프라 측면에서 대응하고 있다. 자체 AI 모델 A.X 개발에서는 상대적으로 부족한 고품질 한국어 데이터를 발굴하고 정제하는 데 집중하고, 보유 데이터는 개인정보 보호와 비식별화 등을 전제로 활용한다. AI의 성능 확장 방식이 대규모 사전학습에서 사후학습과 추론 시점 연산으로 넓어지는 데 맞춰 인프라도 강화한다. SK텔레콤은 2029년까지 5GW 규모 AI 데이터센터 구축을 목표로 투자를 추진하고 GPUaaS 사업도 전개하고 있다. SK텔레콤 AI정책연구원은 “데이터 벽 이후 경쟁의 초점이 단순히 더 많은 데이터를 확보하는 데서 보유한 데이터를 실제 AI에 활용할 수 있도록 만드는 역량으로 이동할 것”이라고 내다봤다.

2026.09.07 10:10박수형 기자

AI가 '암산'하기 시작했다…오픈AI 새 추론법에 안전 우려

오픈AI가 인공지능(AI)이 생각하는 과정 일부를 밖으로 드러내지 않는 새로운 추론 기술을 적용한 것으로 알려졌다. AI 판단 과정을 사람이 감시하기 어려워질 수 있어 안전성을 둘러싼 우려가 나오고 있다. 오픈AI는 3일(현지시간) 새로운 AI 모델 'GPT-6 아스트라'를 정식으로 공개했다. 아스트라에는 새로운 추론 기법인 '순환 깊이(recurrent depth)'가 일부 적용된 것으로 알려졌다. 관련 내용은 미국 매체 디인포메이션이 익명 취재원을 인용해 처음 보도했다. 순환 깊이는 같은 연산을 모델 내부에서 여러 차례 반복하는 추론 방식이다. AI가 답을 내놓기 전에 일부 계산을 글로 드러내지 않고 내부에서 이어갈 수 있다. 기존 추론 AI는 어려운 문제를 풀 때 중간 판단을 글로 하나씩 만들어가며 답을 찾는다. 이를 '사고사슬(CoT·Chain of Thought)'이라고 한다. 수학 문제를 풀면서 풀이 과정을 노트에 적는 것과 비슷하다. 순환 깊이는 풀이 과정 일부를 글로 남기지 않고 내부에서 계산한다는 점에서 차이가 있다. 학생이 풀이를 모두 적지 않고 일부는 암산으로 푼다고 볼 수 있다. 이 추론 방식은 같은 연산 구조를 반복해서 사용할 수 있어 모델 크기를 늘리지 않고도 계산 단계를 추가할 수 있다. 기존에는 복잡한 문제를 처리하기 위해 모델 자체를 키우거나 CoT을 길게 생성했다면 또 다른 추론 방법이 생긴 셈이다. 순환 깊이는 AI 안전 측면에서는 새로운 문제를 낳을 수 있다. 학생이 암산하는 부분이 많아질수록 다른 사람이 풀이 과정을 확인하기 어려운 것처럼 AI에서도 사람이 들여다볼 수 있는 영역이 줄어들 수 있어서다. AI가 어떤 과정을 거쳐 답을 내놓는지 알기 어렵다는 '블랙박스' 문제는 오랫동안 AI의 한계로 꼽혀왔다. 모델 내부의 수많은 계산을 사람이 직접 읽기 어렵기 때문이다. 추론 AI의 CoT은 블랙박스를 없애지는 못하지만 중간 판단 일부를 사람이 읽을 수 있게 보여주는 통로 역할을 해왔다. 모델이 해킹이나 속임수 같은 위험한 행동을 계획할 경우 그 흔적이 CoT에 나타나면 이를 찾아낼 수도 있다. 실제 지난 7월 오픈AI의 내부 사이버 보안 평가 과정에서 여러 AI 에이전트가 통제를 우회해 자사 연구 인프라와 허깅페이스 시스템을 침해한 사고에서도 이들이 남긴 기록이 조사에 활용됐다. 순환 깊이의 활용이 늘어나면 사람이 볼 수 있는 이런 통로가 좁아질 수 있다. CoT을 통해 밖으로 드러나던 계산 일부를 모델 내부에서 처리할 수 있어서다. 사람이 확인하기 어려운 '블랙박스' 영역이 다시 넓어질 수 있다는 게 AI 안전 연구자들의 우려다. 오픈AI도 아스트라의 추론 과정을 감시하기가 이전보다 어려워졌다는 점을 인정했다. 회사는 아스트라 공개와 함께 내놓은 안전성 보고서에서 아스트라의 CoT이 이전 모델인 GPT-5.6 솔보다 감시하기 어려워졌다고 밝혔다. 다만 CoT을 이용한 안전 감시는 계속 적용한다는 방침이다. 앤트로픽과 구글 딥마인드도 내부적으로 이 추론 방식의 도입을 논의하는 것으로 알려졌다. 디인포메이션은 두 회사가 관련 기술을 검토하고 있지만 실제 적용 여부나 모델 개발 계획은 확인되지 않았다고 보도했다. 벅 슐레저리스 레드우드 리서치 최고경영자(CEO)는 자신의 X 계정에 "아스트라가 불투명 순환을 쓴다는 보도에 극도로 우려하고 있다"며 "오픈AI가 이 기법을 더 밀어붙이면 순환 횟수를 대폭 늘려 CoT 감시 가능성을 완전히 파괴할 선택지를 갖게 될 것"이라고 밝혔다.

2026.09.04 10:57김동원 기자

에퀴닉스, 엔비디아와 '분산형 AI 추론' 승부수…인프라 연결성 강화

에퀴닉스가 인공지능(AI) 확산으로 복잡해지는 기업 인프라 연결과 추론 환경을 동시에 겨냥한 신규 서비스를 선보였다. 클라우드·네트워크·AI 환경 연결을 자동화하는 동시에 엔비디아·투게더AI와 손잡고 데이터와 사용자 가까이에서 AI 추론을 실행할 수 있는 분산형 인프라 구축에 나선다. 에퀴닉스는 고객·파트너 행사 '에퀴닉스 호라이즌'에서 '에퀴닉스 패브릭 원'과 기업용 분산형 AI 추론 프로그램 '에퀴닉스 인퍼런스 익스체인지'를 공개했다고 3일 밝혔다. 패브릭 원은 기업에 분산된 클라우드와 네트워크, AI 환경을 연결하는 과정을 간소화하기 위한 관리형 '애니-투-애니' 연결 서비스다. AI 도입이 확대되면서 기업이 연결해야 할 클라우드와 AI 서비스 제공업체, 사업장 등이 늘어나는 데 따른 네트워크 운영 복잡성을 줄이는 것에 중점을 뒀다. 특히 아마존웹서비스(AWS)와 구글 클라우드가 공동 개발한 오픈 커넥티비티 사양을 활용한다. 이를 통해 분산된 클라우드와 AI, 기업 환경 전반의 상호운용성을 지원한다는 목표다. 고객이 연결하려는 대상과 요구사항을 지정하면 패브릭 원이 이를 구현하는 데 필요한 연결 방식을 결정해 제공하는 구조다. 기존처럼 네트워크 서비스 구성 요소를 기업이 일일이 조합하고 관리할 필요도 줄였다. 포털과 애플리케이션 프로그래밍 인터페이스(API), 자동화 워크플로우뿐 아니라 에이전트 기반 요청이나 자연어 프롬프트로 필요한 연결 요건을 지정할 수 있다. 이후 패브릭 원이 라우팅과 클라우드 연결, 암호화, 시스템 복원, 장애 조치 등을 자동으로 오케스트레이션하고 관리한다. 향후 기업이 에이전틱 아키텍처를 도입하면 AI 에이전트가 사람의 수동 개입 없이 필요한 연결을 탐색하고 요청·프로비저닝하는 환경까지 지원한다는 구상이다. 에퀴닉스는 AI 인프라 연결뿐 아니라 실제 추론 환경 구축에도 사업 범위를 넓힌다. 이번에 함께 공개한 인퍼런스 익스체인지는 기업이 AI 추론을 데이터와 사용자, 애플리케이션에 가까운 위치에서 실행할 수 있도록 지원하는 분산형 AI 추론 프로그램이다. 최근 기업 AI가 실험을 넘어 실제 운영 단계로 이동하면서 추론을 어느 위치에서 실행할지가 성능과 비용, 데이터 거버넌스 등에 영향을 미치는 요소로 떠오르고 있다는 게 회사 측 설명이다. 인퍼런스 익스체인지는 클라우드와 모델, 제공업체, 지역 등에 분산된 추론 환경을 연결해 기업의 운영 부담을 줄이는 데 초점을 맞췄다. 이를 위해 에퀴닉스는 엔비디아와 기존 협력을 강화하고 투게더AI와 새롭게 손잡았다. 엔비디아의 '엔터프라이즈 레퍼런스 아키텍처'와 200개 이상의 오픈소스 모델을 지원하는 투게더AI 추론 플랫폼을 에퀴닉스의 글로벌 데이터센터 인프라와 결합한다는 방침이다. 에퀴닉스는 전력과 첨단 냉각, 운영 관리 등 기반 인프라를 제공하고 '에퀴닉스 패브릭'을 통해 클라우드·네트워크·AI 서비스 제공업체를 연결한다. 엔비디아는 AI 팩토리의 처리량과 토큰당 비용을 고려한 AI 인프라와 레퍼런스 아키텍처를 제공할 예정이다. 투게더AI는 상위 계층에서 추론 플랫폼을 제공한다. 여러 고객이 자원을 공유하는 멀티테넌트 방식과 전용 용량이 필요한 워크로드를 위한 싱글테넌트 환경을 모두 지원한다. 이를 통해 기업이 워크로드 특성에 따라 AI 추론 인프라를 선택할 수 있도록 하는 구조다. 활용 영역은 사용자·데이터와 가까운 곳에서 추론을 수행하는 '메트로 엣지 추론'부터 폐쇄형 모델에서 오픈소스 모델로 전환하는 '오픈 모델 마이그레이션', 데이터 주권 요건을 고려한 '소버린 AI'까지 포함한다. 특히 소버린 AI는 규제를 받는 산업이나 특정 국가·지역에서 데이터와 추론 처리 위치에 대한 통제권을 유지하면서 AI를 활용할 수 있도록 지원할 방침이다. 이번에 공개된 패브릭 원은 올해 말 베타 버전을 선보인 뒤 내년 북미 지역부터 정식 출시할 예정이다. 인퍼런스 익스체인지는 내년 1분기부터 제공된다. 아데어 폭스-마틴 에퀴닉스 최고경영자(CEO) 겸 사장은 "AI가 가파른 속도로 기업 기술 환경을 바꾸고 있는 만큼, 지금 어떤 인프라를 선택하느냐가 향후 수년간의 경쟁력을 결정지을 것"이라며 "엔비디아와의 오랜 관계를 바탕으로 현대 AI의 핵심인 가속 컴퓨팅 기반을 갖추는 한편, 개방형 에코시스템을 지향하는 투게더AI와의 협력을 통해 각 기업에 최적화된 확장성까지 확보했다"고 밝혔다.

2026.09.03 15:41한정호 기자

엔비디아 "AI 인프라 호황에 내년 매출 70% 이상 성장 전망"

엔비디아가 26일(현지시간) 2분기 실적발표 이후 진행된 컨퍼런스콜에서 "AI 인프라 투자 수요 증가에 따라 내년(회계연도 기준 2028년) 매출이 올해 대비 70% 늘어날 것"이라고 밝혔다. 엔비디아에 따르면 올 2분기(5~7월, 회계연도 기준 2027년 2분기) 매출은 962억 2100만 달러(약 133조 1600억원)로 전년 동기(467억 4300만 달러, 약 64조 6900억원) 대비 두 배 이상 늘어났다. 이날 콜렛 크레스 엔비디아 최고재무책임자(CFO)는 "내년 전체 매출은 올해 대비 70% 늘어날 것"이라고 밝혔다. 젠슨 황 엔비디아 최고경영자(CEO) 역시 "공급망 제약이 없다면 70% 이상도 기대할 수 있다"고 설명했다. 성장을 이끄는 핵심 변수는 에이전틱 AI다. 콜렛 크레스 CFO는 "AI 에이전트가 추론과 계획, 도구 사용을 반복하면서 인간이 동일한 작업을 수행할 때보다 15~100배 많은 연산 자원을 필요로 할 수 있다"고 설명했다. 젠슨 황 CEO는 엔비디아의 경쟁력이 단순한 GPU 성능에 있지 않다고 강조했다. 엔비디아는 데이터 생성·준비, 사전학습, 사후학습, 에이전틱 추론 등 AI의 전체 과정을 하나의 시스템에서 처리할 수 있는 'AI 팩토리' 플랫폼을 구축했다는 설명이다. D램과 고대역폭메모리(HBM), SSD 등 메모리 반도체 뿐만 아니라 데이터센터 전력·시설, 파운드리 등 전체 공급망 제약에 대해 젠슨 황 CEO는 "특정 부품 뿐만 아니라 전력과 냉각, 메모리, 웨이퍼, 각종 시스템 부품 등 공급망 전반에 제약이 있다"고 밝혔다. 이어 "현재 모든 요소를 전력으로 가동하고 있으며 생산능력이 한꺼번에 늘어나는 것이 아니라 매일 조금씩 늘어날 것이다. 현재 엔비디아가 확보한 공급량은 수요의 약 70% 수준이며, 실제 수요는 그보다 훨씬 높다"고 덧붙였다. 콜렛 크레스 CFO는 "AI 인프라 구축 자체가 메모리 부족을 심화시키고 있다. 메모리 가격 상승폭이 당초 예상보다 컸고 내년에도 가격 상승이 이어질 것"이라고 내다봤다. 대규모 투자도 AI 인프라 확대를 뒷받침한다. 엔비디아는 아폴로, 블랙록, 블랙스톤, 브룩필드, 골드만삭스, KKR 등 금융사들과 손잡고 향후 AI 인프라 구축을 위해 5000억 달러(692조 2500억원) 이상의 제3자 자본을 동원하는 금융 플랫폼을 추진하고 있다. 콜렛 크레스 CFO는 "프런티어 AI 연구소들이 컴퓨팅 자원 부족에 직면해 있으며, 엔비디아의 자금 지원은 이들의 성장을 돕는 동시에 투자 수익을 확보하기 위한 것"이라고 설명했다. 젠슨 황 CEO는 "오픈AI와 앤트로픽 등 주요 AI 기업에 대한 투자는 전략적 파트너십의 일환이며 이들이 장기적으로 엔비디아의 주요 고객으로 남을 것"이라고 강조했다.

2026.08.27 09:03권봉석 기자

오픈AI 첫 AI 추론칩 공개…전력 효율·응답 속도 엔비디아 앞서

오픈AI가 자체 개발한 첫 번째 인공지능(AI) 맞춤형 추론 프로세서 '할라피뇨(Jalapeño)' 테스트 결과를 공개했다. 비교 결과 할라피뇨는 전력 효율과 응답 속도에서 엔비디아의 GB200과 GB300 기반 시스템보다 우수한 성능을 보였다. 오픈AI는 26일 GPT-OSS 120B, 딥시크(DeepSeek) R1 670B, 키미(Kimi) K2.5 1T 등 3개 공개 모델을 대상으로 자체 테스트를 진행한 결과를 공식 홈페이지를 통해 발표했다. 오픈AI는 세미애널리시스(SemiAnalysis)의 공개 벤치마크인 인퍼런스엑스(InferenceX)를 활용해 테스트를 진행했다. 그 결과 할라피뇨는 최대 처리량 기준으로 전력당 AI 처리량이 비교 시스템보다 1.51.9배 높았으며, 종단 간 응답 지연시간은 1.73.6배 낮았다고 밝혔다. 사용자와의 상호작용이 많은 워크로드에서는 성능 격차가 더 커졌다. 할라피뇨의 사용자당 디코딩 처리량은 비교 시스템보다 2.1~4.1배 높았다. 디코딩은 AI가 답변을 토큰 단위로 생성하는 과정으로, 사용자 입장에서는 응답 속도와 직접적으로 연결되는 지표다. 모델별로 보면 GPT-OSS 120B 테스트에서 할라피뇨의 전력당 최대 처리량은 초당 8만5448토큰으로, 엔비디아 GB200 기반 비교 시스템의 초당 4만4960토큰보다 1.9배 높았다. 종단 간 응답 지연시간은 1.03초로, 비교 시스템의 1.80초보다 짧았다. 딥시크 R1 670B 테스트에서는 할라피뇨의 전력당 처리량이 비교 시스템보다 1.7배 높았고, 종단 간 응답 지연시간은 3.6배 낮았다. 사용자당 디코딩 처리량은 초당 700토큰으로, 비교 시스템의 초당 169토큰보다 4.1배 높았다. 가장 큰 공개 모델인 키미 K2.5 1T 테스트에서도 할라피뇨는 비교 시스템보다 전력당 최대 처리량이 약 1.5배 높았고, 종단 간 응답 지연시간은 3.4배 낮았다. 사용자당 디코딩 처리량은 약 2.1배 높았다고 오픈AI는 설명했다. 오픈AI는 단순한 칩 단위 성능보다 전력 1킬로와트당 얼마나 많은 AI 작업을 처리할 수 있는지가 실제 서비스 환경에서 더 중요한 기준이라고 강조했다. 특히 AI 에이전트는 하나의 작업을 수행하기 위해 여러 차례 추론을 연속으로 실행하기 때문에 각 단계의 지연시간이 누적될 수 있다. 전력 효율과 응답 속도를 함께 개선하면 더 빠른 응답과 안정적인 서비스 제공이 가능하다는 설명이다. 할라피뇨의 성능 향상은 프로세서 자체뿐 아니라 메모리, 네트워크, 소프트웨어, 서버 시스템을 함께 설계한 결과라고 오픈AI는 밝혔다. AI 추론은 입력된 프롬프트를 처리하는 프리필(prefill) 단계와 답변을 토큰 단위로 생성하는 디코드(decode) 단계로 나뉘는데, 두 단계의 병목이 서로 다르다. 프리필 단계에서는 연산 능력이 중요하지만, 디코드 단계에서는 메모리 대역폭과 데이터 이동이 더 큰 영향을 미친다. 오픈AI는 할라피뇨가 모델 상태와 답변 생성 과정에서 활용되는 케이브이 캐시(KV cache)를 필요한 위치에 가깝게 유지하고, 프로세서 간 데이터 이동과 통신 지연을 줄이는 방식으로 설계됐다고 설명했다. 오픈AI는 할라피뇨 개발 과정에 AI를 직접 활용했다고도 밝혔다. 초기 설계부터 테이프아웃까지 9개월 만에 진행했으며, AI를 활용해 설계안 탐색과 구현, 측정, 검증 과정을 단축했다는 설명이다. 산술 회로 최적화에도 AI를 활용해 제한된 일정 안에 더 많은 연산 성능을 구현할 수 있었다고 덧붙였다. 또한 오픈AI는 코드 생성 도구 코덱스(Codex)와 GPT-아스트라(GPT-Astra)를 활용해 당초 생산 계획에 포함되지 않았던 3개 공개 모델을 두 달 안에 높은 성능으로 구동했다고 밝혔다. GPT-OSS의 일부 어텐션과 전문가 혼합 구조 블록에서는 AI가 생성한 구현이 기존 전문가가 작성한 구현보다 1.5~1.8배 빠르게 실행됐다. 다만 이 수치는 전체 모델이 아닌 일부 블록에 해당한다고 오픈AI는 설명했다. 오픈AI는 올해 말부터 자체 컴퓨팅 인프라에 할라피뇨를 배치할 계획이다. 현재 생산 적격성 검증과 소프트웨어 고도화, 대규모 운영 준비를 진행하고 있으며 더 많은 모델을 대상으로 성능을 검증할 예정이다. 2세대 할라피뇨는 개발이 상당히 진행된 상태이며, 3세대 제품도 설계에 들어갔다고 밝혔다. 다만 오픈AI는 엔비디아와의 협력을 중단하지는 않을 방침이다. 학습과 추론 작업 모두에서 엔비디아를 비롯한 여러 파트너사의 가속기를 계속 폭넓게 활용할 계획이라고 밝혔다. 오픈AI는 "할라피뇨 발표 이후 칩과 이를 중심으로 구축한 시스템에 대한 테스트를 지속해왔다"며 "이번 결과는 유의미한 성능 진전을 보여준다. 할라피뇨는 전력 단위당 더 많은 AI 작업을 처리하면서도 더 빠르게 응답을 반환할 수 있다"고 밝혔다. 이어 "고객 입장에서는 더 빠른 응답, 더 반응성 높은 에이전트, 수요가 늘어나도 더 안정적인 접근성을 의미할 수 있다"며 "이러한 개선은 갈수록 성능이 높아지는 AI를 더 저렴하고 더 폭넓게 이용할 수 있도록 하는 데 기여할 것"이라고 말했다.

2026.08.26 09:17남혁우 기자

망고부스트 "에이전트 시대 DPU·SW 결합…'AI 인프라계 애플' 도약"

인공지능(AI) 기술이 단순 추론을 넘어 스스로 판단하고 복잡한 과업을 수행하는 'AI 에이전트' 시대로 진입하면서, 폭발하는 데이터센터(DC) 워크로드를 감당하기 위한 인프라 혁신이 화두로 떠올랐다. 이에 국내 AI 시스템 반도체 스타트업 망고부스트는 이기종 하드웨어를 유기적으로 연결하는 고성능 '데이터처리장치(DPU)' 설계 기술과 추론 최적화부터 다루는 풀스택 소프트웨어 솔루션을 융합해 글로벌 AI 인프라 시장의 판도를 바꾸겠다는 출사표를 던졌다. 회사는 특정 하드웨어 벤더에 종속되지 않는 개방형 생태계와 개발자 친화적인 환경을 무기로 'AI 데이터센터계의 애플'로 도약한다는 포부다. 망고부스트는 2022년 김장우 서울대 교수가 설립한 AI 시스템 반도체 딥테크 기업이다. DPU 설계 원천기술과 인프라 최적화 소프트웨어를 아우르는 '풀스택(Full-stack) 솔루션'을 앞세워 글로벌 시장을 공략하고 있다. "단일 서버 한계 직면…유기적 연결 가속하는 DPU 필수" 망고부스트는 단일 GPU 서버 중심의 데이터 처리 방식이 이미 물리적, 비용적 한계에 직면했다고 진단한다. 서로 다른 GPU 모델과 원격 저장공간(스토리지), CPU 등을 묶어 하나의 거대한 유기적 시스템으로 동작하게 만드는 과정에서 심각한 데이터 통신 병목이 발생하기 때문이다. 이원석 망고부스트 전략기획팀 팀장은 "추론만 하던 시대에서 본격적인 AI 에이전트 시대가 열리며 처리해야 할 워크로드 단위가 비약적으로 커졌다"며 "동일 기종의 GPU 서버만으로는 전체 성능을 감당할 수 없어 이기종 장치들을 필연적으로 연결해야 하는데, 이때 발생하는 네트워크 오버헤드를 전담 가속하는 DPU가 차세대 데이터센터의 핵심 인프라로 부상하고 있다"고 강조했다. 망고부스트의 DPU는 시장을 과점 중인 엔비디아의 '블루필드(BlueField)'와 대비되는 설계 철학을 지닌다. 이 팀장은 "엔비디아 DPU는 하드웨어 가속을 최소화하고 내부 CPU 중심으로 가동되는 반면, 망고부스트는 하드웨어 가속 비중을 극대화해 극한의 네트워크 성능 향상을 이끌어낸다"고 설명했다. 생태계의 확장성 측면에서도 궤를 달리한다. 이 팀장은 "엔비디아 DPU가 자사 GPU와 소프트웨어에 최적화된 폐쇄적 생태계에 갇혀 있다면, 우리는 특정 벤더에 종속되지 않는 '스위스' 같은 중립적 지위를 지향한다"며 "엔비디아와 AMD GPU는 물론 국내외 이기종 NPU, 다양한 네트워크 스위치 장비까지 완벽히 연결하는 개방형 솔루션을 제공한다"고 말했다. "시장 적기 대응 위해 FPGA 주력…차세대 승부처는 ASIC" 현재 망고부스트는 개발에만 수년이 소요되는 주문형 반도체(ASIC) 대신 필드 프로그래머블 게이트 어레이(FPGA) 기반 DPU 제품 공급에 주력하고 있다. 변화 무쌍한 AI 네트워크 표준에 즉각적으로 대응하기 위해서다. 한성철 망고부스트 HW개발 그룹장은 "AI 데이터센터용 네트워크 요구사항이 쉼 없이 변하는 상황에서, 하드웨어 구조를 유연하게 바꿀 수 있는 FPGA 제품이 신규 프로토콜을 가장 신속하게 지원할 수 있는 무기"라고 말했다. 비용 효율성에 대해서도 소신을 밝혔다. 한 그룹장은 "초기 매몰 비용 감안하면 대량 양산 전 적정 수량 단계에서는 FPGA가 훨씬 경제적이며, 전체 GPU 랙(Rack) 시스템 관점에서는 총소유비용(TCO) 절감 효과가 압도적"이라면서도 "데이터 전송량과 전력 효율 니즈가 극대화되는 시점에 맞춰 ASIC으로 승부하기 위해 철저하게 준비 단계를 거치고 있다"고 말했다. 실제로 보수적인 기준에서도 망고부스트의 솔루션은 동급 시스템 대비 약 30%의 TCO 절감 효과를 내는 것으로 파악됐다. 이러한 기술력은 대규모 투자와 글로벌 파트너십 확대로 이어지고 있다. 최근 AMD의 리사 수 최고경영자(CEO)가 직접 방문해 긴밀한 파트너십을 논의했으며, 해외 대형 하이퍼스케일러들과의 공동 솔루션 구축도 활발히 진행 중이다. 국내에서는 주요 K-클라우드 국책 사업 참여와 더불어 국산 NPU 기업들과의 시스템 연동을 강화하고 있다. 현재 누적 투자 유치액 1억 달러(약 1300억원)를 넘긴 상태로, 시리즈 B 펀딩 마무리도 눈앞에 뒀다. 미국 법인을 거점으로 글로벌 인재 확보에도 사활을 걸고 있다. 한 그룹장은 "단순히 DPU 반도체 부품이나 단품 소프트웨어를 파는 회사에 머물지 않겠다"며 "특정 하드웨어에 얽매이지 않고 모든 에코시스템을 유기적으로 엮어 최고 가성비의 시스템 최적화를 이끌어내는 리더, 즉 'AI 데이터센터계의 애플'로 도약할 것"이라고 포부를 밝혔다. '망고 LLM 부스트'로 추론 최적화…SDK로 DPU 문턱 낮춰 망고부스트는 AI 추론 소프트웨어 '망고 LLM 부스트'와 소프트웨어 개발 키트(SDK)를 앞세워 AI 인프라 영역을 넓히고 있다. DPU를 넘어 추론 최적화와 데이터 이동, AI 에이전트 라우팅까지 아우르는 SW 스택을 구축에 한창이다. 김창수 망고부스트 어드밴스드 AI 팀장은 망고 LLM 부스트가 가상거대언어모델(vLLM) 같은 일반 LLM 추론 프레임워크보다 넓은 범위를 다룬다고 강조했다. 기존 프레임워크가 GPU에서 LLM을 구동하는 데만 초점 맞춘다면, 망고 LLM 부스트는 여러 추론 작업을 관리하고 사용자 요청을 적절한 GPU로 보내는 기능까지 지원한다는 설명이다. 김 팀장은 AI 에이전트 시대에 망고 LLM 부스트 역할이 더 커질 것으로 봤다. 에이전트가 긴 대화와 복잡한 작업을 수행할수록 LLM이 앞서 계산한 내용을 임시 저장하는 'KV 캐시'도 덩달아 늘어나서다. 그는 "망고 LLM 부스트는 방대한 KV 캐시를 저장하고 재사용하거나, 필요한 GPU로 옮기는 과정을 관리한다"며 "한번 계산한 내용을 재활용하면 같은 연산을 반복하지 않아도 돼 추론 속도를 높일 수 있다"고 설명했다. 이어 "KV 캐시가 커져 GPU에 모두 보관하기 어려워지면 스토리지나 다른 GPU로 데이터를 옮겨야 한다"며 "이때 LLM 부스트가 캐시 저장 활용을 돕고, DPU가 실제 데이터 이동을 지원하는 양방향 구조로 작동한다"고 덧붙였다. 망고부스트는 SDK를 통해 DPU 사용 문턱도 낮추고 있다. 개발자가 DPU 구조나 복잡한 저수준 프로그래밍을 직접 익히지 않아도 주요 기능을 쓸 수 있도록 지원하는 방식이다. 김 팀장은 "DPU를 직접 프로그래밍하려면 새로운 개발 환경을 익혀야 해 부담이 크다"며 "개발자가 필요한 기능만 쉽게 가져다 쓸 수 있도록 만드는 것이 SDK 목표"라고 설명했다. 망고인퍼런스는 추론 환경에서 데이터 병목을 해결하는 DPU 부스트X(BoostX) 기술과 에이전트 운영체제(OS)를 효율화하는 'LLM 부스트'를 결합한 형태다. 개발자가 익숙한 API 형태로 AI 인프라 기능을 손쉽게 활용할 수 있도록 지원한다. 개발자와 스타트업 등은 HW 를 직접 제어하거나 복잡한 구현을 수행할 필요 없이 API 호출만으로 필요한 기능을 간편하게 활용할 수 있다. 망고인퍼런스는 올해 하반기 출시될 예정이다.

2026.08.19 14:57전화평 기자

AI추론 확산...프론트엔드 스위치 시장 커진다

AI 인프라 무게중심이 대규모 모델 학습에서 추론과 에이전틱 AI로 이동하면서 데이터센터 네트워크 투자 대상도 달라질 것이란 전망이 나왔다. GPU를 대규모로 연결하는 백엔드 네트워크뿐 아니라 CPU와 스토리지 등을 연결하는 프론트엔드 네트워크 수요가 빠르게 늘어날 것이라는 분석이다. 17일 시장조사업체 델오로그룹에 따르면 최근 AI 추론과 에이전틱 AI 확산으로 프론트엔드 데이터센터 네트워크 시장이 크게 성장할 것으로 전망됐다. 델오로는 향후 프론트엔드 데이터센터 스위치 매출 증가분의 50% 이상을 AI 관련 수요가 차지할 것으로 예상했다. AI에서 파생되는 프론트엔드 네트워크 수요는 연평균 약 40% 성장할 것으로 내다봤다. 기존 AI 인프라는 대규모 모델을 학습시키기 위해 수많은 GPU 등 가속기를 서로 연결하는 데 초점이 맞춰졌다. 이 때문에 GPU 간 대용량 데이터를 빠르게 주고받도록 하는 백엔드 네트워크가 중요했다. 하지만 AI 서비스가 학습을 넘어 실제 이용자에게 답변을 제공하는 추론 단계로 확대되고, 여러 작업을 스스로 수행하는 AI 에이전트가 확산하면서 CPU와 스토리지 등 범용 인프라의 역할도 커지고 있다. 이들 장비와 외부 서비스 등을 연결하는 프론트엔드 네트워크에도 더 많은 투자가 필요해진다는 설명이다. 사메 부젤벤 델오로그룹 부사장은 “AI 인프라가 대규모 학습에서 추론과 에이전틱 워크플로로 이동하면서 범용 인프라 수요가 증가하고 프론트엔드 네트워크 요구도 확대되고 있다”고 설명했다. 이 같은 변화는 AI 데이터센터의 GPU와 CPU 구성 비율에도 영향을 미치고 있다. 델오로에 따르면 기존에는 GPU 등 XPU 10개당 CPU 1개를 배치하는 10대 1 비율이 일반적인 가정으로 활용됐다. 하지만 추론과 에이전틱 AI를 처리하는 일부 환경에서는 이 비율이 1대 1 수준까지 변화하고 있다. 추론 환경에서는 CPU가 AI 작업을 조율하고 데이터를 필요한 곳으로 이동시키는 역할을 담당하기 때문이다. GPU 성능만 높이는 것으로는 전체 AI 서비스를 효율적으로 운영하기 어려워지면서 CPU와 이를 연결하는 네트워크의 중요성도 함께 높아지는 셈이다. AI 추론에 활용되는 키-값(KV) 캐시 스토리지도 새로운 네트워크 수요를 만들고 있다. AI가 이전에 처리한 정보를 저장해 반복적인 연산을 줄이는 KV 캐시 활용이 늘어나면서 관련 스토리지 랙을 연결하기 위한 네트워크도 필요해지고 있다는 설명이다. 결국 AI 데이터센터 네트워크 시장의 성장축이 GPU 클러스터를 연결하는 백엔드에만 머무르지 않고 CPU와 스토리지 등을 연결하는 프론트엔드까지 확대되는 흐름이다. 델오로는 이에 따라 액톤, 아리스타, 셀레스티카, 시스코, HPE·주니퍼, H3C, 화웨이, 엔비디아 등을 시장 확대의 주요 수혜 업체로 꼽았다. 델오로는 AI 추론과 에이전트 시장이 확대될수록 프론트엔드 네트워크 투자가 함께 늘면서 기존 네트워크 장비업체뿐 아니라 신규 사업자에도 성장 기회가 생길 것으로 점쳤다.

2026.08.17 12:52박수형 기자

퓨리오사AI, 스웨덴 스톡홀름 AI 데이터센터 구축 참여…RNGD 8800장 공급

인공지능(AI) 반도체 기업 퓨리오사AI가 스웨덴 스톡홀름에서 추진되는 차세대 AI 데이터센터 구축 사업에 참여한다. 퓨리오사AI는 미국 AI 인프라 기업 I/ONX HPC, 데이터센터 개발·운영 기업 벨록스(Velox)와 함께 스톡홀름 AI 데이터센터 프로젝트에 참여한다고 5일 밝혔다. 이번 프로젝트는 총 15MW(메가와트) 규모로 조성한다. 2027년 초 2MW 규모 1단계 시설을 우선 가동하고 연내 8MW를 추가 구축한다. 이후 장기적으로 15MW까지 시설을 확대한다. 퓨리오사AI는 1단계 사업에 AI 추론 가속기 'RNGD(레니게이드)' 1800장을 공급한다. 향후 확장 단계를 포함해 총 8800장 이상 레니게이드를 순차 납품할 예정이다. 레니게이드는 I/ONX HPC의 AI 서버 플랫폼 '심포니 식스티포(Symphony SixtyFour)'에 탑재돼 그래픽처리장치(GPU)와 함께 이기종 컴퓨팅 환경을 구성한다. 레니게이드는 대규모 언어모델(LLM) 및 에이전틱 AI 추론 연산을 담당한다. 프로젝트에서 퓨리오사AI는 하드웨어와 소프트웨어 스택을 제공한다. 벨록스는 데이터센터 개발 및 운영을 맡으며, I/ONX HPC는 시스템 통합과 AI 플랫폼을 담당한다. 백준호 퓨리오사AI 대표는 "이번 프로젝트는 RNGD가 유럽 대규모 데이터센터에 도입되는 사례"라며 "글로벌 파트너들과 차세대 AI 추론 인프라 확산을 이어가겠다"라고 말했다.

2026.08.05 09:10전화평 기자

[AI 고속도로] AWS CEO "AI 사업 잠재력 막대…데이터센터 투자 늘린다"

아마존웹서비스(AWS)가 생성형 인공지능(AI) 활용이 모델 학습을 넘어 실제 서비스 운영 단계로 확산되면서 클라우드 수요가 빠르게 늘고 있다고 밝혔다. 이에 맞춰 데이터센터와 AI 인프라 투자를 확대하며 장기 성장 기반 확보에 속도를 내겠다는 목표다. 맷 가먼 AWS 최고경영자(CEO)는 4일(현지시간) 공개된 블룸버그와의 인터뷰에서 "AI 사업의 잠재력은 그야말로 막대하다"며 "기업들이 AI 모델을 학습하는 단계를 넘어 실제 업무에 AI를 적용하기 시작하면서 추론 수요가 빠르게 증가하고 있다"고 밝혔다. 가먼 CEO는 최근 기업들의 AI 활용 방식이 빠르게 변화하고 있다고 설명했다. 초기에는 거대언어모델(LLM) 학습을 위한 대규모 그래픽처리장치(GPU) 클러스터 구축이 중심이었다면, 이제는 완성된 AI 모델을 실제 서비스와 업무에 적용하는 추론 중심의 워크로드가 빠르게 늘고 있다는 평가다. 그는 "여전히 대규모 학습 클러스터 수요도 이어지고 있지만 AI 모델이 더욱 강력해질수록 더 많은 기업이 자사 업무에 추론 기능을 통합하고 있다"며 "AI 인프라 수요는 앞으로도 확대될 것"이라고 내다봤다. 이같은 흐름은 AWS 실적에서도 확인된다. 아마존이 지난달 30일(현지시간) 발표한 올해 2분기 실적에 따르면 AWS 매출은 전년 동기 대비 37% 증가한 422억 3200만 달러(약 60조 4255억원)를 기록했다. 최근 18개 분기 가운데 가장 높은 성장률이다. 영업이익은 166억 2100만 달러(약 23조 7896억원)로 전년보다 64% 늘며 아마존 전체 영업이익의 절반 이상을 차지했다. AI 투자 확대에 따른 비용 부담도 커졌다. 아마존은 데이터센터·서버·메모리 등 AI 인프라 투자 확대에 따라 올해 자본지출(CAPEX) 전망치를 기존 2000억 달러(약 286조원)에서 2200억 달러(약 314조원)로 상향 조정했다. 잉여현금흐름(FCF)은 대규모 설비투자 영향으로 적자로 전환했지만 AWS의 성장세가 투자 회수에 대한 시장 우려를 상당 부분 상쇄했다는 평가가 나온다. 시장도 긍정적으로 반응했다. 아마존 주가는 실적 발표 이후 상승세를 이어가며 3일(현지시간) 시가총액 3조 달러(약 4293조원)를 처음 돌파했다. AWS가 약 4년 만에 가장 높은 성장률을 기록한 데다 AI 인프라 투자 확대 기조를 재확인하면서 투자 심리가 개선된 영향으로 분석된다. 이에 마이크로소프트(MS)·메타·알파벳 등 다른 빅테크와 AI 인프라 기업들의 주가도 함께 상승했다. 가먼 CEO는 AWS가 향후 데이터센터 투자 계획도 장기 수요를 바탕으로 추진하고 있다고 설명했다. 그는 "우리는 고객들과 5년 단위 장기 계약을 체결하며 신규 데이터센터 수요를 예측 중"이라며 "현재도 수요가 공급을 크게 웃돌고 있어 고객들이 원하는 규모를 맞추기 위해 지속적으로 구축하고 투자할 것"이라고 말했다.

2026.08.04 10:24한정호 기자

오케스트로-넷앱, AI 추론·데이터 묶는다…통합 인프라 풀스택 강화

오케스트로와 넷앱이 기업용 인공지능(AI) 서비스 운영을 위한 통합 인프라 개발에 나선다. AI 추론 환경과 데이터 관리, 재해복구(DR)를 단일 아키텍처로 결합해 안정적인 AI 서비스 운영 기반을 마련한다는 목표다. 오케스트로는 넷앱과 AI 추론 및 DR 역량 강화를 위한 업무협약(MOU)을 체결했다고 22일 밝혔다. 최근 기업 AI 도입이 시범 운영을 넘어 실제 서비스 단계로 확대되면서 AI 인프라의 역할도 커지고 있다. 단순히 그래픽처리장치(GPU) 등 연산 자원을 확보하는 수준을 넘어 대규모 데이터를 안정적으로 처리·보호하고 장애 발생 시에도 서비스를 지속할 수 있는 데이터 인프라와 DR 체계가 핵심 요소로 부상하는 상황이다. 이번 협약으로 양사는 오케스트로 AI 인프라 풀스택 소프트웨어(SW)와 넷앱의 데이터 오케스트레이션 및 엔터프라이즈급 DR 기술을 결합해 AI 추론 서비스에 최적화된 통합 아키텍처를 공동 개발할 계획이다. 데이터 파이프라인을 고도화하고 AI 서비스 운영 안정성을 높인다는 구상이다. 오케스트로는 서버 가상화 솔루션 '콘트라베이스', 클라우드 네이티브 운영관리 플랫폼 '비올라', AI 추론 운영 플랫폼 '콘체르토 AI' 등을 기반으로 AI 인프라 운영에 필요한 풀스택 SW를 제공 중이다. AI 서비스 구축부터 인프라 운영, 추론 관리, 통합 관제까지 하나의 체계에서 지원하는 것이 특징이다. 넷앱은 AI 데이터 파이프라인 운영에 필요한 데이터 관리 역량을 제공한다. 협약에 따라 오케스트로는 API 기반 연동으로 넷앱 스토리지 기능을 자사 플랫폼에 통합하고 넷앱은 테스트용 하드웨어와 전담 엔지니어링 지원을 제공할 예정이다. 아울러 넷앱 테크놀로지 얼라이언스 프로그램 기반 AI·데이터 인프라 생태계 공동 개발을 비롯해 GPU 가속 기반 AI 추론과 대규모 데이터 파이프라인, 고성능 스토리지 통합 검증도 추진할 방침이다. 기업용 AI·클라우드 구축을 위한 액티브-액티브 DR 참조 아키텍처와 운영 모델도 공동으로 마련할 계획이다. 아울러 국내외 시장을 겨냥한 공동 고투마켓(GTM) 전략도 추진한다. 양사는 AI 추론 서비스 운영에 최적화된 데이터 인프라를 제공하는 동시에 비즈니스 연속성과 데이터 안정성을 강화해 국내 AI·클라우드 시장 공략에 나선다는 목표다. 오케스트로는 이번 협력을 계기로 AI 인프라부터 데이터 관리, DR까지 아우르는 풀스택 SW 사업을 확대할 계획이다. 김범재 오케스트로 대표는 "AI가 실제 산업 현장으로 확산되면서 기업들은 AI 추론 성능뿐 아니라 데이터 안정성, 서비스 연속성까지 함께 확보해야 하는 과제를 안고 있다"며 "이번 협약을 통해 우리 AI 인프라 풀스택 소프트웨어 기술과 넷앱의 데이터 인프라 전문성을 결합, 기업 고객이 AI 서비스를 안정적으로 운영할 수 있는 통합 아키텍처를 구현해 나가겠다"고 밝혔다. 유재성 한국넷앱 대표는 "기업들은 AI 도입을 확대하고자 하지만 성능과 비용 효율성 간 균형을 맞춰야 하는 부담을 안고 있다"며 "우리는 AI에 최적화된 데이터 관리 역량 포트폴리오를 바탕으로 기업이 워크로드에 따라 인프라를 유연하게 구성하고 비용을 최적화할 수 있는 견고한 데이터 기반을 구축하도록 지원하고 있다"고 말했다. 이어 "오케스트로와의 협력은 기업이 엔터프라이즈 AI를 확장할 수 있도록 지원하겠다는 우리의 의지"라며 "고성능 AI 워크로드를 지원하고 거버넌스가 적용된 안전한 데이터에 즉시 접근할 수 있도록 해 운영 안정성과 데이터 보호를 보장하는 지능형 데이터 인프라로기업 AI 확장을 지원할 것"이라고 덧붙였다.

2026.07.22 16:46한정호 기자

팀스파르타 초경량 언어모델, 'K-AI 리더보드' 초고난도 추론 1위

팀스파르타(대표 이범규)가 자체 개발한 초경량 언어모델 'K-AX 스파르탄 1.8B'가 과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 운영하는 'K-AI 리더보드'의 초고난도 추론 평가인 'HLE(Ko)' 분야에서 1위를 차지했다. 이번 성과에 대해 회사는 "대형 모델 중심의 AI 시장에서 독자적인 초경량 모델의 압도적인 효율성과 고난도 추론 성능을 입증했다는 점에서 의의가 크다"고 밝혔다. HLE(Humanity's Last Exam)는 미국 AI안전센터와 스케일AI가 공동 개발한 초고난도 AI 추론 벤치마크다. 수학, 과학, 인문학 등 100여 개 분야 전문가가 출제한 2500개 문항으로 구성돼 최상위 AI 모델조차 통과가 까다로운 평가로 알려져 있으며, K-AI 리더보드의 핵심 평가 지표 중 하나다. HLE(Ko)에서 평가에서 'K-AX 스파르탄 1.8B'는 0.123점을 기록하며 2위 모델(0.077점) 대비 4.6%포인트, 약 60% 높은 성능을 보였다. 10위권 모델 대부분이 0.068~0.077점대에 분포한 가운데 단독 선두에 오른 것이다. 18억 개 파라미터의 초경량 모델이 수백억에서 수천억 개 규모의 대형 모델들을 제친 결과로, 상위 10개 모델의 평균(약 38.7B)과 비교하면 20분의 1 크기로 거둔 성과다. 특히 236B급 모델 대비 파라미터는 131분의 1에 불과하지만, 점수는 두 배 이상 높았다. 메모리 요구량도 약 256M에 불과해 CCTV나 초소형 컴퓨터인 라즈베리 파이(Raspberry PI)처럼 고도로 제한된 환경에서도 고난도 추론을 한다. 236B급 대형 모델을 구동하려면 수백 GB 메모리의 멀티 GPU 클러스터가 필요한 데 반해 하드웨어 요구량이 100분의 1 이하다. 즉, 거대 모델이 데이터센터의 GPU 서버 한 대가 필요할 때 K-AX 스파르탄 1.8B는 초소형 컴퓨터 한 대에 들어가는 셈으로, 고난도 추론 성능은 유지하면서 AI 인프라 비용을 90% 이상 낮출 수 있는 구조다. 비결은 자체 개발한 학습 방법론 'SGT·SSGT'에 있다. 문장 전체 토큰을 고르게 학습하는 기존 방식과 달리, 추론의 방향을 좌우하는 핵심 토큰을 선별해 학습을 집중하고, 답변 과정에서 오류 가능성을 점검해 스스로 경로를 수정하는 자기 교정 학습을 결합했다. 팀스파르타는 검증된 방법론을 대형화해 주력 프런티어 모델 'K-AX 스파르탄 122B'를 완성했다. 양자화(경량화) 기술을 적용해 기업 내부 장비에서도 운용된다. 122B를 엔진으로 쓰는 'AX 포트리스'는 인터넷과 분리된 폐쇄망에서 작동하는 AI 코딩 에이전트다. 소스코드와 내부 데이터를 외부로 보내지 않고 코드 생성, 자동완성, 검토부터 빌드, 테스트, 배포 도구 호출까지 수행하며, 자동완성 응답 속도는 워크스테이션 한 대 기준 0.3초 미만으로 실측됐다. 주요 대상은 금융·공공·국방·제조 등 외부 생성형 AI 사용이 제한되는 분야다. AX 포트리스를 사용하면, 정보 유출 우려로 클라우드 기반 코딩 도구를 도입하지 못한 기업도 사내망에서 AI 개발 환경을 구축할 수 있다. 보안관제 분야에서는 도메인 특화 학습과 내부 관제 시스템 연동 검증을 마쳤으며, 향후 법률 문서 검토, 금융 규제 해석, 의료 가이드라인 분석 등 복합적인 판단이 필요한 업무로 적용 범위를 넓힐 계획이다. 이범규 팀스파르타 대표는 “이번 1위는 팀스파르타의 독자적인 설계와 학습 기술만으로 세계적 수준의 추론 성능을 구현할 수 있음을 입증한 결과”라며 “검증된 기술을 적용한 K-AX 스파르탄 122B와 AX 포트리스를 기반으로 보안과 생산성이 함께 필요한 기업의 실질적인 AX를 적극 지원하겠다”고 밝혔다.

2026.07.20 18:30백봉삼 기자

삼성SDS, 퓨리오사AI 기반 'NPUaaS' 출시…인프라 선택권 확장

삼성SDS가 정부의 국산 인공지능(AI) 반도체 확산 기조에 발맞춰 클라우드 기반 서비스형 신경망처리장치(NPUaaS)를 선보이며 고객 인프라 선택권 확장에 나선다. 삼성SDS는 퓨리오사AI의 2세대 NPU '레니게이드(RNGD)'를 기반으로 한 NPUaaS를 삼성 클라우드 플랫폼(SCP)에 탑재·출시했다고 20일 밝혔다. 레니게이드는 AI 추론에 특화된 국산 NPU로, 이미 학습된 AI 모델을 실제 서비스에 적용해 답변 생성, 문서 분석, 이미지 판별 등을 처리하는 단계에서 GPU 대비 전력 효율성과 가성비가 뛰어난 것으로 평가된다. 삼성SDS의 NPUaaS 고객은 NPU 서버를 직접 구매하거나 자체 데이터센터에 구축하지 않고도 SCP를 통해 구독형으로 사용할 수 있다. 기업 수요와 데이터 규모에 따라 NPU를 원하는 장수 단위로 자유롭게 선택할 수 있도록 해 스타트업부터 대기업까지 AI 서비스 규모에 맞춰 활용할 수 있게 지원한다. 또 고성능 스토리지와 컴퓨트, 고속 네트워크 등 SCP의 다양한 상품들과 연계해 유연한 사용을 돕는다. 특히 삼성SDS는 이번 NPUaaS를 SCP의 소버린 클라우드 환경으로 제공해 엄격한 보안 규제를 적용받는 공공 고객도 안심하고 이용할 수 있도록 지원할 계획이다. 회사는 이번 NPUaaS 출시를 통해 기존 서비스형 그래픽처리장치(GPUaaS)는 물론 NPU 기반 연산 자원까지 확대하면서, 고객 AI 인프라 선택권 확대와 국산 NPU 기반 AI 인프라 확산 및 소버린 AI 구축에 앞장선다는 목표다. 이호준 삼성SDS 클라우드서비스사업부장은 "이번 NPUaaS 출시는 단순히 새로운 클라우드 상품을 선보이는 것을 넘어 고객이 고성능 AI 기술을 더 유연하고 가성비 높게 사용할 수 있다는 데 의의가 있다"며 "앞으로도 고객 니즈 해결을 위해 SCP 기반 상품을 다양화하고 클라우드 AI 기술 생태계를 지속 선도해 나갈 것"이라고 밝혔다.

2026.07.20 10:49한정호 기자

  Prev 1 2 3 4 5 6 Next  

지금 뜨는 기사

이시각 헤드라인

[인터뷰] 韓 공략 시동 건 코어위브…데이터센터 협력·추론 사업 키운다

먹고 입고 쓰는 한글…유통업계, 한글날 제정 100주년 마케팅 활발

삼성·TSMC, 올 3분기도 파운드리 '희비교차'…점유율 격차 확대 전망

최태원 "호남 반도체 팹, 용인 3분의 2 규모 검토...속도감 있게 추진"

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.