[AI는 지금] 오픈AI·앤트로픽·구글·메타, 9월 신모델 러시…AI 경쟁, '성능·효율'로 확전
오픈AI와 앤트로픽, 구글, 메타가 9월 들어 잇따라 최신 인공지능(AI) 모델을 내놓으며 하반기 모델 경쟁에 불을 붙였다. 앤트로픽과 오픈AI가 코딩·사이버 보안 등 프런티어 모델의 성능 한계를 끌어올린 가운데 구글과 메타는 상대적으로 저렴한 경량 모델의 에이전트·코딩 성능과 비용 효율을 높이는 데 속도를 내는 분위기다. 3일 업계에 따르면 구글과 메타는 지난 2일(현지시간) 각각 '제미나이 3.8 플래시'와 '뮤즈 스파크 1.3'을 공개했다. 이달 1일에는 앤트로픽이 '클로드 페이블 5.1'을 내놨으며 오픈AI도 차세대 모델 '아스트라'의 출시를 예고해 눈길을 끌었다. 각 업체들이 비슷한 시기에 신모델을 내놨지만 전략은 갈렸다. 앤트로픽과 오픈AI가 최고 성능 모델의 코딩·사이버 능력을 끌어올리는 데 힘을 준 반면, 구글과 메타는 상대적으로 저렴한 경량 모델의 성능과 활용도를 높이는 데 집중했다. 특히 구글은 이번에도 최고 성능 모델인 '프로' 대신 '플래시'를 또 다시 앞세워 눈길을 끌었다. '프로' 계열은 지난 2월 '제미나이 3.1 프로' 이후 반년 넘게 후속 모델이 나오지 않은 상태다. 앞서 구글은 지난 5월 연례 개발자 행사 '구글 I/O 2026'에서 '제미나이 3.5 프로'를 6월 중 출시하겠다고 예고했지만, 일정은 계속 미뤄지고 있다. 월스트리트저널(WSJ)에 따르면 개발 과정에서 일부 '제미나이 3.5 프로' 후보 모델은 플래시 계열보다 충분한 성능 우위를 확보하지 못해 폐기된 것으로 전해졌다. 이에 구글은 최근 플래시 모델로 방향을 튼 모습이다. 지난 7월 3.6 플래시, 지난달 3.7 플래시에 이어 이번 3.8 플래시까지 6주 사이 세 번째 모델을 잇따라 내놓은 것이다. 이번에 선보인 제미나이 3.8 플래시는 소프트웨어 엔지니어링과 장시간 에이전트 작업, 복잡한 추론 능력을 강화했다. 구글은 이를 가장 지능적인 '워크호스' 모델로 소개하면서 입력 100만 토큰당 0.75달러, 출력 3.75달러로 기존 3.7 플래시와 같은 가격을 유지했다. 코딩 성능도 크게 끌어올렸다. 구글에 따르면 장기 소프트웨어 엔지니어링 평가인 '딥SWE v1.1'에서 제미나이 3.8 플래시는 상당수 대형 프런티어 모델을 앞섰다. 복잡한 작업에서는 추가 추론과 반복적인 도구 호출을 통해 결과를 개선하도록 설계했다. 구글은 사이버 보안 특화 모델인 '제미나이 3.8 플래시 사이버'도 이번에 함께 내놨다. 취약점 탐지와 자동 패치에 초점을 맞춘 모델로, 정부 기관과 주요 인프라 운영자, 소프트웨어 유지관리자 등 검증된 사용자에게 우선 제공된다. 같은 날 경량 모델인 '뮤즈 스파크 1.3'을 공개한 메타도 구글과 비슷한 전략을 내세우는 모습이다. 메타는 지난 4월부터 '뮤즈 스파크'보다 더 크고 강력한 모델을 개발 중이라고 밝혀왔지만, 아직 프론티어급 모델은 공개하지 않고 있다.대신 메타는 스파크 계열을 잇따라 고도화하며 코딩과 에이전트 등 실사용 영역에서 경쟁력을 높이고 있다. 이번에 공개한 '뮤즈 스파크 1.3'은 하나의 긴 대화 안에서 여러 업무를 처리하고 외부 도구를 사용해 정보를 수집하며 작업 계획을 보완하는 장기 에이전트 능력을 강화한 것이 특징이다. 비용 효율도 높였다. 메타는 이전 버전인 스파크 1.2와 비교해 도구 호출을 약 20%, 토큰 사용량을 약 25% 줄였다고 밝혔다. 이처럼 구글과 메타가 경량 모델의 실사용 성능과 비용 효율을 높이는 사이 앤트로픽과 오픈AI는 프런티어 모델의 성능 상한을 끌어올리는 데 집중하고 있다. 실제 앤트로픽이 이달 공개한 '클로드 페이블 5.1'은 기존 페이블 5보다 장시간 코딩과 과학 업무 수행 능력을 강화한 것이 특징이다. 특히 코딩과 컴퓨터 작업 능력을 평가하는 '터미널 벤치 4.0'에서는 55.8%를 기록해 기존 페이블 5의 42.0%를 웃돌았다. 과학 업무 평가 점수도 24.7%에서 52.6%로 높아졌다. 또 앤트로픽은 기본 토큰 가격은 유지하면서 캐시 읽기 비용은 75% 낮췄다. 장시간 에이전트 업무에서 이전 작업 내용을 반복적으로 불러올 때 발생하는 비용 부담을 줄이기 위한 조치다. 이에 맞서 오픈AI는 차세대 모델 '아스트라'를 앞세워 사이버 보안 성능을 끌어올리고 있다. 또 아스트라는 자체 준비성 프레임워크에서 사이버 보안 능력의 '크리티컬' 기준에 도달했다. 이는 적절한 도구와 시스템 접근 권한이 주어질 경우 사람이 각 단계를 지시하지 않아도 알려지지 않은 소프트웨어 취약점을 찾아내고 이를 악용할 방법까지 개발할 수 있는 수준이라는 의미다. 이에 오픈AI는 '아스트라'의 높은 위험성을 고려해 사용 범위를 제한키로 했다. 고급 사이버 기능은 초기 일부 테스터에게 먼저 제공한 뒤 방어 목적의 프로그램을 통해 승인된 사용자로 확대할 예정이다. 또 허가받지 않은 행동을 감시하고 의심스러운 활동을 자동으로 중단하는 안전장치도 강화했다. 오픈AI는 "모델이 더 중요한 업무를 수행할 수 있게 되면서 정렬과 통제 실패가 미치는 영향도 더 심각해질 수 있다"며 "보호 조치가 충분하지 않을 경우 개발 속도를 늦출 의지도 필요하다"고 밝혔다. 업계에선 이번 신모델 경쟁이 기업들의 AI 도입 방식에도 영향을 줄 것으로 보고 있다. 최고 성능이 필요한 코딩·과학·사이버 보안 업무에는 프런티어 모델을 쓰고, 반복 호출이 많은 에이전트 업무에는 상대적으로 저렴한 경량 모델을 적용하는 식으로 활용 방식이 세분화될 가능성이 커졌기 때문이다. 모델 선택 기준도 단순 벤치마크 점수에서 벗어나고 있다. 실제 업무를 끝내는 데 필요한 토큰 사용량과 도구 호출 횟수, 처리 속도, 안정성까지 함께 따져야 전체 운영 비용을 비교할 수 있어서다. 업계 관계자는 "경량 모델이 빠르게 고도화되면서 기업들이 프런티어 모델에만 의존할 필요가 줄어들고 있다"며 "앞으로 AI 업체들은 최고 성능을 끌어올리는 것과 동시에 실제 서비스에서 얼마나 낮은 비용으로 안정적인 성능을 제공할 수 있는지를 놓고 경쟁하게 될 것"이라고 말했다.