검색 - IT세상을 바꾸는 힘 지디넷코리아

ZDNet 검색 페이지

'테스트타임 컴퓨팅'통합검색 결과 입니다. (3건)

태그
기간
- 3개월
- 1년
- 1년 이전

재검색

구글 '제미나이 2.5'로 추론형 AI 전면전…기술 주도권 겨눈다

구글 딥마인드가 추론하는 차세대 인공지능(AI) 모델을 선보였다. 복잡한 문제 해결을 위한 '사고형 AI'로 본격 진화하며 추론 및 코딩 성능을 강화해 오픈AI, 앤트로픽 등 경쟁사에 대응하기 위해서다. 26일 구글 공식 블로그에 따르면 구글의 AI 자회사인 딥마인드는 '제미나이 2.5 프로 익스페리멘털'을 실험적으로 출시했다. 이 모델은 출시 직후 AI 성능을 인간 기준으로 평가하는 벤치마크인 LM아레나(LMArena)에서 1위에 올랐으며 구글 AI 스튜디오와 '제미나이' 앱에서 우선 제공된다. 기업용 플랫폼인 '버텍스' AI에는 추후 탑재될 예정이다. '제미나이 2.5'는 응답 전 사고 과정을 거치는 '생각하는 모델'로 설계됐다. 단순한 분류와 예측을 넘어 맥락 분석과 논리적 판단을 기반으로 복잡한 문제를 풀 수 있는 구조다. 구글은 이를 통해 복합적 상황에서도 에이전트가 자율적으로 판단할 수 있도록 지원할 계획이다. 사고형 AI 기반으로 개발된 이번 2.5 프로는 수학·과학 분야에서도 최고 성능을 기록했다. 특히 'GPQA'와 'AIME 2025' 등의 고난도 벤치마크에서도 테스트 시간 기술 없이도 뛰어난 성과를 냈으며 전문가 집단이 설계한 '휴매니티스 라스트 이그잼'에서도 도구 없이 18.8%의 점수를 기록했다. 코딩 능력도 대폭 향상됐다. 웹 애플리케이션 구현, 에이전트형 코드 작성, 코드 리팩토링 등에서 우수한 성능을 보였다. 실제로 프로그래밍 능력을 평가하는 벤치마크인 'SWE-벤치 베리파이드' 기준 63.8%의 정확도를 기록했다. 이는 맞춤형 에이전트를 활용한 결과로, 실제 개발 환경에 가까운 평가 기준에서의 성과다. 구글은 '제미나이 2.5 이전에도 추론 특화 모델 개발에 힘써왔다. 지난해 12월 공개된 '제미나이 2.0'은 멀티모달 기능과 코드 생성 능력을 강화한 최초의 모델로, 이후 지난 2월에는 '제미나이 2.0 플래시 씽킹'을 단계적 사고 설명이 가능한 추론 특화 모델로서 공개한 바 있다. 경쟁사들의 움직임도 거세다. 오픈AI는 지난해 9월 추론 모델인 'o1' 시리즈를 출시했으며 지난 1월에는 'o3'를 공개했다. 중국 딥시크 역시 같은 달 6천710억 패러미터를 탑재한 'R1'을 내놨고 최근에는 앤트로픽이 '클로드 3.7 소네트'를 공개했다. 이는 업계 최초로 일반형 AI와 추론형 AI를 통합한 하이브리드 모델이다. 이번 '제미나이 2.5 프로'는 사고형 아키텍처에 멀티모달과 긴 맥락 기능까지 결합해 이들과의 경쟁을 본격화한 셈이다. 현재 서비스는 구글 AI 스튜디오에서 제공된다. 고급 이용자라면 제미나이 앱에서도 모델 선택을 통해 접근 가능하다. 코라이 카북추오글루 구글 딥마인드 최고기술책임자(CTO)는 "'제미나이 2.5'는 복잡한 문제를 다루기 위한 사고형 모델로, AI의 새로운 지평을 연다"며 "고객 피드백을 바탕으로 지속적으로 개선할 것"이라고 밝혔다.

2025.03.26 10:40조이환 기자

"앤트로픽, 클로드 새 모델 공개 임박?"…출시설에 AI 업계 촉각

앤트로픽이 추론과 신속 응답을 결합한 '하이브리드' 인공지능(AI) 모델을 개발하고 있는 것으로 보인다. 최근 AI 업계에서는 주요 기업들이 잇따라 신형 모델을 출시하며 기술 경쟁이 격화되고 있어 앤트로픽의 행보에도 관심이 집중되고 있다. 14일에 디인포메이션에 따르면 앤트로픽은 향후 몇 주 안에 차세대 AI 모델을 출시할 계획을 가지고 있는 것으로 알려졌다. 이번 모델이 도입할 가능성이 높은 핵심 기술 중 하나는 '슬라이딩 스케일' 기능이다. 이 기능을 활용하면 AI의 연산 모드를 조절해 성능을 최적화할 수 있다. 앤트로픽 내부 직원들은 신형 AI 모델이 일부 프로그래밍 작업에서 오픈AI의 'o3-미니-하이' 모델을 능가하는 성능을 보였다고 전했다. 이에 따라 이 모델은 대규모 코드베이스 분석 및 비즈니스 활용에서도 강점을 가질 것으로 예상된다. 앤트로픽의 이번 행보는 AI 업계의 치열한 경쟁 구도 속에서 나온 결정으로 보인다. xAI의 최고경영책임자(CEO)인 일론 머스크 역시 지난 13일 두바이에서 열린 행사에서 "우리 AI 모델 '그록 3'가 최종 개발 단계에 있다"며 "향후 1~2주 내 출시될 것"이라고 밝힌 바 있다. 다만 이번 보도는 내부 정보망을 기반으로 한 것으로, 출시 여부와 정확한 일정은 공식적으로 확인되지 않았다. 업계에서는 앤트로픽의 신형 AI 모델이 오픈AI, 구글, xAI를 비롯한 경쟁사들과의 기술 격차를 줄이는 계기가 될지 주목하고 있다. 다리오 아모데이 앤트로픽 대표는 최근 테크크런치와의 인터뷰에서 "우리는 자체적으로 더 차별화된 추론 모델을 만드는 데 집중하고 있다"며 "일반 모델과 추론 모델을 구분하는 기존 개념이 다소 이해하기 어렵다"고 밝혔다.

2025.02.14 10:04조이환 기자

"더 빠르고 저렴하게"…오픈AI, 'o3-미니' 전격 출시

딥시크발 인공지능(AI) 쇼크가 확산되는 가운데 오픈AI가 새로운 추론 모델 'o3-미니'를 공개해 AI 경쟁에 불을 지폈다. 2일 테크크런치에 따르면 오픈AI는 지난 31일 자사의 'o' 계열 테스트타임 컴퓨팅 추론 모델 중 최신 버전인 'o3-미니'를 공식 출시했다. 이 모델은 프로그래밍, 수학, 과학 등 기술적 문제 해결에 특화돼 있으며 기존 모델 대비 속도와 비용 효율성이 개선됐다. 오픈AI는 지난해 12월 기술 공개 행사를 통해 'o3' 모델과 함께 'o3-미니'의 벤치마크 성능을 처음 공개한 바 있다. 당시 'o3'는 기존 모델과 달리 스스로 사실 검증을 수행해 오류를 줄이며 프로그래밍, 수학, 과학 등의 난이도 있는 분야에서 신뢰할 수 있는 답변을 제공하는 모습을 보였다. 회사에 따르면 이번에 출시된 'o3-미니'는 기존 'o1' 및 'o1-미니' 모델과 비교해 유사한 성능을 유지하면서도 응답 속도가 24% 더 빠르고 가격은 63% 더 저렴하다. 외부 테스트 결과 사용자의 절반 이상이 'o1-미니'보다 'o3-미니'의 답변을 선호했으며 실제 복잡한 문제 해결 시 주요 오류 발생이 39% 감소한 것으로 나타났다. 이번 출시를 통해 일반 사용자는 '챗GPT'에서 o3-mini를 사용할 수 있으며 유료 플랜 이용자는 추가적인 쿼리 한도를 부여받는다. '챗GPT' 플러스 및 팀 플랜 사용자는 하루 150회까지 이용 가능하며 프로 사용자에게는 무제한 액세스가 제공된다. 개발자들은 오픈AI 애플리케이션 프로그램 인터페이스(API)를 통해 'o3-미니'를 선택적으로 사용할 수 있지만 초기에는 이미지 분석 기능이 포함되지 않는다. API에서는 사용자가 '낮음, 중간, 높음' 중 적절한 추론 강도를 선택해 모델이 생각하는 깊이를 조절할 수 있다. 기본적으로는 '중간' 강도로 설정돼 있으며 유료 사용자는 이를 '높음' 강도로 변경할 수 있다. 가격은 입력 토큰 100만 개당 0.55달러(한화 약 700원), 출력 토큰 100만 개당 4.40달러(한화 약 6천원)로 책정됐다. 오픈AI에 따르면 이는 중국 AI 기업 딥시크(DeepSeek)의 'R1' 모델의 출력 토큰 단가인 경쟁력 있는 가격이다. 다만 'o3-미니'가 모든 AI 모델을 뛰어넘는 것은 아니다. 딥시크 'R1' 모델과 비교하면 특정 벤치마크에서는 우위를 점하지만 다른 부문에서는 근소한 차이를 보인다. 예를 들어 'o3-미니'는 'AIME 2024' 벤치마크에서는 'R1'을 앞섰으나 박사 수준 과학 문제 해결 테스트인 'GPQA 다이아몬드'에서는 낮은 추론 강도 설정 시 'R1'보다 낮은 점수를 기록했다. 오픈AI는 공식 블로그를 통해 "'o3-미니'는 'o1' 대비 동등한 성능을 갖추면서도 응답 속도와 비용 면에서 더욱 효율적"이라며 "특히 높은 추론 강도 설정에서는 'o1-미니'와 'o1'을 모두 뛰어넘는 성능을 보인다"고 밝혔다.

2025.02.02 08:50조이환 기자