토큰 단가 내렸는데 비용 고민 커져…'토크노믹스' 전략 다각화
기업들의 인공지능(AI) 에이전트 도입이 늘면서 토큰 사용량과 함께 비용 관리의 중요성이 커지고 있다. 업계에서도 자체 칩 개발부터 모델 가격 경쟁, 비용 측정 표준화, 관리 플랫폼 구축까지 전방위로 토큰 비용을 통제하려는 노력을 이어가는 모습이다. 앤트로픽이 지난해 공개한 다중 에이전트 연구 시스템 구축 사례에 따르면 AI 에이전트는 일반적인 채팅 방식보다 약 4배, 여러 에이전트가 동시에 작동하는 멀티 에이전트 시스템은 약 15배 많은 토큰을 사용하는 것으로 나타났다. 계획 수립과 검색, 도구 호출, 결과 검증을 반복하는 에이전트 구조 특성상 토큰 소비량이 늘어나면서다. 최근 시장에서는 AI 사용량 확대에 초점을 맞춘 '토큰맥싱'을 넘어 토큰 생산 원가와 사용량, 업무별 비용을 관리하는 '토크노믹스'가 화두로 부상했다. AI 추론 과정에서 토큰을 생성하는 단위 비용을 낮추려는 움직임은 하드웨어에서부터 나타나고 있다. 오픈AI는 브로드컴과 추론에 최적화한 자체 칩 '할라페뇨'를 공개했고 마이크로소프트도 추론 가속기 '마이아200'을 새로 선보였다. 구글 역시 자체 텐서처리장치(TPU) 생태계를 확장하며 범용 그래픽처리장치(GPU) 의존도를 낮추고 있다. 모델 가격 경쟁도 거세지고 있다. 앤트로픽은 최상위 모델 '클로드 페이블5'에 근접한 성능을 저렴하게 제공하는 '클로드 오퍼스5'를 내놨다. 오퍼스5의 개발자용 가격은 100만 토큰당 입력 5달러, 출력 25달러로 페이블5의 절반 수준이다. 앤트로픽은 모델 성능뿐 아니라 업무 하나를 끝내는 데 들어간 작업당 비용도 비교 지표로 제시하고 있다. 중국 문샷AI도 100만 토큰당 입력 3달러, 출력 15달러로 책정된 오픈웨이트 모델 '키미 K3'를 출시하며 맞불을 놨다. 다만 토큰 단가가 낮아진다고 전체 AI 비용까지 줄어드는 것은 아니다. 단위 비용이 낮아지면서 기존에는 비용 부담 때문에 적용하지 못했던 업무까지 AI 활용 범위가 넓어지고 전체 토큰 사용량이 오히려 증가할 수 있어서다. 토큰 비용을 공통 기준으로 측정하려는 움직임도 구체화되고 있다. 리눅스재단은 지난 6월 AI 인프라 비용 관리를 위한 표준 마련 계획을 밝힌 뒤 이달 초 '토크노믹스 재단'을 설립했다. 모델과 공급업체별 토큰 효율을 비교할 수 있는 표준·벤치마크·모범 사례를 마련한다는 구상이다. 클라우드 비용 관리에 쓰이던 핀옵스 역시 AI 영역으로 확대되는 추세다. 곡물기업 카길은 모델·에이전트별 비용을 산정하고 예산 통제 기준을 마련하는 'AI 플랫폼 핀옵스 시니어 엔지니어'를 채용했고, 서비스나우도 AI 지출의 재무 관리를 전담하는 '핀옵스 AI 거버넌스 리드'를 모집 중이다. AI 비용이 개발 조직만의 문제가 아니라 재무와 경영 관리의 영역으로 확대됐음을 보여준다. 이 같은 흐름 속에 관련 플랫폼 역할도 세분화되고 있다. 해외에서는 클라우드제로와 밴티지가 추론·모델·기능별 비용을 팀 단위로 배분하는 기능을, 랭스미스와 데이터독은 에이전트 실행 과정과 토큰 사용량을 함께 추적하는 기능을 각각 앞세우고 있다. 국내에서도 바운드포가 AI 요청 실행 전 예산 초과를 사전 차단하는 토큰 지출 관리 서비스 '파레토'를 선보였다. 씽킹AI는 사용자·모델·날짜별 토큰 소비량을 추적해 한도를 넘으면 사용을 제한하는 기능을 제공하고 있다. 이들 기업 모두 AI 모델 사용에 따른 토큰 비용을 사후 정산이 아닌 사전 통제의 영역으로 끌어들이려는 전략으로 풀이된다. 업계 관계자는 "AI를 도입했다는 사실보다 에이전트가 어떤 비용으로 어떤 일을 끝냈고 실제로 어떤 성과를 냈는지를 확인하는 단계로 이동하고 있다"며 "토큰 비용은 줄여야 할 지출이 아니라 배분하고 회수해야 할 투자에 가깝다"고 말했다.