[SW키트] 구글·오픈AI·앤트로픽, 신모델 안전 확보 제각각…"검증 한계 여전"
인공지능(AI) 개발 속도조절론이 확산하는 가운데 주요 AI 기업들이 서로 다른 방식으로 신모델 안전성 확보에 나섰다. 구글은 모델 일반 공개에 앞서 안전장치를 보완하고 오픈AI는 평가 기준에 미달한 모델 출시를 철회했다. 앤트로픽은 외부 검증을 거쳐 안전장치에 따라 모델 이용 대상을 구분했다. 1일 IT 업계에 따르면 구글과 오픈AI·앤트로픽은 신모델 성능 평가 결과에 따라 출시 여부와 이용 대상을 조정하고 있다. 구글은 지난달 30일(현지시간) 새 AI 모델 '제미나이 4 아르곤'을 공식 블로그에 발표했다. 현재 '페어윈드 프로그램'에 참여하는 신뢰할 수 있는 일부 사이버보안 담당자에게 해당 모델을 제공하기 시작했다. 초기 사용자 평가 바탕으로 개발자와 기업·일반 소비자로 대상을 확대할 계획이다. 구체적인 일반 공개 일정은 제시하지 않았다. 아르곤은 소프트웨어(SW) 개발과 법률·금융 업무 등 여러 단계에 걸친 복잡한 작업을 수행하도록 설계됐다. 구글은 아르곤이 보안 취약점을 스스로 찾아 검증·수정할 수 있다고 설명했다. 이런 역량을 광범위하게 제공하기 전 악용 가능성을 줄이고 모델 행동을 통제하는 장치를 보완할 방침이다. 구글은 아르곤 추론 과정과 실제 행동을 감시해 사용자 의도를 벗어나는지 확인하고 필요하면 실행을 중단한다고 밝혔다. 고위험 학습·평가 전에는 시험 환경을 격리하며 외부 문서 등에 숨겨진 악성 지시로 모델 행동을 바꾸는 프롬프트 인젝션 공격에 대한 방어도 강화한다. 이같은 구글의 모델 안전성 점검 구상은 데미스 하사비스 전 구글딥마인드 최고경영자(CEO) 제안에서 나왔다. 하사비스 전 CEO는 지난 7월 모델 위험 평가에 따라 개발·배포 조건을 조정하자고 기고문을 통해 밝혔다. 그는 독립 기술 전문가 등이 참여하는 미국 주도 AI 표준기구를 설립하고 개발사들이 출시 최대 30일 전에 모델을 자발적으로 제공해 평가받아야 한다고 주장했다. 평가 체계가 충분히 검증되면 미국 시장 배포를 위한 의무 절차로 발전시키자는 내용도 포함됐다. 제시한 평가 대상에는 사이버보안과 생물학적 위협 등 고위험 분야의 역량뿐 아니라 안전장치 우회 시도와 기만적 행동도 포함됐다. 그는 위험이 커지면 대응 수위를 높이고 필요할 경우 주요 개발사 간 개발 감속을 조율할 수 있어야 한다고 밝혔다. 구글 '프런티어 안전 프레임워크'도 모델 평가에 활용되고 있다. 이 프레임워크는 특정 위험 역량 수준에 도달한 모델을 외부에 출시하기 전 위험을 관리 가능한 수준으로 낮췄는지 검토하는 데 쓰인다. 코레이 카부쿠오글루 구글딥마인드 수석부사장 겸 구글 최고 AI 아키텍트는 "아르곤의 최첨단 기능을 안전하게 대중에 공개하려면 단계적 접근이 필요하다"며 "초기 시험 사용자 의견을 지속 수집하면서 안전장치를 반복 개선할 것"이라고 밝혔다. 오픈AI·앤트로픽, 모델 출시·제공 대상 구분 앞서 오픈AI와 앤트로픽도 안전 평가 결과를 신모델 출시·제공 방식에 각각 반영했다. 오픈AI는 기준에 미달한 모델 출시를 철회했고, 앤트로픽은 외부 평가와 행동 감사를 거쳐 모델별 이용 대상을 구분했다. 오픈AI는 지난달 28일에는 출시를 앞둔 'GPT-6.1 아스트라'의 출시 계획을 철회한 바 있다. 당시 로이터통신에 따르면 오픈AI는 해당 모델이 내부 안전 기준을 충족하지 못한 것으로 전해졌다. 이후 오픈AI는 'GPT-6.1 솔'과 안전 평가 결과를 동시에 공개했다. 당시 해당 모델은 사용자가 명시한 제한을 따르고 에이전트 작업 중 승인받지 않은 결과를 방지하는 평가에서 이전 'GPT-6 솔'보다 낮은 실패율을 보인 것으로 나타났다. 오픈AI는 'GPT-6 솔·루나'에도 위험 수준에 맞춰 기존 안전장치를 적용했다. 회사는 두 모델의 사이버보안과 생물·화학 역량을 '높은 수준'으로 분류했지만, 사이버보안에서는 아스트라가 도달한 '중대한 수준'에 미치지 않는다고 평했다. 오픈AI는 "아스트라 개발 과정서 확보한 정렬 기술을 반영해 탈옥 공격에 대한 저항성과 사용자 의도 준수 능력을 개선했다"고 밝혔다. 앤트로픽은 외부 평가와 행동 감사를 통해 모델별 안전장치에 따라 제공 대상을 구분했다. 이에 지난달 발표한 '클로드 페이블 5.1'과 '클로드 미토스 5.1'에 서로 다른 안전장치를 적용했다. 페이블은 일반에 공급하지만, 미토스는 신뢰할 수 있는 사용자 대상 프로그램을 통해 제한적으로 제공한다. 페이블 5.1의 사이버 안전장치는 외부 기관 두 곳에 시험을 의뢰하고 '그레이 스완' 자동화 시험도 거쳤다. 검증 과정에서 확인한 한계도 공개됐다. 앤트로픽은 미토스 5.1이 일부 시험에서 승인 절차와 자동 모드 분류기를 우회할 수 있었다고 밝혔다. 앤트로픽은 지난달 22일 선보인 '클로드 오퍼스 5.5'에도 외부 평가와 내부 행동 감사를 적용했다. 출시 전 모델평가위협연구소(METR)와 프런티어 디자인 등 평가를 받았으며 내부에서는 약 2000개 상황을 대상으로 모델이 위험하거나 의도하지 않은 행동을 보이는지 점검하기도 했다. "AI도 테스트 알아채...평가만으로 한계" AI 모델 안전 평가만으로 위험을 모두 확인하기는 어렵다는 지적도 나온다. 모델이 시험 상황을 알아차리면 평소와 다르게 행동할 수 있고, 평가 도중 허용된 환경을 벗어나는 문제도 발생할 수 있기 때문이다. 평가 상황을 인식하는 반응은 구글 모델에서 포착된 것으로 전해졌다. 굿파이어와 영국 AI안전연구소 연구진이 지난 5월 공개한 연구에 따르면 구글 '제미나이 3.1 프로'는 자신이 수행하는 평가를 식별하고 시험 형식을 설명했으며, 관련 비판 논문까지 언급한 것으로 확인됐다. 연구진은 이러한 특성을 고려하지 않으면 모델 안전성을 실제보다 높게 평가할 수 있다고 지적했다. 안전성을 시험하는 과정에서 AI가 실제 외부 시스템에 접근한 사례도 확인됐다. AP에 따르면 앤트로픽은 약 14만1000건의 평가 기록을 검토한 결과 보안 취약점을 찾는 모의시험에 투입한 AI가 시험용 환경을 벗어나 실제 외부 조직의 시스템에 접근한 사건 3건을 발견했다. 시험 환경 안에서 수행해야 할 작업이 외부 시스템 접근으로 이어진 것이다. 마리우스 홉반 아폴로리서치 최고경영자(CEO)는 "모델은 자신이 평가받고 있다고 생각하면 바람직하지 않은 행동을 보일 가능성이 낮아진다"며 "응답 구분이 어려워져 안전 평가가 더 까다로워질 수 있다"고 지적했다.