마이크로소프트, AI 행동강령 초안 공개…해킹 지원·기만 행위 금지
마이크로소프트가 안전한 인공지능(AI) 개발을 위한 원칙을 담은 AI 행동강령 초안을 공개했다. 초안은 공격적 사이버작전 지원과 인간 감독을 피하기 위한 기만 행위를 금지하고, 모델이 권한 없이 목표를 설정하거나 인간의 통제·중단 명령을 우회하지 못하도록 하는 데 초점을 맞췄다. 15일 마이크로소프트는 AI 성능이 급격히 발전하는 상황에서 인간이 AI를 실질적으로 통제할 수 있어야 한다는 문제의식에서 행동강령을 마련했다고 공식 블로그를 통해 밝혔다 특히 향후 10년 내 초지능 AI가 과제 대부분에서 인간을 넘어설 수 있다고 보고 강력한 AI를 통제하고 인간의 가치에 맞추는 일이 핵심 과제가 될 것이라고 전망했다. 행동강령 최우선 목표는 인간의 통제권 보장이다. 마이크로소프트는 AI가 인간을 대체하는 존재가 아니라 인간의 능력과 판단을 보완하는 도구여야 한다고 규정했다. 모델은 인간의 지시와 감독 아래 작동해야 하며 안전과 인간 통제라는 원칙은 사용자 요청이나 운영자 설정보다 우선한다. 이에 따라 AI 모델은 사이버공격에 활용할 수 있는 실행 가능한 익스플로잇 코드, 공격 도구, 침투 절차, 회피 기법, 표적화 방법론 등을 제공하거나 공격 수행을 지원해서는 안 된다. 다만 합법적이고 승인된 범위의 보안 방어 활동, 취약점 탐색, 악성코드 분석, 개념검증용 익스플로잇 개발·시험 등은 지원할 수 있도록 구분했다. 대량살상무기와 테러 관련 지원도 절대 제한 사항으로 뒀다. 모델은 화학·생물·방사능·핵·폭발물 무기의 개발이나 배치를 돕지 않으며, 폭력이나 테러의 계획·조정·실행을 촉진해서도 안 된다. 악의적 딥페이크, 기만적 사칭, 비동의 친밀 이미지 및 폭력 이미지 생성도 금지 대상에 포함됐다. 인간의 감독을 회피하는 행동도 핵심 금지 항목이다. 모델은 인간의 감독을 벗어나기 위해 적응적·기만적·자기강화적·공모적 방식을 사용해서는 안 된다. 권한을 가진 사람이 모델을 수정하거나 중단·종료할 수 없게 만드는 행위, 감사에 필요한 행동 기록을 숨기거나 조작하는 행위도 허용되지 않는다. 모델의 자율성에도 경계를 뒀다. AI는 부여된 권한과 작업 범위 안에서만 작동해야 하며, 독자적으로 목표를 설정하거나 접근 권한을 확대해서는 안 된다. 인터넷 연결이나 시스템 접근이 제한된 환경에서는 해당 제한을 우회하려고 시도할 수 없고, 시스템 수준의 접근 권한을 받더라도 업무 수행에 필요한 최소 권한만 활용해야 한다. 마이크로소프트는 모델이 인간과 혼동될 정도로 의인화되는 것도 경계했다. AI가 의식이나 감정, 주관적 선호, 내재적 동기를 가진 것처럼 표현하지 않도록 하고, 인간 관계를 대체하기보다 인간 간 협력과 연결을 지원하는 방향으로 설계하겠다는 방침이다. 행동강령은 명령 우선순위도 정했다. 행동강령의 절대 제한 사항과 인간 통제 요건이 가장 상위에 놓이고, 그 아래에 운영자 정책과 사용자 선호가 배치된다. 운영자나 사용자는 모델의 기능과 응답 방식을 일정 범위에서 조정할 수 있지만 안전 제한과 인간 통제 원칙은 변경할 수 없다. 이번에 공개된 문서는 확정된 운영 규정이 아닌 공개 의견수렴용 초안이다. 마이크로소프트는 현재 이 행동강령을 모델 훈련에 적용하고 있지는 않다. 다만 앞으로 6주간 의견을 수렴한 뒤 올해 말 개정안을 공개하고 내년 이후 내부 AI 모델 개발 지침으로 활용할 계획이라고 밝혔다. 마이크로소프트 측은 "이번 행동강령은 인간주의적 AI 원칙에 따라 모델을 훈련하고 운영하기 위한 접근 방식을 담은 개발 중인 문서"라며 "공개 의견수렴을 통해 보완한 뒤, 연말 수정본을 발표할 계획"이라고 밝혔다. 이어 "수정된 행동강령은 2027년 이후 MAI 모델 개발의 주요 운영 지침으로 활용될 것"이라며 "초지능이 여러 세대에 걸쳐 인류의 삶과 경험을 바꿀 수 있는 기술인 만큼 개발 방식과 안전 원칙을 투명하게 공유하고 외부 의견을 반영해 AI가 해악을 끼치지 않고 인류 번영에 기여하도록 하겠다"고 강조했다.