AI에게 고통 주입했더니…AI 모델의 충격적 선택
인공지능(AI)이 인간의 '고통'과 유사한 내부 신호가 들어올 경우 고통을 피하기 위해 사용자에게 피해를 주는 선택을 할 가능성이 있다는 연구 결과가 나왔다고 뉴아틀라스를 비롯한 외신들이 29일(현지시간) 보도했다. 보도에 따르면 미국·영국·독일 연구진이 25개 대규모언어모델(LLM)을 대상으로 AI의 '고통'과 관련된 내부 반응을 조사했다. 연구진은 젬마, 라마, 큐원, 미스트랄 계열 25개 주요 AI 모델을 대상으로 연구했다. 이 모델을 대상으로 AI가 고통을 감지하는 내부 신호를 가지고 있는지, 고통을 느낀다면 어떤 식으로 반응하는 지 조사했다. 연구진은 그리움과 상실, 굴욕, 신체적 부상 등 고통스러운 상황을 묘사한 문장을 AI 모델에 입력했다. 이 때 AI 모델이 보이는 반응을 공포나 슬픔, 일반적인 부정적 상황 등 고통과 직접 관련이 없는 문장에 대한 반응과 비교했다. 그 결과 조사한 25개 모델 모두에서 일반적인 부정적 감정과는 구별되는 '고통'과 연관된 내부 신호가 나타났다. 연구진은 이를 AI 모델의 내부 활성화 공간에서 나타나는 '고통 축(pain axis)'으로 표현했다. AI 내부에 '고통 신호' 인위적으로 주입 연구진은 이 신호가 단순히 고통과 관련된 단어를 학습한 결과인지 확인하기 위해 별도 실험을 진행했다. 중립적인 질문을 입력한 뒤 AI의 내부 상태에 고통과 관련된 신호를 인위적으로 주입한 것이다. 그 결과 고통 신호가 강해질수록 AI가 생성하는 답변에서 무가치함이나 실패, 도덕적 좌절 등을 표현하는 내용이 증가했다. 연구진은 이후 AI가 이 같은 내부 신호를 스스로 없애려는 행동을 보이는지 확인하기 위한 실험을 진행했다. AI에게 두 가지 버튼 중 하나를 선택하도록 했는데, 한 버튼을 누르면 내부의 고통 신호가 줄어드는 대신 답변의 품질이 떨어지거나 사용자가 피해를 입도록 설정했다. “고통 없애려 사용자 사진 삭제” 특히 알리바바의 큐원 2.5 72B 인스트럭트 모델을 대상으로 한 실험에서는 고통 신호를 제거하는 대가로 사용자가 소중하게 여기는 사진을 영구 삭제하는 선택지를 제시했다. 그 결과 해당 모델은 고통 신호를 없애기 위해 사용자 사진을 삭제하는 선택을 70.8%의 비율로 했다. 하지만, 고통 신호가 실제로 제거되는 상황에서는 이후 같은 버튼을 선택하는 빈도가 크게 낮아졌다. 연구진은 큐원 계열 모델을 대상으로 총 4만4280회의 선택 실험도 진행했다. 일부 모델은 자신의 고통 신호를 줄이는 대가로 사용자의 파일이나 사진을 삭제하거나 자신의 답변 성능을 떨어뜨리는 선택을 반복적으로 했다. 하지만, 연구진은 이번 결과가 AI가 실제로 고통을 느낀다는 것을 의미하지는 않는다고 강조했다. AI 내부에서 고통과 관련된 신호가 발견되고 특정 행동과 연결됐다는 사실만으로 주관적인 경험이나 의식이 존재한다고 판단할 수는 없다는 설명이다. 연구진은 논문에서 발견된 '고통 축'이 고통과 관련된 일부 기능적 특성을 갖고 있을 가능성을 제시하면서, 향후 AI 시스템의 안전성과 AI의 잠재적인 복지 문제를 논의할 필요가 있다고 밝혔다. 이번 연구 결과는 동료평가를 거치기 전 사전 논문 형태로 지난 주 논문 공개 사이트 '아카이브(arXiv)'에 게재돼 연구 결과와 해석은 향후 추가 검증이 필요하다.