AI가 커닝 페이퍼 보고 배우면 진짜 실력이 늘까
작은 AI에게 큰 AI의 실력을 물려주려고 풀이 방향을 짚어 주는 힌트를 슬쩍 쥐여줬더니, 성적표는 오히려 나빠졌다. 중국 전자상거래 기업 징동(JINGDONG)의 익스플로어 아카데미(Explore Academy)와 싱가포르국립대(NUS), 홍콩중문대(CUHK), 베이징대(PKU) 공동 연구진이 2026년 6월 공개한 논문 'DOPD'는 이 역설적인 현상에 '특권 착각(Privilege Illusion)'이라는 이름을 붙였다. 특권 착각이란 AI에게 풀이 방향을 짚어 주는 힌트를 주면 겉으로는 똑똑해 보이지만, 그 향상된 실력이 진짜 능력이 아니라 단지 남들이 못 본 정보를 봤기 때문에 생긴 착시일 뿐인 현상을 말한다. AI를 직접 만들지 않는 일반 사용자에게도 이 발견은 중요하다. 우리가 쓰는 챗봇이 어떻게 '진짜 실력'을 갖추게 되는지, 그리고 왜 더 많은 정보를 준다고 항상 더 똑똑해지지 않는지를 설명해 주기 때문이다. 힌트에 의존한 AI가 오히려 흔들린 특권 착각 징동 연구진은 큰 AI의 지식을 작은 AI로 옮기는 과정에서 '특권 착각'이라는 실패 패턴을 처음으로 규명했다. AI 업계에서는 성능이 좋은 큰 모델(선생 모델)의 실력을 값싸고 가벼운 작은 모델(학생 모델)에게 물려주는 작업을 '증류(Distillation)'라고 부른다. 우유를 끓여 진한 연유를 만들듯, 큰 모델의 핵심 능력만 뽑아 작은 모델에 압축해 넣는다는 뜻이다. 연구진은 이 증류 과정에서 선생 모델이나 학생 모델에게 문제 풀이의 방향을 짚어 주는 힌트, 즉 '특권 정보(Privileged Information)'를 미리 보여주면 성능이 오를 것이라 기대했다. 하지만 결과는 정반대였다. 학생 모델이 진짜 사고력을 기르는 대신, 힌트에만 의존하는 지름길 요령만 베껴 학습이 오히려 불안정해졌다. 그림1 여덟 개 벤치마크에서 경쟁 방식을 모두 앞선 DOPD의 성능 비교 (출처: DOPD 논문 Figure 1) 이 상황은 시험공부에 비유하면 쉽게 이해된다. 답지를 미리 본 친구의 풀이를 그대로 따라 적으면 그 문제는 맞힐 수 있지만, 답지 없이 새 문제를 마주하면 아무것도 풀지 못하는 것과 같다. 나는 '원리를 이해한 사람'인가, 아니면 '답지를 외운 사람'인가. 연구진이 던지는 질문이 바로 이것이다. 딱 20%의 결정적 토큰이 실력을 좌우한다는 데이터 징동 연구진의 실험에 따르면 AI 학습에서 결정적 역할을 하는 것은 전체의 극히 일부인 '고급 정보 토큰'이며, 이를 20% 덜어내자 학습 효과가 절반 수준으로 떨어졌다. 여기서 토큰(Token)이란 AI가 문장을 처리할 때 잘게 쪼갠 단어나 글자 조각을 뜻한다. AI는 문장을 통째로 보지 않고 이 조각들을 하나씩 이어가며 답을 만든다. 연구진은 수많은 토큰 가운데 실제로 중요한 판단이 담긴 조각은 소수에 불과하고, 나머지 상당수는 '그리고', '그래서' 같은 별 의미 없는 연결어라는 점에 주목했다. 실험은 이 차이를 선명하게 보여준다. 무작위로 토큰의 20%를 빼거나, 별로 중요하지 않은 토큰 20%를 빼면 성적에 거의 영향이 없었다. 그런데 가장 중요한 '고급 정보 토큰' 20%를 빼자, 100번째 학습 단계에서 기존 방식이 얻던 향상 효과의 절반밖에 얻지 못했다. 멀티모달(이미지와 글을 함께 다루는) 모델에서는 그 효과가 겨우 20% 수준으로 더 크게 무너졌다. 결정적인 소수의 조각이 전체 실력을 좌우한다는 뜻이다. 이는 회의에서 오간 수백 마디 중 실제로 중요한 결정은 몇 문장에 담기는 것과 같은 이치다. 토큰마다 다른 처방을 내리는 이중 증류 방식 징동 연구진이 제안한 DOPD(듀얼 온폴리시 증류, Dual On-policy Distillation)는 모든 토큰을 똑같이 가르치지 않고, 조각의 성격에 따라 서로 다른 학습 전략을 자동으로 배분하는 방식이다. 기존 방식이 모든 토큰을 한 명의 선생에게서 똑같은 강도로 배우게 했다면, DOPD는 각 토큰이 '진짜 실력 차이'에서 온 것인지 '단지 힌트를 봤기 때문'인지를 먼저 판별한다. 그 기준이 되는 것이 '특권 어드밴티지 갭(Privilege Advantage Gap)'이다. 특권 어드밴티지 갭이란 선생 모델과 학생 모델에게 똑같은 힌트를 줬을 때 두 모델의 예측이 얼마나 벌어지는지를 나타내는 값으로, 이 격차가 크면 진짜 능력 차이, 작으면 단순 정보 차이로 해석한다. DOPD는 이 판별을 토대로 토큰을 네 종류로 나눠 각각 다르게 처방한다. 선생이 확실한 실력 우위를 보이는 결정적 토큰에는 강하게 가르치고, 단순히 힌트 덕에 잘 아는 토큰에는 가볍게만 가르친다. 둘 다 자신 없어 하는 애매한 토큰은 무리하게 밀어붙이지 않고 안정만 유지하며, 학생이 이미 자신 있어 하는 부분은 스스로 탐색하도록 내버려 둔다. 의사가 환자마다 다른 약을 처방하듯, 조각마다 맞춤 강도로 지식을 전달하는 셈이다. 힌트의 정답 여부보다 방향 제시가 중요하다는 발견 징동 연구진의 실험에서 DOPD는 기존 방식(기본형 OPD)보다 언어 모델에서 평균 7.5점, 이미지 언어 모델에서 6.0점 높은 성능을 기록했다. 특히 큰 모델과 작은 모델의 크기 차이가 클수록 효과가 두드러졌다. 가장 격차가 큰 실험(80억 규모 선생에서 6억 규모 학생으로 압축)에서 기존 방식은 3.5점 오르는 데 그쳤지만, DOPD는 14.1점 올라 원래 실력 격차의 53%를 메웠다. 흥미로운 대목은 어떤 힌트가 효과적이었는가에 있다. 연구진이 다섯 종류의 힌트를 비교한 결과, 정답을 그대로 알려준 경우가 가장 나빴다. 학생 모델이 정답만 통째로 외워 오히려 힌트 없이 배운 것보다 성적이 떨어졌다. 반대로 풀이 과정 없이 방향만 짚어 준 단계별 힌트가 8.3점, 10.4점으로 가장 큰 향상을 만들어냈다. 핵심은 힌트가 정답을 담고 있느냐가 아니라, 학생이 스스로 능력을 기르도록 방향을 제시하느냐에 있다는 것이다. 이는 좋은 과외 선생이 답을 불러주는 대신 "이 부분을 이렇게 접근해 봐"라고 길을 열어 주는 것과 같다. 다만 이 결과는 징동 연구진이 사용한 특정 모델(Qwen3 계열)과 데이터 환경에서 나온 것으로, 모든 AI 학습에 그대로 적용될지는 더 지켜볼 필요가 있다. AI 학습의 '양보다 질' 시대를 여는 실마리 이번 연구가 시사하는 바는 AI를 더 똑똑하게 만드는 길이 단순히 더 많은 정보를 주입하는 데 있지 않을 수 있다는 점이다. 정보를 무분별하게 밀어 넣으면 오히려 겉만 번지르르한 착시를 만들 수 있고, 정작 필요한 것은 '무엇을 언제 가르칠지'를 가려내는 선별 능력이라는 해석이 가능하다. 다만 연구진 스스로 밝혔듯 DOPD는 좋은 품질의 힌트를 만드는 데 별도 비용이 들고, 학생 모델을 한 번 더 계산해야 하는 부담이 있으며, 토큰을 나누는 기준이 아직은 경험적 규칙에 기대고 있다는 한계가 남아 있다. 그럼에도 선생과 학생 양쪽에서 필요한 것만 골라 배우게 한다는 발상은, 앞으로 더 효율적이고 믿을 수 있는 AI 학습 방식을 고민하는 데 하나의 유용한 관점을 던진다. 이 방향이 실제 상용 AI 개발의 표준으로 자리 잡을지는 두고 볼 일이다. FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.) Q. 증류(Distillation)가 정확히 무엇인가요? 성능이 뛰어난 큰 AI 모델의 능력을 값싸고 가벼운 작은 AI 모델에게 옮겨 담는 학습 방법입니다. 우유를 졸여 진한 연유를 만들듯, 큰 모델의 핵심 실력만 뽑아 작은 모델에 압축해 넣는다고 이해하시면 됩니다. 스마트폰처럼 작은 기기에서도 똑똑한 AI를 쓸 수 있게 해 주는 기술입니다. Q. '특권 착각'은 우리가 쓰는 챗봇에도 영향을 주나요? 직접적으로는 개발 단계의 이야기지만, 우리가 쓰는 챗봇의 품질과 연결됩니다. AI가 힌트에만 의존해 학습하면 겉보기엔 똑똑해 보여도 새로운 문제 앞에서 약해질 수 있습니다. 이번 연구는 AI가 '외운 실력'이 아니라 '진짜 실력'을 갖추도록 돕는 방법을 제시한 것입니다. Q. 힌트를 많이 줄수록 AI가 더 똑똑해지는 것 아닌가요? 이번 연구는 오히려 반대일 수 있음을 보여줍니다. 정답을 그대로 알려주자 AI 성적이 떨어졌고, 풀이 방향만 짚어 준 힌트가 가장 좋은 결과를 냈습니다. 정보의 양보다 어떤 정보를 어떻게 주느냐가 더 중요하다는 뜻입니다. 기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다. 리포트명: DOPD: Dual On-policy Distillation 이미지 출처: AI 생성 콘텐츠 해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다. ■ 이 기사는 AI 전문 매체 'AI 매터스'와 제휴를 통해 제공됩니다. 기사는 클로드 3.5 소네트와 챗GPT를 활용해 작성되었습니다. (☞ 기사 원문 바로가기)