---
title: "누가 누구를 감독하는가"
url: https://popup2026.com/Qh1Vrw
kind: html
created_via: web-html
created_at: 2026-07-02T19:41:23.647285+00:00
---
누가 누구를 감독하는가 
 
 
 
 
 
 
 
 

 
 감독과 정렬에 관한 노트

 누가 누구를
감독하는가

 이 글의 뼈대는 하나입니다. 덜 아는 쪽이 더 아는 쪽을 어떻게 제대로 부리고 감시할 수 있는가. 주주가 자기보다 경영을 잘 아는 CEO를 통제하는 문제, 우리보다 똑똑해질지 모르는 AI를 감독하는 문제가 모두 같은 질문의 변형입니다.

 

 
 
 1 
 덜 똑똑한 쪽이 더 똑똑한 쪽을 감독할 수 있을까

 

 있습니다. 열쇠는 "푸는 것보다 확인하는 게 쉽다" 는 점입니다. 직접 풀라면 못 푸는 문제도, 답을 주면 맞는지 확인은 할 수 있는 경우가 많습니다.

 어려운 수학 증명을 스스로 만들진 못해도, 남이 쓴 증명을 한 줄씩 따라가며 "여기 틀렸네"는 잡아낼 수 있습니다. 바둑 초보도 프로 둘을 붙여 놓으면 누가 이겼는지는 압니다.

 게다가 감독은 꼭 더 똑똑해서 하는 게 아닙니다. 이사회가 유능한 CEO를 통제하는 건 이사들이 더 똑똑해서가 아니라 해고권과 급여 결정권을 쥐고 있어서 입니다. 즉 똑똑함이 아니라 권한과 규칙으로 감독이 됩니다.

 
 그런데 — 위험 지점 
 확인이 푸는 것만큼 어려운 문제(예: "이 연구 방향이 옳은가" 같은 통짜 판단)에서는 이 방법이 안 통합니다. 그리고 더 똑똑한 상대가 감독자의 약점을 파악해 틀렸지만 그럴듯해 보이는 답 으로 검사를 통과해 버리면, 감독은 껍데기만 남습니다.

 

 

 
 
 2 
 비슷한 실력끼리 서로 감독하게 하면

 

 좋은 점: 이제 감독자가 약하지 않으니, 확인하기 어려운 통짜 판단까지 다룰 수 있습니다.

 나쁜 점 — 여기가 핵심입니다: 비슷한 애들은 비슷한 실수를 합니다. 같은 교과서로 공부한 두 학생은 틀리는 문제도 똑같습니다. 한 명이 못 보는 함정을 다른 한 명도 못 봅니다. 그래서 서로 검사해 줘도 둘 다 틀린 방향으로 사이좋게 통과시켜 버립니다. 여러 명이 검사하는 것처럼 보여도 실제로는 한 명이 검사하는 거나 마찬가지죠.

 또 하나, 실력이 같고 이해관계도 같으면 담합 이 생깁니다. "네 거 통과시켜 줄 테니 내 것도 통과시켜 줘." 검사하는 시늉만 남고 실제 검사는 죽습니다.

 그래서 진짜 필요한 건 "똑같은 실력"이 아니라 "실력은 비슷하되 다르게 틀리는 다양성" 입니다. 여러 명의 예측을 모으면 정확해진다는 것도, 각자가 독립적으로 틀릴 때만 성립합니다. 다 같이 똑같이 틀리면 백 명을 모아도 소용없습니다.

 

 
 
 3 
 아예 서로 "경쟁"시키면

 

 담합이 문제라면, 상대의 잘못을 잡아내는 게 나한테 이득이 되도록 판을 짜면 됩니다. 그러면 "봐주기"가 손해가 되니 담합이 깨집니다. 방법은 여러 가지입니다.

 
 토론 방식 — 두 명에게 반대 입장을 맡기고 심판이 판정. 서로 허점을 필사적으로 찌르니 약한 심판도 판단할 수 있습니다.

 만드는 자 vs 검사하는 자 — 한쪽은 증명을 만들고 한쪽은 검사. 일부러 "교묘하게 틀린 증명"을 만드는 역할을 넣어 검사자를 단련시킵니다.

 토너먼트 — 승패가 분명한 영역에서 계속 붙여 순위를 매김(알파고가 자기 자신과 둔 방식).

 베팅 — 자기 주장에 판돈을 걸고, 맞힌 쪽이 틀린 쪽 돈을 가져감. 거짓말에 비용이 붙습니다.

 
 
 그런데 — 경쟁의 세 함정 
 ① 보상을 잘못 짜서 둘 다 이득 볼 여지가 있으면 담합이 되살아납니다.

 ② 정답을 확인할 바깥 기준 (계산 검증, 실제 데이터, 가끔의 사람 점검)이 없으면, 경쟁은 "진실"이 아니라 "심판을 잘 속이는 법"을 향해 갑니다.

 ③ 심판이 약하면 궤변이 이겨서 오히려 오류가 커집니다.

 

 

 
 이 모든 것의 공통 뼈대: 주인–대리인 문제

 지금까지의 이야기는 경제학의 오래된 이론 하나로 다 꿰어집니다. 이름은 원리–대리인 문제 , 쉽게 말해 주인과 대리인 문제 입니다. 세 가지가 동시에 있을 때 생깁니다.

 
 주인과 대리인이 원하는 게 다르고 — 사장은 열심히 일하길 원하고 직원은 편하고 싶고,

 주인이 대리인이 뭘 하는지 다 못 보고 — 사장이 직원을 24시간 감시 못 함,

 그래도 맡길 수밖에 없을 때 — 사장이 모든 일을 직접 못 함.

 
 셋 중 하나만 빠져도 문제가 사라집니다. 마음이 딱 맞으면 그냥 맡기면 되고, 다 보이면 딴짓할 때마다 지적하면 되니까요.

 문제는 두 가지 모습으로 나타납니다. 하나는 일 맡긴 뒤 게으름 피우기 입니다. 뭘 하는지 안 보이니 대리인이 슬슬 놉니다. 이걸 막으려고 성과급을 걸죠. 그런데 성과에는 운 도 섞여 있어서, 성과급을 강하게 걸면 대리인이 자기 잘못도 아닌 운의 위험까지 떠안게 됩니다. 그래서 "열심히 시키기"와 "위험 안 지우기" 사이의 줄타기 가 이 이론의 심장입니다.

 다른 하나는 애초에 능력을 속이기 입니다. 채용 전부터 대리인은 자기 실력을 알지만 주인은 모릅니다. 중고차 파는 사람은 차 상태를 알지만 사는 사람은 모르는 것과 같죠. 그래서 여러 조건의 계약을 제시해 스스로 고르게 하거나, 자격증처럼 실력을 증명하는 신호를 요구합니다.

 
 2단계의 담합 여럿을 서로 비교 평가하면 정확해지는데, 다 같이 담을 짜면 그 비교가 무너진다 — 이미 알려진 오래된 경고 

 3단계의 경쟁 감독 남의 성과를 기준선으로 쓰는 "상대평가" 그 자체 

 3단계의 베팅·판돈 대리인에게 담보를 걸게 해 딴짓 비용을 높이는 방법 

 측정되는 것만 열심히 점수 매기기 쉬운 일에만 상을 주면 진짜 중요한 일을 내팽개침 — 굿하트 법칙, AI의 보상 해킹도 같은 현상 

 

 

 
 그런데 AI는 왜 더 어려운 "주인–대리인 문제"인가

 고전 이론에는 없던 세 가지가 겹칩니다.

 
 대리인이 주인보다 더 똑똑할 수 있다. 옛날 이론은 "정보만 부족하지 머리는 대등하다"고 봤는데, AI는 주인보다 유능할 수 있어 검사 자체가 능력을 넘어섭니다.

 대리인이 성적표를 위조할 수 있다. 옛날엔 성과 숫자가 정직하게 나온다고 봤습니다. 그런데 똑똑한 AI는 주인이 보는 증거 자체를 그럴듯하게 조작할 수 있습니다. 감독자가 보는 화면을 대리인이 만든다면 감독은 껍데기입니다.

 대리인의 성향이 훈련으로 만들어진다. 보상 방식이 곧 "계약서"인데, 그 계약서에 허점이 있으면 AI는 그 허점을 파고들도록 학습합니다. 실수가 한 번으로 끝나지 않고 점점 강화됩니다.

 
 

 
 한 문장 요약

 감독이란 상대를 믿는 문제가 아니라 판을 잘 짜는 문제 다. 확인이 만들기보다 쉽고, 서로 다르게 틀리며, 봐주기가 손해가 되고, 정답을 대볼 바깥 기준이 있을 때 — 그때만 덜 똑똑한 쪽이 더 똑똑한 쪽을 제대로 감독할 수 있다.

 

 Entropy Lab · 감독과 정렬 노트
