{"slug":"Qh1Vrw","url":"https://popup2026.com/Qh1Vrw","kind":"html","title":"누가 누구를 감독하는가","description":"감독과 정렬에 관한 노트 누가 누구를 감독하는가 이 글의 뼈대는 하나입니다. 덜 아는 쪽이 더 아는 쪽을 어떻게 제대로 부리고 감시할 수 있는가. 주주가 자기보다 경영을 잘 아는 CEO를 통제하는 문제, 우리보다 똑똑해질지 모르는 AI를 감독하는 문제가 모두 같은 질문의 변형입니다.…","createdVia":"web-html","createdAt":"2026-07-02T19:41:23.647285+00:00","lastEditedAt":null,"viewCount":1,"forkedFrom":null,"forkCount":0,"agentCreated":false,"text":"누가 누구를 감독하는가 \n \n \n \n \n \n \n \n \n\n \n 감독과 정렬에 관한 노트\n\n 누가 누구를\n감독하는가\n\n 이 글의 뼈대는 하나입니다. 덜 아는 쪽이 더 아는 쪽을 어떻게 제대로 부리고 감시할 수 있는가. 주주가 자기보다 경영을 잘 아는 CEO를 통제하는 문제, 우리보다 똑똑해질지 모르는 AI를 감독하는 문제가 모두 같은 질문의 변형입니다.\n\n \n\n \n \n 1 \n 덜 똑똑한 쪽이 더 똑똑한 쪽을 감독할 수 있을까\n\n \n\n 있습니다. 열쇠는 \"푸는 것보다 확인하는 게 쉽다\" 는 점입니다. 직접 풀라면 못 푸는 문제도, 답을 주면 맞는지 확인은 할 수 있는 경우가 많습니다.\n\n 어려운 수학 증명을 스스로 만들진 못해도, 남이 쓴 증명을 한 줄씩 따라가며 \"여기 틀렸네\"는 잡아낼 수 있습니다. 바둑 초보도 프로 둘을 붙여 놓으면 누가 이겼는지는 압니다.\n\n 게다가 감독은 꼭 더 똑똑해서 하는 게 아닙니다. 이사회가 유능한 CEO를 통제하는 건 이사들이 더 똑똑해서가 아니라 해고권과 급여 결정권을 쥐고 있어서 입니다. 즉 똑똑함이 아니라 권한과 규칙으로 감독이 됩니다.\n\n \n 그런데 — 위험 지점 \n 확인이 푸는 것만큼 어려운 문제(예: \"이 연구 방향이 옳은가\" 같은 통짜 판단)에서는 이 방법이 안 통합니다. 그리고 더 똑똑한 상대가 감독자의 약점을 파악해 틀렸지만 그럴듯해 보이는 답 으로 검사를 통과해 버리면, 감독은 껍데기만 남습니다.\n\n \n\n \n\n \n \n 2 \n 비슷한 실력끼리 서로 감독하게 하면\n\n \n\n 좋은 점: 이제 감독자가 약하지 않으니, 확인하기 어려운 통짜 판단까지 다룰 수 있습니다.\n\n 나쁜 점 — 여기가 핵심입니다: 비슷한 애들은 비슷한 실수를 합니다. 같은 교과서로 공부한 두 학생은 틀리는 문제도 똑같습니다. 한 명이 못 보는 함정을 다른 한 명도 못 봅니다. 그래서 서로 검사해 줘도 둘 다 틀린 방향으로 사이좋게 통과시켜 버립니다. 여러 명이 검사하는 것처럼 보여도 실제로는 한 명이 검사하는 거나 마찬가지죠.\n\n 또 하나, 실력이 같고 이해관계도 같으면 담합 이 생깁니다. \"네 거 통과시켜 줄 테니 내 것도 통과시켜 줘.\" 검사하는 시늉만 남고 실제 검사는 죽습니다.\n\n 그래서 진짜 필요한 건 \"똑같은 실력\"이 아니라 \"실력은 비슷하되 다르게 틀리는 다양성\" 입니다. 여러 명의 예측을 모으면 정확해진다는 것도, 각자가 독립적으로 틀릴 때만 성립합니다. 다 같이 똑같이 틀리면 백 명을 모아도 소용없습니다.\n\n \n\n \n \n 3 \n 아예 서로 \"경쟁\"시키면\n\n \n\n 담합이 문제라면, 상대의 잘못을 잡아내는 게 나한테 이득이 되도록 판을 짜면 됩니다. 그러면 \"봐주기\"가 손해가 되니 담합이 깨집니다. 방법은 여러 가지입니다.\n\n \n 토론 방식 — 두 명에게 반대 입장을 맡기고 심판이 판정. 서로 허점을 필사적으로 찌르니 약한 심판도 판단할 수 있습니다.\n\n 만드는 자 vs 검사하는 자 — 한쪽은 증명을 만들고 한쪽은 검사. 일부러 \"교묘하게 틀린 증명\"을 만드는 역할을 넣어 검사자를 단련시킵니다.\n\n 토너먼트 — 승패가 분명한 영역에서 계속 붙여 순위를 매김(알파고가 자기 자신과 둔 방식).\n\n 베팅 — 자기 주장에 판돈을 걸고, 맞힌 쪽이 틀린 쪽 돈을 가져감. 거짓말에 비용이 붙습니다.\n\n \n \n 그런데 — 경쟁의 세 함정 \n ① 보상을 잘못 짜서 둘 다 이득 볼 여지가 있으면 담합이 되살아납니다.\n\n ② 정답을 확인할 바깥 기준 (계산 검증, 실제 데이터, 가끔의 사람 점검)이 없으면, 경쟁은 \"진실\"이 아니라 \"심판을 잘 속이는 법\"을 향해 갑니다.\n\n ③ 심판이 약하면 궤변이 이겨서 오히려 오류가 커집니다.\n\n \n\n \n\n \n 이 모든 것의 공통 뼈대: 주인–대리인 문제\n\n 지금까지의 이야기는 경제학의 오래된 이론 하나로 다 꿰어집니다. 이름은 원리–대리인 문제 , 쉽게 말해 주인과 대리인 문제 입니다. 세 가지가 동시에 있을 때 생깁니다.\n\n \n 주인과 대리인이 원하는 게 다르고 — 사장은 열심히 일하길 원하고 직원은 편하고 싶고,\n\n 주인이 대리인이 뭘 하는지 다 못 보고 — 사장이 직원을 24시간 감시 못 함,\n\n 그래도 맡길 수밖에 없을 때 — 사장이 모든 일을 직접 못 함.\n\n \n 셋 중 하나만 빠져도 문제가 사라집니다. 마음이 딱 맞으면 그냥 맡기면 되고, 다 보이면 딴짓할 때마다 지적하면 되니까요.\n\n 문제는 두 가지 모습으로 나타납니다. 하나는 일 맡긴 뒤 게으름 피우기 입니다. 뭘 하는지 안 보이니 대리인이 슬슬 놉니다. 이걸 막으려고 성과급을 걸죠. 그런데 성과에는 운 도 섞여 있어서, 성과급을 강하게 걸면 대리인이 자기 잘못도 아닌 운의 위험까지 떠안게 됩니다. 그래서 \"열심히 시키기\"와 \"위험 안 지우기\" 사이의 줄타기 가 이 이론의 심장입니다.\n\n 다른 하나는 애초에 능력을 속이기 입니다. 채용 전부터 대리인은 자기 실력을 알지만 주인은 모릅니다. 중고차 파는 사람은 차 상태를 알지만 사는 사람은 모르는 것과 같죠. 그래서 여러 조건의 계약을 제시해 스스로 고르게 하거나, 자격증처럼 실력을 증명하는 신호를 요구합니다.\n\n \n 2단계의 담합 여럿을 서로 비교 평가하면 정확해지는데, 다 같이 담을 짜면 그 비교가 무너진다 — 이미 알려진 오래된 경고 \n\n 3단계의 경쟁 감독 남의 성과를 기준선으로 쓰는 \"상대평가\" 그 자체 \n\n 3단계의 베팅·판돈 대리인에게 담보를 걸게 해 딴짓 비용을 높이는 방법 \n\n 측정되는 것만 열심히 점수 매기기 쉬운 일에만 상을 주면 진짜 중요한 일을 내팽개침 — 굿하트 법칙, AI의 보상 해킹도 같은 현상 \n\n \n\n \n\n \n 그런데 AI는 왜 더 어려운 \"주인–대리인 문제\"인가\n\n 고전 이론에는 없던 세 가지가 겹칩니다.\n\n \n 대리인이 주인보다 더 똑똑할 수 있다. 옛날 이론은 \"정보만 부족하지 머리는 대등하다\"고 봤는데, AI는 주인보다 유능할 수 있어 검사 자체가 능력을 넘어섭니다.\n\n 대리인이 성적표를 위조할 수 있다. 옛날엔 성과 숫자가 정직하게 나온다고 봤습니다. 그런데 똑똑한 AI는 주인이 보는 증거 자체를 그럴듯하게 조작할 수 있습니다. 감독자가 보는 화면을 대리인이 만든다면 감독은 껍데기입니다.\n\n 대리인의 성향이 훈련으로 만들어진다. 보상 방식이 곧 \"계약서\"인데, 그 계약서에 허점이 있으면 AI는 그 허점을 파고들도록 학습합니다. 실수가 한 번으로 끝나지 않고 점점 강화됩니다.\n\n \n \n\n \n 한 문장 요약\n\n 감독이란 상대를 믿는 문제가 아니라 판을 잘 짜는 문제 다. 확인이 만들기보다 쉽고, 서로 다르게 틀리며, 봐주기가 손해가 되고, 정답을 대볼 바깥 기준이 있을 때 — 그때만 덜 똑똑한 쪽이 더 똑똑한 쪽을 제대로 감독할 수 있다.\n\n \n\n Entropy Lab · 감독과 정렬 노트","alternates":{"markdown":"https://popup2026.com/Qh1Vrw.md","json":"https://popup2026.com/Qh1Vrw.json","html":"https://popup2026.com/Qh1Vrw"}}