본문 바로가기

테크리드 오답노트

점수의 역설

“숫자는 거짓말을 하지 않아요.
하지만 숫자를 다루는 놈은 거짓말을 하지”

최근에 모 대기업에서 놀랄만한 규모의 모럴 해저드 사건이 터졌습니다. 후속 기사에서는 엘리트라고 뽑아 놓은 신입 직원들 중 적반하장으로 소송까지 진행하는 것에 다들 놀랐다 — 고 하던데, 개인적으로는 소회가 좀 달랐습니다.

애초에 그런, 쪽에 유리하게 채용/평가 시스템을 만들어 굴리며 뭔 소리지?

자세히 공유하긴 그렇습니다만. 그 바닥의 채용/평가 시스템이야 워낙 유명하기도 하고 다방면으로 겪어 본 경험도 있어서 여러가지로 생각해 둔 거리가 많습니다.

대기업 공채라는 상황의 특수성을 감안하면 지필 시험 / 구조적 면접 / 단시간의 회전식 공채 면접 / 점수제 커트라인은 어느 정도 불가피한 영역이기도 합니다. 좀 더 깊이 들어가면 그러니까 공채 같은 포맷으로 사람을 채용하지 말라고, 라는게 밑바탕에 있습니다만.

 

(합리적) 인센티브 이론을 아십니까? 시카고 대학교의 노벨 경제학상 수상자 게리 베커를 필두로, 이후 폭발적으로 발전한 실험 사회학 방법론과 함께 일가를 이룬 이론입니다. 일견 경제학과 크게 무관한 듯, 비합리적인 듯 보이는 인간(경제 주체)의 선택들이 사실 그 입장에서는 경제적으로 합리적인 선택(이득 최대화 / 손실 최소화)이다 — 라는 이론인데요. 흔한 과학의 좋은 이론들이 그렇듯이 알고 보면 콩 심은데 콩 나는 당연한 소리를 합니다.

인센티브 이론에서 중요하게 다루는 법칙 중 하나가, “행위 주체는 인센티브에 반응한다”는 겁니다. 그 인센티브는 실제 금전적인 이득일 수도 있으나, 사회적 평판이나 인정, 감정 혹은 개인의 만족과 같은 비 물질적인 인센티브일 수도 있습니다. 각 개인에 따라 가치Value의 기준이 다르기 때문에 주어진 인센티브(들)에 대한 선택은 갈릴 수 있으나, 어쨌든 각각의 행위 주체 기준으로 주어진 상황에서 최대한 이득이 되는 방향으로 선택하고 움직인다는 겁니다.

디렉션과 거버넌스를 이야기 할 때 그 핵심에는 이러한 인센티브의 설계가 있습니다. 따랐을 때 더 이득이 되는 쪽賞으로, 혹은 따르지 않았을 때 손실이 생기는 쪽罰으로 조직 구조를 설계해서 하나의 방향성Direction을 만드는 것이 조직의 거버넌스Governance 라고 봅니다.

문제는, 보통 인센티브 설계가 설계자의 의도대로 움직이지 않는다는 겁니다.

그 사례에 있어서는 워낙 다양하고, 재밌는 다른 읽을 거리들도 허다해서— 스티븐 레빗의 [괴짜 경제학]외 시리즈를 강력 추천합니다 — 좀 유명한 예 하나만 들어 볼까요. 쥐 숫자를 줄이고 싶었던 어느 정부 이야기입니다.

그곳에서는 거리에 쥐가 들끓어서, 사람들이 쥐를 잡아 오면 그 숫자만큼 보상해 주는 인센티브 체계를 만들었습니다. 보상금이 걸린 행정 문제이다 보니 몇 마리의 쥐를 잡았는지 입증할 방법이 필요했겠지요. 잡은 쥐의 꼬리를 잘라서 가져오면 그 숫자만큼 보상금을 지급했다고 합니다. 그 결과는?

보상금을 목적으로 가정에서 쥐를 사육하는 사람들이 생겼다고 합니다.

 

다시, 채용과 평가의 문제로 돌아가 보겠습니다. 공채는 대규모 다대다 채용의 방식입니다. 평가자도, 피평가자도 각각 여러 사람들을 거칩니다. 정해진 자리에 사람을 채우는 문제라면 책임자가 보기에 이 사람이 저 사람보다 더 적합할 것 같다는 것 만으로 충분합니다. 하지만 사람을 일단 선별해 두고 빈 자리에 보내는 공채의 방식에서는 — 적어도, 객관적이고 보편적인 것 같은 표준/기준이 있는, 것, 같다?, 정도의 인식이 필요합니다.

그러니 표준화 점수 체계가 중요해 지고, 점수에 따라 일정 비율을 잘라내는 방식을 취하게 됩니다. 조직과 자리에 따라 어딘가에서는 과감하고 폭발적인 행동력을 지닌 사람이, 또 다른 곳에서는 조용하게 주어진 일만 묵묵하게 해내는 사람이 더 적합할 수 있습니다, 만, 공채라는 표준에서는 그 모든 것이 일단, 일괄 기준의 선형Linear 점수제 안에 투사됩니다. 그것이 무엇이든.

데이터를 다룬 경험이 있는 사람들 대부분 공감할 겁니다. 같은 숫자라 할 지라도, 어떻게 꺼내 놓는가에 따라 완전히 다른 이야기가 될 수 있다는 것을. 때문에 어떤 숫자 데이터를 놓고 해석을 한다면, 무엇을 대상으로 / 어떻게 측정 되었는지를 반드시 고려해야만 합니다. 그 숫자의 배경 맥락을 얼렁뚱땅 넘기면 숫자 놀음의 구라가 되고, 한쪽 눈 감고 무시하면 그냥 사기가 됩니다.

언뜻 객관적인 듯 보이는 표준 점수제의 근본 문제가 바로 이겁니다.

그거, 무엇을 대상으로 어떻게 측정합니까?

대충 현업/책임자와 이해관계가 깊지 않은, 혹은 적어도 채용 시스템 설계에 대한 고민이 깊지 않거나 — 아니면 그만큼 깊은 무력감을 갖고 있는 — 사람(들)이 만든 상식 퀴즈에서 크게 벗어나지 않습니다. 이렇게 되면 시험 점수는 대체로 출제자의 의도/관점을 얼마나 비슷하게 일치시킬 수 있는가, 에 크게 갈리지 않습니다. 출제자가 상식이라 생각하는 지식을 외우고, 출제자가 생각하고 체감하는 방향으로 해석하면 얼마든지 해킹Hacking이 가능한 시험입니다.

따라서 이런 표준 시험은 그야말로 최소한의 지식 수준만을 확인하고, 그 다음 단계에서 해킹 여부를 평가하고 그 내막을 살펴볼 과제/심층 면접 등의 장치가 필요합니다. 이 기준으로 본다면 표준 시험은 절대평가로 대략 10배수 정도가 통과 되어야 마땅합니다. 그리고 가장 첫 관문인 표준 시험을 통과한 후에는 백지에서부터 제대로 된 심층 평가를 시작해야 합니다.

하지만 갖가지 현실적인 한계 때문에 그렇게 되고 있지 않습니다. 일차적인 표준 시험 점수는 상대평가를 받으며, 최종 선별 단계에까지 중요한 기준이 됩니다. 개인적으로는 상당부분 채용 단계에서의 무력감 혹은 나태 때문이라고 봅니다만.

명백한 경제 주체인 사람은 인센티브에 반응합니다. 채용, 이라는 인센티브 체계가 이렇게 짜여 있다면, 그 대상인 응시자 — 피평가자는 어쨌든 점수를 끌어 올리는 방향으로 반응합니다. 애석하게도 시험을 잘 보기 위해서 죽어라 공부하는 방향은 아닙니다. 물론 채용이 높은 가치이기는 하지만, 그런 댓가를 지불할 만큼 높은 일은 아닐테니까요. 가장 쉽게 찾을 수 있는 방법은 기출문제 연구입니다.

선형 점수 체계로 사람을 줄 세우고자 한다면, 반드시, 실제보다 부풀리는 점수 해킹에 대한 대응을 갖고 있어야 합니다. 정석은 길고 피곤하며 지루한 길이며, 누구나 그 방법은 알지만 거의 아무도 그렇게 하지 않습니다. 따라서 크건 작건 반칙/해킹으로 자신의 이득을 취하려는 경향이 강할수록, 표준 점수 체계에서는 상대적으로 더 많은 이득을 볼 수 있습니다. 표준 점수 체계가 공고할수록, 최종 결과에 미치는 영향이 클 수록, 더 강하게 말입니다.

그리고 예의 그 채용/평가 체계는 지난 수십년 동안 여러 현실적인 이유에서 큰 변화 없이 유지되어 왔습니다. 오히려 더 공고해졌다고 볼 수 있을 겁니다. 한 켠으로는 (어쨌든) 그런 평가 체계의 승리자(들)이 만든 시험이니 말입니다. 그래서 딱히, 현상 자체는 그리 놀랍지 않았습니다. 알고보면 콩 심은데 콩 나는 이야기.

 

숫자는 거짓말을 하지 않는다, 객관적이고 보편 타당하다.

그래요?

숫자 다루는 사람 치고 적당히 어루만져 주는 방법 한 두 가지 모르는 사람 별로 없을텐데. 혹시 그런 건가요, ‘나는 바담풍 해도 너는 바람 풍 해라’. 그러니까, 너무 나이브 하지 않습니까, 그거?

의심 없이 숫자를 볼 수 있습니까? 그렇다면, 필경 숫자의 역설에 갇힌 겁니다.

 

'테크리드 오답노트' 카테고리의 다른 글

수포 시대의 인문학 밈 유감  (0) 2026.09.16
브랜드와 타이틀  (0) 2026.09.16
Quality Code  (0) 2026.09.16
좋은 팀장은 다 어디 갔을까?  (0) 2026.09.16
팀워크의 탄생  (0) 2026.09.16