Vol. 41 · Rubber-Stamp Oversight 책임 · Deep read
Lisanne Bainbridge (1983) · Lee et al. (CHI 2025)

사람이 승인했다,
그러나
판단했는가
인간 감독이 있다는 사실과 인간 통제가 작동한다는 사실은 다르다.

AI를 들일 때 기업이 가장 자주 다는 안전장치는 "최종 결정은 사람이 한다"이다. 그런데 검토자에게 시간도, 근거도, 거부할 권한도 없다면 그 사람은 책임자가 아니라 승인 버튼이다. 기록에는 사람이 남고, 판단은 이미 기계가 했다.

The Irony승인은 남고 판단은 사라진다
Not Less Trust덜 믿기가 답이 아니다
Make It Real감독을 실질로 만드는 설계
원전
Ironies of Automation · The Impact of Generative AI on Critical Thinking Bainbridge(1983) · Lee et al.(CHI 2025) · Schemmer et al.(IUI 2023)
Previously on Vol. 40
조선 정조 대왕의 프로젝트 리더십10년 걸릴 공사를 2년 8개월에 끝냈다. 사람을 압박해서가 아니라, 설계와 기술과 값을 치러서였다.
용어 · 이 글에서의 정의
형식적 감독 Rubber-Stamp Oversight

이 글에서 '형식적 감독'은 검토자가 게으르다는 뜻이 아니다. 인간 검토자가 판단에 필요한 시간과 근거, 거부할 권한 없이 승인 절차에만 놓인 상태를 뜻한다. 기록에는 사람의 결재가 남지만, 결론은 이미 기계가 낸 것이다.

Section Ⅰ · The Irony승인은 남고 판단은 사라진다

사람을 넣어 두는 것으로
안전해지지 않는다

AI를 업무에 들일 때 기업이 가장 자주 다는 안전장치는 한 문장이다. "최종 결정은 사람이 한다." 그 문장은 감사에도 통하고 회의에서도 통한다. 다만 그 사람이 실제로 결정하고 있는지는 따로 물어야 한다.

리샌 베인브리지가 1983년 논문 「자동화의 아이러니」에서 짚은 문제가 여기에 있다. 자동화가 대부분의 일을 가져가면 사람에게는 자동화하지 못한 일과 감시하는 일이 남는다. 그런데 손을 쓰는 일이 줄면 그 기술은 연습 부족으로 무뎌진다. 문제는 그다음이다. 사람이 넘겨받아야 하는 순간은 대개 무언가 잘못된 순간이고, 그때는 평소보다 더 높은 숙련이 필요하다. 그래서 베인브리지는 자동화할수록 훈련을 오히려 늘려야 한다고 했다. 40년 전 발전소와 항공기를 두고 쓴 글인데, 지금 읽으면 AI 도입 회의록 같다.

최근 연구는 여기에 한 층을 더한다. 마이크로소프트 리서치의 이하오핑 리 연구진은 지식노동자 319명에게서 실제 생성형 AI 사용 사례 936건을 모아 CHI 2025에 발표했다. 결과 중 하나가 이랬다. AI의 능력을 더 신뢰할수록 산출물을 비판적으로 따져 보는 노력이 줄었다. 반대로 자기 능력에 대한 자신감이 높은 사람은 더 활발히 따져 보았다.

같은 연구는 비판적 사고가 사라진다기보다 자리를 옮긴다고 본다. 정보를 모으는 일에서 검증하는 일로, 문제를 푸는 일에서 답을 통합하는 일로, 실행하는 일에서 관리하는 일로. 부담이 줄었다기보다 종류가 바뀐 것이다. 그런데 조직의 감독 설계는 대개 그 변화를 따라가지 않는다. 검토자에게 여전히 승인 버튼 하나만 주어진다.

Bainbridge
1983
「자동화의 아이러니」가 나온 해. 자동화가 늘수록 개입 기술은 무뎌지는데, 개입할 순간은 가장 어렵다
Field data
936
지식노동자 319명에게서 모은 실제 생성형 AI 사용 사례 (Lee 외, CHI 2025)
The finding
검토
AI를 더 신뢰할수록 산출물을 비판적으로 따져 보는 노력이 줄었다
Where it moved
3가지
비판적 사고의 이동: 정보 수집→검증, 문제 해결→응답 통합, 실행→관리

Section Ⅱ · Not Less Trust덜 믿기가 답이 아니다

고쳐야 할 것은 총량보다
분해능이다

여기까지 읽으면 결론이 "그러니 AI를 덜 믿자"로 기울기 쉽다. 연구는 그 방향에 제동을 건다.

Three Ways to Get Reliance Wrong
의존을 그르치는 두 방향과 하나의 목표
01
과의존
Over-reliance · 틀린 조언을 받아들인다
AI가 틀렸는데 그대로 승인한다. 매끄러운 답일수록 잘 통과한다. 우리가 Vol. 32에서 본 경계 밖의 실패가 조직으로 들어오는 통로다.
02
과소의존
Under-reliance · 맞는 조언을 거부한다
이쪽도 손해다. 디트보르스트 연구진은 사람들이 알고리즘이 틀리는 것을 한 번 보고 나면, 평균적으로 더 나은데도 등을 돌린다는 것을 보였다. 사람의 실수보다 기계의 실수에 더 가혹하다.
03
적정 의존
Appropriate reliance · 가려서 따른다
셰머 연구진의 정의는 명료하다. 옳은 조언과 틀린 조언을 구별하고 그 구별에 따라 행동하는 능력. 목표는 신뢰를 낮추는 것이 아니라 가려내는 눈금을 촘촘히 하는 것이다.

이 대목에서 우리 시리즈도 한 번 고쳐 읽어야 한다. Vol. 32에서 우리는 '끄는 자리'를 알아야 한다고 썼다. 그 말이 'AI를 덜 믿어라'로 읽히면 절반만 맞다. 끄는 자리를 정하는 목적은 의심의 총량을 늘리는 데 있지 않고, 켤 자리에서는 제대로 켜기 위해서다. 무차별한 불신은 무차별한 신뢰만큼이나 값을 치른다.

“적정 의존은 옳은 AI 조언과 틀린 AI 조언을 구별하고, 그 구별에 따라 행동하는 능력이다.” (요지 · Schemmer 외, Appropriate Reliance on AI Advice, IUI 2023)

Section Ⅲ · Make It Real감독을 실질로 만드는 설계

검토자를 넣지 말고
검토할 조건을 넣는다

인간 감독의 질은 검토자의 수로 재지지 않는다. 그가 무엇을 가지고, 어느 시점에, 어떤 권한으로 개입할 수 있는지로 재야 한다. 그 조건을 설계로 세우려면 다음을 통과해야 한다.

Design Checks · 승인 버튼을 판단으로 바꾸려면
인간 감독을 실질로 만드는 다섯 질문
01
시간과 맥락을 주었는가?
검토자가 결론의 근거를 이해할 시간과 정보를 갖는가, 처리 건수에 쫓기고 있는가.
02
거부할 권한이 실제로 있는가?
AI의 결론을 되돌리거나 중단시킬 수단이 있는가. 이의를 제기해도 불이익이 없는가(Vol. 28).
03
설명 대신 반증거리를 주는가?
좋은 설명은 결론을 더 믿게 만드는 설명이 아니다. 출처·불확실성·적용되지 않는 조건·반대 증거를 함께 주어 검증할 수 있게 하는 설명이다.
04
개입 기술을 유지시키는가?
자동화가 늘어난 만큼 훈련을 줄이지는 않았는가. 베인브리지의 결론은 반대였다(Vol. 25).
05
자율성에 회수 조건이 있는가?
권한을 단계로 나누어 주었는가(열람·추천·실행·예외처리). 오류가 늘면 즉시 되돌릴 기준을 미리 정했는가(Vol. 17·34).

이 다섯 가지가 없으면 남는 것은 결재란의 이름뿐이다. 사고가 났을 때 그 이름은 책임을 지지만, 사고를 막지는 못한다. 우리가 Vol. 26에서 본 그대로다. 책임은 시스템으로 넘어가지 않는데, 판단은 이미 조용히 넘어가 있는 상태가 가장 위험하다.

그래서 신뢰의 최종 기준은 정확도가 아니다. 틀렸을 때 알아차리고, 멈추고, 고칠 수 있는가이다. 완벽한 AI를 기다리는 것은 계획이 될 수 없다. 오류를 전제하고도 그 능력을 쓰면서, 판단의 주인을 사람 쪽에 남겨 두는 설계가 계획이다.

AI를 더 많이 들일수록 더 많이 의심해야 하는 것은 아니다. 더 정확히 나누어 묻고, 더 독립적으로 확인하고, 더 빨리 고칠 수 있어야 한다. 성숙한 조직은 AI를 많이 쓰는 조직이 아니라, 어디까지 믿고 언제 멈출지를 미리 정해 둔 조직이다.

Synthesis · Vol. 41

감독이 있다는 것과
작동한다는 것은 다르다

베인브리지가 1983년에 짚은 자동화의 아이러니는 지금 더 잘 맞는다. 자동화가 늘수록 사람은 손을 쓰는 일에서 멀어져 개입 기술이 무뎌지는데, 정작 개입이 필요한 순간은 무언가 잘못된 때라 평소보다 더 높은 숙련을 요구한다. 여기에 최근 연구가 하나를 더한다. AI를 신뢰할수록 산출물을 비판적으로 따져 보는 노력이 줄었다.

그렇다고 답이 '덜 믿기'는 아니다. 적정 의존 연구가 보여 주듯 과의존과 과소의존은 둘 다 실패다. 필요한 것은 신뢰의 총량 조절보다 분해능이다. 어떤 과업에서, 어떤 증거 아래, 어디까지 의존할지를 나누고, 검토자에게 시간과 근거와 거부할 권한을 실제로 쥐여 주는 것.

Bainbridge '83 · Lee et al. '25 — Leadership Insight
More from Leadership Insight