기본 콘텐츠로 건너뛰기

당신의 테스트 결과를 신뢰할 수 있습니까? - 선입견의 무서움

여러분은 선입견이 무엇인지 이미 알고 계실겁니다.

어떤 사람들은 자신은 선입견 따위는 없다고 말씀하실것이고, 실제로도 선입견이 다른 사람보다 적은 사람들도 있긴 하지만 대부분의 사람들은 꽤 많은 선입견을 가지고 있습니다.

선입견은 당사자의 성장 환경, 학습, 경험 등이 복합적으로 작용하여 마음 속 깊이 뿌리 깊게 자리 잡은 감정이기 때문에 대부분의 사람들은 어떤 결정을 내리고 선택을 할 때 자신의 선입견이 개입되어 있다는 것을 쉽게 알아차리기 힘듭니다.

사람이 어떤 결정을 하고 선택을 하는 과정은 크게 두가지로 나뉘는데..

하나는 숙고 체계라는 방식으로 말 그대로 생각하고 생각하고 또 생각해서 결정하는 것이고, 다른 하나는 반사 체계로 그냥 무의식적으로 순간적으로 결정하는 방식을 말합니다.

선입견은 반사 체계에 속하는 것으로 우리의 결정에 무의식적으로 또한 신속하고 강력하게 영향을 미칩니다.

이러한 선입견을 알아보는 재미난 심리 테스트가 있습니다.

일명 '암묵적 연상 테스트(Implicit Association Test, IAT)' 불리는 테스트입니다.

IAT는 http://www.implicit.harvard.edu 에서 몇가지 시범 검사를 해볼 수 있습니다. 한글도 지원하기 때문에 관심 있는 분들은 한번 해보시는 것도 좋을 것 같습니다.

저는 인종에 관한 검사를 진행한 결과로


당신의 데이터가 제시하는 것:
흑인에 비해 백인에게 자동적 선호 다소 있음


 당신의 검사 결과 해석은 '백인에게 자동적 선호있음' 입니다. 왜냐하면 당신이 백인 얼굴과 좋은 단어들을 동일한 자판 키로 반응할 때 흑인 얼굴과 좋은 단어들을 동일한 자판 키로 반응할 때에 비해 더 빨리 반응하셨기 때문입니다.

위와 같이 나왔습니다.

어떤 분들은 IAT의 결과에 동의하지 못하실 수도 있으실 겁니다. 그리고 솔직히 말하면 IAT는 사람의 선입견을 측정하는 검사는 아닙니다.

하지만 위 검사를 통해서 우리가 자신에 대해 판단하고 있던 것과 전혀 다른 결과를 얻을 수도 있습니다. 즉, 자신이 선입견이 없다고 생각하는 것에 대해 선입견이 있는 것으로 나올 수 있습니다.

선입견이 없다고 생각하는 것에 대해 선입견이 있는 것으로 나오는 것은 실제로 생각과 행동의 시간 차이가 매우 작기 때문에 인지하지 못하기 때문입니다. IAT에서는 이것을 우리가 무의식적으로 관계를 형성한 것을 선택하는 것과 그렇지 못한 것을 선택하는 것에 있어서 매우 의미있는 시간차이가 있다고 합니다. 즉, 저는 백인과 좋은 의미의 단어들의 상관관계가 흑인과 좋은 의미의 단어들의 상관관계보다 더 강하게 형성되어 있다는 것입니다. 비록 제가 스스로 백인과 흑인은 평등하고 그렇게 생각하고 있다고 말한다고 하더라도 실제적인 제 무의식의 세계는 백인을 흑인보다 더 우월하다고 생각하고 있다는 것입니다.

다른 예를 들어, 오랜 기간 동안 테스트를 수행한 테스터는 자사의 제품의 장단점에 대해 많은 것을 알게 됩니다. 그리고 각 개발자의 성향을 알게 되고 이러한 정보들은 일종의 선입견을 형성합니다.

하지만 누군가 그 테스터에게 귀사 제품을 어떻게 생각하느냐? 라고 질문을 하였을 때, 솔직한 대답을 하는 경우는 많지 않습니다.

환경, 이해관계에 따라서 정말 결함이 많고 좋지 않은 제품일지라도 그렇게 말하지 못할 수도 있고 그렇게 대답할 수도 있다는 것입니다. 왜냐하면 자신이 테스트한 제품이 뚜렷하게 인식할 수 있을 정도로 나쁘지 않을 수 있기 때문입니다. 즉, 어떤 상황에 때하여 뚜렷하게 인식할 수 없을 때 그러한 인식의 차이를 인식해 낼 수 있느냐는 것입니다.

자신의 생각과 실제 자신의 행동 사이의 간극이 작은 경우라면 이러한 인식의 차이를 인식하기 힘들고 실제 자신의 생각보다 자신의 행동을 더 믿게 될 수도 있다는 것입니다.

즉, 자신이 테스트하고 있는 제품이 좋지 않은 제품이라고 생각하지만 제품의 좋은 면만을 부각시키기 위해 노력한다든지, 좋지 않은 면을 보지 않거나 숨기는 행동을 보일 수도 있다는 것입니다.

사용성의 경우에도 더 나은 방법이 있음에도 불구하고 기존의 방식을 고집할 수도 있습니다.

액티브 엑스를 사용하지 않고도 충분히 안전한 서비스를 구축할 수도 있지만 엑티브 엑스와 안전에 대한 강력한 상관관계의 선입관에 따라 엑티브 엑스를 고집할 수도 있습니다.

만약 인증 기관과 같은 경우라면 충분히 좋은 품질의 제품임에도 불구하고 개발회사의 선입견이 인증 결과에 영향을 미칠 수도 있습니다.

그런 면에서 많은 연구자들이 테스트를 자동화하기 위해 애쓰는 것일지도 모릅니다. 하지만 아직까지는 분명 테스트는 인간이 해야만 하는 테스트들이 남아 있습니다.

그것이 사용성 테스트일수도 있고, 기능성 테스트 일수도 있습니다.

중요한 것은 그러한 테스트에 우리의 선입견이 개입되지 않을 수 있도록 얼마나 노력하느냐는 것입니다.

잘 훈련된 테스터는 테스트 결과를 판단할 때 자신의 판단의 간극을 알아차리고 한번 더 생각하는 능력을 지닙니다.

여러분은 어떠신가요?

댓글

이 블로그의 인기 게시물

우리는 AI로 '더 빠른 말'을 키우고 있는걸까요? 아니면 '자동차'를 만들고 있는걸까요?

20년 넘게 IT 현장에서 뒹굴거렸는데... 요즘처럼 "우리가 지금까지 당연하게 여겨온 일하는 방식의 본질"에 대해 근본적인 질문을 던지게 만드는 때가 없었던 것 같습니다. 최근 읽은 UX 관련 글 하나가 가슴을 쿵 치고 지나갔습니다. UX 및 디지털 트렌드를 다루는 블로그 ux4dotcom에 올라온 "Beyond Faster Horses — Why AI Challenges One of UX's Oldest Assumptions"라는 글입니다. (출처: ux4dotcom - Beyond Faster Horses — Why AI Challenges One of UX's Oldest Assumptions ) 혁신을 말할 때 늘 인용되는 헨리 포드의 유명한 말이 있습니다. "사람들에게 무엇을 원하느냐고 물었다면, 그들은 '더 빠른 말'이라고 답했을 것이다." 사람들은 자신이 경험해 본 범위 안에서만 미래를 상상합니다. 말만 탈 줄 아는 사람에게 자동차는 상상 밖의 범주(Mental Model)니까요. 저자는 그동안 UX(사용자 경험)라는 학문과 필드 자체가 '더 빠른 말을 만드는 일(기존 과업의 효율화)'에 집중해 왔다고 지적합니다. 사용자의 행동을 관찰하고, 마찰(Friction)을 줄이고, 화면을 간소화하고, 기존 워크플로우를 최적화해 주는 작업 말입니다. 실제로 주변을 봐도 우리가 AI를 쓰는 방식도 대부분 이 범주를 벗어나지 못하고 있습니다. 더 빠르게 이메일을 작성하고, 문서 요약을 3초 만에 끝내고, 프레젠테이션 장표나 일정표를 순식간에 만들어내는 일. 분명 유용하고 저 역시 매일 요기하게 쓰고 있지만, 이건 어디까지나 '기존에 인간이 하던 일의 프로세스를 흉내 내어 속도만 올린 것(Faster Horse)'에 불과합니다. 정작 "이 워크플로우 자체가 과연 계속 존재해야 하는가?"라는 근본적인 질문은 던지지 못하고 있는 것이죠....

20년 차 테스터가 고른 최근 IT 소식: 기술의 속도, 그리고 사람의 자리

20년 넘게 IT 업계에서 테스팅하고 강의하고 공부하고 여러 일을 해왔지만... 정말이지 단 하루도 편하게 쉴 틈을 주지 않는 세상입니다. 특히 최근 4~5년 동안 가속화된 AI의 물결은 기술의 스펙트럼뿐만 아니라 우리가 일하고, 협업하고, 조직을 이끄는 방식 전체를 뒤흔들고 있습니다. 이번 주에도 수많은 뉴스레터와 아티클을 훑어보았습니다. 그중에서도 기술의 화려함 뒤에 숨겨진 ‘사람, 조직, 그리고 커리어의 본질’을 찌르는 글 몇 개가 눈에 띄어 메모해 둡니다. 제 평소 생각과 맞닿아 있는 6가지 이야기입니다. --- 1. 인지부채(Cognitive Debt): 바이브 코딩 시대에 우리가 지게 되는 진짜 빚 (출처: ROBOCO - 인지부채: 바이브 코딩 시대의 새로운 부채 관리법 / 정도현 수석 컨설턴트 ) 요즘 커서(Cursor)나 클로드 코드(Claude Code) 같은 에이전트를 붙여 "이거 만들어줘" 하고 승인(Approve) 버튼만 누르면 눈 깜짝할 사이에 코드베이스가 완성되는 '바이브 코딩(Vibe Coding)'이 유행입니다. 그런데 속도는 엄청나게 빠른데, 정작 서비스에 장애가 나면 "AI가 짜서 잘 모르겠는데요?"라는 답이 나오는 이상한 현상이 벌어집니다. 정도현 컨설턴트는 이를 '인지부채(Cognitive Debt)'라고 정의합니다. 코드는 쌓이는데, 정작 인간의 시스템 이해도는 쌓이지 않는 격차죠. * Human-in-the-loop의 환상: AI가 초당 수백 줄을 뽑아내는데 사람이 일일이 검토한다? 결국 검토자는 병목이 되고, 시간 압박에 쫓겨 영혼 없이 승인 버튼만 누르게 됩니다. 40년 전 자동화 연구(Bainbridge, 1983)가 지적했듯, 자동화될수록 사람은 감시만 하다가 정작 개입해야 할 결정적 순간에 숙련도를 잃어버립니다. * 부채는 0으로 만드는 게 아니라 '관리'하는 것: AI가 만든 모든 코드를 사람이 외울 수는 없습니다. 핵심은 ...

'자동화 편향'과 '대중적 불신' 을 고려한 AI 테스팅 시나리오 설계

최근 생성형 AI나 자율주행, 에이전트 기술의 테스팅 시나리오를 작성할 때 우리가 당연하게 전제(Assumption)로 깔고 가는 중요한 인간 행동 방식이 하나 있습니다. 바로 '자동화 편향성(Automation Bias)'입니다. 인간은 시스템이 자동화되고 스마트해질수록 기술을 과도하게 신뢰하고 주의력을 놓아버립니다. 차량을 운전하면서 운전자 보조 시스템을 켜고 전방 주시를 태만히 하고 스마트폰을 보거나 영상을 시청하는 운전자라던지 AI 의료 진단 보조 도구가 내놓은 결과를 의사가 깊은 의심 없이 그대로 승인해 버리는 현상이라던지 AI 챗봇이 추천한 잘못된 정보를 사용자가 사실로 믿고 행동하는 케이스 같은 게 있을 겁니다. 우리는 항상 이러한 "사람들이 AI를 너무 믿어서 발생하는 위험"을 핵심 리스크로 정의하고, 이를 검증하기 위한 안전장치(Safety Guardrail)나 경고 알림, 오용 방지(Misuse) 테스팅 시나리오를 도출해 왔습니다. 그런데 최근 Gizmodo에 보도된 미국 설문조사 결과는 매우 흥미로운 사실을 보여줍니다. (출처: Gizmodo - Survey Finds Americans See AI as Comparable to Humans—It’s Making Them Trust It Less )   기사에서 언급된 설문조사의 결과는 AI가 사람을 닮아갈수록 완벽함에 대한 기대와 실수가 충돌하고 책임이 모호해져 대중의 신뢰는 오히려 떨어진다는 것이었습니다.  자세히 살펴보면 해당 조사는 일반 대중을 대상으로 AI에 대한 인지적 반응을 측정했습니다. AI가 인간과 유사한 대화/추론 능력을 보일 때 유저가 느끼는 '인지적 불쾌한 골짜기(Uncanny Valley)' 현상을 정량 지표로 포착해 냈다는 점에서 의미가 있다고 생각합니다. 단순히 "AI가 좋다/나쁘다"를 넘어, 의인화(Anthropomorphism)의 수준과 신뢰도(Trust) 사이의 음(-)의 상관관계를 입증했기 때문...