기본 콘텐츠로 건너뛰기

당신의 테스트 결과를 신뢰할 수 있습니까? - 선입견의 무서움

여러분은 선입견이 무엇인지 이미 알고 계실겁니다.

어떤 사람들은 자신은 선입견 따위는 없다고 말씀하실것이고, 실제로도 선입견이 다른 사람보다 적은 사람들도 있긴 하지만 대부분의 사람들은 꽤 많은 선입견을 가지고 있습니다.

선입견은 당사자의 성장 환경, 학습, 경험 등이 복합적으로 작용하여 마음 속 깊이 뿌리 깊게 자리 잡은 감정이기 때문에 대부분의 사람들은 어떤 결정을 내리고 선택을 할 때 자신의 선입견이 개입되어 있다는 것을 쉽게 알아차리기 힘듭니다.

사람이 어떤 결정을 하고 선택을 하는 과정은 크게 두가지로 나뉘는데..

하나는 숙고 체계라는 방식으로 말 그대로 생각하고 생각하고 또 생각해서 결정하는 것이고, 다른 하나는 반사 체계로 그냥 무의식적으로 순간적으로 결정하는 방식을 말합니다.

선입견은 반사 체계에 속하는 것으로 우리의 결정에 무의식적으로 또한 신속하고 강력하게 영향을 미칩니다.

이러한 선입견을 알아보는 재미난 심리 테스트가 있습니다.

일명 '암묵적 연상 테스트(Implicit Association Test, IAT)' 불리는 테스트입니다.

IAT는 http://www.implicit.harvard.edu 에서 몇가지 시범 검사를 해볼 수 있습니다. 한글도 지원하기 때문에 관심 있는 분들은 한번 해보시는 것도 좋을 것 같습니다.

저는 인종에 관한 검사를 진행한 결과로


당신의 데이터가 제시하는 것:
흑인에 비해 백인에게 자동적 선호 다소 있음


 당신의 검사 결과 해석은 '백인에게 자동적 선호있음' 입니다. 왜냐하면 당신이 백인 얼굴과 좋은 단어들을 동일한 자판 키로 반응할 때 흑인 얼굴과 좋은 단어들을 동일한 자판 키로 반응할 때에 비해 더 빨리 반응하셨기 때문입니다.

위와 같이 나왔습니다.

어떤 분들은 IAT의 결과에 동의하지 못하실 수도 있으실 겁니다. 그리고 솔직히 말하면 IAT는 사람의 선입견을 측정하는 검사는 아닙니다.

하지만 위 검사를 통해서 우리가 자신에 대해 판단하고 있던 것과 전혀 다른 결과를 얻을 수도 있습니다. 즉, 자신이 선입견이 없다고 생각하는 것에 대해 선입견이 있는 것으로 나올 수 있습니다.

선입견이 없다고 생각하는 것에 대해 선입견이 있는 것으로 나오는 것은 실제로 생각과 행동의 시간 차이가 매우 작기 때문에 인지하지 못하기 때문입니다. IAT에서는 이것을 우리가 무의식적으로 관계를 형성한 것을 선택하는 것과 그렇지 못한 것을 선택하는 것에 있어서 매우 의미있는 시간차이가 있다고 합니다. 즉, 저는 백인과 좋은 의미의 단어들의 상관관계가 흑인과 좋은 의미의 단어들의 상관관계보다 더 강하게 형성되어 있다는 것입니다. 비록 제가 스스로 백인과 흑인은 평등하고 그렇게 생각하고 있다고 말한다고 하더라도 실제적인 제 무의식의 세계는 백인을 흑인보다 더 우월하다고 생각하고 있다는 것입니다.

다른 예를 들어, 오랜 기간 동안 테스트를 수행한 테스터는 자사의 제품의 장단점에 대해 많은 것을 알게 됩니다. 그리고 각 개발자의 성향을 알게 되고 이러한 정보들은 일종의 선입견을 형성합니다.

하지만 누군가 그 테스터에게 귀사 제품을 어떻게 생각하느냐? 라고 질문을 하였을 때, 솔직한 대답을 하는 경우는 많지 않습니다.

환경, 이해관계에 따라서 정말 결함이 많고 좋지 않은 제품일지라도 그렇게 말하지 못할 수도 있고 그렇게 대답할 수도 있다는 것입니다. 왜냐하면 자신이 테스트한 제품이 뚜렷하게 인식할 수 있을 정도로 나쁘지 않을 수 있기 때문입니다. 즉, 어떤 상황에 때하여 뚜렷하게 인식할 수 없을 때 그러한 인식의 차이를 인식해 낼 수 있느냐는 것입니다.

자신의 생각과 실제 자신의 행동 사이의 간극이 작은 경우라면 이러한 인식의 차이를 인식하기 힘들고 실제 자신의 생각보다 자신의 행동을 더 믿게 될 수도 있다는 것입니다.

즉, 자신이 테스트하고 있는 제품이 좋지 않은 제품이라고 생각하지만 제품의 좋은 면만을 부각시키기 위해 노력한다든지, 좋지 않은 면을 보지 않거나 숨기는 행동을 보일 수도 있다는 것입니다.

사용성의 경우에도 더 나은 방법이 있음에도 불구하고 기존의 방식을 고집할 수도 있습니다.

액티브 엑스를 사용하지 않고도 충분히 안전한 서비스를 구축할 수도 있지만 엑티브 엑스와 안전에 대한 강력한 상관관계의 선입관에 따라 엑티브 엑스를 고집할 수도 있습니다.

만약 인증 기관과 같은 경우라면 충분히 좋은 품질의 제품임에도 불구하고 개발회사의 선입견이 인증 결과에 영향을 미칠 수도 있습니다.

그런 면에서 많은 연구자들이 테스트를 자동화하기 위해 애쓰는 것일지도 모릅니다. 하지만 아직까지는 분명 테스트는 인간이 해야만 하는 테스트들이 남아 있습니다.

그것이 사용성 테스트일수도 있고, 기능성 테스트 일수도 있습니다.

중요한 것은 그러한 테스트에 우리의 선입견이 개입되지 않을 수 있도록 얼마나 노력하느냐는 것입니다.

잘 훈련된 테스터는 테스트 결과를 판단할 때 자신의 판단의 간극을 알아차리고 한번 더 생각하는 능력을 지닙니다.

여러분은 어떠신가요?

댓글

이 블로그의 인기 게시물

피드백 루프: AI 시대 테스터가 지켜내야 할 핵심 엔진

소프트웨어 개발과 테스팅 현장에서 가장 자주 언급되지만, 막상 시스템이 복잡해질수록 쉽게 경시되곤 하는 핵심 개념이 바로 '피드백 루프(Feedback Loop)'입니다. 코드를 수정하고, 빌드하고, 테스트 결과를 확인하고, 다시 개선하는 그 순환 과정의 속도와 정확도가 결국 소프트웨어의 품질을 결정짓기 때문입니다. 품질 전문가 매슈 하이저(Matthew Heusser)가 자신의 블로그 Quality Remarks에 기고한 "One Loop After Another" 아티클은 바로 이 피드백 루프의 다층적 구조와, AI 시대에 우리가 놓치지 말아야 할 품질 검증의 본질을 날카롭게 되짚어 줍니다. (출처: Quality Remarks - One Loop After Another / Matthew Heusser) https://qualityremarks.com/one-loop-after-another/ 매슈 하이저는 소프트웨어 개발 생태계가 단순히 하나의 커다란 테스트 루프로 돌아가는 것이 아니라, 시간 축과 관점에 따라 겹겹이 쌓인 '연쇄적인 피드백 루프들(One Loop After Another)'로 이루어져 있다고 설명합니다. 초단기 루프 (Inner Loop): 개발자가 코드를 작성하는 몇 초~몇 분 단위의 루프입니다. 단위 테스트(Unit Test)나 IDE의 Linter, AI 자동 완성이 즉각적인 피드백을 주는 영역입니다. 단기 루프 (Daily / CI Loop): 커밋과 푸시가 이루어지고, CI/CD 파이프라인에서 통합 테스트와 정적 분석이 실행되는 몇 시간 단위의 루프입니다. 중기 루프 (Iteration / Exploration Loop): 스프린트 단위로 탐색적 테스팅(Exploratory Testing)을 수행하고, 실제 사용자 시나리오나 엣지 케이스를 사람이 직접 검증하며 시스템의 유기적 작동을 확인하는 며칠~몇 주 단위의 루프입니다. 장기 루프 (Outer / Market Loop): 실제 ...

에이전틱 AI 프로젝트에서 테스터의 5가지 핵심 원칙

AI 코딩 에이전트와 자율형 에이전트가 빠르게 개발 워크플로우에 통합되면서, 단순히 코드를 잘 짜는 것을 넘어 '에이전트와 어떻게 협업하고 통제할 것인가'가 개발자와 아키텍트들의 가장 큰 화두로 떠올랐습니다. 윤석찬 님의 아티클 "AI 에이전트 시대, 개발자는 어떻게 일해야 하는가? – 프론티어 엔지니어링의 10가지 원칙"은 에이전틱 AI 시대에 엔지니어가 마주하는 패러다임 변화와, 실무 현장에서 일하는 방식을 어떻게 재정의해야 하는지 아주 명확한 가이드라인을 제시해 줍니다. (출처: channy.creation.net - 윤석찬 님의 블로그) https://channy.creation.net/blog/1989 비록 대규모 에이전트 오케스트레이션이나 초거대 인프라 시스템을 개인이 직접 구축하고 운용하는 것은 비용적·기술적으로 현실적인 한계가 있습니다. 하지만 개인 프로젝트에서 AI와 바이브 코딩(Vibe Coding)을 활용하며 겪었던 맥락 손실, 환각, 통제 불능의 경험들을 떠올려보면, 이 아티클이 제시하는 10가지 프론티어 엔지니어링 원칙은 소규모 개인 개발 환경에서도 대단히 깊은 공감을 불러일으킵니다. 이 글은 단순히 "AI 도구를 잘 쓰자"는 수준에 머무르지 않습니다. AI 에이전트가 생성해내는 불확실성 속에서 인간 엔지니어가 시스템의 맥락을 주도하고, 오작동을 제어하며, 품질의 키(Steering Wheel)를 쥐기 위한 구조적 사고법을 다룹니다. 그렇다면 프론티어 엔지니어링의 원칙을 바탕으로, 시스템의 신뢰성과 안전성을 검증해야 하는 테스터는 과연 어떤 실무 원칙을 세워나갈 수 있을까요? 윤석찬 님이 제시한 엔지니어링 원칙을 테스팅 관점으로 재해석해 보면, 다음과 같은 5가지 원칙으로 정리할 수 있을 것 같습니다. 1. 결정론적 검증에서 '경계선 및 허용 오차(Boundary)' 테스팅으로 전환하라 에이전트 기반 시스템은 같은 입력을 주어도 매번 다른 추론 경로를 거치는 확률적(Stoc...

합성 사용자(Synthetic Users)의 5가지 유형과 AI 테스팅 현장에서의 활용법

AI와 생성형 모델 기술이 발전하면서, 사용자 경험(UX) 연구와 테스팅 현장에서 가상 퍼소나를 활용해 테스트 데이터를 수집하거나 사용성을 평가하려는 시도가 급격히 늘고 있습니다. 이를 흔히 '합성 사용자(Synthetic Users)'라고 부릅니다. 하지만 막연히 "AI에게 사용자 역할을 시켜 테스트를 돌린다"고 할 때, 그 가상 사용자가 어떤 방식과 데이터로 생성되었는지 명확히 구분하지 않으면 자칫 왜곡된 결과에 빠질 위험이 있습니다. UX 및 사용성 리서치 분야의 권위 있는 기관인 MeasuringU에서 이 합성 사용자의 개념을 명쾌하게 분류한 아티클을 공개했습니다. 바로 "What Are the Different Types of Synthetic Users?"라는 글입니다. (출처: MeasuringU - What Are the Different Types of Synthetic Users? / Jeff Sauro, PhD & Jim Lewis, PhD) https://measuringu.com/what-are-the-different-types-of-synthetic-users/ Jeff Sauro와 Jim Lewis 박사는 합성 사용자를 단순히 하나의 개념으로 뭉뚱그리지 않고, 생성 기술의 근거와 데이터 기반에 따라 크게 5가지 유형으로 깔끔하게 정리해 줍니다. 첫째는 규칙 기반(Rule-Based) 합성 사용자입니다. AI 모델이 아니라 사전 정의된 조건문, 정규식, 시나리오 스크립트에 따라 움직이는 전통적인 형태의 가상 사용자입니다. 예측 가능하고 정확하지만, 인간 사용자의 복잡한 정서나 미묘한 변수를 반영하진 못합니다. Selenium, Playwright, K6 같은 도구를 통해 지정된 경로대로 버튼을 누르고 데이터를 입력하는 방식을 들 수 있습니다. 둘째는 퍼소나 기반 LLM(Persona-Based LLM) 합성 사용자입니다. 생성형 AI에게 "너는 50대 비테크놀로지 사용...