기본 콘텐츠로 건너뛰기

AI는 과연 인간을 대신해 '진짜 사용성 문제'를 찾아낼 수 있을까?

최근 AI 에이전트와 바이브 코딩의 바람을 타고 가장 뜨거운 화두로 떠오른 분야 중 하나가 바로 'AI를 활용한 자동화 테스팅'입니다. 특히 사용성 평가(Usability Testing) 영역에서 "사람 평가자 대신 AI가 사용성 문제를 자동으로 찾아낼 수 있는가?"에 대한 논쟁은 현장의 리더들과 테스터들에게 대단히 흥미로운 관심사입니다.

최근 UX 및 사용성 측정 분야의 권위 있는 기관인 MeasuringU에서 이 질문에 대해 매우 현실적이고 명확한 답을 내려주는 실험 결과를 공개했습니다. 바로 "Does AI Find Real Usability Problems? A Replication"이라는 아티클입니다.

(출처: MeasuringU - Does AI Find Real Usability Problems? A Replication / Jeff Sauro, PhD & Jim Lewis, PhD)

https://measuringu.com/does-ai-find-real-usability-problems-a-replication/

이 글은 AI가 실제 사용성 문제를 발견할 수 있는지에 대한 이전 연구를 다시 엄격하게 재현(Replication)하고 검증한 결과를 다룹니다. 기존의 일부 낙관적인 연구나 마케팅적 주장에서는 AI가 사용자의 사용성 문제를 사람만큼, 혹은 사람보다 잘 찾아낸다고 말하곤 했습니다. 하지만 MeasuringU의 연구진이 동일한 조건에서 통제된 실험을 수행해 보니 매우 흥미롭고 냉정한 결론에 도달했습니다.

실험의 핵심 결론은 AI가 사용성 문제를 '전혀 못 찾는 것'은 아니지만, 사람이 직접 관찰하고 발견해 내는 '진짜 사용성 문제(Real Usability Problems)'와는 질적으로 큰 차이가 있다는 점입니다.

AI가 도출해 내는 사용성 문제들을 면밀히 분석해 보면, 실제 사용자가 화면에서 겪는 치명적인 마찰이나 혼란보다는 가이드라인에 기반한 정적 체크리스트 수준의 지적에 머무르는 경우가 많았습니다. 특히 사용자가 과업을 수행하는 과정에서 느끼는 정서적 답답함, 맥락상의 오해, 그리고 의도와 행동 간의 미묘한 불일치에서 발생하는 진짜 사용성 결함들을 AI는 제대로 포착해 내지 못했습니다.

더 나아가 AI는 사용자가 실제로 아무런 불편 없이 잘 지나간 부분에서도 그럴듯한 논리를 대며 '거짓 양성(False Positive)'을 대량으로 보고하는 경향을 보였습니다. 이는 실무 현장에서 테스터나 UX 리서처가 AI가 뽑아낸 리포트를 일일이 검증하고 가려내는 데 더 많은 시간을 쓰게 만드는, 일종의 '검증 비용의 폭증'을 야기합니다.

이 아티클을 읽으며 제 개인적인 경험과 생각을 돌이켜보게 됩니다. AI 자동화 도구들을 접할 때마다 느끼는 점이지만, AI는 과거 소프트웨어의 정적 분석 도구(Static Analysis Tool)와 유사한 역할을 해줄 뿐입니다. 코딩 컨벤션이나 명확한 규칙 위반을 잡는 데는 유용할지 몰라도, 시스템의 맥락과 인간의 복잡한 심리를 이해하는 테스팅을 대체할 수는 없습니다.

결국 사용성 평가 영역에서 AI는 아직까지는 테스터의 '대체재'가 아니라 단순한 '지원 도구'로 생각해야 한다고 봅니다. 물론 시간이 더 흐른다면 기술이 더 발전한다면 얘기가 달라질 수 있을 수도 있습니다.

하지만 아직은 AI가 뽑아준 평가 결과에 안주하여 "AI가 괜찮다고 했으니 사용성 검증이 끝났다"고 믿어버리는 순간, 우리는 전형적인 '자동화 편향(Automation Bias)'에 빠지게 되며, 그 결과 실제 사용자가 서비스에서 겪게 될 치명적인 장애물들을 놓치게 됩니다.

소프트웨어 품질과 사용성이라는 우주를 항해하는 우리 히치하이커들에게 필요한 것은, AI라는 유능하지만 가끔 허풍을 떠는 조수를 적절히 활용하되, 사람의 실제 행동과 맥락을 읽어내는 테스터 본연의 '비판적 사고'를 끝까지 유지하는 일일 것입니다. 결국 진짜 문제를 알아채고 서비스의 품질을 완성하는 것은 언제나 사람의 날카로운 시선이니까요.

댓글

이 블로그의 인기 게시물

피드백 루프: AI 시대 테스터가 지켜내야 할 핵심 엔진

소프트웨어 개발과 테스팅 현장에서 가장 자주 언급되지만, 막상 시스템이 복잡해질수록 쉽게 경시되곤 하는 핵심 개념이 바로 '피드백 루프(Feedback Loop)'입니다. 코드를 수정하고, 빌드하고, 테스트 결과를 확인하고, 다시 개선하는 그 순환 과정의 속도와 정확도가 결국 소프트웨어의 품질을 결정짓기 때문입니다. 품질 전문가 매슈 하이저(Matthew Heusser)가 자신의 블로그 Quality Remarks에 기고한 "One Loop After Another" 아티클은 바로 이 피드백 루프의 다층적 구조와, AI 시대에 우리가 놓치지 말아야 할 품질 검증의 본질을 날카롭게 되짚어 줍니다. (출처: Quality Remarks - One Loop After Another / Matthew Heusser) https://qualityremarks.com/one-loop-after-another/ 매슈 하이저는 소프트웨어 개발 생태계가 단순히 하나의 커다란 테스트 루프로 돌아가는 것이 아니라, 시간 축과 관점에 따라 겹겹이 쌓인 '연쇄적인 피드백 루프들(One Loop After Another)'로 이루어져 있다고 설명합니다. 초단기 루프 (Inner Loop): 개발자가 코드를 작성하는 몇 초~몇 분 단위의 루프입니다. 단위 테스트(Unit Test)나 IDE의 Linter, AI 자동 완성이 즉각적인 피드백을 주는 영역입니다. 단기 루프 (Daily / CI Loop): 커밋과 푸시가 이루어지고, CI/CD 파이프라인에서 통합 테스트와 정적 분석이 실행되는 몇 시간 단위의 루프입니다. 중기 루프 (Iteration / Exploration Loop): 스프린트 단위로 탐색적 테스팅(Exploratory Testing)을 수행하고, 실제 사용자 시나리오나 엣지 케이스를 사람이 직접 검증하며 시스템의 유기적 작동을 확인하는 며칠~몇 주 단위의 루프입니다. 장기 루프 (Outer / Market Loop): 실제 ...

에이전틱 AI 프로젝트에서 테스터의 5가지 핵심 원칙

AI 코딩 에이전트와 자율형 에이전트가 빠르게 개발 워크플로우에 통합되면서, 단순히 코드를 잘 짜는 것을 넘어 '에이전트와 어떻게 협업하고 통제할 것인가'가 개발자와 아키텍트들의 가장 큰 화두로 떠올랐습니다. 윤석찬 님의 아티클 "AI 에이전트 시대, 개발자는 어떻게 일해야 하는가? – 프론티어 엔지니어링의 10가지 원칙"은 에이전틱 AI 시대에 엔지니어가 마주하는 패러다임 변화와, 실무 현장에서 일하는 방식을 어떻게 재정의해야 하는지 아주 명확한 가이드라인을 제시해 줍니다. (출처: channy.creation.net - 윤석찬 님의 블로그) https://channy.creation.net/blog/1989 비록 대규모 에이전트 오케스트레이션이나 초거대 인프라 시스템을 개인이 직접 구축하고 운용하는 것은 비용적·기술적으로 현실적인 한계가 있습니다. 하지만 개인 프로젝트에서 AI와 바이브 코딩(Vibe Coding)을 활용하며 겪었던 맥락 손실, 환각, 통제 불능의 경험들을 떠올려보면, 이 아티클이 제시하는 10가지 프론티어 엔지니어링 원칙은 소규모 개인 개발 환경에서도 대단히 깊은 공감을 불러일으킵니다. 이 글은 단순히 "AI 도구를 잘 쓰자"는 수준에 머무르지 않습니다. AI 에이전트가 생성해내는 불확실성 속에서 인간 엔지니어가 시스템의 맥락을 주도하고, 오작동을 제어하며, 품질의 키(Steering Wheel)를 쥐기 위한 구조적 사고법을 다룹니다. 그렇다면 프론티어 엔지니어링의 원칙을 바탕으로, 시스템의 신뢰성과 안전성을 검증해야 하는 테스터는 과연 어떤 실무 원칙을 세워나갈 수 있을까요? 윤석찬 님이 제시한 엔지니어링 원칙을 테스팅 관점으로 재해석해 보면, 다음과 같은 5가지 원칙으로 정리할 수 있을 것 같습니다. 1. 결정론적 검증에서 '경계선 및 허용 오차(Boundary)' 테스팅으로 전환하라 에이전트 기반 시스템은 같은 입력을 주어도 매번 다른 추론 경로를 거치는 확률적(Stoc...

에이전틱 AI 시대에 테스팅은?

 "소프트웨어 엔지니어링은 과연 끝난 것일까?" 최근 AI 코딩 에이전트와 바이브 코딩(Vibe Coding)의 급부상 속에서, 엔지니어들과 아키텍트들이 스스로에게 던지는 가장 뼈아픈 질문입니다. 이 질문에 대해 기술 현장의 날카로운 시선을 담은 이원국 님의 아티클 "소프트웨어 엔지니어링의 종말"과 arXiv 논문 "Agentic Software: How AI Agents Are Restructuring the Software Paradigm"은 아주 근본적인 패러다임의 변화를 짚어내고 있습니다. (출처: blog.wonkooklee.com - 소프트웨어 엔지니어링의 종말) https://blog.wonkooklee.com/blog/20260913_02/ (출처: arXiv - Agentic Software: How AI Agents Are Restructuring the Software Paradigm) https://arxiv.org/html/2606.05608v2 이원국님의 아티클과 논문에서 공통적으로 말하는 핵심은, 우리가 알고 있던 '인간이 직접 코드를 다듬고 작성하던 전통적 소프트웨어 엔지니어링'의 정체성은 종말을 고하고 있으며, 그 자리를 '에이전트 패러다임(Agentic Paradigm)'이 빠르게 대체하고 있다는 사실입니다. arXiv 논문 "Agentic Software"에서는 소프트웨어 구축의 단위가 단순히 결정론적(Deterministic) 알고리즘이나 코드에서, 목표를 스스로 자율 추론하고 도구를 호출하며 과업을 완수하는 'AI 에이전트 오케스트레이션'으로 이동하고 있음을 말하고 있습니다. 이제 개발자는 시스템의 메서드나 API 하나하나를 직접 타이핑하는 존재가 아닙니다. AI 에이전트가 코드를 생성하고, 실행하고, 테스트를 돌리고, 스스로 디버깅하는 일련의 자율 루프(Autonomous Loop)를 설계하는 '시스템...