기본 콘텐츠로 건너뛰기

사용성 테스트 과제와 시나리오 작성

------------------------------------------------------------

1. 사용성 테스팅(Massive and Rapid Usability Testing)

 가. 사용성 테스팅의 정의

 나. Rapid Usbility Testing

 다. Massive Usability Testing vs. Rapid Usability Testing

2. 사용성 테스팅 계획(개발 수명주기에서의 사용성 테스팅)

 가. 사용성 테스팅은 언제 수행하나요?

3. 참가자 선정

 가. 사용성 테스팅에 얼마나 많은 참가자가 적당한가?

 나. 사용성 테스팅에서 사용자란 누구인가?

4. 사용성 테스팅 수행

 가. 사용자 테스팅
  - 사용자 테스팅 소개
  - 테스트 과제와 시나리오 작성
  - 관찰실
  - 테스트 진행
  - 회고 그리고 보고서
  - 체크리스트
  - 사용자 테스팅의 장점과 단점

 나. 카드 소팅

 다. 소원의 나무

5. 정리(?)

------------------------------------------------------------

사용자 테스트를 진행하기 위해서 반드시 필요한 것이 테스트 과제와 시나리오입니다.

테스트 과제란 참가자들이 해보고 싶어하는 것을 말합니다. 즉, 사용자가 테스트 대상 제품을 통해 하고 싶어하는 일을 뜻합니다.

테스트 시나리오란 이러한 테스트 과제를 수행하기 위해 알아야 하는 상황을 담은 글을 말합니다.

예를 들어, 온라인 서점이 테스트 대상이라고 한다면

테스트 과제는

1. 책 검색하기
2. 장바구니에 책 담기
3. 구매하기
4. 취소하기
5. 배송 추적 하기

등이 될 것입니다.

테스트 시나리오는 위의 과제들을 수행하기 위해 알아야할 상황을 만들어 주는 것입니다.

예를 들면,

'당신은 중간고사 과제를 제출하기 위해 OOO 서적을 구매해야 합니다. OOO 서적을 구매 후 배송 추적을 해보시기 바랍니다.'

와 같이 작성해 주시면 됩니다.

이러한 테스트 과제와 시나리오는 작성하는 방법에 정답은 없습니다.

우선은 마음을 차분히 가라앉히신 후에 종이를 꺼내고 펜을 쥐시기 바랍니다.

그리고 당신이 테스트해야할 제품에서 가장 중요한 일을 5~10개 정도 적어보시기 바랍니다.

여기서 주의해야할 점은 당신이 또는 제품을 개발한 관련 이해관계자들이 원하는 일, 계획했던 일이 아닌 사용자들이 하고 있는 일을 골라내야한다는 것입니다.

이것은 간단한 일 같지만 생각처럼 쉽지 않습니다.

제품을 상세하게 생각하지 말고 좀 더 큰 범위로 생각하여 진행하시는 것이 좋습니다.

테스트 대상 제품의 상세 기능 목록을 참고하지 마시고 테스트 대상 제품을 큰 범위로 표현하고 그러한 제품을 사용자들이 사용하고자 할 때 무엇을 하고 싶을지를 생각해 보시기 바랍니다.

예를 들어, 여러분이 '미리내'라는 온라인 서점을 테스트 대상으로 하신다고 가정을 한다면 이 온라인 서점에는 기획자가 구상한 수많은 기능들이 있을 겁니다.

검색, 장바구니, 내 책장, 배송 추적, 구매하기, 반품하기 등등..

그러한 기능들을 생각하지 마시고 큰 범위인 온라인 서점이라고 표현하신 뒤, 온라인 서점을 사용자들이 이용한다면 가장 중요한 일이 무엇일지를 생각하시기를 바랍니다.

온라인 서점이라고 한다면

역시 검색, 구매 정도가 가장 중요한 일일 것입니다. 리뷰나 평점 등도 책을 선택하는 데 있어 중요할 수도 있습니다.

이렇게 과제 리스트를 작성하셨다면 주변의 동료들에게 '온라인 서점'을 사용한다면 어떤 걸 하고 싶은지 물어보시고 작성한 과제 리스트와 비교해 보시기 바랍니다.

많은 과제들이 중복되어 있을 것입니다. 그러한 과제들이 서로 중요하다고 동의하는 과제들입니다.

그렇게 과제 리스크가 결정되고 나면 그러한 과제들 중 어떤 과제를 실제로 테스트 할지를 결정해야 합니다.

테스트 시간은 한정되어 있기 때문에 모든 과제를 진행하기는 어렵습니다.

테스트 시간을 1시간으로 한다면 일반적으로 실제 과제가 수행되는 시간은 35분 전후가 됩니다.

과제 리스트의 각각의 과제들을 수행하는데 걸리는 시간을 감안하여 실제 수행할 과제를 선택하시기 바랍니다.

그리고 선정된 과제 이외의 과제들은 선정된 과제를 예상보다 일찍 끝내는 참가자들을 위해 예비로 가지고 계시면 됩니다.(버리시면 안됩니다.)

최종적으로 과제 리스트를 결정하실 때 아래와 같은 사항을 한번 더 확인해 보시기 바랍니다.

1. 정말로 중요한 과제인가?
온라인 서점이라면 책을 검색하고 결제하는 것이 가장 중요한 과제입니다. 사용자들이 해당 과제를 수행하지 않을 경우 제품 자체를 사용할 수 없는 가장 중요한 과제를 선정하시기 바랍니다.

2. 이전에도 사용자들이 불편을 호소했던 것인가?
이전에 사용성 테스팅을 진행하여 개선이 된 제품 또는 기존의 제품에서 업그레이드 또는 업데이트 된 제품의 경우에 이전부터 사용자들이 불편을 호소했던 부분들을 과제로 선택하시기 바랍니다.
고객 지원 부서나 웹 서비스의 경우 사용자들의 로그는 그러한 부분들을 찾는 데 유용한 데이터입니다.

3. 사용자들이 불편을 겪을 것이라고 의심되는 부분인가?
완전히 새로운 제품을 처음 사용성 테스팅을 진행하는 것이라면 사용자들이 문제를 겪을 수 있을 것이라고 의심되는 것을 포함시킬 수 있습니다.
하지만 이러한 과제는 선정에 있어서 조심할 필요가 있습니다. 과제 선정 시 특정 이해관계자의 의견을 대변하는 과제 등을 선정하지 않도록 하셔야 합니다.

마지막으로 위의 주의 사항보다 더 중요한 사항이 있습니다.

바로 테스트를 진행하는 진행자의 관점이 가미되어서는 안된다는 것입니다. 어떤 특정한 목적을 가지고 과제와 시나리오가 작성되어서는 안됩니다.

진행자는 어떤 목적으로 특정 사용성 문제가 부각될 수 있도록 테스트를 진행하고 그렇게 하기 위해 과제를 만들어 낼 수 있습니다.

예를 들어 '다음 만화속 세상'의 웹에서 볼 수 있는 웹툰과 모바일 페이지에서 볼 수 있는 웹툰은 동일하지 않습니다.

특정 웹툰은 모바일 페이지에서 볼 수 없습니다.

그런데 만약 과제가 그러한 특정 웹툰을 검색하거나 보는 것으로 작성된다면 어떻게 될까요?

사용자는 테스트 중간에 큰 혼란에 빠질 것이고 꽤 많은 시간동안 서비스되지 않는 웹툰을 찾기 위해 악전고투를 벌이게 될 것입니다. 그리고 이것은 관찰자들에게 아주 선명하게 각인될 것입니다.

그렇다면 이런 과제를 만들어도 되는 것일까요? 만들면 안되는 것일까요?

그것은 과제의 목표가 무엇이냐에 따라 다를 수 있습니다.

사용자가 웹에서 보던 웹툰을 이동 중에서 모바일 단말기에서 보기를 원하는 것이 진정으로 원하는 기능이라면 이런 과제를 선정할 수도 있습니다.

하지만 이런 기능이 사용자에게는 매우 사소하지만 진행자가 특정 목적을 위해 이런 과제를 선정한다면 그것은 문제가 있는 것이고 이런 과제를 선정해서는 안되는 것입니다.

만약 후자라면 테스트 결과와 진행 자체의 신뢰성에 엄청난 타격을 입게 되고 회사와 조직은 추후 사용성 테스팅을 추진해야할 동기를 잃어버리게 되고 결국 많은 것을 잃게 될 것입니다.

비슷한 경우로 과제 선정시에는 테스트 환경에 대해서도 고민할 필요가 있습니다.

예를 들어 온라인 뱅킹에 대한 사용성 테스트를 진행할 때 파이어폭스에서 진행해야할까요? 인터넷 익스플로러에서 진행해야할까요?

국내 대다수의 금융 기관은 인터넷 익스플로러만을 지원하므로 인터넷 익스플로러에서 진행해야하는 것일까요?

만약 사용자가 파이어폭스만을 이용하는 사용자라면 어떨까요?

이 경우에도 사용자들이 파이어폭스를 많이 이용한다면 진행할 수도 있습니다. 하지만 웹 접근성을 부각시키기 위해 진행자가 의도적으로 사용성 테스트를 파이어폭스로 진행한다면 어떻게 될까요?

어떤 웹서비스들은 반드시 인터넷 익스플로러에서만 동작하지 않는 경우도 있습니다. 특정 게시판이 특정 브라우저에서만 기능하지 않는 결함이 있다고 했을 때 그 결함을 강조하기 위해서 진행자가 일부러 특정 브라우저에서 사용성 테스트를 수행한다면 어떻게 될까요?

즉, 사용성 테스트 과제는 얼마든지 진행자의 의도에 따라 변형될 수 있으며, 그러한 경우에 외부에서 그러한 점을 인식하고 문제를 제기하는 것은 쉽지 않다는 것입니다.

테스트 과제는 전적으로 사용자의 관점에서 선정되어야 하고 객관적이어야 합니다.

사람이 하는 일이기 때문에 100% 객관적일수는 없겠지만 그래서 테스트 과제는 매우 조심해서 선정되어야 합니다.

이렇게 최종 과제 리스트를 작성하셨다면 이제 시나리오를 작성하셔야 합니다.

시나리오에는 참가자가 맡게 될 배역과 동기, 해야 할 일 그리고 약간의 설명을 담으시면 됩니다.

시나리오는 거창하게 쓸 필요 없이 과제를 해야하는 상황(~ 하십시오.)과 필요한 정보(아이디, 비밀번호, 카드 번호 등등)만 담고 있으면 됩니다.

한가지 주의할 점은 시나리오에 제품의 기능을 지칭하는 단어나 그러한 기능을 유추할 수 있는 단어는 배제해야 합니다. 되도록 일반적인 단어를 사용하시기 바랍니다.

예를 들어

'책을 장바구니에 넣고 결제 버튼을 선택하십시오.'


는 잘못된 시나리오입니다.

'책을 구매해 보시기 바랍니다.'


가 적합한 시나리오입니다.

그리고 약어나 특정 도메인에서 사용되는 전문 용어 역시 사용하지 마시기 바랍니다.

테스트 시나리오는 명료하고, 애매모호하지 않고, 이해 가능한 문장으로 구성되어야 합니다.

마지막으로 테스트 시나리오를 사용자가 수행할 때 주의해야할 사항으로는

검색 기능에 대한 사용성을 테스트 하는 것이 아니라면 사용자가 검색 기능을 사용하지 못하도록 하는 것이 좋습니다.

여기서 검색이란 도움말 등을 참고하지 못하도록 하는 것이 좋다는 의미입니다. 어떤 기능을 사용하기 위해서 특정 단어의 의미를 검색하거나 기능에 대한 도움말을 검색하지 못하도록 하시기 바랍니다.

그리고 다른 제품이나 서비스 또는 다른 사이트로 이동하지 않도록 주의를 기울이셔야 합니다.

이렇게 테스트 과제와 시나리오 정해진 후에는 정해진 시나리오에 대하여 파일럿 테스트를 수행하시기 바랍니다.

파일럿 테스트는 스스로도 할 수 있으며, 주변의 누군가에게 도움을 요청할 수도 있습니다. 친구나 가족도 좋습니다.

파일럿 테스트는 작성된 시나리오를 다른 사람들이 정확하게 이해하고 해당 작업을 수행하는지 확인하는 목적으로 진행합니다.

즉, 시나리오가 분명하고, 완전하고 모호하지 않는지 확인하는 것입니다.

때문에 실제 테스트처럼 긴 시간을 들일 필요 없이 짧은 시간동안 빠르게 수행하시면 됩니다.

이러한 파일럿 테스트는 실제 테스팅이 수행되기 2~3일 전에 수행하시면 됩니다. 그리고 테스팅을 진행할 제품도 이 시간에 맞춰서 준비가 끝나야 합니다.

테스트 과제와 테스트 시나리오의 작성을 다시 한번 더 정리하면

1. 테스트 대상에서 가장 중요한 일을 5~10개를 적는다.
2. 동료 검토를 한다.
3. 테스트 시간을 고려하여 과제를 선정한다.
4. 사용자가 테스트를 일찍 끝냈을 때를 대비하여 예비 과제를 준비한다.
5. 각각의 과제에 대하여 시나리오를 작성한다.
6. 시나리오 파일럿 테스트를 수행한다.
7. 파일럿 테스트에서 나온 문제를 수정하여 최종 시나리오를 확정한다.

로 정리할 수 있습니다.

이렇게 확정된 시나리오는 큼지막한 카드(A4 절반 크기 정도)에 잘 보일 수 있도록 인쇄를 해서 준비하시면 됩니다.

인쇄를 하실 때에는 시나리오 번호 등은 인쇄 하지 않으셔도 됩니다.

테스트 시나리오는 각각이 독립되도록 구성되어야 하므로 번호는 의미가 없습니다. 실제 테스트를 수행하는 현장에서는 참가자의 반응에 따라 완전히 새로운 테스트 과제와 시나리오를 즉흥에서 만들어야 할 수도 있습니다.

테스트 현장은 통제가 되지 않기 때문에 진행자는 모든 시나리오를 알고 있어야 하며, 사용자의 반응에 따라 적절한 과제와 시나리오를 제시할 수 있도록 준비하셔야 합니다.

필요하다면 전체 시나리오가 적힌 종이를 준비하시는 것도 좋습니다.

이제 테스트 과제와 시나리오가 준비되었습니다.

다음으로는 관찰실의 구성과 준비에 대해서 다루도록 하겠습니다.

댓글

이 블로그의 인기 게시물

우리는 AI로 '더 빠른 말'을 키우고 있는걸까요? 아니면 '자동차'를 만들고 있는걸까요?

20년 넘게 IT 현장에서 뒹굴거렸는데... 요즘처럼 "우리가 지금까지 당연하게 여겨온 일하는 방식의 본질"에 대해 근본적인 질문을 던지게 만드는 때가 없었던 것 같습니다. 최근 읽은 UX 관련 글 하나가 가슴을 쿵 치고 지나갔습니다. UX 및 디지털 트렌드를 다루는 블로그 ux4dotcom에 올라온 "Beyond Faster Horses — Why AI Challenges One of UX's Oldest Assumptions"라는 글입니다. (출처: ux4dotcom - Beyond Faster Horses — Why AI Challenges One of UX's Oldest Assumptions ) 혁신을 말할 때 늘 인용되는 헨리 포드의 유명한 말이 있습니다. "사람들에게 무엇을 원하느냐고 물었다면, 그들은 '더 빠른 말'이라고 답했을 것이다." 사람들은 자신이 경험해 본 범위 안에서만 미래를 상상합니다. 말만 탈 줄 아는 사람에게 자동차는 상상 밖의 범주(Mental Model)니까요. 저자는 그동안 UX(사용자 경험)라는 학문과 필드 자체가 '더 빠른 말을 만드는 일(기존 과업의 효율화)'에 집중해 왔다고 지적합니다. 사용자의 행동을 관찰하고, 마찰(Friction)을 줄이고, 화면을 간소화하고, 기존 워크플로우를 최적화해 주는 작업 말입니다. 실제로 주변을 봐도 우리가 AI를 쓰는 방식도 대부분 이 범주를 벗어나지 못하고 있습니다. 더 빠르게 이메일을 작성하고, 문서 요약을 3초 만에 끝내고, 프레젠테이션 장표나 일정표를 순식간에 만들어내는 일. 분명 유용하고 저 역시 매일 요기하게 쓰고 있지만, 이건 어디까지나 '기존에 인간이 하던 일의 프로세스를 흉내 내어 속도만 올린 것(Faster Horse)'에 불과합니다. 정작 "이 워크플로우 자체가 과연 계속 존재해야 하는가?"라는 근본적인 질문은 던지지 못하고 있는 것이죠....

20년 차 테스터가 고른 최근 IT 소식: 기술의 속도, 그리고 사람의 자리

20년 넘게 IT 업계에서 테스팅하고 강의하고 공부하고 여러 일을 해왔지만... 정말이지 단 하루도 편하게 쉴 틈을 주지 않는 세상입니다. 특히 최근 4~5년 동안 가속화된 AI의 물결은 기술의 스펙트럼뿐만 아니라 우리가 일하고, 협업하고, 조직을 이끄는 방식 전체를 뒤흔들고 있습니다. 이번 주에도 수많은 뉴스레터와 아티클을 훑어보았습니다. 그중에서도 기술의 화려함 뒤에 숨겨진 ‘사람, 조직, 그리고 커리어의 본질’을 찌르는 글 몇 개가 눈에 띄어 메모해 둡니다. 제 평소 생각과 맞닿아 있는 6가지 이야기입니다. --- 1. 인지부채(Cognitive Debt): 바이브 코딩 시대에 우리가 지게 되는 진짜 빚 (출처: ROBOCO - 인지부채: 바이브 코딩 시대의 새로운 부채 관리법 / 정도현 수석 컨설턴트 ) 요즘 커서(Cursor)나 클로드 코드(Claude Code) 같은 에이전트를 붙여 "이거 만들어줘" 하고 승인(Approve) 버튼만 누르면 눈 깜짝할 사이에 코드베이스가 완성되는 '바이브 코딩(Vibe Coding)'이 유행입니다. 그런데 속도는 엄청나게 빠른데, 정작 서비스에 장애가 나면 "AI가 짜서 잘 모르겠는데요?"라는 답이 나오는 이상한 현상이 벌어집니다. 정도현 컨설턴트는 이를 '인지부채(Cognitive Debt)'라고 정의합니다. 코드는 쌓이는데, 정작 인간의 시스템 이해도는 쌓이지 않는 격차죠. * Human-in-the-loop의 환상: AI가 초당 수백 줄을 뽑아내는데 사람이 일일이 검토한다? 결국 검토자는 병목이 되고, 시간 압박에 쫓겨 영혼 없이 승인 버튼만 누르게 됩니다. 40년 전 자동화 연구(Bainbridge, 1983)가 지적했듯, 자동화될수록 사람은 감시만 하다가 정작 개입해야 할 결정적 순간에 숙련도를 잃어버립니다. * 부채는 0으로 만드는 게 아니라 '관리'하는 것: AI가 만든 모든 코드를 사람이 외울 수는 없습니다. 핵심은 ...

'자동화 편향'과 '대중적 불신' 을 고려 AI 테스팅 시나리오 설계

최근 생성형 AI나 자율주행, 에이전트 기술의 테스팅 시나리오를 작성할 때 우리가 당연하게 전제(Assumption)로 깔고 가는 중요한 인간 행동 방식이 하나 있습니다. 바로 '자동화 편향성(Automation Bias)'입니다. 인간은 시스템이 자동화되고 스마트해질수록 기술을 과도하게 신뢰하고 주의력을 놓아버립니다. 차량을 운전하면서 운전자 보조 시스템을 켜고 전방 주시를 태만히 하고 스마트폰을 보거나 영상을 시청하는 운전자라던지 AI 의료 진단 보조 도구가 내놓은 결과를 의사가 깊은 의심 없이 그대로 승인해 버리는 현상이라던지 AI 챗봇이 추천한 잘못된 정보를 사용자가 사실로 믿고 행동하는 케이스 같은 게 있을 겁니다. 우리는 항상 이러한 "사람들이 AI를 너무 믿어서 발생하는 위험"을 핵심 리스크로 정의하고, 이를 검증하기 위한 안전장치(Safety Guardrail)나 경고 알림, 오용 방지(Misuse) 테스팅 시나리오를 도출해 왔습니다. 그런데 최근 Gizmodo에 보도된 미국 설문조사 결과는 매우 흥미로운 사실을 보여줍니다. (출처: Gizmodo - Survey Finds Americans See AI as Comparable to Humans—It’s Making Them Trust It Less )   기사에서 언급된 설문조사의 결과는 AI가 사람을 닮아갈수록 완벽함에 대한 기대와 실수가 충돌하고 책임이 모호해져 대중의 신뢰는 오히려 떨어진다는 것이었습니다.  자세히 살펴보면 해당 조사는 일반 대중을 대상으로 AI에 대한 인지적 반응을 측정했습니다. AI가 인간과 유사한 대화/추론 능력을 보일 때 유저가 느끼는 '인지적 불쾌한 골짜기(Uncanny Valley)' 현상을 정량 지표로 포착해 냈다는 점에서 의미가 있다고 생각합니다. 단순히 "AI가 좋다/나쁘다"를 넘어, 의인화(Anthropomorphism)의 수준과 신뢰도(Trust) 사이의 음(-)의 상관관계를 입증했기 때문...