기본 콘텐츠로 건너뛰기

성과 측정과 생산성

조직에서 테스터의 자질은 무엇으로 평가되어야 할까요?

품질은 어떤 지표로 측정해야 하는 걸까요?

테스트의 결과는 무엇을 측정해서 제출해야 하는 걸까요?

개인적으로 테스터 개개인을 측정하는 것에는 반대하는 입장이다.

도데체 테스터의 가치를 단순한 숫자로 정의 내릴 수 있다는 생각은 누가 한 것일까?

개개인을 단순한 숫자로 측정하는 것은 관리자의 편의성을 생각해 볼때 이만한 해결책 이상은 있을 수가 없다.

하지만 내가 테스터 개개인의 측정을 반대하는 것은 측정 자체가 아니라 어떤 기준에 맞춰 모든 테스터가 그 기준을 상회해야한다는 그 어이없는 믿음에 반대하는 것이다.

예를 들면, 테스트 케이스의 갯수, 결함 발견 갯수 등등으로 테스터의 능력치를 측정합니다.

그런 이면에는 모든 사람이 슈퍼맨이길 바라는 관리자의 헛된 야망이 숨어있습니다.

하지만 모든 사람이 다 슈펴맨이 가능한 걸까요? 슈퍼맨이 된다고 해도 그런 슈퍼맨들만 모인 팀의 생산성이 과연 높은 것일까요?

예전에 히딩크 감독이 멀티 플레이를 주장했다 하지만 그렇다고 해서 축구에서 진영이나 포지션이 없어진 것은 아니다.

그리고 날고 긴다는 사람들만 모아놓은 대표팀이라고 해서 언제나 어디서나 승리하는 것은 아니라는 것을 알고 있다.

테스터 개개인의 능력을 측정하는 것은 필요로 하는 일이다. 하지만 테스터가 모든 분야에서 특정 기준 이상이어야 한다는 믿음에는 동의할 수 없다.

조직원의 특성을 파악하고 그 특성을 조화롭게 이끌어 내어 팀의 생산성을 높일 수 있는 관리자가 필요하다.

다양한 척도를 이용해서 테스터의 생산성을 측정하겠다는 가장 큰 약점이라면 테스터가 측정값을 속이기 쉽다는 것이다. 테스트나 품질 그 자체보다는 성과와 인사고과만을 위해 일하는 바보같은 테스터가 양산되어 버린다.

예를 들어 테스트 케이스 갯수를 가지고 생산성을 측정한다면 테스터는 의도적으로 의미없는 테스트 케이스 갯수를 늘릴 가능성이 매우 높다.

단순히 결함의 갯수만으르 가지고 측정한다면 테스터는 오타와 같은 쓸모없는 결함만을 양산해 낼 가능성이 높다. 리스크가 높은 결함은 그만큼 발견하기 어렵고 시간이 오래 걸리기 때문이다. 또 그만한 시간과 노력을 기울인다고 하여도 결함이 나오지 않을 가능성도 매우 높다.

즉, 회사가 자신을 평가하는 기준이 숫자라는 것을 알게 되면 대부분의 조직원은 숫자를 위조하기 위한 모든 행동을 강구하게 된다. 애초에 이런 측정 시스템을 통해 추구하고자 했던 것에는 관심조차 없다.

품질 같은 것에 신경을 쓴다고 해도 자신에게 돌아오는 이익이 없다면 뭐하러 그런것에 신경을 쓰겠는가?

물론 모든 수치가 쓸모없는 것은 아니다.

리스크 영역별 결함 발견율과 수정율, 문제 해결에 걸린 시간, 출시 후 고객이 발견한 결함 갯수 등과 같이 분명하고 타당한 측정 지표를 계획할 수 있어야 한다.

즉, 테스트의 목표 대비 진행 상태를 추적할 수 있는 수치라면 의미가 있을 수 있다. 그리고 이런 수치는 개개인 보다는 조직 단위로 측정하는 것이 좋다.

왜냐하면 조직안의 팀원들은 모두 다 다르다. 잘하는 분야도 개성도 모두 다르다. 그들이 서로 협력해서 나오는 그 최종적인 생산성이 높아질 수 있도록 해야 한다.

결론은 의미 없는 개인에 대한 측정을 그만 두자. 만약 개인에 대한 측정을 하게 된다면 그 측정은 인사고과에 상관 없이 관리자가 팀원 개개인의 능력을 향상시킬 수 있는 자료로만 활용하도록 하자.

생산성은 조직 단위로 측정하도록 하자. 모든 의무와 책임은 조직단위로 움직여야 한다. 그래야 팀원은 소속감과 책임감을 동시에 느낄 수 있다. 팀의 생산성을 저해하는 팀원이 있다면 팀 전체의 이익을 위해 자연 도태 될 것이다.

관리자는 팀의 생산성을 저해하는 팀원을 가려내고 그 팀원의 특성과 어려움을 파악하고 그것을 이겨낼 수 있는 능력을 개발하도록 지원해야 한다.

그렇지 않고 만약 여러분의 상사가 여러분을 다른 사람과 비교하면서 닥달만 한다면 다른 관리자를 찾아보기를 권유하고 싶다.

생산성을 높이고 싶은가? 개개인의 성과 측정에 집착하지 말고 조직으로 생각을 하도록 하자. 소프트웨어 개발과 테스트는 결코 개개인이 독단적으로 수행하는 작업이 아니다.

댓글

댓글 쓰기

이 블로그의 인기 게시물

피드백 루프: AI 시대 테스터가 지켜내야 할 핵심 엔진

소프트웨어 개발과 테스팅 현장에서 가장 자주 언급되지만, 막상 시스템이 복잡해질수록 쉽게 경시되곤 하는 핵심 개념이 바로 '피드백 루프(Feedback Loop)'입니다. 코드를 수정하고, 빌드하고, 테스트 결과를 확인하고, 다시 개선하는 그 순환 과정의 속도와 정확도가 결국 소프트웨어의 품질을 결정짓기 때문입니다. 품질 전문가 매슈 하이저(Matthew Heusser)가 자신의 블로그 Quality Remarks에 기고한 "One Loop After Another" 아티클은 바로 이 피드백 루프의 다층적 구조와, AI 시대에 우리가 놓치지 말아야 할 품질 검증의 본질을 날카롭게 되짚어 줍니다. (출처: Quality Remarks - One Loop After Another / Matthew Heusser) https://qualityremarks.com/one-loop-after-another/ 매슈 하이저는 소프트웨어 개발 생태계가 단순히 하나의 커다란 테스트 루프로 돌아가는 것이 아니라, 시간 축과 관점에 따라 겹겹이 쌓인 '연쇄적인 피드백 루프들(One Loop After Another)'로 이루어져 있다고 설명합니다. 초단기 루프 (Inner Loop): 개발자가 코드를 작성하는 몇 초~몇 분 단위의 루프입니다. 단위 테스트(Unit Test)나 IDE의 Linter, AI 자동 완성이 즉각적인 피드백을 주는 영역입니다. 단기 루프 (Daily / CI Loop): 커밋과 푸시가 이루어지고, CI/CD 파이프라인에서 통합 테스트와 정적 분석이 실행되는 몇 시간 단위의 루프입니다. 중기 루프 (Iteration / Exploration Loop): 스프린트 단위로 탐색적 테스팅(Exploratory Testing)을 수행하고, 실제 사용자 시나리오나 엣지 케이스를 사람이 직접 검증하며 시스템의 유기적 작동을 확인하는 며칠~몇 주 단위의 루프입니다. 장기 루프 (Outer / Market Loop): 실제 ...

에이전틱 AI 프로젝트에서 테스터의 5가지 핵심 원칙

AI 코딩 에이전트와 자율형 에이전트가 빠르게 개발 워크플로우에 통합되면서, 단순히 코드를 잘 짜는 것을 넘어 '에이전트와 어떻게 협업하고 통제할 것인가'가 개발자와 아키텍트들의 가장 큰 화두로 떠올랐습니다. 윤석찬 님의 아티클 "AI 에이전트 시대, 개발자는 어떻게 일해야 하는가? – 프론티어 엔지니어링의 10가지 원칙"은 에이전틱 AI 시대에 엔지니어가 마주하는 패러다임 변화와, 실무 현장에서 일하는 방식을 어떻게 재정의해야 하는지 아주 명확한 가이드라인을 제시해 줍니다. (출처: channy.creation.net - 윤석찬 님의 블로그) https://channy.creation.net/blog/1989 비록 대규모 에이전트 오케스트레이션이나 초거대 인프라 시스템을 개인이 직접 구축하고 운용하는 것은 비용적·기술적으로 현실적인 한계가 있습니다. 하지만 개인 프로젝트에서 AI와 바이브 코딩(Vibe Coding)을 활용하며 겪었던 맥락 손실, 환각, 통제 불능의 경험들을 떠올려보면, 이 아티클이 제시하는 10가지 프론티어 엔지니어링 원칙은 소규모 개인 개발 환경에서도 대단히 깊은 공감을 불러일으킵니다. 이 글은 단순히 "AI 도구를 잘 쓰자"는 수준에 머무르지 않습니다. AI 에이전트가 생성해내는 불확실성 속에서 인간 엔지니어가 시스템의 맥락을 주도하고, 오작동을 제어하며, 품질의 키(Steering Wheel)를 쥐기 위한 구조적 사고법을 다룹니다. 그렇다면 프론티어 엔지니어링의 원칙을 바탕으로, 시스템의 신뢰성과 안전성을 검증해야 하는 테스터는 과연 어떤 실무 원칙을 세워나갈 수 있을까요? 윤석찬 님이 제시한 엔지니어링 원칙을 테스팅 관점으로 재해석해 보면, 다음과 같은 5가지 원칙으로 정리할 수 있을 것 같습니다. 1. 결정론적 검증에서 '경계선 및 허용 오차(Boundary)' 테스팅으로 전환하라 에이전트 기반 시스템은 같은 입력을 주어도 매번 다른 추론 경로를 거치는 확률적(Stoc...

결국 테스팅은 어렵다

 AI 코딩 에이전트와 대형 언어 모델(LLM)이 코드를 순식간에 쏟아내고 테스트 스크립트까지 자동으로 만들어주는 시대가 되면서, 일각에서는 "이제 테스팅도 버튼 하나 누르면 끝나는 쉽고 단순한 일 아닌가?"라는 착각에 빠지곤 합니다. 하지만 품질 전문가 매슈 하이저(Matthew Heusser)가 자신의 블로그 Quality Remarks에 기고한 "Turns Out Testing is Hard" 아티클은, 기술이 아무리 화려하게 발전하더라도 소프트웨어의 '진짜 품질'을 검증하는 일은 여전히 지독하게 어렵고 복잡하다는 현실을 서늘하게 되짚어 줍니다. (출처: Quality Remarks - Turns Out Testing is Hard / Matthew Heusser) https://qualityremarks.com/turns-out-testing-is-hard/ 이 아티클이 말하는 핵심은 간단합니다. 단순한 스크립트 실행이나 표면적인 기능 작동 여부를 확인하는 '체크(Checking)'는 AI나 도구를 통해 얼마든지 자동화하고 속도를 높일 수 있지만, 시스템의 숨겨진 리스크를 탐색하고 비판적으로 질문을 던지는 '진짜 테스팅(Testing)'의 난이도는 오히려 이전보다 더 올라갔다는 점입니다. AI 코딩 에이전트가 단 몇 초 만에 수백 줄의 코드를 생성을 해내면서 당장 눈앞의 기능은 돌아가는 것처럼 보입니다. 하지만 그 이면에서는 오작동이 일어날 수 있는 엣지 케이스, 시스템 간의 미묘한 맥락 단절, 그리고 나중에 거대한 장애로 돌아올 인지부채가 순식간에 쌓여갑니다. 매슈 하이저는 왜 테스팅이 여전히 지독히 어려운 과제로 남아있는지 몇 가지 근본적인 이유를 제시합니다. 첫째, '모호함과의 싸움'입니다. 소프트웨어 요구사항은 언제나 비어있는 행간과 모호함을 품고 있습니다. AI는 주어진 텍스트 그대로 명시적인 조건만 테스트하지만, 실제 인간 테스터는 명시되지 않은 사용...