기본 콘텐츠로 건너뛰기

품질 기준은 누가 만드는 것인가?

테스트를 하면 결함이 발견됩니다.

시스템이 어떤 원인으로 충돌이 발생해서 죽어버리거나 하는 문제는 별다른 이견 없이 개발 조직 전체가 수정을 하기 위해 노력을 합니다.

하지만 사용성, 보안성, 효율성과 같은 비기능성 결함들에 대해서는 얘기가 달라집니다.

개발에 참여하는 이해관계자들간의 의견 충돌로 결론을 내지 못하고 수정되지 못하는 경우가 비일비재합니다.

테스터들은 사용자에게 불편하다며 사용자가 원한다며 사용자를 들먹거리지만 다른 이해관계자들은 내가 아는 사용자는 그렇지 아니하다며 기획 의도라며 무시하기 일쑤입니다.

결함의 본질은 흐려지고 정치 싸움의 아수라장이 되기 십상입니다.

이런 아수라장의 원인에는 이러한 비기능성 결함에 대하여 테스트 조직이 근거를 명확하게 제시하지 못하기 때문입니다.

근거를 명확하게 제시하지 못하는 이유는 첫번째는 기준이 없기 때문이고 두번째는 실제로 사용자를 대상으로 조사나 테스트를 수행해 본적이 없기 때문입니다.

많은 테스트 조직이 비기능성 결함에 대한 근거로 사용자를 들먹거리지만 실상은 그냥 테스터들의 직감, 경험일 뿐입니다.

그 어디에도 사용자는 없습니다.

사정이 이러하다보니 소프트웨어 개발에 있어 품질 기준이 있을리 만무합니다.

소프트웨어 개발의 전체 과정에서 품질 기준은 가장 격렬한 분쟁을 일으키기 좋은 소재입니다.

과연 품질 기준은 어떻게 만들어야 할까요?

많은 조직들은 고객이 원하는 품질 기준을 알아내기 위하여 노력을 합니다. 물론 노력조차 하지 않는 조직도 있습니다.

하지만 아무리 많은 비용과 시간 그리고 좋은 방법론, 접근법을 사용한다 하더라도 절대로 사용자가 원하는 품질 기준은 알아낼 수 없습니다.

왜냐하면 사용자는 절대로 자신이 어느 정도의 품질을 원하는지 알지 못하기 때문입니다.

사용자는 그저 소프트웨어를 개발한 회사가 제시해주는 품질에 만족하며 사용할 뿐입니다.

그런데 이러한 소프트웨어를 만드는 회사가 시장을 독과점 하는 경우라면 사용자들은 그냥 그 회사의 품질에 길들여지고 그 회사의 품질이 최고인듯 생각하게 됩니다.

비교군 자체가 없기 때문에 그렇습니다. 그리고 어떤 문제가 발생하더라도 나만 아니면 괜찮다는 인지부조화로 합리화시켜버립니다.

우리 나라에서 쏟아져 나오는 많은 소프트웨어가 이러한 상황에서 국제적인 경쟁력조차 갖추지 못하는 낮은 품질의 소프트웨어를 만듭니다.

특히 우리 나라의 대다수 사용자들은 영어권에서 쏟아져 나오는 높은 품질의 소프트웨어를 접할 기회가 그다지 없습니다.

그 회사들은 시장이 작은 우리 나라에 관심을 기울일 이유가 그다지 크지 않기 때문입니다.

영어권 국가들은 다양한 사용자들을 만족시켜야 하기 때문에 품질에 대하여 좀 더 심각하게 고민해야만 살아남을 수 있지만 우리 나라 기업은 그런 고민이 없습니다.

우리 나라의 소프트웨어가 외국에 팔리지 못하는 것은 우물안 개구리처럼 품질 기준조차 만들지 못하는 낮은 성숙도를 가지는 조직의 문제가 크다고 봅니다.

품질 기준은 만드는 사람이 세워야 합니다. 자신들이 정한 기준에 도달하기 위해 끝없이 도전하고 도전해야 합니다.

하지만 우리 나라에서 그런 회사를 보기가 쉽지 않습니다.

많은 회사들이 이러한 품질 기준을 세우는 것을 꺼려합니다. 왜냐하면 그러한 품질 기준을 맞추고 그러한 품질 기준에 따라 제품을 만드는 것은 초기 비용이 꽤 많이 들어갑니다.

많은 실패와 도전에 대한 기회 비용이 필요한데, 여기에 대해 투자할 이유가 없는 것입니다.

그냥 대충 만들어도 넙죽 넙죽 받아 쓰는 멍청한 고객이 사방에 널려 있는데 품질 기준을 만들고 그 품질에 도전할 동기가 없는 것이죠.

하지만 결국은 우물 안 개구리로 외부 충격이 가해지면 쉽게 쓰러져버립니다.

그런데, 품질 기준을 세우고 그 기준에 대한 투자가 정말로 그렇게 많은 비용이 들어가는 작업일까요?

여러분이 정말 품질이 좋은 제품이라고 생각하는 제품을 하나 생각해 보십시오.

그리고 그 제품을 생산하는 단가를 생각해 보십시오.

예를 들면 자동차를 생각해보죠.

정말 좋은 자동차를 만드는 회사로 어떤 회사가 떠오르시나요?

볼보, BMW, 렉서스??

그러면 그러한 자동차를 생산하는데 들어가는 단가는 얼마나 될까요? 이러한 자동차는 과연 얼마나 비싼걸까요?

우리 나라는 여러 보호 무역 장치와 옵션 장난질로 길들여진 마인드로 객관적 비교가 힘들긴 하지만 현대나 기아에 비해 크게 비싼 가격은 아닙니다.

자동차에 정말로 중요한 것이 무엇인지를 생각해본다면 말입니다.

안전을 기준으로 투자를 한다고 하면 말입니다.

조직 자체의 품질 기준을 세우고 그에 대한 도전은 장기적으로는 많은 비용 절감의 효과를 가져올 수 있습니다.

품질 기준은 누구에게 물어서 알아낼 수 없는 것입니다.

고객은 절대 품질 기준을 얘기해 줄 수 없습니다.

품질 기준은 소프트웨어를 개발하는 당사자들이 세워야 하는 것입니다.

이건 테스터가 만드는 것도 개발자가 만드는 것도 사장님이 만드는 것도 아닙니다.

이해관계자 전체의 총의가 모여 하나의 목표가 되어야 합니다.

지금 당장은 경쟁 업체를 이기기 위해서 아니면 최소한 따라가기에 급급하기 때문에 품질이 중요하게 생각되지 않으시나요?

경쟁 업체의 품질 수준과 비슷한 수준으로만 만드는 정도로 비용 절감을 극대화하면 과연 살아남을 수는 있는걸까요?

고객은 생각외로 영악하고 매우 냉정합니다.

독과점 시장으로 다져진 패러다임이라해도 계속되는 충격이 가해진다면 언제 어느 순간에 파도 앞의 모래성과 같이 될지 아무도 알 수 없는 것입니다.

중요한 것은 기존의 품질보다 더 나은 품질의 블루오션을 잡아낸다면 더 적은 비용으로 경쟁 업체를 이길 수도 있을 겁니다.

그러기 위해서는 사용자를 이해하려는 노력과 사용자를 위해 우리가 품질의 기준을 제시할 수 있어야 한다고 생각합니다.

애플은 그러한 일을 꽤 오랫동안 잘 해왔던 업체 중 하나입니다.

애증의 삼성은 글쎄요...

많은 사람들이 삼성이 위기라고 말하지만 전 아직 시작도 안했다고 봅니다.

삼성을 포함한 우리 나라 기업들의 위기는 베껴야 할 품질 기준의 선도 업체가 사라지는 순간이라고 봅니다.

그런 의미에서 애플이 앞으로도 계속 잘 나갔으면 하는 바램입니다.

그 전에 우리가 스스로 품질에 대한 기준을 제시하는 수준으로 성숙되었으면 하는 바램입니다.

댓글

이 블로그의 인기 게시물

합성 사용자(Synthetic Users)의 5가지 유형과 AI 테스팅 현장에서의 활용법

AI와 생성형 모델 기술이 발전하면서, 사용자 경험(UX) 연구와 테스팅 현장에서 가상 퍼소나를 활용해 테스트 데이터를 수집하거나 사용성을 평가하려는 시도가 급격히 늘고 있습니다. 이를 흔히 '합성 사용자(Synthetic Users)'라고 부릅니다. 하지만 막연히 "AI에게 사용자 역할을 시켜 테스트를 돌린다"고 할 때, 그 가상 사용자가 어떤 방식과 데이터로 생성되었는지 명확히 구분하지 않으면 자칫 왜곡된 결과에 빠질 위험이 있습니다. UX 및 사용성 리서치 분야의 권위 있는 기관인 MeasuringU에서 이 합성 사용자의 개념을 명쾌하게 분류한 아티클을 공개했습니다. 바로 "What Are the Different Types of Synthetic Users?"라는 글입니다. (출처: MeasuringU - What Are the Different Types of Synthetic Users? / Jeff Sauro, PhD & Jim Lewis, PhD) https://measuringu.com/what-are-the-different-types-of-synthetic-users/ Jeff Sauro와 Jim Lewis 박사는 합성 사용자를 단순히 하나의 개념으로 뭉뚱그리지 않고, 생성 기술의 근거와 데이터 기반에 따라 크게 5가지 유형으로 깔끔하게 정리해 줍니다. 첫째는 규칙 기반(Rule-Based) 합성 사용자입니다. AI 모델이 아니라 사전 정의된 조건문, 정규식, 시나리오 스크립트에 따라 움직이는 전통적인 형태의 가상 사용자입니다. 예측 가능하고 정확하지만, 인간 사용자의 복잡한 정서나 미묘한 변수를 반영하진 못합니다. Selenium, Playwright, K6 같은 도구를 통해 지정된 경로대로 버튼을 누르고 데이터를 입력하는 방식을 들 수 있습니다. 둘째는 퍼소나 기반 LLM(Persona-Based LLM) 합성 사용자입니다. 생성형 AI에게 "너는 50대 비테크놀로지 사용...

피드백 루프: AI 시대 테스터가 지켜내야 할 핵심 엔진

소프트웨어 개발과 테스팅 현장에서 가장 자주 언급되지만, 막상 시스템이 복잡해질수록 쉽게 경시되곤 하는 핵심 개념이 바로 '피드백 루프(Feedback Loop)'입니다. 코드를 수정하고, 빌드하고, 테스트 결과를 확인하고, 다시 개선하는 그 순환 과정의 속도와 정확도가 결국 소프트웨어의 품질을 결정짓기 때문입니다. 품질 전문가 매슈 하이저(Matthew Heusser)가 자신의 블로그 Quality Remarks에 기고한 "One Loop After Another" 아티클은 바로 이 피드백 루프의 다층적 구조와, AI 시대에 우리가 놓치지 말아야 할 품질 검증의 본질을 날카롭게 되짚어 줍니다. (출처: Quality Remarks - One Loop After Another / Matthew Heusser) https://qualityremarks.com/one-loop-after-another/ 매슈 하이저는 소프트웨어 개발 생태계가 단순히 하나의 커다란 테스트 루프로 돌아가는 것이 아니라, 시간 축과 관점에 따라 겹겹이 쌓인 '연쇄적인 피드백 루프들(One Loop After Another)'로 이루어져 있다고 설명합니다. 초단기 루프 (Inner Loop): 개발자가 코드를 작성하는 몇 초~몇 분 단위의 루프입니다. 단위 테스트(Unit Test)나 IDE의 Linter, AI 자동 완성이 즉각적인 피드백을 주는 영역입니다. 단기 루프 (Daily / CI Loop): 커밋과 푸시가 이루어지고, CI/CD 파이프라인에서 통합 테스트와 정적 분석이 실행되는 몇 시간 단위의 루프입니다. 중기 루프 (Iteration / Exploration Loop): 스프린트 단위로 탐색적 테스팅(Exploratory Testing)을 수행하고, 실제 사용자 시나리오나 엣지 케이스를 사람이 직접 검증하며 시스템의 유기적 작동을 확인하는 며칠~몇 주 단위의 루프입니다. 장기 루프 (Outer / Market Loop): 실제 ...

AI 에이전트의 환각과 프롬프트 폭증을 막는 '컨텍스트 엔지니어링(Context Engineering)'과 아키텍처의 미래

AI 코딩 에이전트나 생성형 LLM을 소프트웨어 개발에 접목하는 시도가 늘어나면서, 엔지니어들이 마주하는 가장 큰 기술적 병목 중 하나는 바로 '컨텍스트(Context)'의 관리입니다. 저 역시 최근 AI와 바이브 코딩(Vibe Coding)을 활용해 여러 프로젝트를 진행하고 있는데, 하나의 대화창(세션)을 오래 켜둔 채 작업을 계속 이어가다 보면 AI가 초기 맥락을 잊어버리거나 이전에 지켜달라고 했던 제약조건을 놓치며 실수를 저지르는 경우를 자주 겪곤 합니다. 그래서 저는 목적별로 대화창을 명확하게 분리해서 작업하거나, 어느 정도 작업 단계가 진행되면 지금까지의 구현 내용과 의사결정을 요약 정리한 뒤 새 대화창에서 AI에게 이를 다시 학습시키는 방식으로 맥락을 관리하고 있습니다. 그렇다면 엔지니어링 아키텍처 차원에서는 이 문제를 어떻게 접근하고 있을까요? InfoQ의 발표 아티클 "Architecture / Context Engineering"에서는 바로 이 지점, 즉 단순한 프롬프트 엔지니어링을 넘어 시스템 아키텍처 수준에서 컨텍스트를 제어하는 '컨텍스트 엔지니어링(Context Engineering)'의 필요성과 구체적인 프레임워크를 다루고 있습니다. (출처: InfoQ - Architecture / Context Engineering) https://www.infoq.com/presentations/architecture-context-engineering/ 발표자들은 코딩 에이전트나 자율형 에이전트가 현장에서 실패하는 가장 큰 이유로 '비대해진 컨텍스트 윈도우(Bloated Context Windows)'와 무분별하게 채워진 프롬프트(Stuffed Prompts)를 꼽습니다. AI에게 너무 많은 정보를 한 번에 주면, 모델의 주의력(Attention)이 분산되거나 논리적 우선순위를 놓치는 현상이 발생합니다. 마치 인간 엔지니어에게 백과사전 수십 권을 던져주고 "이거 다 읽고 10초 ...