Chapter 09
품질 검증

5color
평가 방법론

왜 9.5점인가. 왜 최대 10라운드인가.
AI가 만든 것을 그냥 쓰면 안 되는 이유와, 5개 관점에서 검증하는 구체적인 방법을 설명합니다.

AI가 만든 것을 그냥 쓰면 생기는 일

AI는 빠르게 만들어 줍니다. 보기에도 그럴싸해요. 그런데 "보기에 그럴싸한 것"과 "실제로 좋은 것"은 다릅니다.

처음 Claude가 만든 paulingplus.com 홈페이지 초안을 봤을 때, 뭔가 이상하다는 느낌이 있었어요. 어디가 이상한지는 몰랐습니다. 그래서 체계적으로 평가하는 방법이 필요했어요. 5가지 다른 눈으로 하나의 결과물을 보는 것 — 그게 5color입니다.

왜 이 숫자인가

9.5
합격선
10점은 완벽입니다. 완벽은 존재하지 않아요. 9.5점은 "5개 관점 모두에서 명확한 약점이 없는 상태"입니다. 8점대는 아직 고칠 것이 보이는 상태, 9점대는 방향이 맞고 디테일을 다듬는 상태, 9.5점은 독자에게 내보낼 수 있는 수준입니다.
10
최대 라운드
10라운드 안에 9.5점에 도달하지 못하면, 방향 자체가 잘못된 겁니다. 수정을 반복해도 안 되는 상태예요. 그때는 구조를 다시 잡습니다. 10라운드 제한은 "무한 수정 함정"을 피하기 위한 장치예요. Deliberative 함정 — 완벽을 추구하다 아무것도 내보내지 못하는 상황 — 을 막습니다.
점수 구간 정리 — 7점대: 구조·방향 재검토 필요 / 8점대: 방향은 맞으나 고칠 것이 여러 곳 / 9점대 초반: 방향 확정, 디테일 수정 중 / 9.5점+: 내보낼 수 있는 상태

각 색의 역할

한 사람이 혼자 평가하면 자기 관점의 편향이 생깁니다. 5개의 다른 페르소나가 각자의 관점에서 보면 한 관점이 놓친 것을 다른 관점이 잡아냅니다.

B
BLACK — 수행자
에디토리얼 웹 설계·퍼스널 브랜딩 전문가 15년차
디자인 완성도, UX 구조, 기술적 완결성. "이 디자인이 진짜 전문가가 만든 것처럼 보이는가."
R
RED — 논리
정보 구조·논리 흐름·CTA 유효성 검증자
메시지 일관성, 섹션 순서의 인과 관계, CTA가 실제로 클릭을 유발하는가.
S
SILVER — 분야 전문가
패션 브랜드 실무자 20년차
현장 적합성, 업계 언어, 실용성. "이 내용이 실제 패션 현장에서 맞는 이야기인가."
B
BLUE — 공감
처음 이 페이지에 들어온 패션 브랜드 대표
첫인상, 감정·신뢰도, 행동 유발. "3초 안에 '이 사람 뭔가 다르다'는 느낌이 오는가."
G
GOLD — 독자
AI Playbook 독자 — "나도 할 수 있을까?" 고민 중인 패션 MD·마케터
실제 사용 경험, 행동 동기. "이걸 읽고 나서 다음 챕터를 읽고 싶어지는가."

AI Playbook 메인 페이지 — 6라운드 진행 예시

아래는 메인 페이지 작업 시 실제 진행된 라운드 수와 방향을 바탕으로 재구성한 예시입니다. 라운드별 수치는 실제 기록이 아닌 참고용입니다.
라운드BLACKREDSILVERBLUEGOLD평균판정
R18.07.57.88.27.57.80미합격
R28.58.38.48.68.38.42미합격
R38.88.78.88.98.78.78미합격
R49.19.09.19.29.09.08근접
R59.39.29.39.49.39.30근접
R69.59.49.59.59.49.46✓ 합격
R1에서 RED·GOLD가 7.5로 가장 낮았던 이유: 정보 구조가 단순 나열이었고(RED), 독자가 다음 챕터를 읽고 싶게 만드는 훅이 없었습니다(GOLD). R2에서 섹션 순서 재구성과 챕터 말미 CTA를 추가하면서 두 항목이 올라갔어요.
합격 후에는?
9.5점에 도달하면 해당 산출물은 "내보낼 수 있는 상태"로 확정합니다. 이후에도 Paul이 직접 읽고 "이건 내 목소리가 아니다"거나 "이 내용이 실제와 다르다"고 하면 별도 수정을 진행합니다. 5color는 구조·정보·디자인을 검증하지만, Paul의 실제 경험과 목소리는 Paul만 확인할 수 있습니다. 그래서 최종 검수는 항상 Paul이 합니다.