뒤로
김
김성구 ·

이미지는 4.5초, 텍스트는 11.7초. 같은 기준으로 거르고 있었습니다

지난주에 저희 앱 스토어 문구를 정해야 했습니다. 두 안을 놓고 의견이 갈려서, 저희 서비스로 직접 테스트했습니다. 검증된 인간 100명에게 물었고 77 대 23으로 갈렸습니다. 이긴 문구를 그대로 스토어에 반영했습니다.

그런데 이번에 배운 건 결과가 아니라 그 옆에 있던 숫자였습니다.

저희는 응답을 두 가지로 거릅니다. 주의력 체크(트랩) 실패, 그리고 너무 빠른 응답. 후자의 기준은 1.5초 고정이었습니다. 그보다 빨리 답했으면 시안을 봤다고 보기 어렵다는 가정이었습니다.

이번 라운드는 텍스트 문구 2개였고, 직전 라운드는 제품 패키지 이미지 2개였습니다. 같은 패널, 같은 필터, 각각 100명입니다. 응답 시간 중앙값이 이미지는 4.5초, 텍스트는 11.7초였습니다. 2.6배 차이입니다.

생각해보면 당연합니다. 이미지 두 장은 한눈에 비교되지만 문구 두 줄은 읽어야 합니다. 문제는 저희 필터가 그 차이를 모르고 있었다는 겁니다.

텍스트 라운드의 응답 시간 분포를 보면 2~4초 구간에 11명이 있습니다. 이 11명은 필터를 통과했습니다. 그런데 같은 캠페인에서 문구를 제대로 읽은 사람들의 중앙값이 11.7초입니다. 2~4초 만에 두 문구를 읽고 골랐다고 보기는 어렵습니다.

고정 임계값은 시안이 무거워질수록 헐거워집니다. 이미지에서 적당했던 1.5초가, 텍스트에서는 사실상 거의 아무것도 거르지 못하는 선이 됩니다. 실제로 두 라운드의 품질 미달 제외는 24%와 31%였는데, 이 차이도 응답자가 달라져서가 아니라 기준이 시안을 못 따라간 결과일 가능성이 큽니다.

그래서 기준을 절대값에서 상대값으로 바꾸려고 합니다. 그 캠페인 자체의 응답 시간 분포를 기준으로 하위 구간을 거르는 방식입니다. 그러면 시안 종류를 사람이 분류하지 않아도 데이터가 알아서 구분합니다.

두 라운드로 내린 판단이라 확정은 아닙니다. 시안 종류를 바꿔가며 몇 번 더 돌려보고, 바뀐 기준이 통과율을 어떻게 움직이는지 그대로 공개하겠습니다.

시안 2개 놓고 고민 중인 팀이 있으면 댓글이나 DM 주세요. 검증된 인간 20명에게 대신 물어보고 리포트 보내드립니다. 무료입니다. 유료 패키지는 크몽 승인 대기 중입니다.

0

댓글

로그인 후 댓글을 남길 수 있습니다.

아직 댓글이 없습니다.