제 해법이 틀렸다는 걸 댓글로 배웠습니다
지난 글에서 응답 시간 필터가 시안 종류를 못 따라간다고 썼습니다. 이미지 라운드 중앙값이 4.5초, 텍스트 라운드가 11.7초인데 둘 다 1.5초 고정 기준으로 거르고 있었다는 이야기였습니다. 그리고 해법으로 "그 캠페인의 응답 시간 분포에서 하위 구간을 거르겠다"고 썼습니다. 백분위 방식입니다.
댓글이 하나 달렸습니다. 오피셜메일 님이 "고정값 하나보다 중앙값과 분포를 기준으로 조정하면 빠른 정상 응답을 덜 버릴 수 있을 것 같다"고 하셨습니다.
답을 쓰려고 분포를 다시 뽑았는데, 제가 쓴 해법이 작동하지 않는다는 게 나왔습니다.
하위 10% 지점이 이미지 라운드 1.29초, 텍스트 라운드 1.16초였습니다. 거의 같습니다. 중앙값은 2.5배 차이가 나는데 하단 꼬리는 붙어 있었던 겁니다. 백분위로 자르면 두 라운드에서 사실상 같은 선이 나옵니다. 제가 문제라고 지적한 1.5초 고정값과 다를 게 없는 기준을, 저는 해법이라고 써놓은 셈이었습니다.
중앙값은 시안 무게를 따라 움직였고 하단 꼬리는 아니었습니다. 그래서 기준을 중앙값에 태우기로 했습니다. 중앙값의 몇 % 미만을 거르는 방식입니다.
문제는 몇 %냐였습니다. 여기서 저희에게 운이 좋은 게 하나 있었습니다. 트랩입니다.
저희는 설문 사이에 주의력 체크를 섞습니다. "A를 눌러주세요"라고 대놓고 지시하는 문항입니다. 이걸 틀린 사람은 화면을 안 보고 있었다는 뜻이고, 이건 응답 시간과 무관하게 얻은 독립적인 정보입니다. 즉 응답 시간 기준이 맞는지 채점할 정답지가 있는 셈입니다.
최근 캠페인 5개에서 후보 기준들을 돌려, 각 기준이 "너무 빠르다"고 거른 응답 중 실제로 트랩도 틀린 사람의 비율을 봤습니다.
고정 1.5초 — 40건 거름, 그중 트랩 실패 45%
하위 10% — 32건, 41%
하위 15% — 47건, 40%
중앙값의 30% — 43건, 47%
중앙값의 40% — 65건, 38%
중앙값의 30%가 가장 정확했고, 놓치는 트랩 실패자도 가장 적었습니다. 40%는 더 많이 잡지만 정직한 응답까지 같이 버립니다. 백분위 방식은 예상대로 고정값보다도 나빴습니다.
바꾸고 나서 텍스트 라운드의 기준이 1.5초에서 2.7초로 올라갔습니다. 걸러지는 응답이 16건에서 26건이 됐습니다. 지난 글에서 문제라고 지목했던 2~4초 구간 11명이 이제 걸립니다. 이미지 라운드는 실질적인 변화가 없습니다. 원래 이미지에서는 고정값이 적당했던 게 맞고, 텍스트에서만 헐거웠던 거라 정확히 그 부분만 조여졌습니다.
배포했고, 앞으로 모든 리포트에 적용됩니다.
정리하면 지난 글에서 문제 진단은 맞았고 해법은 틀렸습니다. 댓글이 아니었으면 백분위로 바꿔놓고 고쳤다고 생각했을 겁니다. 숫자를 공개하니 틀린 부분이 돌아왔습니다.
시안 2개 놓고 고민 중인 팀이 있으면 댓글이나 DM 주세요. 검증된 인간 20명에게 대신 물어보고 리포트 보내드립니다. 무료입니다.
댓글
로그인 후 댓글을 남길 수 있습니다.
아직 댓글이 없습니다.