뒤로
김유빈
김유빈 ·

Log 1 | The devil is in the user interface

image 14.png

<Generative AI Apps Struggle With Retention (Sequoia Capital, 2023)>

많은 사용자가 생성 AI를 경험하고 있다. 하지만 대부분의 서비스가 리텐션 확보에 고전을 면치 못하고 있다. 인공지능 기술의 집약체인 ChatGPT도 초딩 메타버스 Roblox보다 리텐션이 안나오는 실정이다.

image 5.png

<Augmentation Before Replacement (Kamradt, 2023)>

A graph showing the time it took for various social media platforms to reach 100 million users

<AI’s Meteoric Rise Is a Trillion-Dollar Opportunity in the Making (Yahoo Finance, 2023)>

왜 리텐션이 안나올까? 생성 AI 시장이 과속했기 때문이라 생각한다. 인터넷은 도구(브라우저, 검색엔진, 등)와 철학(보안, HTTP 표준 등)을 천천히 구축하며 7년에 걸쳐 1억명의 사용자를 모았다. 하지만 ChatGPT는 단 두 달 만에 1억명의 사용자를 모았다. 도구도, 철학도 채 여물지 않은 상태에서, 전무후무한 속도로 1억을 모았다. 그래서 모든게 불확실한 상황이다. 이 도구가 맞나? 저 철학이 맞나? — 사용자도, 메이커도 혼란스러워하고 있다. 그런 불확실성 속에서 리텐션이 안정적으로 나오긴 힘들다.

image.png

<The Top 12 Reasons Startups Fail (CBINSIGHTS, 2018)>

그럼 생성 AI 시장에서 PMF는 어떻게 찾을 수 있을까? 이게 정답이다, 저게 정답이다 확신하지말고, 겸손한 자세로 실험을 반복하는게 가장 현명한 전략이라 생각한다. 스티브 워즈니악도 개인용 컴퓨터는 “비디오 게이머나 쓰는 죽어가는 유행”이라 예측했었다. 천재 엔지니어도 희대의 오판을 내리는데 우리는 오죽할까. 스타트업이 실패하는 주요 원인 중 하나가 “No market need”인 것만 봐도 시장을 예측하는 것이 얼마나 어려운지 볼 수 있다. 도구도, 철학도 여물지 않은 생성 AI 시장은 더욱이 그러하다. 이 바닥에선 확신보단 겸손이 더 중요하며, 불확실성의 바다에서 꾸준히 실험해야 PMF를 찾기 유리할 것이다.

image.png

<Confounading Variables — (XKCD, 2021)>

그런데 실험에 앞서 간과해서는 안되는 중요한 사실이 있다. 실험 결과로부터 유의미한 결론을 도출하기 위해선 변인통제를 해야한다. 물론 너무 많은 변인을 통제하려 들면 확증편향의 오류를 범할 수 있다. 그래서 <린스타트업>의 방식대로, 가볍게, 단순하게, 빠르게 실험을 설계하는게 현명하다. 하지만 아예 변인을 통제하지 않는 것 또한 문제다. 특히 눈에 띄지 않는 교란변인 (confounding variable)을 통제하는 것이 정말 중요하다. 이를 통제하지 않으면 사용자의 반응을 얻고도 제품의 성/패를 결론 짓기가 어렵다.

image.png<뤼튼 플러그인 랜딩 페이지 (뤼튼, 2023)>

고백하자면 뤼튼이 딱 그런 실수를 했었다. 올해 상반기, 교란변인을 충분히 통제하지 못한채 뤼튼 플러그인을 출시했었다. 뤼튼은 디비피아, 원티드, 올스테이, 타다, 식신 등 다양한 한국 시장의 서비스를 사용자에게 연결해주는 플랫폼 비전에 도전하고 있다. 이 길이 정답인지는 누구도 확신할 수 없다. 그래서 뤼튼은 빠르게 실험을 진행했다. 올해 8월, 맥락에 따라 분위기 좋은 맛집을 식신에서 찾아주고, 궁금한 논문을 디비피아에서 찾아주고, 채용공고를 원티드에서 찾아주는 생성 AI 플랫폼을 세상에 내놓았다.

image.png

< 슈나이더만의 골든 규칙 중 "Keep users in control" 규칙을 어긴 뤼튼 플러그인 (실제 사용자 데이터, 2023)>

하지만 막상 사용자의 반응은 냉담했다. 가슴 아프게도 예상에 못미치는 리텐션을 마주했다. 생성 AI판에선 충분히 그럴 수 있다. 오히려 당연하다. 하지만 "사용자는 뤼튼 플러그인에 관심이 없구나"라 결론짓고 다른 아이템으로 넘어가기엔 뭔가 애매했다. 정성분석을 해보니 사용성이 좋지 않은 경우가 더러 있었기 때문이다. 예를 들면 위와 같은 상황. 사용자는 고도비만 일주일 식단관리 해줘라 부탁했지만 뤼튼은 운동을 찾아주는 <플랜핏>을 호출한 상황이다. 원치 않은 플러그인이 호출되니 사용자는 운동 말고 식단 을 재차 물어본다. 여기서 그냥 생성을 했으면 그나마 나았을텐데, 뤼튼은 또 <플랜핏>을 호출한다. 그러자 사용자는 식단 짜달라고 라며 짜증을 내곤 대화를 끝낸다.

image.png

<Golden rule of UI design #7 - keep users in control (Shneiderman, Desigining the User Interface, 2018)>

벤 슈나이더만의 책 Designing the User Interface을 보면 "The Eight Golden Rule of Interface Design"을 소개하는데, 그 중 일곱번째 규칙인 "keep users in control"을 어긴 상황이라 볼 수 있다. 기존의 경험을 크게 바꾸는 기능의 권한은 왠만하면 사용자에게 부여해야한다. 하지만 뤼튼 플러그인은 그러지 않았다. 플러그인을 끌수는 있었으나 번거로웠다. 플로팅 토글을 눌러 실패한 플러그인을 굳이 찾아 해제 해야했다. 사용하기 불편하다는 교란변인이 존재했던 것이다. 사용자가 플러그인에 가치를 못느껴서 나가는건지, 그냥 사용성이 좋지 않아 나가는 것인지 분간하기 어려웠다. 그래서 플러그인의 성/패를 매듭짓고 앞으로 나아가기가 어려웠다.

image.png

<왜 "Keep users in control"을 안해주냐며 불평하는 라이너챗 리뷰 (라이너 ChatGPT: 웹 및 YouTube용 AI Copilot, 2023)>

생성 AI 검색 시장에서 독보적으로 달리고 있는 라이너도 비슷한 실수를 했었다. 얼마 전 <라이너챗>을 출시했는데 당시의 리뷰를 훑어보면 1점 리뷰가 꽤 달려있다. 내용을 보면 진짜 너무 거슬려요 , 기능을 끌 수 있는 기능도 있어야 하는 거 아닌가요?란 불만이 대부분이다. "Keep users in control" 규칙을 합당한 이유없이 위반한 것이다. 지금은 <라이너챗>을 해제할 수 있도록 대응했다. 하지만 라이너도 분명 헷갈렸을 것이다. 사용자가 <라이너챗>이 필요없어서 1점을 메긴것인지, 아니면 그낭 쓰기 불편해서 1점을 메긴 것인지. 사용성이라는 교란변인을 통제하지 못해 성/패를 가름하기 어려웠을 것이다.

image.png<“These are not three separate devices — these are one device” (Apple, 2007)>

교란변인을 잘 통제해 가설을 성공적으로 검증한 예로는 애플의 아이폰이 있다. “음악, 전화, 인터넷을 하나의 기기에서 할 수 있다면 사용자가 열광할 것이다”는 것이 아이폰의 가치 제안이었다. 지금은 너무나도 당연해보이지만 아직 이렇다할 스마트폰이 없던 당시엔 불확실성 가득한 제안이었다. 그래서 애플은 각종 위험을 무릅쓰고 실험을 했어야 했다.

image.png

<Apple’s Secret iPhone Launch Team: The Event That Began It All (WSJ, 2017)>

그러나 유의미한 결과를 얻기 위해선 각종 교란변수를 걷어내야만 했다. 그 중 하나가 가상 키보드였다. 햅틱 피드백이 없는 가상 키보드는 부정확할 수 밖에 없었다. 별 생각없이 그대로 출시하면, 자꾸만 오타가 나서 아이폰을 안쓰는 것인지, 아니면 3-in-1은 딱히 필요없어 안사는 것인지 분간하기 어려울 터 였다. 그래서 애플은 맥락에 따라 키의 히트 면적이 변하는 기술을 고안했다. 눈에 보이는 크기는 그대로인데, T 를 입력하면 그 다음으로 올 확률이 높은 H의 히트 면적이 살짝 커진다. 이어서 H 를 입력하면 E 의 히트 면적이 굉장히 커진다. 그렇게 물리 키보드에 준하는 정확도의 가상 키보드를 만들었다. 블랙베리 수준의 사용성은 아니었지만 사람들은 큰 불편을 호소하지 않았다. 그렇게 애플은 유력한 교란변인을 통제했고 3-in-1 가치 검증에 집중할 수 있었다.

<Hick's Law Applied to Investments - Too Many Darn Choices! (Disciplined Systematic Global Macro Views, 2019)>

애플과는 달리 뤼튼은 최소한의 사용성을 잡지 못했다. 교란변인으로 작용해 결론 짓기 힘들었다. 그래서 우리는 플러그인의 성/패 판단을 보류하고 한번 더 도전하기로 했다. 나의 경우 주된 교란변인인 "Keep users in control"을 통제하기 위한 연구를 하고 있다. 연구할게 뭐 있나, 그냥 라이너처럼 사용자에게 선택권을 주면 끝날 일 아니냐, 싶을수는 있다. 하지만 사용자에게 권한을 너무 많이 주는 것 또한 좋지 않다. 힉의 법칙 (Hick's law)에 의하면 선택지의 수가 늘어남에 따라 반응 속도는 대수적으로 증가하기 때문이다. 물어보는 것도 눈치껏 해야지 "00 플러그인을 실행할까요?"를 매번 물어보는 것 또한 짜증날 것이다. 대신, 언제 어떤 플러그인을 호출할지 알아서 "낄끼빠빠"하는 것이 최선일 것이다.

image 6.png

그러한 배경에서 GGPP(낄까빠빠) 연구를 진행하고 있다. GGPP는 생성이 필요한 상황( generate ), 플러그인이 필요한 상황 (use )를 눈치 껏 판단한다. 그리고 자신이 없으면 ( if uncertain )사용자에게 "00 플러그인을 실행할까요?"라 재차 물어본다 (ask ). 물론 힉의 법칙에 의거, 매번 물어보는 것 또한 눈치없는 행동이다. 그래서 자신있다면 굳이 물어보지 않고 바로 실행한다(execute ). 그렇게 사용자의 눈치를 살피며 낄 때는 끼고 뺄 때는 빼는 것이 GGPP 알고리즘이다.

image 4.png

<the devil is in the details (The Free Dictionary)>

"The devil is in the details" 라는 관용표현이 있다. 예상치 못한 디테일이 큰 문제의 주요인이 됨을 뒤늦게 깨닫는 상황을 일컫는 표현이다. 별 대수롭지 않게 생각했던 UI의 디테일을 챙기지 못해 뤼튼 플러그인 시즌 2에 도전하는 뤼튼이 딱 그런 상황에 놓여있다.

처음엔 몰랐지만, 이제 우리는 The devil is in the user interface 임을 안다. 그래서 GGPP 연구를 적극적으로 추진하고 있다. 생성/플러그인 사용 여부는 어떻게 판단할 것인지, 결정의 "자신감"은 어떻게 측정할 수 있는지 고민하고 있다.

사용자 경험과 직접적으로 맞닿아있는 연구과제다. 학교 연구실에선, 대기업에선 해보기 어려운 연구다. 그래서 더더욱 이 연구의 성과를 PMC에서 짧게 나마 공유해보고자 한다. 정확도 1% 올리는 연구, 연구를 위한 연구, 사용자 효용이 보이지 않는 연구에 지친 ML 엔지니어가 GGPP 연구를 보고 "뤼튼에 가면 저런 연구를 할 수 있구나"라 생각하게 만드는 것이 목표다.

PMC의 목표로 <ML 엔지니어 5명과 커피챗>을 설정했는데, 많은 엔지니어가 이 글을 읽고 커피챗을 보냈으면 좋겠다.

21

댓글

로그인 후 댓글을 남길 수 있습니다.

William Jung
William Jung

정확도 1% 올리는 연구, 연구를 위한 연구, 사용자 효용이 보이지 않는 연구에 지친 ML 엔지니어가 GGPP 연구를 보고 "뤼튼에 가면 저런 연구를 할 수 있구나"라 생각하게 만드는 것이 목표다. > 글을 읽고 나서 마지막 문장을 보니 어떤 분을 찾고 있는지 명확히 보이는 것 같아요. 좋은 글 남겨주셔서 감사합니다. PMC 기간동안 꼭 목표 달성하실 수 있길 바라요!

김유빈
김유빈

네 민교님 좋은 프로그램 마련해주셔서 감사해요 :)

Cailyn Yong
Cailyn Yong

와 좋은 글 감사합니다

김유빈
김유빈

긴 글 읽어주셔서 감사합니다 ㅎㅎ

HongKiSong
HongKiSong

역시, GPT 조련사.. GPT에게 👨‍🦯 Thinking, Fast🏃‍♂️ and Slow🧎‍♂️를 탑재중이시군요

백승윤
백승윤

좋은 글 감사합니다! OpenAI가 제공하고 있는 Function Call도 GGPP를 잘 못하는 것 같은데 판별이 어려운 회색 지역을 user에게 control를 넘긴하면 오히려 좋은 UX를 만들어낼 수 있을 것 같네요!

정지헌
정지헌

유빈님 좋은 글 감사합니다! 항상 이야기 나눌때마다 인사이트를 얻을 수 있었는데, 이렇게 글로도 많은 가르침을 주시는군요 ㅎㅎ

U
U

좋은 글 감사합니다 유빈님. UI/UX가 문제일 것이라는 가설을 검증하겠다는 계획을 선포하시는 것은 좋지만 참여하시지도 않은 프로젝트의 내용을 짜집기해서 올리는 건 오해의 소지가 있을 것 같네요~ 뤼튼팀 화이팅하세요.

박종한
박종한

어떤 오해의 소지가 있을 수 있을까요???

U
U

"별 대수롭지 않게 생각했던 UI의 디테일을 챙기지 못해 뤼튼 플러그인 시즌 2에 도전하는 뤼튼이 딱 그런 상황에 놓여있다." 라고 말씀주셨는데요. 결론을 도출하는 과정에서 여러 내용을 간과하고 작성주신 것 같습니다~ 1. 외부 상황(투자 유치 및 Business Partner들과의 관계 유지) 2. 실제 프로덕트 개발 상황 및 배경(어떤 가설을 검증하고자 한 것인지, 이 실험으로 보고자했던 Key Metric 등) 3. 실험의 결론과 판단한 근거의 타당성('최소한의 사용성을 잡지 못했다'가 문제이다를 판단한 정성적인 근거의 타당성) 맥락과 상황을 충분히 이해하지 못한 상태로 현상만 보고 내용을 전달하게 되면, 실제 실험의 취지와 근본적인 문제들을 오도할 소지가 있어 보입니다.