뒤로
해례
·
성공한 챗봇 UX가 음성 AI의 한계가 된 이유
생성형 AI의 가장 성공적인 UX는 텍스트 챗봇이었습니다.
사용자가 입력하고, 전송 버튼을 누르고, AI가 답변을 생성한 뒤 다시 사용자가 입력하는 구조입니다. 텍스트 환경에서는 매우 자연스럽고 성공적인 방식이었습니다. 문제는 이후 음성 AI 역시 이 구조를 그대로 이어받았다는 점입니다. 사용자의 음성을 STT로 바꾸고, LLM이 처리한 뒤, 다시 TTS로 읽어주는 방식입니다. 즉 인간의 대화를 처음부터 다시 설계했다기보다, 성공한 챗봇의 입구와 출구만 음성으로 바꾼 셈입니다.
하지만 실제 인간의 대화는 다릅니다. 우리는 상대가 말하는 동안에도 듣고, 필요한 순간에는 말을 시작합니다. 동시에 표정과 시선, 몸짓도 함께 받아들입니다. 귀는 계속 듣고, 입은 필요한 순간에 말하며, 눈은 계속 봅니다.
그렇다면 지금의 AI 기업들은 기존 챗봇 구조의 한계를 넘어, 인간의 대화 UX를 다시 기술 안에 담기 위해 어떤 움직임을 보이고 있을까요? 이번 글에서는 최근의 실시간 AI 흐름을 보며, 기술이 아니라 인간의 대화 UX에서 다시 출발해야 하는 이유를 정리했습니다.
왜 AI는 이제서야 진짜 대화를 시작할까?
https://cfono1.tistory.com/1450
1
댓글
로그인 후 댓글을 남길 수 있습니다.
아직 댓글이 없습니다.