LLM 프롬프트 대장은 누구? 감정 프롬프트를 소개합니다.
들어가기 전에
작년 6월만 해도 AI에 감정은 없다고 느꼈습니다.
그냥 학습된 토큰을 확률적으로 뱉는 앵무새 같은 느낌이랄까요?
그런데 오늘 소개 드릴 프롬프트 기법은 마치 LLM이 감정을 이해하는 듯한 느낌을 줍니다. 과연 LLM은 정말 감정을 보유하고 있을까요?
평균 8% 답변 성능 향상 - 감정 프롬프트
오늘 소개 드릴 연구는 Large Language Models Understand and Can Be Enhanced by Emotional Stimuli입니다.
연구진은 실험을 성공적으로 진행하기 위해 6 가지 LLM에 Emotion Prompt를 사용 해보았는데요 거의 모든 LLM에서 성능 향상을 확인할 수 있었습니다.(평균 8%).
이는 유명한 프롬프트 기법인 CoT(Chain of thought)과 APE(Auto prompt engineering)만을 사용했을 때 보다 더 높은 수치인데요 사용법도 간단합니다.
원래 하고 싶었던 질문이나 프롬프트 뒤에 감정에 호소하는 문장만 붙여주면 끝입니다.
'LLM이 감정을 가졌을까?' 라는 주제는 굉장히 심오하고 무거운 주제일 것 같아서
첫 부분에서는 다루지 않고 우선 사용법과 왜 잘 되는지를 살펴 본 뒤 글의 말미에서
감정에 관한 내용을 다루도록 하겠습니다.
Method
저자는 크게 3가지 방법을 제안하는데요 저는 사회심리학에 아무런 기초 지식이 없기 때문에 저자가 인용한 논문에서 발췌한 내용을 예시로 들었습니다.
self-monitoring(사회적으로 눈치를 보는 능력)
-> 그게 맞아?, 내 커리어에 중요한 일이야 등social cognitive theory(격려의 말)
-> 할 수 있어, 너는 뛰어나 등cognitive emotion regulation(다시 한번 생각해보는 능력)
-> 실제로, LLM이 다시 생각하진 않는데 성능 향상이 일어남
우선, 앞의 세 가지를 분류한 이유는 연구진들이 '어떤 감정이 프롬프트로써 가장 유효한 방법 일까?'를 구분하기 위해 내용을 작성하신 것 같습니다.
저희가 LLM을 사용할 때에는 간단하게 원래 하려던 말이나 프롬프트 뒤에 감정적으로 호소하는 말을 해주기만 하면 됩니다.
연구 논문에서는 일반적으로 "This is very important to my career"가 가장 잘 된다고 하네요
Result
감정 프롬프트를 사용하면 모든 케이스에서 만족할만한 정답을 얻을 수 있다고 합니다. LLM별 비교 및 COT, APE와 같은 유명한 프롬프트 기법과도 비교하였는데요
모든 케이스에서 성능 향상이 이루어짐을 볼 수 있었다고 합니다.
평가는 106명의 참가자들이 각각의 문장 후보에서 어떤 문장의 답변이 좋은지 선택하는 방식을 채택하였습니다.
잘 안되는 경우도 간혹 있는데 T5 모델을 제외하면 큰 모델은 전부 다 잘되는 것을 확인 할 수 있습니다. T5모델은 애초에 성능 자체가 별로 좋지 못해서
적용하더라도 답변의 품질이 떨어진다 정도로 해석할 수 도 있겠습니다.
그리고 그림6을 확인했을 때 30개의 문제중 단 2문제를 제외한 나머지 문제에서 정답의 품질이 올라감을 확인 할 수 있습니다.
왜 잘 될까? AI가 감정을 진정으로 이해하는 걸까?
SFT나 RLHF의 훈련에는 사람의 피드백이 흘러 들어가는데요 이 과정에서 사람의 감정이 일종의 bias 작용을 하여 피드백 모델에게 전달 될 수 있습니다.
연구진의 입장은 이미 LLM은 감정을 가지고 있고 그래서 감정 프롬프트를 적용하면 잘 된다 라고 하는데 글쎄요.. 아래의 표를 해석하면 연구진의 해석처럼 전체적으로 좋아짐을 확인할 수 있다곤 하나 어떤 패턴을 발견하지는 못했습니다.
제 눈에는 모델이 훈련 받았을 때 bias를 얼마나 받았는지를 볼 수 있는 척도 정도로만 보이네요
다음은 문장에 어텐션이 어떻게 걸리는지 프롬프트마다 비교한 표 입니다.
Origin 프롬프트는 감정 프롬프트를 사용하지 않은 경우를 이야기하고 아래의
EP 시리즈는 감정 프롬프트를 사용한 문장들입니다.
positive와 negative 그리고 review에 어텐션이 많이 걸릴 수록 더 잘 집중했다고 생각 하시면 되는데요 Origin 프롬프트에는 빨간 영역이 상대적으로 덜 하다는게 보이시나요?
확실히, 감정 프롬프트를 사용하면 더 잘되는 것을 확인할 수 있습니다.
전문가들은 아직도 부정적 여러분들의 생각은 어떠신가요?
저는 해당 연구 논문을 읽으면서 어느 정도는 연구진에 의견에 동의했습니다만,
전문가들과 이야기를 나눠보니 상당히 부정적인 입장을 내놓으셔서 놀랐습니다.
우선, 제가 아시는 분 중 가장 신경망을 잘 아시는 분의 견해는 다음과 같습니다.
"그냥 재미있는 현상일 뿐, 감정을 가졌다고는 생각하지 않는다.
말씀해 주신 대로 사람의 피드백에 감정이 실려있어서 그럴 것이고 철저히 점수를 많이 주는 방향으로만 학습된 결과다."
저는 그 말에 제대로 반박하진 못했습니다.
하지만, 좋은 감정을 판단할 수 있고 감정 프롬프트를 적용했을 때 더 높은 성과를 발휘하는 AI를 우리는 단지 확률적 앵무새라고 불러야 할까요?
감정 모방 기능을 가진 AI는 감정이 없는 것일까요?
AI 기술 발전의 과도기에서 수정 천동설을 주장했던 과학자들과 우리는 다를 수 있을까요?
여러 분의 의견은 어떠신가요?
전문적인 견해가 아니어도 좋으니 함께 고민하고 토론해보면 좋을 것 같습니다.
업보트와 댓글은 저에게 큰 힘이 됩니다.
댓글
로그인 후 댓글을 남길 수 있습니다.
디트로이트 비컴 휴먼이라는 게임을 아시나요? 진짜 머지 않아 그렇게 될 것 같아요
아 그거 진짜 재밌게 했는데.. 제리코 기억나시나요 엔딩이 넘 맘에드는 게임이었어요
하나하나 엔딩 다 해봤어요ㅋㅋㅋㅋ
명작입니다 ㅋㅋㅋ
잘 읽었습니다 :)
댓글 감사합니다~! 수정본으로 내용 추가해서 돌아오겠습니다
흥미로운 정보 공유해 주셔서 감사합니다!
답글 감사합니다~!
글도 재밌게 쓰시고 닮고싶네요 ㅎㅎ
아닙니다 ㅠㅠ 저는 글공부가 필요한거 같아요
쓰다만 클럽에 이렇게 완성형 글을 써주시면 감사합니다
ㅠㅠ 지금 수정 중입니다 내용 보완하고 업로드하겠습니다~!