ChatGPT가 1주년을 맞았네요! 🎉 그동안 오픈소스 LLM의 성능은 어디까지 발전했을까요?
이 글은 ChatGPT’s One-year Anniversary: Are Open-Source Large Language Models Catching up? 라는 논문을 바탕으로 작성되었습니다.
LLM으로 다양한 서비스를 만드시는 분들에게는 LLM이 가지고 있는 성능이 너무나도 중요합니다. 그래서 우리는 보통 OpenAI의 GPT-4를 자주 이용합니다. 성능이 압도적으로 좋기 때문에 한번 GPT-4의 맛을 보면,, 다른 모델로는 절대 만족할 수가 없게 되는 것 같아요. ChatGPT가 등장하고 나서 open-source LLM도 정말 다양하게 등장했습니다. 지금 당장 생각나는 모델로는 Llama, Falcon, Qwen 정도가 떠오르네요. 하지만 open-source LLM을 띄울 GPU가 없어서, 성능이 비교적으로 안 좋아서 우리는 기꺼이 돈을 지불하면서 GPT-3.5나 GPT-4를 사용합니다.
대략적으로 open-source LLM이 아직 부족하다는 건 알고 있었는데 정량적으로 GPT-4에 비해 얼마나 못 미치는지 궁금해졌고, 그런 제 궁금증을 이 논문을 통해서 해결할 수 있었습니다. 논문에서 재밌었던 내용들을 몇 가지 얘기해볼게요 :)
LLM-based Agent 개발에는 GPT-3.5-turbo 보다는 open-source LLM이 낫다.
GPT-3.5-turbo는 확실히 chat에 중점을 두고 개발되었기에 다양한 task를 수행해야하는 Agent 개발에는 open-source LLM이 낫다고 합니다. 특히 Lemur-70B-chat이 뛰어난 성능을 보였습니다. 물론 GPT-4보다는 미만입니다. 명심하세요. 우리는 아직 GPT-4를 거역할 수 없습니다.
👆HuggingFace에서 Lemur 모델을 사용해볼 수 있습니다. 제 뉴스레터에서도 한번 소개를 했었답니다! 👇
나는 GPU가 많이 없어.. 7B면 충분해..라고 하신다면 Zephyr-7B 추천!
Zephyr-7B는 현존하는 가장 강한 7B 모델 중 하나라고 생각합니다. (Qwen-7B 보다 잘하는진 확실하진 않음..) 유명한 LLama-2-70B 모델하고도 비슷한 성능을 보이기에 추천합니다.
GPT-4는 진짜 손댈 수 없는 신의 영역인가? 그건 아님.
Gorilla 모델은 Agent에게 가장 중요한 Tool 사용에 있어서 GPT-4 보다 성능이 좋았습니다. 하지만 그게 답니다. 딱 아래 짤 정도로 이해하시면 됩니다.

하지만 어찌 되었든 시간이 지날수록 점점 GPT-4와 특정 task에 있어서 견주어볼만한 성능을 가진 open-source LLM 들이 많이 나와주고 있습니다.
계속해서 새로운 LLM이 빠르게 등장하고 있습니다. 계속 open-source LLM에 어떤 큰 업데이트가 있는지 팔로업해야 더 성능이 좋은 모델을 효율적으로 사용할 수 있지 않을까요? 늠름한 엔지니어 클럽에서 함께 좋은 정보들을 공유하며 성장해나가면 좋겠습니다!
댓글
로그인 후 댓글을 남길 수 있습니다.
좋은 정보 공유 감사합니다!