프로덕트

아직 프로덕트가 없습니다.

아티클

전체 보기
백승윤

백승윤

Gemini Pro. GPT-3.5-turbo보다도 별로임!

논문 저자가 재실험을 하고 있다고 하네요. 댓글 참고 부탁드립니다!!

이틀 전에, CMU에서 아카이브 페이퍼가 하나 올라왔는데요. 유명한 10개 데이터셋에 대해서 Gemini Pro, GPT-3.5-turbo, GPT-4를 비교해봤고 그 결과...

image.png

GPT-3.5-turbo 보다도 모든 데이터셋 성능에서 밀리네요. Gemini Pro 쓸 이유가 없겠는데요? OpenAI는 신인 것 같습니다. 그럼 20000.

#짧스콰이엇 처럼 적어보았습니다 ^^

15
12
백승윤

백승윤

LLM의 미래가 궁금하다면 Benchmark를 보아라

최근 LLM 관련 엄청난 Benchmark 2개가 등장했었는데요. 바로 GAIA와 GPQA입니다. 이 둘이 엄청나다고 말한 이유는 Benchmark의 난이도가 기존보다 훨씬 높아졌기 때문입니다.

저는 MNIST라는 데이터셋을 가지고 NeuralNet을 학습하면서 딥러닝에 입문을 하였는데요. 다들 아는 유명한 데이터셋이라고 생각합니다. 적당히 CNN으로 개발하면 Accuracy를 90% 이상 달성하는 건 식은죽 먹기였죠. 그런데 시간이 지날수록 Computer Vision 모델의 성능이 좋아졌고 이 모델들을 더 잘 평가하기 위해선 더 어려운 Benchmark인 ImageNet가 등장해서 자주 사용되기도 하였습니다.

이처럼 모델의 성능이 향상될수록, 모델의 평가를 위한 Benchmark의 난이도도 커져야 합니다. LLM이 처음 등장했을 때, QA에서 너무 좋은 성능을 보였기 때문에 기존 QA Benchmark로는 다양한 LLM들을 평가하기 어렵겠다고 생각했는데 역시나 어려운 Benchmark가 등장하게 되었습니다!

GAIA: a benchmark for General AI Assistants

GAIA는 사람은 쉽게 수행할 수 있지만 AI는 아직 잘 하지 못하는 태스크를 모아두었습니다. 예를 들어, 어떤 질문을 하였을 때 우리는 모르면 구글링도 해보고 논문도 읽어보고 해서 답을 찾듯이 AI도 그런 자유로운 액션을 수행할 수 있는지 평가하게 됩니다. 정말 자비스처럼, Assistant처럼 우리가 부여한 태스크를 수행할 수 있는지 평가할 수 있죠.

image.png

지금은 신이라 불리는 GPT-4도 10% 정도의 성능밖에 보이질 않아요. 만약 AI Assistant가 이걸 Human level인 90%까지 달성한다면,, 정말 현실판 자비스가 탄생하지 않을까요?

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

GPQA는 QA (Question-Answering) Task의 난이도를 확 올렸어요. 생명과학, 물리학, 화학과 같은 전문적인 분야에 대한 질문을 만들고 실제로 PhD들한테 풀어보라고 시키니 65% 정확도를 보였다고 하네요. 또한 구글링으로 쉽게 풀리지 않는 문제라는 걸 증명하기 위해 비전문가분들에게 30분의 시간을 주고 구글링을 활용해서 답해보라고 했지만 34%만이 정답을 맞췄다고 합니다.

image.png

(이거 풀 수 있는 사람..?)

현재 GPT-4는 39% 정확도를 보인다고 해요. LLM의 정확도가 PhD의 정확도보다 높아진다면 우린 정말 고도화된 전문가를 얻을 수 있지 않을까요?


이전에는 Benchmark로 모델 A vs 모델 B, 이렇게 비교를 했다면 앞으로는 사람 vs LLM, 이런 대결 구도로 패러다임이 바뀌는 것 같아 무척 흥미롭네요!

여러분들은 LLM의 미래를 어떻게 생각하시나요?

8
0
백승윤

백승윤

ChatGPT가 1주년을 맞았네요! 🎉 그동안 오픈소스 LLM의 성능은 어디까지 발전했을까요?

이 글은 ChatGPT’s One-year Anniversary: Are Open-Source Large Language Models Catching up? 라는 논문을 바탕으로 작성되었습니다.

LLM으로 다양한 서비스를 만드시는 분들에게는 LLM이 가지고 있는 성능이 너무나도 중요합니다. 그래서 우리는 보통 OpenAI의 GPT-4를 자주 이용합니다. 성능이 압도적으로 좋기 때문에 한번 GPT-4의 맛을 보면,, 다른 모델로는 절대 만족할 수가 없게 되는 것 같아요. ChatGPT가 등장하고 나서 open-source LLM도 정말 다양하게 등장했습니다. 지금 당장 생각나는 모델로는 Llama, Falcon, Qwen 정도가 떠오르네요. 하지만 open-source LLM을 띄울 GPU가 없어서, 성능이 비교적으로 안 좋아서 우리는 기꺼이 돈을 지불하면서 GPT-3.5나 GPT-4를 사용합니다.

대략적으로 open-source LLM이 아직 부족하다는 건 알고 있었는데 정량적으로 GPT-4에 비해 얼마나 못 미치는지 궁금해졌고, 그런 제 궁금증을 이 논문을 통해서 해결할 수 있었습니다. 논문에서 재밌었던 내용들을 몇 가지 얘기해볼게요 :)

LLM-based Agent 개발에는 GPT-3.5-turbo 보다는 open-source LLM이 낫다.

GPT-3.5-turbo는 확실히 chat에 중점을 두고 개발되었기에 다양한 task를 수행해야하는 Agent 개발에는 open-source LLM이 낫다고 합니다. 특히 Lemur-70B-chat이 뛰어난 성능을 보였습니다. 물론 GPT-4보다는 미만입니다. 명심하세요. 우리는 아직 GPT-4를 거역할 수 없습니다.

👆HuggingFace에서 Lemur 모델을 사용해볼 수 있습니다. 제 뉴스레터에서도 한번 소개를 했었답니다! 👇

나는 GPU가 많이 없어.. 7B면 충분해..라고 하신다면 Zephyr-7B 추천!

Zephyr-7B는 현존하는 가장 강한 7B 모델 중 하나라고 생각합니다. (Qwen-7B 보다 잘하는진 확실하진 않음..) 유명한 LLama-2-70B 모델하고도 비슷한 성능을 보이기에 추천합니다.

GPT-4는 진짜 손댈 수 없는 신의 영역인가? 그건 아님.

Gorilla 모델은 Agent에게 가장 중요한 Tool 사용에 있어서 GPT-4 보다 성능이 좋았습니다. 하지만 그게 답니다. 딱 아래 짤 정도로 이해하시면 됩니다.

너 개못하잖아 2

하지만 어찌 되었든 시간이 지날수록 점점 GPT-4와 특정 task에 있어서 견주어볼만한 성능을 가진 open-source LLM 들이 많이 나와주고 있습니다.

image.png

계속해서 새로운 LLM이 빠르게 등장하고 있습니다. 계속 open-source LLM에 어떤 큰 업데이트가 있는지 팔로업해야 더 성능이 좋은 모델을 효율적으로 사용할 수 있지 않을까요? 늠름한 엔지니어 클럽에서 함께 좋은 정보들을 공유하며 성장해나가면 좋겠습니다!

6
1
백승윤

백승윤

⭐️코르카의 기술세션⭐️ 후기

안녕하세요! 저는 코르카의 ML엔지니어이자 LLM(늠름)한 엔지니어 클럽의 모더레이터를 맡고 있는 백승윤이라고 합니다. 👋 저번주 수요일에는 마루 180에서 추천시스템과 LLM과 관련하여 코르카 팀에서 기술 세션을 진행하고 네트워킹 시간을 가졌었는데요! 다들 재밌게 즐겨주셨나요? 😁

코르카에서 기술적으로 발표했던 경험은 여러번 있었지만 코르카만 발표하는 세션은 처음이라 저희도 만반의 준비를 열심히 했었답니다!

image.png

(마지막으로 발표를 준비하고 계신 Tech Lead 태호님과 ML Lead 태희님)

image.png

정말 다양한 분들이 오셔서 저희의 세션을 들어주셨는데요! 귀한 시간 내주셔서 다시 한번 감사드립니다! 🙇‍♂️

image.png

(RecSys 학회에서 얻은 인사이트들을 활용해 어떻게 프로덕트를 개발하고 있는 설명하고 계신 태희님)

첫 순서로는 태희님께서 코르카에서 RecSys Challenge 2023에 참가하여 좋은 성적을 거두었던 경험과 RecSys 학회에서 얻었던 인사이트들을 공유해주셨습니다. 한가지 흥미로웠던 내용은 LLM을 RecSys에 활용하려는 연구도 활발히 진행되고 있다는 것이었어요. 저도 이번에 RecSys 학회를 가서 느꼈지만 많은 사람들이 LLM과 관련된 세션에 굉장히 관심이 많더라구요. 하지만 더불어 든 생각 중 하나는 아직 정말 LLM을 잘 응용한 연구는 많이 이뤄지지 않았다는 것이었어요. 우리가 아직 새롭게 시도해볼 것들이 많은 것 같아서 긍정적으로 느껴졌네요. ㅎㅎ

image.png

(LLM으로 개발하고 있는 우리의 멋진 프로덕트인 Agent Village를 열정적으로 설명하고 계신 태호님)

두번째 순서로는 태호님께서 코르카에서 어떤 LLM 연구를 진행하고 있는지 자세하게 설명하고 자유롭게 질의응답하는 시간을 가졌는데요. 지금까지 등장한 LLM들은 특정 분야에서 인간을 대체할만한 성능을 보여주었기에 LLM을 활용한 서비스를 잘 개발하면 생산성을 극대화시켜줄 수 있다는 말씀을 해주셨고, 거기서 멈추지 않고 코르카는 지금 LLM에게 잠재되어있는 성능을 발현시키기 위해 자체적인 연구도 많이 하고 있다는 얘기를 해주셨어요! 가장 기억에 남는 것은 LLM에게 지속적으로 지식을 주입시켜주기 위해 In-context Learning이 아니라 모델 parameter에 직접적으로 context를 이해할 수 있도록 update하는 연구를 하고 있다고 하셨어요. 관련해서는 나중에 기회가 된다면 글로 더 작성을 해볼게요! :)

세션을 마치고는 자유롭게 네트워킹하면서 서로의 생각들을 공유할 수 있어서 너무나 좋았답니다. 다음 번에도 기회가 된다면 좋은 세션을 가지고 여러분들을 찾아뵐 수 있으면 좋겠습니다!! 또한 LLM(늠름)한 엔지니어 클럽에서는 끊임없이 LLM과 관련된 기술적인 얘기를 자유롭게 할 수 있도록 운영할 예정이니 많은 관심 부탁드립니다 ㅎㅎ

마지막으로 이 세션을 준비해주신 디스콰이엇 분들 너무 감사드리고, 우리 팀의 영현, 선영, 충환, 승표님도 너무 수고많으셨습니다!!

여러분들은 저희의 세션이 어땠나요? 댓글로 후기나 그때 하지 못했던 궁금증들을 자유롭게 남겨주세요!!

7
0
백승윤

백승윤

AI 에이전트가 5년 안에 모든 걸 뒤바꿀 것이다.

오늘 빌 게이츠 선생님의 좋은 글을 읽고 공유하고 싶어 이렇게 몇 자 적어봅니다. (@권민재 좋은 글 공유해주셔서 감사해요! 🥰)

우리는 컴퓨터 작업을 하기 위해서 직접 프로그램을 실행하고 명령어를 입력하고 있다. Notion으로 문서를 작성하고, VSCode로 코드를 작성해서 무언가를 개발해낸다. 하지만 컴퓨터는 우리 대신 이메일을 보내주거나 영화 티켓을 구매해주지는 못한다. 또한 아무리 오래 사용한 앱이라고 해도 내가 일하는 방식이나 취향, 능력과 같은 정보를 거의 파악하지 못하고 있다.

빌 게이츠는 향후 5년 안에 모든 것이 뒤바뀔 것이라고 전망했다. 기기한테 당신이 원하는 것을 말한다면 기기는 그 일을 수행해낼 것이다. 직접 사이트에 접속해서 내 카드로 영화를 예매하고, 가고 싶은 식당을 내 취향 맞춤으로 추천을 해줄 것이다. 생성 AI 에이전트는 단순히 컴퓨터를 작동시키는 방식에만 변화를 주는 것이 아니라 SW 인더스트리 전체에 큰 파장을 불러일으킬 것이다.

모두를 위한 개인 비서가 나타난다.

지금까지 생성 AI를 활용하여 등장한 서비스들은 모두 봇(bot)에 가깝다. 보통 한 앱에만 머물러 있으며 내가 무언가를 물었을 때만 답해줄 수 있다.

에이전트는 보다 똑똑해져서 내가 그에게 묻기 전에 먼저 제안하는 proactive함을 가지게 될 것이다. 계속해서 나의 행동을 추적하면서 패턴을 파악하고 내게 도움이 될 것 같을 때에는 등장해서 도움을 주고 갈 수 있다.

에이전트는 특히 4가지 분야에 큰 영향을 줄 것이다. 헬스케어, 교육, 생산성, 엔터테인먼트와 쇼핑.

  1. 헬스케어

    에이전트가 증상에 대한 기본적인 조언을 하고 어떤 치료를 해야하는지 결정할 수 있는 시기가 온다면 큰 변화가 찾아올 것이다. 특히 의료 기술이 부족한 개발도상국에서 환자들을 케어하는데 큰 도움을 줄 수 있다. 하지만 헬스케어 분야의 에이전트는 다른 분야보다 훨씬 천천히 개발될 것이다. 왜냐하면 삶과 죽음에 직결되어있기 때문이다.

  2. 교육

    대학생이 되면 한번씩 과외 아르바이트를 하곤 한다. 에이전트도 대학생 못지 않은 과외 선생님이 될 수 있다. 수업 자료를 학습하고 학생의 수준을 이해하여 맞춤형 지도를 할 수 있다.

  3. 생산성

    나는 Copilot을 코딩할 때 굉장히 유용하게 사용하고 있는데 에이전트는 차원이 다른 도움을 줄 수 있을 것이다. 정말 한 명의 사람처럼 내 말을 이해하고 많은 일을 해낼 수 있을 것이다. 빌 게이츠는 이렇게 말했다. "If your friend just had surgery, your agent will offer to send flowers and be able to order them for you."

  4. 엔터테인먼트와 쇼핑

    AI는 이미 우리에게 맞춤형 컨텐츠를 잘 추천해주고 있다. 에이전트는 단순히 추천만을 해주지 않을 것이다. 만약 카메라를 사고 싶다면, 에이전트가 대신 모든 상품의 리뷰를 읽고 요약해주어서 추천을 해줄 것이고 바로 주문을 할 수 있게 도와줄 것이다. 어떤 컨텐츠를 봐야할지 모를 때에도 에이전트는 우리와 계속 소통해서 알맞은 제안을 해낼 수 있다.

빌 게이츠는 마지막에 이렇게 말합니다. "앞서 말한 시점까지 도달하기에는 아직 멀었지만 어쨌거나 에이전트는 등장할 것이다. 그들은 우리의 생활 방식을 완전히 바꿔놓을 것입니다."

"But we’re a long way from that point. In the meantime, agents are coming. In the next few years, they will utterly change how we live our lives, online and off."

뛰어난 에이전트가 등장한다는 것은 가슴을 설레게 만들기도 하지만 또 한편으로는 많은 걱정을 만들어내기도 합니다. 아직 기술적으로 해결해나가야할 부분이 너무 많고 사회적으로 정해진 규범도 없어서 모두가 혼란을 겪고 있습니다. 이 대혼란의 시대에 살고 있는 우리는 대체 무엇에 집중을 해야할까요?

저는 머신러닝 엔지니어로서 기술에 집중해보려고 합니다. 특히 safety와 security에 대한 공부하며 발전시켜 나가보고 싶습니다! LLM Security는 아래 레포에서도 정리를 하며 공부하고 있습니다. 관심있으시면 확인해보세요!

👇 Awesome-LLM-Security (⭐️ 322개) 바로가기

또한 LLM에 대한 기술적인 내용을 공유하고 기술적으로 심도 깊은 토론의 장을 만들기 위해 늠름(LLM)한 엔지니어 클럽의 모더레이터로 활동하게 되었습니다. 함께 좋은 인사이트를 나눌 분들을 항상 기다리고 있습니다. 이번 글은 조금 순한 맛이었지만 앞으로는 기술적인 매콤한 맛의 글도 많이 포스팅할 예정이니 많은 관심 부탁드립니다!

👇 늠름(LLM)한 엔지니어 클럽 바로가기

16
4

포스트

아직 포스트가 없습니다.