백승윤

백승윤님의 아티클

백승윤

백승윤

Gemini Pro. GPT-3.5-turbo보다도 별로임!

논문 저자가 재실험을 하고 있다고 하네요. 댓글 참고 부탁드립니다!!

이틀 전에, CMU에서 아카이브 페이퍼가 하나 올라왔는데요. 유명한 10개 데이터셋에 대해서 Gemini Pro, GPT-3.5-turbo, GPT-4를 비교해봤고 그 결과...

image.png

GPT-3.5-turbo 보다도 모든 데이터셋 성능에서 밀리네요. Gemini Pro 쓸 이유가 없겠는데요? OpenAI는 신인 것 같습니다. 그럼 20000.

#짧스콰이엇 처럼 적어보았습니다 ^^

15
12
백승윤

백승윤

LLM의 미래가 궁금하다면 Benchmark를 보아라

최근 LLM 관련 엄청난 Benchmark 2개가 등장했었는데요. 바로 GAIA와 GPQA입니다. 이 둘이 엄청나다고 말한 이유는 Benchmark의 난이도가 기존보다 훨씬 높아졌기 때문입니다.

저는 MNIST라는 데이터셋을 가지고 NeuralNet을 학습하면서 딥러닝에 입문을 하였는데요. 다들 아는 유명한 데이터셋이라고 생각합니다. 적당히 CNN으로 개발하면 Accuracy를 90% 이상 달성하는 건 식은죽 먹기였죠. 그런데 시간이 지날수록 Computer Vision 모델의 성능이 좋아졌고 이 모델들을 더 잘 평가하기 위해선 더 어려운 Benchmark인 ImageNet가 등장해서 자주 사용되기도 하였습니다.

이처럼 모델의 성능이 향상될수록, 모델의 평가를 위한 Benchmark의 난이도도 커져야 합니다. LLM이 처음 등장했을 때, QA에서 너무 좋은 성능을 보였기 때문에 기존 QA Benchmark로는 다양한 LLM들을 평가하기 어렵겠다고 생각했는데 역시나 어려운 Benchmark가 등장하게 되었습니다!

GAIA: a benchmark for General AI Assistants

GAIA는 사람은 쉽게 수행할 수 있지만 AI는 아직 잘 하지 못하는 태스크를 모아두었습니다. 예를 들어, 어떤 질문을 하였을 때 우리는 모르면 구글링도 해보고 논문도 읽어보고 해서 답을 찾듯이 AI도 그런 자유로운 액션을 수행할 수 있는지 평가하게 됩니다. 정말 자비스처럼, Assistant처럼 우리가 부여한 태스크를 수행할 수 있는지 평가할 수 있죠.

image.png

지금은 신이라 불리는 GPT-4도 10% 정도의 성능밖에 보이질 않아요. 만약 AI Assistant가 이걸 Human level인 90%까지 달성한다면,, 정말 현실판 자비스가 탄생하지 않을까요?

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

GPQA는 QA (Question-Answering) Task의 난이도를 확 올렸어요. 생명과학, 물리학, 화학과 같은 전문적인 분야에 대한 질문을 만들고 실제로 PhD들한테 풀어보라고 시키니 65% 정확도를 보였다고 하네요. 또한 구글링으로 쉽게 풀리지 않는 문제라는 걸 증명하기 위해 비전문가분들에게 30분의 시간을 주고 구글링을 활용해서 답해보라고 했지만 34%만이 정답을 맞췄다고 합니다.

image.png

(이거 풀 수 있는 사람..?)

현재 GPT-4는 39% 정확도를 보인다고 해요. LLM의 정확도가 PhD의 정확도보다 높아진다면 우린 정말 고도화된 전문가를 얻을 수 있지 않을까요?


이전에는 Benchmark로 모델 A vs 모델 B, 이렇게 비교를 했다면 앞으로는 사람 vs LLM, 이런 대결 구도로 패러다임이 바뀌는 것 같아 무척 흥미롭네요!

여러분들은 LLM의 미래를 어떻게 생각하시나요?

8
0
백승윤

백승윤

ChatGPT가 1주년을 맞았네요! 🎉 그동안 오픈소스 LLM의 성능은 어디까지 발전했을까요?

이 글은 ChatGPT’s One-year Anniversary: Are Open-Source Large Language Models Catching up? 라는 논문을 바탕으로 작성되었습니다.

LLM으로 다양한 서비스를 만드시는 분들에게는 LLM이 가지고 있는 성능이 너무나도 중요합니다. 그래서 우리는 보통 OpenAI의 GPT-4를 자주 이용합니다. 성능이 압도적으로 좋기 때문에 한번 GPT-4의 맛을 보면,, 다른 모델로는 절대 만족할 수가 없게 되는 것 같아요. ChatGPT가 등장하고 나서 open-source LLM도 정말 다양하게 등장했습니다. 지금 당장 생각나는 모델로는 Llama, Falcon, Qwen 정도가 떠오르네요. 하지만 open-source LLM을 띄울 GPU가 없어서, 성능이 비교적으로 안 좋아서 우리는 기꺼이 돈을 지불하면서 GPT-3.5나 GPT-4를 사용합니다.

대략적으로 open-source LLM이 아직 부족하다는 건 알고 있었는데 정량적으로 GPT-4에 비해 얼마나 못 미치는지 궁금해졌고, 그런 제 궁금증을 이 논문을 통해서 해결할 수 있었습니다. 논문에서 재밌었던 내용들을 몇 가지 얘기해볼게요 :)

LLM-based Agent 개발에는 GPT-3.5-turbo 보다는 open-source LLM이 낫다.

GPT-3.5-turbo는 확실히 chat에 중점을 두고 개발되었기에 다양한 task를 수행해야하는 Agent 개발에는 open-source LLM이 낫다고 합니다. 특히 Lemur-70B-chat이 뛰어난 성능을 보였습니다. 물론 GPT-4보다는 미만입니다. 명심하세요. 우리는 아직 GPT-4를 거역할 수 없습니다.

👆HuggingFace에서 Lemur 모델을 사용해볼 수 있습니다. 제 뉴스레터에서도 한번 소개를 했었답니다! 👇

나는 GPU가 많이 없어.. 7B면 충분해..라고 하신다면 Zephyr-7B 추천!

Zephyr-7B는 현존하는 가장 강한 7B 모델 중 하나라고 생각합니다. (Qwen-7B 보다 잘하는진 확실하진 않음..) 유명한 LLama-2-70B 모델하고도 비슷한 성능을 보이기에 추천합니다.

GPT-4는 진짜 손댈 수 없는 신의 영역인가? 그건 아님.

Gorilla 모델은 Agent에게 가장 중요한 Tool 사용에 있어서 GPT-4 보다 성능이 좋았습니다. 하지만 그게 답니다. 딱 아래 짤 정도로 이해하시면 됩니다.

너 개못하잖아 2

하지만 어찌 되었든 시간이 지날수록 점점 GPT-4와 특정 task에 있어서 견주어볼만한 성능을 가진 open-source LLM 들이 많이 나와주고 있습니다.

image.png

계속해서 새로운 LLM이 빠르게 등장하고 있습니다. 계속 open-source LLM에 어떤 큰 업데이트가 있는지 팔로업해야 더 성능이 좋은 모델을 효율적으로 사용할 수 있지 않을까요? 늠름한 엔지니어 클럽에서 함께 좋은 정보들을 공유하며 성장해나가면 좋겠습니다!

6
1
백승윤

백승윤

⭐️코르카의 기술세션⭐️ 후기

안녕하세요! 저는 코르카의 ML엔지니어이자 LLM(늠름)한 엔지니어 클럽의 모더레이터를 맡고 있는 백승윤이라고 합니다. 👋 저번주 수요일에는 마루 180에서 추천시스템과 LLM과 관련하여 코르카 팀에서 기술 세션을 진행하고 네트워킹 시간을 가졌었는데요! 다들 재밌게 즐겨주셨나요? 😁

코르카에서 기술적으로 발표했던 경험은 여러번 있었지만 코르카만 발표하는 세션은 처음이라 저희도 만반의 준비를 열심히 했었답니다!

image.png

(마지막으로 발표를 준비하고 계신 Tech Lead 태호님과 ML Lead 태희님)

image.png

정말 다양한 분들이 오셔서 저희의 세션을 들어주셨는데요! 귀한 시간 내주셔서 다시 한번 감사드립니다! 🙇‍♂️

image.png

(RecSys 학회에서 얻은 인사이트들을 활용해 어떻게 프로덕트를 개발하고 있는 설명하고 계신 태희님)

첫 순서로는 태희님께서 코르카에서 RecSys Challenge 2023에 참가하여 좋은 성적을 거두었던 경험과 RecSys 학회에서 얻었던 인사이트들을 공유해주셨습니다. 한가지 흥미로웠던 내용은 LLM을 RecSys에 활용하려는 연구도 활발히 진행되고 있다는 것이었어요. 저도 이번에 RecSys 학회를 가서 느꼈지만 많은 사람들이 LLM과 관련된 세션에 굉장히 관심이 많더라구요. 하지만 더불어 든 생각 중 하나는 아직 정말 LLM을 잘 응용한 연구는 많이 이뤄지지 않았다는 것이었어요. 우리가 아직 새롭게 시도해볼 것들이 많은 것 같아서 긍정적으로 느껴졌네요. ㅎㅎ

image.png

(LLM으로 개발하고 있는 우리의 멋진 프로덕트인 Agent Village를 열정적으로 설명하고 계신 태호님)

두번째 순서로는 태호님께서 코르카에서 어떤 LLM 연구를 진행하고 있는지 자세하게 설명하고 자유롭게 질의응답하는 시간을 가졌는데요. 지금까지 등장한 LLM들은 특정 분야에서 인간을 대체할만한 성능을 보여주었기에 LLM을 활용한 서비스를 잘 개발하면 생산성을 극대화시켜줄 수 있다는 말씀을 해주셨고, 거기서 멈추지 않고 코르카는 지금 LLM에게 잠재되어있는 성능을 발현시키기 위해 자체적인 연구도 많이 하고 있다는 얘기를 해주셨어요! 가장 기억에 남는 것은 LLM에게 지속적으로 지식을 주입시켜주기 위해 In-context Learning이 아니라 모델 parameter에 직접적으로 context를 이해할 수 있도록 update하는 연구를 하고 있다고 하셨어요. 관련해서는 나중에 기회가 된다면 글로 더 작성을 해볼게요! :)

세션을 마치고는 자유롭게 네트워킹하면서 서로의 생각들을 공유할 수 있어서 너무나 좋았답니다. 다음 번에도 기회가 된다면 좋은 세션을 가지고 여러분들을 찾아뵐 수 있으면 좋겠습니다!! 또한 LLM(늠름)한 엔지니어 클럽에서는 끊임없이 LLM과 관련된 기술적인 얘기를 자유롭게 할 수 있도록 운영할 예정이니 많은 관심 부탁드립니다 ㅎㅎ

마지막으로 이 세션을 준비해주신 디스콰이엇 분들 너무 감사드리고, 우리 팀의 영현, 선영, 충환, 승표님도 너무 수고많으셨습니다!!

여러분들은 저희의 세션이 어땠나요? 댓글로 후기나 그때 하지 못했던 궁금증들을 자유롭게 남겨주세요!!

7
0
백승윤

백승윤

AI 에이전트가 5년 안에 모든 걸 뒤바꿀 것이다.

오늘 빌 게이츠 선생님의 좋은 글을 읽고 공유하고 싶어 이렇게 몇 자 적어봅니다. (@권민재 좋은 글 공유해주셔서 감사해요! 🥰)

우리는 컴퓨터 작업을 하기 위해서 직접 프로그램을 실행하고 명령어를 입력하고 있다. Notion으로 문서를 작성하고, VSCode로 코드를 작성해서 무언가를 개발해낸다. 하지만 컴퓨터는 우리 대신 이메일을 보내주거나 영화 티켓을 구매해주지는 못한다. 또한 아무리 오래 사용한 앱이라고 해도 내가 일하는 방식이나 취향, 능력과 같은 정보를 거의 파악하지 못하고 있다.

빌 게이츠는 향후 5년 안에 모든 것이 뒤바뀔 것이라고 전망했다. 기기한테 당신이 원하는 것을 말한다면 기기는 그 일을 수행해낼 것이다. 직접 사이트에 접속해서 내 카드로 영화를 예매하고, 가고 싶은 식당을 내 취향 맞춤으로 추천을 해줄 것이다. 생성 AI 에이전트는 단순히 컴퓨터를 작동시키는 방식에만 변화를 주는 것이 아니라 SW 인더스트리 전체에 큰 파장을 불러일으킬 것이다.

모두를 위한 개인 비서가 나타난다.

지금까지 생성 AI를 활용하여 등장한 서비스들은 모두 봇(bot)에 가깝다. 보통 한 앱에만 머물러 있으며 내가 무언가를 물었을 때만 답해줄 수 있다.

에이전트는 보다 똑똑해져서 내가 그에게 묻기 전에 먼저 제안하는 proactive함을 가지게 될 것이다. 계속해서 나의 행동을 추적하면서 패턴을 파악하고 내게 도움이 될 것 같을 때에는 등장해서 도움을 주고 갈 수 있다.

에이전트는 특히 4가지 분야에 큰 영향을 줄 것이다. 헬스케어, 교육, 생산성, 엔터테인먼트와 쇼핑.

  1. 헬스케어

    에이전트가 증상에 대한 기본적인 조언을 하고 어떤 치료를 해야하는지 결정할 수 있는 시기가 온다면 큰 변화가 찾아올 것이다. 특히 의료 기술이 부족한 개발도상국에서 환자들을 케어하는데 큰 도움을 줄 수 있다. 하지만 헬스케어 분야의 에이전트는 다른 분야보다 훨씬 천천히 개발될 것이다. 왜냐하면 삶과 죽음에 직결되어있기 때문이다.

  2. 교육

    대학생이 되면 한번씩 과외 아르바이트를 하곤 한다. 에이전트도 대학생 못지 않은 과외 선생님이 될 수 있다. 수업 자료를 학습하고 학생의 수준을 이해하여 맞춤형 지도를 할 수 있다.

  3. 생산성

    나는 Copilot을 코딩할 때 굉장히 유용하게 사용하고 있는데 에이전트는 차원이 다른 도움을 줄 수 있을 것이다. 정말 한 명의 사람처럼 내 말을 이해하고 많은 일을 해낼 수 있을 것이다. 빌 게이츠는 이렇게 말했다. "If your friend just had surgery, your agent will offer to send flowers and be able to order them for you."

  4. 엔터테인먼트와 쇼핑

    AI는 이미 우리에게 맞춤형 컨텐츠를 잘 추천해주고 있다. 에이전트는 단순히 추천만을 해주지 않을 것이다. 만약 카메라를 사고 싶다면, 에이전트가 대신 모든 상품의 리뷰를 읽고 요약해주어서 추천을 해줄 것이고 바로 주문을 할 수 있게 도와줄 것이다. 어떤 컨텐츠를 봐야할지 모를 때에도 에이전트는 우리와 계속 소통해서 알맞은 제안을 해낼 수 있다.

빌 게이츠는 마지막에 이렇게 말합니다. "앞서 말한 시점까지 도달하기에는 아직 멀었지만 어쨌거나 에이전트는 등장할 것이다. 그들은 우리의 생활 방식을 완전히 바꿔놓을 것입니다."

"But we’re a long way from that point. In the meantime, agents are coming. In the next few years, they will utterly change how we live our lives, online and off."

뛰어난 에이전트가 등장한다는 것은 가슴을 설레게 만들기도 하지만 또 한편으로는 많은 걱정을 만들어내기도 합니다. 아직 기술적으로 해결해나가야할 부분이 너무 많고 사회적으로 정해진 규범도 없어서 모두가 혼란을 겪고 있습니다. 이 대혼란의 시대에 살고 있는 우리는 대체 무엇에 집중을 해야할까요?

저는 머신러닝 엔지니어로서 기술에 집중해보려고 합니다. 특히 safety와 security에 대한 공부하며 발전시켜 나가보고 싶습니다! LLM Security는 아래 레포에서도 정리를 하며 공부하고 있습니다. 관심있으시면 확인해보세요!

👇 Awesome-LLM-Security (⭐️ 322개) 바로가기

또한 LLM에 대한 기술적인 내용을 공유하고 기술적으로 심도 깊은 토론의 장을 만들기 위해 늠름(LLM)한 엔지니어 클럽의 모더레이터로 활동하게 되었습니다. 함께 좋은 인사이트를 나눌 분들을 항상 기다리고 있습니다. 이번 글은 조금 순한 맛이었지만 앞으로는 기술적인 매콤한 맛의 글도 많이 포스팅할 예정이니 많은 관심 부탁드립니다!

👇 늠름(LLM)한 엔지니어 클럽 바로가기

16
4
백승윤

백승윤

🤔 80일 동안 LLM 논문 400개를 정리하면서 느낀 점

image.png

7월 25일에 저는 대뜸 회사 슬랙에 LM (Language Model) 논문을 매일 정리해오겠다고 말했습니다. 그때 당시에는 한창 LLM의 인기가 높아지고 LLM을 활용한 다양한 서비스들이 출시되었기에 전 세계가 LLM에 집중하던 시기였습니다. 우리 팀도 LLM의 가능성에 대해 믿고 있었고, LLM으로 어느 팀보다 더 뛰어난 프로덕트를 만들기 위해서는 리서치가 필요하겠다 느꼈습니다.

사실 2-3달만 지나면 팀원들의 관심이 시들해져 자연스럽게 리서치를 그만하지 않을까 싶기도 했습니다. 잠깐 반짝했다가 요즘에는 뜸한 블록체인이나 메타버스처럼요. 근데 갈수록 LLM의 중요성은 화두되었고 어쩌다보니 사내에 공유하기 위해 정리하던 내용을 뉴스레터로도 만들어 매주 포스팅을 하고 있게 되었습니다. (이것도 이제 10주차가 되었네요..)

image.png

제가 포스팅하는 매주 가장 핫했던 LLM 논문을 정리하는 뉴스레터 👇

https://corca.substack.com/p/top-llm-papers-of-the-week-74f

매일 2-30개 이상의 논문을 훑고 중요한 4-5개 논문들을 뽑아 정리해오는 것을 80일째 하다보니 느낀 점들이 몇 가지 있어 이렇게 글을 적어봅니다. 참고로 저는 그저 학부생이자 3년차 머신러닝 엔지니어 정도입니다. 아직 많이 부족하니 가볍게만 읽어주세요 ㅎㅎ..

  1. 이해가 되지 않는 논문을 몇시간 붙잡고 있지 마세요.

저는 논문을 읽다가 조금이라도 어렵게 느껴진다면 바로 패스합니다. 제가 논문을 보고있는 Arxiv에는 Computer Language 관련해서만 하루에 70개에서 어떨 때는 150개의 논문이 올라옵니다. 한 논문이 이해가 되지 않아도 제게는 나머지 69개의 논문이 남아있습니다. 적어도 그 중 20개는 초록만 읽어도 쉽게 이해가 되더라구요. 물론 어려운 논문을 몇 시간 붙잡고 이해했을 때 얻는 쾌감이 있긴 합니다. 하지만 지금은 하나에 깊게 들여다볼 때가 아니라고 생각합니다. 매일 새로운 방법론과 모델들이 제시되고 보통 그와 관련된 논문들은 초록만 읽어도 쉽게 이해가 됩니다. 그런 논문들만 빠르게 파악해도 충분하다고 생각합니다.

⭐️논문 빠르게 훑는 법⭐️

  1. 초록 읽고 "뭔 소리여.." 하는 생각들면 바로 패스. (아직 이걸 읽을 실력이 되지 않았다는 것)

  2. 논문에 있는 그림 감상할 때, 그림이 맘에 들면 계속 읽기.

  3. 보통 Introduction 마지막 문단 쪽에 자신들의 main contribution을 bullet point로 정리해둡니다. 그거 읽기.

  4. 그것까지 맘에 들었으면 적당히 실험 결과 맛보고 Limitation 파악하고 마무리하기.

  1. 한국이 LLM 리서치에 있어서 많이 느린 것 같습니다.

논문에는 저자와 그의 소속이 보입니다. 대부분의 논문은 Microsoft, Google, Facebook (Meta), Alibaba 등 유명 해외 IT 기업과 MIT, Standford 등 유명 미국 대학에서 나오는 것 같습니다. 물론 중국 대학도 어마어마하게 많이 보이고 싱가포르, 홍콩도 꽤 보이더라구요. 한국은 가끔씩 KAIST, Naver에서 하루에 1-2개 정도 보이는 수준입니다. 정말 자신이 LLM의 가장 최전선의 연구를 파악하고 싶다라고 하시면, 외국의 자료, 커뮤니티들을 많이 봐야합니다. 저는 개인적으로 Twitter(X)를 통해 팔로업을 하고 있습니다. 제 트위터는 @L0Z1K입니다. ^^

  1. 좋은 아이디어는 차고 넘친다. 누가 먼저 실제 프로덕트로 만드는지가 중요한 싸움이다.

GPT-4V가 머지않아 API로 사용가능해질 것 같습니다. 이미 리서치를 하다보면 이걸로 요런것도 할 수 있고 저런것도 할 수 있고 이런 게 문젠데 이건 이렇게 수정이 가능하고 등등.. 모든 얘기가 이미 다 나와있습니다. 실행력만 있다면 LLM을 가지고 정말 뛰어난 프로덕트를 만들 수 있다고 생각합니다. 저도 만들고 있는 멋진 프로덕트를 완성하여 자랑할 날이 오면 좋겠네요.

적고 나서 보니 너무 뻔한 얘기만 적어뒀나 싶네요.. 다음에는 더 얻을게 많은 좋은 글로 돌아오겠습니다. 😅

40
7
백승윤

백승윤

🔥매주 가장 핫한 LLM 논문을 쉽고 빠르게 접하는 법

image.png

은 바로 이 뉴스레터를 구독하는 것입니다! (대놓고 홍보 죄송합니다...😅)

이번주에 가장 핫했던 LLM 논문 보러가기👇

안녕하세요. 그 주에 핫한 LLM 논문을 정리해서 뉴스레터를 만들고 있는 ML Engineer 백승윤입니다. 저는 ML Engineer로서 매주 빠르게 변화하는 LLM 관련 기술들을 팔로업하기 위해서 매일매일 arxiv 논문 사이트에 들어가서 평균 30개의 논문을 훑고 그 날의 중요한 논문들을 정리해 사내에 공유를 하고 있습니다.

그러다 팀원이 '이 야무진 걸 자기만 볼 수 없다.'며 뉴스레터를 만들어보라고 하였고 그렇게 시작하게 되었습니다. 단순히 정보 공유 목적으로 시작하게 되었습니다. (약간의 회사 이름 알리기도 있구요.. 코르카.. 기억해주세요..)

LLM 최신 동향을 보다 빠르게 논문 레벨에서 팔로업하고 싶으신 분들은 이 뉴스레터에 많은 관심 부탁드립니다!!

11
3
백승윤

백승윤

앤드류 응 교수님이 전하는 Opportunities in AI

어제 앤드류 응 교수님의 강연 하나가 공개되고 좋은 내용을 담은 것 같아 공유드립니다!

주관적으로 해보는 핵심 요약

  1. 인공지능은 전기처럼 범용적인 기술입니다.

    • 지난 10년은 지도 학습이 AI에서 가장 지배적인 분야였지만, 앞으로는 Generative AI도 영향력이 커질 것입니다. 왜냐하면 이전에는 지도학습을 사용해서 모델을 개발하면 1달(데이터 수집) + 3달(모델 학습) + 3달(모델 배포) = 7달이 걸렸지만, Prompt-based AI를 사용한다면 1주일로 충분하기 때문입니다.

    • 단기적인 유행에 있어서 주의해야 합니다. 유용한 제품이어도 방어할 수 있는 장기적인 가치를 만들어내지 못하면 망합니다. 특히 Prompt-based AI로 만들어낸 서비스는 그 기술이 누구나 따라할 수 있을 정도로 쉽게 복제되기에 유의해야 합니다.

  2. 인공지능은 더 다양한 산업 분야에 적용될 것입니다.

    image.png
    • 이전까지 인공지능은 web search, advertising, recommendation과 같이 한 분야가 엄청난 value를 가지고 있는 분야에만 적용되었습니다. 그리고 value가 낮은 프로젝트(공장 불량 검사, rice disease classification)에는 적용되기 어려웠습니다. 커스터마이징하는데 큰 값을 요구했기 때문이죠.

    • 하지만 로우/노코드 툴이 등장하면서 AI 시스템을 개발하기 더 쉬워졌습니다. 더 많은 산업에 적용될 수 있기에 앞으로 인공지능 밸류를 키우는데 큰 도움이 될 것입니다.

  3. AGI는 아직 멀었습니다. 인간이 하는걸 AI가 제대로 대체했다고 생각하지 않습니다. 우리보다 똑똑하지만 한편으로 우리보다 훨씬 멍청하기도 합니다.

다들 교수님의 강연을 듣고 어떤 생각이 드셨는지 궁금합니다!

6
0
백승윤

백승윤

Code Llama 논문을 정리해보았습니다.

그저께 Meta에서 Code Llama 모델을 release하였는데요. OpenAI 의존성 없이 Code Llama 를 가지고 재밌는 서비스들이 많이 나오게 될 것 같습니다. Code Llama 논문 리뷰를 해봤는데 이 모델에 대해 궁금하신 점들을 해소하는데 도움이 되었으면 좋겠습니다 :)

7
2
백승윤

백승윤

보이스피싱/스미싱 탐지 서비스 개발 - (2)

Demo를 정말 초간단으로 만들어보았습니다.

Google Cloud speech-to-text API를 활용하여 음성파일을 텍스트로 변환하고 그 텍스트를 특정 prompt에 넣어 ChatGPT을 통해 보이스피싱에 관련된 것인지 응답을 받습니다.

실제로 Output의 예시입니다. 더 많은 예시는 깃헙 README에 추가해두었습니다. 보다시피 아직 정확하게 음성을 인식하지는 못한다.

[+] Context: 그럼 관련해서 몇 가지 드렸고요 예 예 서울중앙지검 서울중앙지검 이요
[+] 보이스피싱 점수: 8점
[+] 그렇게 판단한 이유
[+] 1. 피싱범이 "서울중앙지검"이라는 단어를 반복해서 사용하여 신뢰성을 유도하려 한다.
[+] 2. 피싱범이 "드렸고요 예 예"와 같이 중얼거리는 식으로 말을 하여 다른 사람인 척 하고 있다.
[+] 3. 피싱범이 구체적인 사유 없이 "관련해서 몇 가지 드렸고요"와 같이 모호한 언어를 사용하고 있다.
url thumbnail

GitHub - L0Z1K/Phishing-Detector: Detect whether the context is related to phishing with LLMs.

Detect whether the context is related to phishing with LLMs. - GitHub - L0Z1K/Phishing-Detector: Detect whether the context is related to phishing with LLMs.

https://github.com/L0Z1K/Phishing-Detector

추가적으로 개발할 것들은 1) 실시간으로도 탐지할 수 있게 구현. 2) 더 나은 결과를 낼 수 있게 다양한 prompt를 시도해서 ChatGPT에게 물어봐야할 것 같습니다. 3) 원래는 네이버 클로바 API를 사용하려고 했는데 해외에 체류 중이라 가입에서 막혔었네요. Google API가 만족스럽지 않아 네이버 API도 시도해보려 합니다.

실제 서비스로 구현하기 위해서는 해결해야할 점이 몇가지 보였습니다.

  1. Real-time으로 음성인식 및 LLM 사용이 디바이스에게 큰 부하를 주지 않을까?
  2. 앱으로 어떻게 구현할지 감이 오질 않는다. 어떻게 문자나 전화가 오는 것을 인식할 것인지. 어떻게 사용자에게 알림을 줄 것인지.
5
0
백승윤

백승윤

보이스피싱/스미싱 탐지 서비스 개발 - (1)

사이드 프로젝트를 생각하지 않으면, 그 상태로 시간이 빠르게 흘러간다는 것을 알았습니다. 앱 개발 공부를 하고 나서 한 달 정도가 그저 그렇게 지나갔습니다. 속도 있게 진행하기 위해서는 기록이 필요하다고 느껴서 오늘부터 적어볼까 합니다.

현재 기획하고 있는 서비스는 보이스피싱과 스미싱을 탐지해서 사전 예방을 해주는 서비스입니다.

  • 필요성: 아직도 보이스피싱과 스미싱이 만연하게 벌어지고 있습니다. 뒤늦게 알아채도 잡을 방법이 없습니다. 따라서 예방하는 것이 더 중요합니다.
  • 현재 존재하는 프로덕트의 한계점
  • 문자를 보낸 전화번호가 사기와 관련된 특정 DB에 속해있는지 여부로 감지한다. 하지만 사기꾼들은 전화번호를 몇만개 가지고 있을 거고 돌아가면서 쓰기에 모두 다 탐지가 안될 수 있다.
  • 내가 구상하는 프로덕트의 특징
  • AI 기술을 활용하여 통화 내용, 문자 내용 자체로 탐지한다.

구현은 다음과 같이 구상하고 있습니다.

  1. 네이버 CLOVA Speech Recognition API로 음성을 Text로 변환. (네이버 클로바 앱이 그렇게 음성 인식을 잘한다고 하더라구요.)
  2. GPT-4(or ChatGPT)에게 대화 내용을 전달하여 보이스피싱일 확률 계산. (제가 밑바닥부터 보이스피싱 탐지 NLP 모델을 개발하는 것보다 GPT-4가 더 잘 판단할 거라고 생각합니다.)

처음에는 앱 개발을 생각했지만, 제가 그나마 잘하는 분야로 조준하는게 좋다고 생각했습니다. 저보다 잘하는 앱 개발자나 디자이너는 정말 많으니까요. 우선 Demo를 간단하게 개발해볼 생각입니다.

(반드시 5/5 전까지는 Demo와 돌아오겠습니다.)

2
0