윤현묵

윤현묵님의 아티클

윤현묵

윤현묵

[230822] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 오늘도 유익한 AI뉴스 공유드립니다 :)

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😀

1️⃣BentoML을 활용한 DeepFloyd IF 모델 배포하는 방법!
허깅 페이스에서는 모델의 업로드, 공유, 배포를 도와주는 플랫폼인 반면, BentoML은 머신 러닝 모델을 제공하고 서비스로 배포하기 위한 오픈 소스 플랫폼이에요. 프로덕션 준비 AI 애플리케이션을 만드는 통합 프레임워크를 제공한다는 점에서 저도 유용하게 사용하고 있는데요. BentoML 사용 방법은 간단합니다! 1) 모델 정의 2) 모델 저장 3) BentoML 서비스 생성 4) 벤토 패키징 5) Bento 배포. 오늘 소개해드리는 블로그에는 DeepFloyd IF와 BentoML를 통합해서 배포하는 방법을 소개하고 있습니다. 비교적 따라하기 쉽게 핸즈온으로 되어 있으니 직접 한번 경험해보시는 걸 추천합니다!

2️⃣구글 리서치의 "CHITA" 방법론: 더 빠르고 효과적인 신경망 가지치기
최신 신경망은 다양한 애플리케이션에서 뛰어난 성능을 보이지만, GPU와 같은 하드웨어가 많이 필요하죠. 이때문에 GPU가 없는 환경에서는 딥러닝을 사용하기 어렵습니다. 해결하기 위해서는 네트워크의 가중치를 제거하는 '프루닝' 기법이 사용되곤 하는데요. 프루닝은 훈련 전, 중, 후에 진행할 수 있습니다. 오늘 소개하는 프루닝 기법은 훈련 후 진행하는 것을 목표로 합니다. 프루닝에는 영향력이 작은 것을 없애는 기법과 최적화를 진행할 때마다 영향력이 작은 것들을 업애는 기법이 있습니다. 그러나 둘의 관계에서 트레이드오프가 존재한다고 해요. 이에 구글 리서치에서 발표한"CHITA" 방법을 소개해 드릴게요. 트레이드오프를 해결하며, 기존 방법보다 빠르게 네트워크를 프루닝하면서 정확도를 향상시키는 것을 보여 준다는 점에서 흥미롭네요!

3️⃣"STUDY" 추천 시스템: 학생들을 위한 개인화된 오디오북 콘텐츠 제안
학생들에게 독서는 단순 지식 정보 향상을 기반으로 학업과도 긴밀하게 연관되죠. 다양한 책과 읽을거리 중 시선을 사로잡고, 흥미와 재미를 끄는 콘텐츠를 찾는 것은 중요할 수 밖에 없습니다. 이에 머신 러닝(ML)을 활용한 추천 시스템이 도움을 줄 수 있을 것 같은데요! 머신러닝은 사용자의 선호도와 참여도를 기반으로 개인화된 콘텐츠를 추천하는 데 활용되며, 사용자의 경험을 향상시키는 데 중요한 역할을 합니다. "STUDY" 추천 시스템은 교육 환경의 오디오북 콘텐츠 추천에 중점을 두고 있습니다. Learning Ally와의 협력으로 학생들에게 적합한 오디오북을 추천하기 위한 알고리즘이 개발되었으며, 교실 내 친구들과의 독서 기록을 공유하며 인기 있는 책을 추천하는 방식을 채택하였다고 합니다. 평소 독서나 독서 모임을 즐기거나, 자녀가 있다면 활용해보면 좋을 것 같아요~!

📍Llama 2, SDXL 이미 알고 있다면?
AI학교 아이펠 리서치 과정 모집 중 → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230821] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 다들 주말 잘 보내셨나요 :)
오늘의 AI뉴스와 함께 한 주를 시작해 볼까요?

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다🌱.
그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣DSDN: 텍스트-비디오 생성할 때 깜박임과 아티팩트 문제 해결법은 무엇?
최근 텍스트-비디오 생성에 대한 관심이 커지고 있지만, 현재 생성된 비디오에는 깜박임과 아티팩트 (비디오 품질 왜곡)문제가 여전히 존재하고 있습니다 이를 해결하기 위해 이 논문에서는 동영상 생성의 일관성을 향상시키기 위한 이중 스트림 Diffusion 모델(DSDN)을 소개합니다.
두 Diffusion 스트림, 비디오 콘텐츠와 모션 브랜치는 별도로 실행하며, 크로스 트랜스포머를 상호작용시켜 콘텐츠와 모션을 정렬합니다. 추가로 모션 디코더와 컴바이너가 도입되어 동영상 모션 작업이 간편해졌습니다. 실험 결과, 이 방법을 통해 깜박임 없이 고품질의 연속 동영상이 생성된 것을 확인할 수 있었습니다.

2️⃣TeCH: 미세 조정 텍스트-이미지 확산을 활용한 고품질 3D 인물 재구성
한 장의 이미지를 통해 옷을 입은 사람의 '보이지 않는 영역'을 재구성하는 연구는 디테일 복원 퀄리티를 높일 때 난관을 초래합니다. 이번 논문에서는 텍스트 기반, 3D인물을 재구성하여 보는 새로운 TeCH 방법을 소개합니다.
이 방법은 의복을 분석하고 시각적 질문 답변을 활용, 생성된 설명 텍스트 프롬프트와 미세 조정 Text-to-Image Diffusion 모델을 통해 3D 인물을 재구성하는 방법입니다.
이 논문에서는 더 나아가 DMTet 기반의 하이브리드 3D 표현을 통해 고해상도 3D 옷을 입은 사람을 재구성까지 하는데요, TeCH는 고품질의 3D 옷을 입은 인간을 생성했으며 이전 모델들보다 더욱 개선되었다고 합니다.

3️⃣DragNUWA: 텍스트, 이미지, 궤적을 활용한 세분화된 비디오 생성 모델
제어 가능한 비디오 생성 연구는 높은 관심을 받지만, 세밀한 제어 능력과 복잡한 궤적을 처리하는데 한계가 있습니다. 이런 한계를 극복하기 위해 요즘 연구진들은 DragNUWA라는 오픈 도메인 Diffuion 기반 비디오 생성 모델을 소개합니다.
이 모델은 텍스트, 이미지, 궤적 정보를 결합하여 영상 콘텐츠를 세분화시켜 제어하고 궤적 샘플러(TS), 멀티스케일 융합(MF), 적응형 훈련(AT) 전략을 통해 궤적 제어의 한계를 극복했습니다. 또한 여러 기법을 활용한 DragNUWA는 세분화된 비디오 생성 제어에서도 우수한 성능을 보였습니다.

📍Llama 2, SDXL 이미 알고 있다면?
AI학교 아이펠 리서치 과정 모집 중 → https://bit.ly/3OX29fF

6
0
윤현묵

윤현묵

🗞[230818] 모두를 위한 AI 뉴스🗞

안녕하세요, 오늘도 좋은 정보 공유드립니다 :)

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다🌱.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣코드 기반 검증이 있는 GPT-4 코드 인터프리터를 활용해서 어려운 수학 문제 풀기
GPT-4와 PaLM-2와 같은 LLM은 수학 추론 문제 해결에서 큰 진전을 보였습니다. 특히 GPT-4는 수학 데이터 세트에서 뛰어난 성능을 보여주는데 이 논문은 GPT-4 코드 인터프리터가 어떻게 코드를 사용해 추론 능력을 향상시키는지를 탐구하였습니다. 또한 코드 생성, 실행 및 평가, 그리고 불합리한 결과에 대한 수정이 중요하다는 사실을 발견했습니다.
이를 바탕으로 새로운 프롬프트 방법인 명시적 코드 기반 자체 검증(CSV)을 제안하였습니다. 이 방법은 GPT-4에게 코드를 통해 답을 자체 검증하도록 유도하며, 검증 결과에 따라 자동으로 솔루션을 수정합니다. 이 방식을 사용하면 수학 데이터 세트에서 53.9%에서 84.3%의 제로샷 정확도를 달성할 수 있다고 합니다.

2️⃣검색증강된 인코더-디코더 모델로 문맥 내 학습 시키기!
이 연구에서는 검색 증강 인코더-디코더 언어 모델을 중점으로 문맥 내 학습 능력을 조사합니다. 최신 ATLAS 모델 분석을 통해 문맥 내 학습 시 한계를 발견했고 이를 극복하기 위해 검색 증강 마스크 언어 모델링과 접두사 언어 모델링을 통합한 RAVEN 모델을 제안합니다. 또한, 문맥 내 융합 학습을 도입하여 few-shot 성능을 향상시키고자 했습니다. 실험 결과, RAVEN은 적은 매개변수를 가졌음에도 ATLAS보다 우수한 성능을 보이며 최첨단 언어 모델과 유사한 결과를 기록했습니다. 이 연구는 검색 증강 인코더-디코더 언어 모델의 잠재력을 보여주는 한 사례라는 생각이 드네요!

3️⃣원인과 결과로부터 얻은 추론으로 멀티모달 모델을 학습시키면 벌어지는 일은?
새로운 개념을 학습하고 적절히 응답하는 능력은 매우 중요한데요, 현재 거대 멀티모달 모델은 큰 데이터를 학습은 하지만, 새로운 개념이나 보이지 않는 이미지를 이해하는 단계까지는 어려운 것이 사실입니다. 상황 내 학습(ICL)은 훈련 없이 학습을 탐구하는 방법입니다. 이 연구에서는 이를 강화하기 위해 '원인과 결과로부터의 추론'을 중점으로 한 링크 컨텍스트 학습(LCL)을 제안합니다. LCL은 인과 관계를 강조하며, 거대 멀티모달 모델이 새로운 개념을 효과적으로 이해할 수 있도록 도와줍니다. 이를 평가하기 위해 보이지 않는 이미지와 라벨로 구성된 ISEKAI 데이터 세트를 사용하였습니다. LCL을 도입한 거대 멀티모달 모델은 기존 모델보다 탁월한 학습 능력을 보였습니다.

📍Llama 2, SDXL 이미 알고 있다면?
AI학교 아이펠 리서치 과정 모집 중 → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

🗞[230817] 모두를 위한 AI 뉴스🗞

안녕하세요, 여러분~ 오늘도 흥미로운 소식 전달 드립니다.

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다🌱.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣Git Commit 메세지를 활용한 데이터셋을 구축해서 코드 만들어주는 LLM 만들기!
Git 커밋의 구조를 이용해 코드와 명령어를 활용한 데이터셋을 구축하고 StarCoder를 튜닝하는 논문이 나왔습니다. 해당 모델을 만들기 위해서 350개의 프로그래밍 언어로 4테라바이트의 Git 커밋을 컴파일한 CommitPack을 사용했습니다.
이를 기반으로 만들어진 StarCoder 모델은 HumanEval Python 벤치마크에서 뛰어난 성능을 보여주었고, 새로운 휴먼에벌팩 벤치마크를 통해 다양한 코딩 작업과 프로그래밍 언어에 대한 성능을 보여주었습니다. 해당 자료의 경우 코드, 모델, 데이터까지 무료로 공개되어 있는데요, 실제 잘 작동하는지 테스트를 진행해보고 바로 해보고 싶네요!

2️⃣Hugging Face Open LLM Leaderboard 1등 : Platypus
Platypus이라는 모델이 현재 HuggingFace의 오픈 LLM 리더보드에서 1위를 차지하는 LLM으로 등극헀습니다. 논문에서는 크게 3가지 주제를 다루고 있는데요,

  1. 공개적으로 사용할 수 있는 큐레이팅된 데이터 세트인 Open-Playtpus

  2. 특정 도메인 지식을 반영하기 위해 LoRA 모듈을 미세 조정하는 방법

  3. 학습 데이터의 유출과 오염을 확인하는 접근법 설명 등 입니다.

Platypus는 최소한의 미세 조정 데이터와 컴퓨팅으로도 뛰어난 성능을 보여주는데, 13B Platypus 모델은 A100 GPU에서 5시간 동안 25,000개의 질문을 사용하여 훈련될 수 있습니다.
이 모델 또한 모델, 데이터셋, 코드 모두 공개되어 있는데요, 지금 바로 한번 확인해보세요!

3️⃣PrefixLM이 CausalLM보다 좋은 이론적인 이유
트랜스포머 기반의 접두사 언어 모델(prefixLM)이 사용하는 인컨텍스트 샘플들이 서로 어텐션 메커니즘으로 연결이 되어 있는 방식이 인과 언어 모델(causalLM)에 비해 더 우수한 성능을 보여줍니다. 이 논문에서는 특정 파라미터 조건에서 두 언어 모델의 특성을 이론적으로 분석하였습니다. prefixLM은 선형 회귀의 최적 해에 수렴하는 반면, Causal LM은 최적 해를 보장하지 못하는 수렴 역학을 가진다는 결과를 도출하였습니다.
이론적인 분석을 보완하기 위해 여러 실험을 진행하였고, 그 결과 Causal LM이 prefixLM에 비해 성능이 떨어진다는 것을 확인했습니다. 가볍게 먼저 생각해봤을 때에도 prefixLM이 인컨텍스트 샘플이 있을 때 Causal LM보다 훨씬 우수하다는 생각을 했는데요 이렇게 이론적인 부분으로까지 증명되니까 조금 더 확실해진것 같네요!

📍Llama 2, SDXL 이미 알고 있다면?
AI학교 아이펠 리서치 과정 모집 중 → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230816] 모두를 위한 AI뉴스: AMDx허깅페이스 파트너십 체결?


모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다🌱.
오늘의 AI뉴스 시작해 볼게요! :)

1️⃣AMD와 Hugging Face의 파트너십 체결
AMD와 Hugging Face가 하드웨어 플랫폼 관련으로 파트너십을 맺었습니다. AMD의 경우 Nvidia와 GPU 시장에서 경쟁하고 있습니다. 게임이나 그래픽 측면에서 AMD GPU도 Nvidia GPU만큼의 성능을 내고 있지만 딥러닝 분야에서는 아직 AMD GPU가 Nvidia보다 점유율이 낮습니다. 이번에 Hugging Face와 AMD 와의 파트너십 체결로 AMD GPU 생태계가 활성화되어 GPU 시장에서 경쟁이 활성화되었으면 좋겠네요!

2️⃣OpenAI 모델의 추가기능과 새로운 ChatGPT 모델 공개
ChatGPT의 새로운 모델이 나왔다고 합니다. 기존에 우리가 사용했던 ChatGPT 모델은 gpt-3.5-turbo-0301과 gpt-4-0314, gpt-4-32k-0314를 사용했습니다. 오늘 GPT-3.5-turbo-0613, gpt-4-0613, gpt-4-32k-0613으로 모델이 업그레이드되었습니다. 이번 모델에서는 추가적으로 함수 호출기능이 들어가 있다고 합니다! OpenAI에서 gpt-3.5-turbo의 입력 토큰에 대해서는 25% 비용 절감을 진행했고 최신 임베딩 모델에서는 75% 비용을 절감했다고 합니다. 3월에 만든 모델의 경우 9/13일까지만 사용가능하다고 하고 추후에는 전부 오늘 공개한 모델로 변경된다고 합니다.

3️⃣얀 르쿤 교수님이 제시한 새로운 AI 아키텍쳐
메타 수석 AI 과학자로 근무하고 계시는 얀 르쿤 교수님께서 기존 모델들보다 훨씬 빠르게 학습하고 복잡한 작업을 수행하는 방법을 계획하는 아키텍쳐를 공개했습니다. 이번에 공개한 아키텍쳐는 I-JEPA이며 해당 모델은 픽셀을 비교하는 것이 아닌 이미지의 Representation을 비교하는 내부 모델을 생성하는 방식으로 학습한다고 합니다. I-JEPA의 경우 파인튜닝 필요 없이 다양한 어플리케이션에서 사용할 수 있으며 학습 효율도 기존의 모델들보다 최대 10배까지 좋다고 합니다! 해당 모델도 훈련콛와 모델 체크포인트를 오픈소스로 공개한다고 합니다!

📍Llama 2, SDXL 이미 알고 있다면?
AI학교 아이펠 리서치 과정 모집 중 → https://bit.ly/44cSNkr

3
0