윤현묵

윤현묵님의 아티클

윤현묵

윤현묵

[230925] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

이제 곧 추석이 다가오네요, 추석 전 마지막 월요일! AI 뉴스와 함께 하시죠!

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [DreamLLM: 멀티모달 이해와 생성을 위한 혁신적 학습 프레임워크](https://huggingface.co/papers/2309.11499) DreamLLM은 멀티모달 이해와 생성 간의 시너지를 활용한 다용도 멀티모달 대규모 언어 모델(MLLM)을 위한 학습 프레임워크입니다. 이 모델은 원시 멀티모달 공간에서 직접 샘플링을 하여 언어와 이미지 생성에 중점을 둡니다, 외부 특징 추출기의 한계를 극복합니다. 또한, DreamLLM은 텍스트와 이미지의 비정형 레이아웃을 모두 모델링하는 원시 인터리브 문서 생성을 지원합니다, 이로써 다양한 멀티모달 분포를 효과적으로 학습합니다. DreamLLM은 이런 방식으로 자유 형식의 인터리브 콘텐츠 생성이 가능한 최초의 MLLM이 되었으며, 실험 결과 그 우수한 성능을 입증하였습니다.

2️⃣ [FreeU: 확산 U-Net 아키텍처의 잠재력 발굴과 생성 품질 향상](https://huggingface.co/papers/2309.11497) 이번 논문에서는 확산 U-Net 아키텍처의 미개발 잠재력을 탐구하여 생성 품질을 향상시키는 방법을 제시합니다. U-Net의 주요 기여는 노이즈 제거에 있으며, 스킵 연결은 네트워크가 백본 의미를 약하게 만듭니다. 이를 바탕으로 "FreeU"라는 방법을 제안하여 스킵 연결과 백본의 강점을 전략적으로 활용합니다. FreeU의 적용 결과는 이미지 및 비디오 생성 작업에서 기존 확산 모델에 쉽게 통합되어 생성 품질을 크게 개선할 수 있음을 보여줍니다. 이를 위해서는 추론 중에 두 가지 스케일링 계수를 조정하기만 하면 됩니다.

3️⃣ [Kosmos-2.5: 텍스트 집약적 이미지를 위한 멀티모달 리터러티브 모델 소개](https://huggingface.co/papers/2309.11419) Kosmos-2.5는 텍스트 집약적 이미지의 기계 판독을 위한 멀티모달 리터러티브 모델입니다. 이 모델은 이미지 내의 텍스트 블록에 공간 좌표를 할당하며, 텍스트의 스타일과 구조를 마크다운 형식으로 캡처하는 능력을 가집니다. 이 기능은 Transformer 아키텍처, 작업별 프롬프트, 유연한 텍스트 표현을 사용하여 달성되었습니다. Kosmos-2.5는 문서 수준 텍스트 인식과 이미지에서의 마크다운 텍스트 생성에서 우수한 성능을 보이며, 다양한 텍스트 집약적 이미지 이해 작업에 적용될 수 있습니다. 이 모델은 텍스트가 풍부한 이미지의 실제 애플리케이션에도 적용 가능하며, 향후 멀티모달 대규모 언어 모델 확장의 기반이 될 것입니다.


🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

3
0
윤현묵

윤현묵

[230922] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

벌써 금요일이네요, 하루만 더 일하면 주말입니다!!
AI 뉴스와 함께 파이팅 👍

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.

그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [대규모 언어 모델의 압축 능력: Chinchilla 70B의 성능 평가 및 응용](https://huggingface.co/papers/2309.10668)

예측 모델을 압축기로 변환하는 것은 확립된 개념이며, 최근 대규모 언어 모델의 훈련이 강조되었습니다. 이러한 모델은 높은 예측 능력을 가지기 때문에 효과적인 압축기로 작용할 수 있습니다. 이 연구에서는 대규모 언어 모델의 압축 능력을 중점으로 평가하였으며, 결과로 Chinchilla 70B는 특정 도메인 압축기보다 더 높은 압축 효율을 보였습니다. 또한, 예측과 압축의 동등성을 통해 gzip과 같은 기존 압축기를 사용하여 조건부 생성 모델을 구축할 수 있음을 제시하였습니다.

2️⃣ [LLM의 RLHF 최적화: 어드밴티지 모델과 선택적 리허설의 도입](https://huggingface.co/papers/2309.10202)

대규모 언어 모델(LLM)은 자연어 처리 분야에 혁신을 가져왔으나, RLHF를 통해 모델을 인간의 가치와 선호도에 맞게 조절하는 것은 큰 도전과제로 남아있습니다. 이 도전과제는 보상 해킹과 치명적인 망각 같은 문제들을 포함하고 있습니다. 이를 해결하기 위해 두 가지 혁신적인 방안을 제안합니다: 1) 어드밴티지 모델은 보상 해킹을 방지하기 위해 예상되는 보상과 추가 보상의 차이를 모델링합니다. 2) 선택적 리허설은 치명적인 망각을 줄이기 위해 특정 데이터를 선택하여 PPO 훈련과 지식을 재구성합니다. 이 방법들은 실험 결과 안정성을 높이고, 더 높은 보상 점수와 승리율을 달성하였습니다.

3️⃣ [언어 에이전트 연구: AGENTS 라이브러리와 프레임워크의 소개](https://huggingface.co/papers/2309.07870)

이 논문은 언어 에이전트(language agents)에 대한 연구를 다룹니다. 큰 언어 모델(Large Language Models, LLMs)은 ChatGPT와 같은 도구를 통해 환경, 인간 또는 다른 에이전트와 상호 작용하며 복잡한 작업을 자동으로 해결할 수 있는 자율 에이전트를 구축하는 데 사용됩니다. 이러한 언어 에이전트는 인공 일반 지능(AGI)로의 약속된 단계이며 고객 서비스, 컨설팅, 프로그래밍, 글쓰기, 교육 등의 역할에서 인간의 노력을 줄일 수 있습니다. 이 논문에서는 AGENTS라는 언어 에이전트를 위한 오픈 소스 라이브러리와 프레임워크를 소개합니다. AGENTS의 주요 목표는 언어 에이전트의 사용자 정의, 조정 및 배포를 비전문가에게도 간단하게 만드는 것입니다. 또한, 이 라이브러리는 언어 에이전트에 대한 다양한 프레임워크로서의 주요 기능을 제공합니다.

🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

5
0
윤현묵

윤현묵

[230921] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

벌써 목요일이네요, 이제 하루만 버터면 금요일입니다!
AI 뉴스보면서 얼른 하루 보내시죠 :)
모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [PDFTriage: 구조화된 문서에서의 효과적인 질의응답을 위한 새로운 접근 방식](https://huggingface.co/papers/2309.08872)

대규모 언어 모델(LLM)은 문서의 긴 컨텍스트를 처리하는 데 문제가 있어, 질의응답(QA) 작업에서 어려움을 겪습니다. 기존 접근 방식은 문서의 관련 문맥을 일반 텍스트로 변환하는데 초점을 맞추었지만, PDF나 웹 페이지와 같은 구조화된 문서를 처리하는데는 한계가 있습니다. 이를 극복하기 위해 저희는 구조화된 문서의 구조와 콘텐츠를 모두 활용하는 PDFTriage라는 방식을 제안하였습니다. PDFTriage는 실험에서 기존 방식보다 효과적임을 입증하였습니다. 또한, 이 문제에 대한 연구를 지원하기 위해 80개의 구조화된 문서에 대한 900개의 질문을 포함한 벤치마크 데이터 세트를 공개하였습니다.

2️⃣ [CulturaX: 167개 언어를 위한 대규모 다국어 데이터 세트의 개발 및 최적화](https://huggingface.co/papers/2309.09400)

대규모 언어 모델(LLM)의 발전은 큰 모델 크기와 방대한 학습 데이터에 기반하며, 이 모델들은 과학 발전을 촉진하기 위해 종종 공개됩니다. 그러나 대부분의 LLM 학습 데이터는 완전히 공개되지 않아, 모델의 편향 및 오류를 이해하고 교정하기 어렵게 만듭니다. 특히 다국어 학습에 사용되는 데이터 세트는 종종 부적절하게 수집 및 정리됩니다. 이 문제를 해결하기 위해, 167개 언어와 6조 3천억 개의 토큰으로 구성된 CulturaX라는 대규모 다국어 데이터 세트를 개발하였습니다. 이 데이터 세트는 여러 단계의 철저한 클리닝과 중복 제거 프로세스를 거쳐 최적의 품질을 달성하기 위해 맞춤화되었습니다.

3️⃣ [알파미센스 AI 모델을 활용한 '미센스' 돌연변이 카탈로그의 공개와 그 의미]

(https://www.deepmind.com/blog/alphamissense-catalogue-of-genetic-mutations-to-help-pinpoint-the-cause-of-diseases)

인간 유전학에서 질병의 원인을 밝히는 것은 큰 도전입니다. 연구자들은 '미센스' 돌연변이 카탈로그를 공개했는데, 이는 인간 단백질의 기능에 영향을 주며, 때로는 질병을 유발하는 유전적 돌연변이입니다. 이 카탈로그는 알파미센스라는 AI 모델을 사용하여 개발되었고, 이 모델은 7,100만 개의 미센스 변이 중 89%를 병원성 또는 양성으로 분류했습니다. 이러한 AI 도구를 사용하여 돌연변이의 영향을 예측하면 다양한 연구 분야를 가속화하는 데 도움이 될 수 있습니다. 연구 결과와 알파미센스의 모델 코드는 모두 공개되었습니다.

🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

3
0
윤현묵

윤현묵

[230920] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

비오는 아침이군요, 이제 날이 점점 선선해지고 있습니다.

다들 건강 챙기시고 AI 뉴스 확인하세요~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [EvoPrompt: 진화 알고리즘을 활용한 자동 프롬프트 최적화](https://huggingface.co/papers/2309.08532)

대규모 언어 모델(LLM)은 훌륭한 성능을 보이지만, 효과적인 프롬프트 제작에 사람의 노력이 필요하다. 이를 해결하기 위해, 이 백서에서는 진화 알고리즘(Evolution Algorithm)를 기반으로 한 프롬프트 최적화 프레임워크인 EvoPrompt를 소개한다. EvoPrompt는 LLM의 언어 처리 능력과 EA의 최적화 능력을 결합하여 프롬프트를 자동으로 개선한다. 여러 데이터 세트와 모델에 대해 테스트한 결과, EvoPrompt는 기존 방법보다 최대 25% 더 높은 성능을 보였다. 이 연구는 인공신경망과 기존 알고리즘의 결합의 가능성을 보여준다.

2️⃣ [LERF-TOGO: 자연어 쿼리를 활용한 물체 파악 분포 방법](https://huggingface.co/papers/2309.07970)

물체의 특정 부분을 파악하는 것은 다양한 작업에서 중요합니다. 그러나 기존 학습 기반 파악 플래너는 물체의 다양성을 확장하는데 어려움이 있습니다. 이 연구에서는 자연어 쿼리를 활용하여 물체의 파악 분포를 출력하는 LERF-TOGO라는 방법을 제안합니다. 이 방법은 텍스트 쿼리를 사용하여 3D 언어 필드로 클립 임베딩을 추출하고, DINO 피처를 이용하여 3D 오브젝트 마스크를 생성합니다. LERF-TOGO는 이 마스크를 활용하여 파악 순위를 매길 오브젝트의 의미 분포를 얻습니다. 실제 테스트에서 LERF-TOGO는 다양한 물체에서 81%의 정확도로 올바른 부분을 파악하였고, 69%에서 성공적으로 파악하였습니다.

3️⃣ [ReLU 어텐션의 성능: 소프트맥스 어텐션과의 비교](https://huggingface.co/papers/2309.08586)

이전 연구에서는 어텐션 매커니즘에서 소프트맥스를 ReLU와 같은 포인트 단위 활성화로 대체할 때 정확도가 저하되는 것을 관찰했습니다. 비전 트랜스포머의 경우, 시퀀스 길이로 나눌 때 이러한 성능 저하가 완화되는 것을 발견했습니다. ImageNet-21k에서 소형에서 대형 비전 트랜스포머를 훈련한 실험에 따르면 ReLU 어텐션은 컴퓨팅의 함수로서 스케일링 동작 측면에서 소프트맥스 어텐션의 성능에 근접하거나 일치할 수 있는 것으로 나타났습니다.

🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230919] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 하루를 달래줄 AI 뉴스가 찾아왔습니다~
즐거운 소식 보고 힘내시죠 :)

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요!


1️⃣ [대규모 언어 모델 배포를 위한 최신 효율성 향상 기술 소개]

Hugging Face에서 LLM을 손쉽게 사용할 수 있는 방법을 알려주었습니다. 최근의 대규모 언어 모델(GPT3/4, Falcon, LLama 등)은 인간 수준의 텍스트 이해와 생성 능력을 발휘하기 위해 수십억 개의 파라미터를 필요로 하며, 이로 인해 메모리 요구량이 크게 증가하게 됩니다. 이러한 모델은 또한 광범위한 컨텍스트 정보를 처리해야 하기 때문에 긴 입력 시퀀스를 관리하는 기능도 필요로 합니다. 이번 블로그에서는 LLM의 효율적인 배포를 위해 이 문제들을 해결하는 현재의 기술들을 소개하고 있습니다. 그 중에는 낮은 정밀도 연산, 플래시 주의라는 어텐션 알고리즘 변형, 그리고 효율적인 추론을 위한 새로운 모델 아키텍처 등이 포함됩니다. 이러한 기술들은 LLM의 성능을 유지하면서도 효율성을 향상시키는 데 중요한 역할을 합니다.

2️⃣ [MediaPipe FaceStylizer: 모바일 AR에서의 효율적인 얼굴 스타일링 솔루션]

최근 모바일 애플리케이션에서의 증강 현실(AR) 경험에 대한 관심이 증가하면서 고품질의 얼굴 생성 및 편집 모델, 특히 GAN 기반의 모델에 대한 수요가 높아지고 있습니다. 하지만 이러한 GAN 모델은 복잡하며 대규모의 훈련 데이터가 필요합니다. 이에 MediaPipe FaceStylizer는 위의 문제를 해결하면서 Google의 AI 원칙을 준수하는 얼굴 스타일링 솔루션을 제공합니다. 이는 경량이면서도 고품질의 이미지 생성을 가능하게 하며, 오픈 소스로 제공됩니다. 사용자는 손쉽게 이를 사용하여 개인화된 얼굴 스타일링 애플리케이션을 만들 수 있습니다.

3️⃣ [프롬프트 엔지니어링 꿀팁 대방출 (feat. 앤드류 응)]

프롬프트 엔지니어링에 대한 모두연 블로그 글이 나왔습니다! 프롬프트 엔지니어링이 대두된 이유는 현재 LLM은 지시사항에 맞춰 훈련된 모델이기 때문입니다. 프롬프트 엔지니어링에서 중요한 사항은 크게 2가지로 명확하고 구체적인 지시를 작성하기, AI 모델에게 생각할 시간을 주기로 줄 수 있습니다. 프롬프트 엔지니어링은 같은 모델로 물어본다고 하더라도 어떻게 물어보느냐에 따라 성능 차이가 발생하는 것에 기인하기 때문에 앞으로도 발전가능성이 높은 분야라고 생각합니다.

📍A'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

7
2
윤현묵

윤현묵

[2300918] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

즐거운 월요일입니다!
새로 시작하는 한주는 새로운 AI 뉴스와 함께 시작하시죠 :)


모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ MagiCapture: 고해상도 인물 이미지 생성을 위한 개인화 방법론
대규모 텍스트-이미지 모델, 특히 스테이블 디퓨전,은 사실적인 인물 이미지 생성이 가능하지만, 사실성에는 한계가 있어 상업적 수준에 도달하지 못하고 있습니다. 인물 이미지의 부자연스러운 부분은 인간이 쉽게 감지할 수 있습니다. MagiCapture는 이 문제를 해결하기 위한 개인화 방법으로, 몇 장의 참조 이미지만으로 고해상도 인물 이미지를 생성합니다. 주어진 무작위 셀카를 기반으로 미세 조정된 모델로 여권이나 프로필 사진과 같은 스타일의 이미지를 생성할 수 있습니다. 하지만, 합성 과정에서의 품질 저하와 소스 피사체의 신원 변경 문제가 있습니다. MagiCapture는 이를 해결하기 위해 주의 재집중 손실과 보조 전처리를 도입하고, 감독이 약한 학습 환경에서 강력한 학습을 지원합니다. 후처리 단계를 통해 더욱 사실적인 결과물을 생성하며, 다른 객체에도 적용 가능하다는 장점이 있습니다.

2️⃣ LLVM 어셈블리 최적화를 위한 대규모 언어 모델 활용 연구
대규모 언어 모델을 사용하여 코드 최적화 방법을 연구합니다. LLVM 어셈블리를 최적화하기 위해 7B 매개변수 트랜스포머 모델이 개발되었으며, 이 모델은 최적화되지 않은 어셈블리를 입력으로 사용하여 최적의 컴파일러 옵션을 제시합니다. 학습 중에 모델은 최적화 전후의 명령어 수와 최적화된 코드를 예측하게 되어, 이 과정이 모델의 성능과 이해도를 향상시킵니다. 이 방법은 컴파일러와 비교하여 명령어 수를 3.0% 개선하였고, 코드 추론 능력도 뛰어나 91%의 시간 동안 컴파일 가능한 코드를 생성하며 70%의 시간 동안 컴파일러 출력을 완벽하게 모방합니다.

3️⃣ 딥러닝 기반 NeRF을 활용한 축구 경기 합성 연구
스포츠 방송, 특히 축구 경기의 신규 뷰 합성은 방송 업계에서 큰 관심을 받지만, 높은 품질의 합성 리플레이를 생성하는 산업용 솔루션은 많지 않습니다. 대부분의 고급 시스템은 작동 방식을 공개하지 않으며, 여러 대의 정적 카메라를 활용하는 방식은 많은 도전 과제를 안고 있습니다. 하지만 최근 딥러닝 기반의 NeRF가 등장하면서, 사실적인 시각 합성 애플리케이션이 개발되었습니다. 이 연구에서는 NeRF을 사용하여 축구 장면의 합성에 대한 가능성을 탐구합니다. 결과는 완벽하지 않지만, 비용 효율적인 자동 솔루션의 가능성을 보여줍니다. 연구자들은 이 분야의 추가 연구를 위해 데이터 세트와 코드를 공개하였습니다.

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

7
0
윤현묵

윤현묵

[2300915] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

벌써 금요일입니다 :)
불금을 즐기기 앞서 AI 뉴스 어떠신가요?

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣ 포토버스 :AI프로필을 빠르게 만들 수 있는 모델
개인화된 텍스트-이미지 생성은 맞춤형 이미지 제작을 가능하게 하는 강력한 도구죠. 하지만 기존 방법론은 여러 한계가 있습니다. 이를 해결하기 위해 논문저자들은 포토버스라는 방법론을 도입하여 이미지 생성을 더 효과적으로 제어할 수 있는 방법을 찾았다고 하는데요! 이 방법론은 신원 보존을 강화하고, 테스트 시간 조정 없이, 단일 얼굴 사진에만 의존하여 빠르게 고품질 이미지를 생성합니다. 이 방식은 다양한 장면과 스타일의 이미지 생성이 가능하며, 평가를 통해 아이덴티티 보존과 편집 용이성에서 우수한 성능을 보였다고 하니 자세한 내용은 링크에서 확인해보세요!

2️⃣ vLLM: PagedAttention 알고리즘을 활용한 대규모 언어 모델 처리량 향상
대규모 언어 모델(LLM)의 처리량 향상을 위해서는 많은 요청을 효과적으로 일괄 처리해야 합니다. 그러나 기존 시스템은 키-값 캐시(KV 캐시) 메모리의 관리 문제로 인해 이에 어려움이 있습니다. PagedAttention이라는 새로운 알고리즘을 도입하여 KV 캐시 메모리의 낭비를 최소화하고, 이를 기반으로 vLLM이라는 새로운 LLM 서빙 시스템을 개발하였습니다. vLLM은 기존의 시스템에 비해 2~4배 높은 처리량을 보였으며, 이는 특히 큰 모델과 복잡한 시나리오에서 더욱 두드러졌다고 합니다!

3️⃣ AstroLLaMA: 천문학 분야를 위한 향상된 대규모 언어 모델
대규모 언어 모델은 전문 분야인 학술 천문학에서 한계를 보이는 경우가 많습니다. AstroLLaMA는 이러한 문제를 해결하기 위해 개발된 도메인 특화 모델로, 기존 모델인 Llama-2에 비해 30% 높은 성능을 보여주었습니다. 이 모델은 적은 매개변수를 사용하면서도 최첨단 기술보다 더욱 통찰력 있는 텍스트 완성 및 임베딩을 생성합니다. AstroLLaMA의 주 목적은 천문학 연구, 자동 논문 요약, 대화형 에이전트 개발을 지원하는 것을 목표한다고 합니다!

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

3
0
윤현묵

윤현묵

[2300914] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 날씨가 점점 쌀쌀해지고 있는데요, 다들 감기 조심하시고 AI 뉴스 함께 하시죠!

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣ 교과서로만 공부했어요! : phi-1.5 등장!
TinyStories와 phi-1 모델의 연속적인 연구를 통해 소규모 Transformer 기반 언어 모델의 성능에 대한 연구를 진행했습니다. 대규모 언어 모델을 사용해 ‘교과서 수준의’ 데이터 생성을 제안하며, 자연어의 상식 추론을 중심으로 ‘교과서만 있으면 된다’는 전략을 채택했다고 하는데요!
이로 인해 자연어 작업에서 5배 큰 모델과 유사한 성능을 가지며, 복잡한 추론 작업에서는 기존 모델을 능가하는 13억 개의 파라미터 모델인 phi-1.5를 개발했습니다. phi-1.5는 큰 언어 모델의 많은 특성을 갖지만, 웹 데이터의 부재로 인한 개선된 측면을 보여주는 데요! phi-1.5를 오픈소스로 공개했다고 하니 깃허브를 꼭 확인해보세요!

2️⃣ NExT-GPT: 범용 다중모달 언어 모델로 인간 수준 AI 구축
다중모달 대규모 언어 모델(MM-LLM)은 발전을 이루었지만, 여러 모달리티로 콘텐츠를 생성하는 능력이 제한적이죠. 인간과 유사한 AI를 구축하기 위해 해당 논문에 NExT-GPT라는 엔드투엔드 범용 애니투애니 MM-LLM 시스템이 개발됐다고 합니다!
이 시스템은 텍스트, 이미지, 비디오, 오디오 등 다양한 출력을 생성할 수 있으며, 특정 프로젝션 레이어의 소량의 파라미터만으로 튜닝 가능하여 비용 절감 및 확장성이 우수합니다. 모달리티 전환 인스트럭션 튜닝을 도입해 교차 모달 의미 이해 및 콘텐츠 생성을 강화하였습니다. 이 연구는 인간과 유사한 AI 연구의 가능성을 보여준다고 하니 자세한 내용은 링크에서 확인해보세요!

3️⃣ VITS2: 개선된 단일 단계 텍스트 음성합성 모델의 소개
최근 단일 단계 텍스트 음성 변환 모델은 두 단계 파이프라인을 능가하는 성능을 보이고 있지만, 부자연스러움, 계산 효율성, 음소 변환의 의존도 등의 문제가 있습니다. 이 연구에서는 이러한 문제를 개선한 단일 단계 텍스트 음성합성 모델 VITS2를 제안했는데요. VITS2는 개선된 구조와 훈련 메커니즘을 통해 음성의 자연스러움과 효율성을 향상시키며, 음소 변환에 대한 의존도도 크게 줄었다고 하니 앞으로 음성 모델에 대한 기대감이 커지네요!

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[2300913] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 선선한 수요일입니다. 오늘도 AI 뉴스와 함께 시작해요 ~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣ 전자책에서 자동 오디오북 생성하는 모델 공개!

오디오북은 문학의 접근성을 확대하지만 제작에는 많은 시간이 필요하죠~ 이 연구에서는 온라인 전자책에서 고품질의 오디오북을 자동으로 생성하는 시스템을 소개합니다! 최근의 텍스트 음성 변환 기술을 이용해 프로젝트 구텐베르크의 전자책에서 인간 수준의 오디오북을 생성하는데요.이 시스템은 다양한 전자책에서 읽을 수 있는 콘텐츠를 식별하고, 사용자는 말하기 속도, 스타일, 억양을 조절하거나 원하는 목소리로 매칭할 수 있습니다. 5,000개 이상의 오디오북과 맞춤형 오디오북 제작 데모를 제공한다고 하니 상세 내용은 링크에서 확인해보세요!

2️⃣ GPT-4를 이용한 'Chain of Density' 요약 방법

적절한 정보를 선택하여 요약하는 것은 꽤나 복잡한 작업인데요. 트위터에서 ‘Chain of Density’(CoD) 프롬프트를 이용해 GPT-4로 더 밀도 높은 요약을 요청했습니다!GPT-4는 누락된 주요 엔티티를 계속 통합하여 요약을 생성하는데요. 이 CoD를 통한 요약은 기본 프롬프트로 생성된 것보다 더 추상적이며 더 통합적입니다. 인간의 선호도 연구에서 밀도 높은 GPT-4 요약이 사람이 작성한 요약과 유사하게 선호됨을 발견하였으며, 정보와 가독성 간의 균형이 중요하다는 것을 확인했습니다.

3️⃣ 애플의 희소형 모바일 비전 MoE(V-MoE): 효율적인 비전 트랜스포머 최적화

분산 MoE모델(Sparse Mixture-of-Experts)은 모델 파라미터의 작은 부분만 활성화하여 높은 효율성을 달성합니다. 이 연구에서는 이 기술을 사용해 비전 트랜스포머(ViT)를 축소하여 리소스 제약이 있는 응용 프로그램에 맞게 최적화합니다.전체 이미지를 처리하는 새로운 MoE 설계와 라우터 안내를 위한 슈퍼클래스 정보 사용을 제안하는데요. 결과적으로, 소니의 희소형 모바일 비전 MoE(V-MoE)는 기존 ViT 모델보다 더 높은 성능과 효율성을 보입니다. 특히, ViT-Tiny 모델의 경우, 애의 모바일 V-MoE는 ImageNet-1k에서 3.39% 더 높은 성능이라 하니 링크에서 꼭 확인해보세요~

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

3
0
윤현묵

윤현묵

[230908] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 드디어 금요일이 찾아왔습니다 :)

날씨도 좋은데 퇴근하고 AI 지식 뽐내러 가볼까요?

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣ [Hydra-RLHF: PPO 메모리 요구 사항 최적화를 통한 강화 학습 효율성 향상](https://huggingface.co/papers/2309.00754)인간 피드백 기반 강화 학습(RLHF)은 언어 모델링에 혁신을 가져왔지만, 근사 정책 최적화(PPO)의 높은 메모리 요구로 인해 실무자들이 사용하기 어렵습니다. 우리는 PPO의 메모리 사용량을 줄이는 방법으로 Hydra-RLHF를 제안하였습니다. 이는 SFT와 보상 모델을 통합하고 훈련 중 LoRA를 동적으로 '끄는' 방식입니다. 실험 결과, LoRA-PPO는 메모리 사용량을 줄이면서 성능을 향상시켰고, Hydra-PPO는 지연 시간을 최대 65%까지 줄이면서 성능을 유지하였습니다. 이는 Hydra-PPO가 RLHF에 대한 효과적인 솔루션임을 보여줍니다.

2️⃣ [ModelScope-Agent: LLM을 위한 통합 가능한 에이전트 프레임워크와 지능형 어시스턴트](https://huggingface.co/papers/2309.00986)최근 대규모 언어 모델(LLM)은 사람처럼 의도를 이해하고 추론하며 행동을 설계하는 능력을 보였습니다. LLM의 성능을 극대화하기 위해 외부 API와 연결 가능한 에이전트 프레임워크에 대한 관심이 증가하고 있습니다. 이 연구에서는 LLM을 컨트롤러로 사용하여 여러 오픈 소스 LLM과 원활하게 통합 가능한 ModelScope-Agent 프레임워크를 제시합니다. 이 프레임워크는 도구 사용, 메모리 제어, 맞춤형 모델 훈련 등을 지원합니다. 또한, ModelScopeGPT라는 실제 지능형 어시스턴트도 소개되며, 이는 ModelScope 에이전트 프레임워크를 기반으로 1000개 이상의 AI 모델과 커뮤니티 지식을 연결할 수 있습니다.

3️⃣ [PromptTTS 2: 변동성 네트워크와 대규모 언어 모델을 활용한 고품질 텍스트 음성 변환](https://huggingface.co/papers/2309.02285)텍스트보다 음성은 더 다양한 정보를 전달할 수 있습니다. 하지만 기존의 텍스트 음성 변환(TTS) 방식은 음성 프롬프트에 의존하므로, 텍스트 프롬프트를 사용하는 것이 더 일반적입니다. 이러한 TTS 방식은 일대다 문제와 프롬프트 데이터 세트의 제한적 가용성 문제가 있습니다. 본 연구에서는 PromptTTS 2라는 새로운 시스템을 소개하는데, 이는 텍스트 프롬프트에서 누락된 음성 변동성 정보를 변동성 네트워크를 통해 제공하며, 대규모 언어 모델을 이용해 고품질의 텍스트 프롬프트를 생성합니다. 이 시스템은 대규모 음성 데이터 세트에서 높은 성능을 보여주며, 텍스트 프롬프트와 더 일관된 음성 생성 및 다양한 음성 샘플링을 지원합니다. 이로 인해 사용자는 더 많은 선택을 할 수 있으며, 프롬프트 생성에 드는 라벨링 비용도 크게 절감됩니다.

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

3
0
윤현묵

윤현묵

[230907] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 어느덧 목요일이네요 :) 오늘도 AI 뉴스로 상쾌하게 시작해볼까요?

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣ [RLAIF: 인간 피드백 없이 언어 모델 선호도 조절의 새로운 방법]

(https://huggingface.co/papers/2309.00267)인간 피드백을 활용한 강화 학습(RLHF)은 대규모 언어 모델을 인간의 선호도에 맞게 조절하는 데 유용하지만, 인간의 선호도 레이블을 얻는 것이 어려운 문제입니다. 인간이 아닌 기존 언어 모델을 사용하여 선호도 레이블을 부여하는 RLAIF 방법과 RLHF 방법의 효과는 비슷하다는 것이 확인되었습니다. 인간 평가자는 약 70%의 경우에서 RLAIF와 RLHF 모델을 기본 모델보다 선호했습니다. 이 결과는 RLAIF가 인간 수준의 성능을 가지며, RLHF의 확장 문제에 대한 해결책이 될 수 있음을 보여줍니다.

2️⃣ [FACET: 인구통계학적 속성에 따른 비전 모델 성능 평가를 위한 대규모 평가 세트]

(https://huggingface.co/papers/2309.00035)컴퓨터 비전 모델은 성별, 피부색 등의 인구통계학적 속성에 따라 성능 차이를 보이는 것으로 알려져 있습니다. 이를 평가하기 위해 우리는 FACET라는 대규모 평가 세트를 제시하였습니다. 이 세트는 32k 이미지로 구성되어 있으며, 각 이미지에는 전문가에 의해 피부 톤, 머리 유형 등의 속성에 대한 주석이 달려 있습니다. FACET을 사용하여 최첨단 비전 모델을 평가한 결과, 모델의 성능은 인구통계학적 속성과 그 교차점에 따라 다르게 나타났습니다. 이는 모든 사람들이 비전 작업에서 동등하게 대우받지 못함을 의미합니다. 우리는 이 벤치마크를 통해 더 공정하고 효과적인 비전 모델 개발에 기여할 수 있기를 희망합니다.

3️⃣ [YaRN: 트랜스포머 위치 임베딩의 일반화와 컨텍스트 확장 능력 향상](https://huggingface.co/papers/2309.00071)트랜스포머 기반 언어 모델에서 효과적으로 위치 정보를 인코딩하는 회전식 위치 임베딩(RoPE)은 학습된 시퀀스 길이를 초과할 경우 일반화에 실패합니다. 이를 해결하기 위해 YaRN 방법이 소개되었으며, 이 방법은 이전 방법에 비해 10배 적은 토큰과 2.5배 적은 훈련 단계만 필요로 합니다. YaRN을 사용한 LLaMA 모델은 더 긴 컨텍스트 길이를 효과적으로 처리하고 외삽할 수 있으며, 이전 방법보다도 더 나은 컨텍스트 창 확장 능력을 보여줍니다.

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230906] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

한 주의 절반이 지났습니다. 오늘도 AI 뉴스와 힘차게 시작하시죠~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)

1️⃣ [CRATE 화이트박스 트랜스포머: 지도 학습에서의 세분화 특성 강화](https://huggingface.co/papers/2308.16271)최근 비전 작업을 위한 트랜스포머 모델이 다양한 애플리케이션에서 효과적임이 확인되었습니다. 자가 지도 방법인 DINO를 사용한 비전 트랜스포머(ViT)는 세분화 특성을 보였지만, 지도 분류 작업을 통한 ViT에서는 그렇지 않았습니다. 이 연구는 트랜스포머에서의 세분화가 자기 지도 학습만의 ㅑ결과인지, 아니면 다른 조건에서도 동일한 결과를 얻을 수 있는지를 검증합니다. 실험 결과, CRATE라는 화이트박스 트랜스포머 아키텍처를 사용하면 세분화 특성이 지도 학습 최소 조건에서도 나타난다는 것을 확인하였습니다. 이 아키텍처의 설계된 수학적 기능이 세분화된 특성을 강화하는 것으로 파악되었습니다. 이 연구는 효과적이면서도 해석 가능한 화이트박스 모델 설계 방향을 제시합니다.코드는 아래에서 확인할 수 있습니다.[GitHub - Ma-Lab-Berkeley/CRATE: Code for CRATE (Coding RAte reduction TransformEr).](https://github.com/Ma-Lab-Berkeley/CRATE)

2️⃣ [ASD 파이프라인: 모든 크기의 이미지를 효과적으로 생성하는 텍스트-이미지 합성 모델](https://huggingface.co/papers/2308.16582)텍스트-이미지 합성을 위한 생성 모델인 스테이블 디퓨전은 이미지의 크기와 해상도로 인한 구도 문제에 직면합니다. 이 문제는 모델이 한 크기의 이미지와 텍스트만 학습하기 때문에 발생하며, 무제한 크기의 이미지 학습은 큰 계산 비용 때문에 어렵습니다. 이 문제점을 해결하기 위해 유니티는 모든 크기의 이미지를 효과적으로 생성하면서 GPU 리소스 사용을 최소화하는 2단계 파이프라인 ASD(Any-Size-Diffusion)를 도입했습니다. 초기 단계인 ARAD를 통해 다양한 이미지 크기에 맞게 구도를 조절하고, 다음 단계인 FSTD 기술로 원하는 크기의 이미지를 빠르게 생성합니다. ASD는 LAION-COCO와 MM-CelebA-HQ 벤치마크에서 기존 방법보다 2배 빠른 추론 시간으로 잘 구조화된 이미지를 생성함을 입증하였습니다.

3️⃣ [GNFactor: 3D 복셀 기반의 시각적 행동 복제 에이전트로 로봇 조작 최적화](https://huggingface.co/papers/2308.16891)실제 환경에서 다양한 조작 작업을 수행하는 로봇을 개발하기 위해선 로봇이 장면의 3D 구조와 의미를 깊게 이해해야 합니다. 이 연구에서는 멀티태스크 로봇 조작을 위한 GNFactor라는 시각적 행동 복제 에이전트를 제안합니다. 이 에이전트는 3D 복셀 표현을 기반으로 일반화 가능한 신경장과 인식자 변환기를 최적화합니다. 이 모델은 시맨틱 정보를 깊은 3D 복셀로 추출하기 위해 비전 언어 모델을 활용합니다. 실험 결과, GNFactor는 보이는 및 보이지 않는 작업 모두에서 현재의 최신 방법보다 뛰어난 성능을 보여줍니다.자세한 내용은 아래에서 확인할 수 있습니다.
https://yanjieze.com/GNFactor/

📍AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230905] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 오늘도 어김없이 AI 뉴스 전달드려요~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😄

1️⃣ 고밀도 추적과 TAP 모델을 활용한 로봇의 빠른 작업 학습

실험실이나 공장 외부에서 로봇을 유용하게 사용하려면 새로운 동작을 빠르게 학습할 수 있는 방법이 필요한데요! 현존하는 방식들은 작업별로 적용하기 어렵거나 데이터 효율성이 떨어집니다. 오늘 소개해드리는 연구에 따르면 "고밀도 추적"을 통한 빠른 학습을 제안하며, TAP 모델을 이용해 데모에서의 움직임을 추출하고 다양한 상황에 적용합니다. 이 방법을 사용하면 로봇이 복잡한 작업을 몇 분 안에 학습하고 수행할 수 있으니 앞으로 기대가 됩니다!
https://huggingface.co/papers/2308.15975

2️⃣ MVDream: 텍스트 프롬프트를 활용한 일관된 멀티뷰 이미지 생성 모델

텍스트 프롬프트를 기반으로 기하학적으로 일관된 멀티뷰 이미지를 생성하는 MVDream이라는 멀티뷰 확산 모델을 소개합니다! 이 모델은 대규모 웹 데이터와 3D 에셋의 렌더링 데이터를 결합하여 2D와 3D의 일관성을 달성하는데요. 이를 통해 3D 생성에 대한 멀티뷰 프리뷰와 2D 리프팅 방법의 안정성 향상이 가능하다고 합니다! 또한, 이 모델은 개인화된 3D 생성을 위한 드림부스3D 애플리케이션에서 적은 샷 설정으로 빠르게 미세 조정이 가능해질 것 같아요.
https://huggingface.co/papers/2308.16512

3️⃣ Belebele: 122개 언어 변형을 포함한 다국어 기계 독해 데이터 세트의 소개와 평가

Belebele은 122개 언어 변형을 포함하는 객관식 기계 독해(MRC) 데이터 세트로, 자연어 이해(NLU) 벤치마크의 언어 범위를 확장했다고 합니다! 이는 고자원, 중자원, 저자원 언어의 텍스트 모델 평가에 적합하며, 영어 데이터 세트는 매우 어려운 수준이라고 하는데요!병렬화된 데이터 세트는 모든 언어 모델 성능 비교를 가능하게 하며, 다국어 마스킹 언어 모델(MLM)과 대규모 언어 모델(LLM)의 성능을 평가했습니다. 작은 MLM이 다양한 언어 이해력이 뛰어나며, 큰 어휘 크기와 의식적 어휘 구성이 리소스가 적은 언어에서의 성능 향상과 관련이 있다는 결과를 보여졌다고 해요. Belebele은 NLP의 다국어 성능 평가와 분석에 중요한 도구로 제시될 것 같습니다!
https://huggingface.co/papers/2308.16884

📍AI학교 아이펠 지금 바로 지원하기 → https://bit.ly/3OX29fF

3
0
윤현묵

윤현묵

[230904] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

즐거운 월요일입니다! AI 뉴스와 함께 시작하시죠~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😃

1️⃣ LLaSM: 음성과 언어로 상호작용하는 다중 모달 언어 모델의 등장최근 다중 모드 언어 모델이 주목받고 있으며, 대부분은 시각-언어 다중 모드에 중점을 두고 있죠! 오늘 소개해드리는 연구에 따르면 음성 및 언어 지시에 반응하는 대규모 다중 모달 음성-언어 모델인 LLaSM을 제안합니다!인간과 인공지능 간 더 자연스러운 상호작용의 가능성을 보여줬는데요! 뿐만 아니라 LLaSM-Audio-Instructions라는 대규모 음성 명령어 데이터 세트도 함께 공개했다고 하니 본문을 확인해보세요!

2️⃣ LM-Infinite: 람다 주의 마스크로 대규모 언어 모델의 긴 시퀀스 한계 극복최근 대규모 언어 모델(LLM)은 다양한 도메인에서 눈부신 발전을 보였지만, 긴 시퀀스에 대한 일반화에 문제를 겪고 있죠! 대부분의 훈련은 고정된 길이로 진행되며, 긴 컨텍스트에서 모델은 문제를 겪는 경우가 많습니다.이를 해결하기 위한 전통적인 방법은 비용이 많이 들며, 효과적인 설계가 필요하데요. 기존 LLM의 한계점을 보완하기 위해 람다 형태의 주의 마스크와 거리 제한만을 사용한 LM-Infinite의 방법을 소개합니다! 이 방법은 다양한 LLM에 적용 가능하며, 높은 계산 효율과 함께 더 긴 시퀀스에 대해 더욱 뛰어난 성능을 보여준다고 해요~

3️⃣ Jais와 Jais-chat: 아랍어 중심 대규모 언어 모델의 혁신새로운 아랍어 중심의 대규모 언어 모델인 Jais와 Jais-chat을 출시됐습니다! 이 모델은 GPT-3 기반 아키텍처를 사용하여 아랍어와 영어 텍스트, 다양한 프로그래밍 언어의 소스 코드를 혼합하여 사전 학습하는데요.130억 개의 파라미터로 이루어진 이 모델은 아랍어에서 기존 모델보다 훨씬 뛰어난 성능을 보여주며, 비슷한 규모의 영어 모델과도 경쟁력이 있을 것 같습니다. 아랍어 LLM 연구를 촉진하고자 기초 Jais 모델과 Jais-chat 변형 두 가지 버전을 제공한다고 하니 본 내용을 꼭 확인해보세요!

📍AI학교 아이펠 지금 바로 지원하기 → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230830] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 어느 덧 2023년 8월이 끝나가고 있습니다.

8월의 마무리를 신나는 AI 소식과 함께 한다면 풍성한 9월이 다가올겁니다 😎


모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😄

1️⃣Nougat: 과학 문서의 PDF를 마크업 언어로 변환하는 광학 문자 인식 모델
과학 문서는 주로 PDF로 저장되지만, 이 형식은 정보가 쉽게 손실될 수 있는 위험이 있죠. 오늘 가져온 논문에서는 과학 문서를 마크업 언어로 변환하기 위한 광학 문자 인식 모델인 Nougat을 소개하였습니다. 이 모델은 읽기 어려운 문서를 기계가 읽을 수 있는 텍스트로 변환하여 과학 지식의 접근성을 향상시키는 것을 목표로 합니다. 이를 위해 제작된 모델과 코드는 공개될 예정이라고 합니다!

2️⃣OmniQuant: LLM을 위한 전방향 보정 양자화 기법의 소개대규모 언어 모델(LLM)의 배포는 큰 메모리와 계산 요구 사항 때문에 어려움이 있죠. 기존 학습 후 양자화(PTQ) 방식은 이 문제를 부분적으로 해결하였지만 한계가 있었기 때문인데요. 이를 극복하기 위해 유니티는 LLM을 위한 전방향 보정 양자화(OmniQuant) 기법을 도입했다고 합니다!OmniQuant는 학습 가능한 가중치 클리핑과 학습 가능한 등가 변환 두 가지 주요 구성 요소로 작동하며, LLM의 양자화 프로세스를 효율적으로 최적화합니다. 이 기법은 다양한 양자화 구성에서 우수한 성능을 보이며, 실제 장치에서 추론 속도와 메모리 사용량을 크게 줄일 수 있다고 합니다!

3️⃣SoTaNa: 향상된 ChatGPT와 LLaMA를 기반으로 한 오픈소스 소프트웨어 개발 어시스턴트소프트웨어 개발은 현대 사회의 혁신과 효율성을 촉진하는 중요한 분야로, 효과적인 개발 어시스턴트의 수요가 증가하고 있습니다. 대규모 언어 모델인 ChatGPT와 LLaMA는 제한적인 접근성과 의도 파악 어려움이 있는데요. 이를 해결하기 위해 SoTaNa, 오픈소스 소프트웨어 개발 어시스턴트를 소개하며, ChatGPT를 기반으로 LLaMA 모델을 향상시키는 방식을 채택합니다. 스택 오버플로의 질문 응답 효율성과 코드 요약 및 생성 기능을 평가하며, 단일 GPU에서도 실행 가능함을 강조한다고 합니다!


📍오늘까지만! 아이펠 6기 앵콜 모집 중
AI학교 아이펠 지금 바로 지원하기 → https://bit.ly/3OX29fF

4
0
윤현묵

윤현묵

[230829] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 가을이 슬슬 다가오는군요
모두들 환절기 감기 조심하시고, 이럴 땐 역시 AI 뉴스죠~ 좋은 소식 전달드립니다 :)

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😃

1️⃣Google의 인식 공정성 팀: 멀티모달 ML의 포용성 및 공정성 연구
Google의 책임감 있는 AI 연구는 다양한 전문가들과의 협업을 기반으로 하며, 인식 공정성 팀은 컴퓨터 비전과 ML 공정성 연구를 주도합니다. 이 팀의 목표는 멀티모달 ML 시스템, 특히 기초 모델과 생성 AI에서의 공정성과 포용성을 확장하는 것입니다. 이들은 분류, 로컬라이제이션, 캡션 등의 핵심 기술 구성 요소에 대해 공정성과 포용성을 최우선 성능 목표로 삼고 있습니다. 그들의 연구는 공정하고 포용적인 ML 모델링을 위한 새로운 분석 및 해결책을 찾는 것에 중점을 둡니다. 이를 통해 인구통계학적, 문화적, 사회적 정체성을 어떻게 책임감 있게 모델링할 수 있는지, 시스템 편향을 어떻게 측정하고 개선할 수 있는지, 그리고 더 포용적인 시스템을 어떻게 구축하고 문제에 빠르게 대응할 수 있는지에 대한 핵심 질문에 답하고자 합니다.

2️⃣딥러닝 모델의 양자화: 허깅페이스에서의 접근법 및 도구
허깅페이스에 양자화 관련 블로그 포스팅이 올라와서 공유합니다! 딥러닝에서의 정밀도는 숫자 표현의 유효 자릿수나 세부 정보의 보존 수준을 의미합니다. 숫자는 다양한 데이터 유형으로 표현되며, 각 유형은 표현할 수 있는 숫자의 범위를 가집니다. 딥 러닝에서는 부동 소수점(FP32/16/8...)을 사용해 가중치를 표현하며, 높은 정밀도는 더 큰 모델 크기와 느린 계산 속도를 초래할 수 있습니다. 이로 인해 양자화, 즉 정밀도를 낮추는 과정이 필요해집니다. 양자화 방법에는 '훈련 후 정량화'와 '양자화 인식 훈련' 두 가지가 있습니다. 최신의 양자화 방법은 성능 저하 문제를 극복하기 위해 개발되었으며,

에코시스템의 도구를 사용하여 이러한 방법들을 적용할 수 있습니다.

3️⃣Code Llama: 프로그래밍을 위한 다음 세대 언어 모델 출시
오늘, 코드 생성을 위한 대규모 언어 모델인 Code Llama를 출시했습니다. 이 모델은 기존 개발자의 작업 효율성을 향상시키며, 코딩 학습의 진입 장벽을 낮춥니다. Code Llama는 프로그래머의 생산성 향상과 교육을 지원하는 도구로 기대됩니다. 제너레이티브 AI 분야는 빠르게 발전하고 있으며, 저희는 개방적인 AI 접근법을 택했습니다. 코드 라마는 라마 2를 기반으로 코드 작업에 특화된 데이터 세트로 추가 학습되었습니다. 자연어 프롬프트를 사용해 다양한 언어의 코드를 생성하고 완성, 디버깅 작업을 도울 수 있습니다.

📍[D-1] 아이펠 6기 앵콜 모집 중!
AI학교 아이펠 지금 바로 지원하기 → https://bit.ly/3OX29fF

2
0
윤현묵

윤현묵

[230828] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 즐거운 한 주의 시작을 AI뉴스와 함께 할까요?


모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😃

1️⃣BLIVA: 텍스트 기반 이미지 해석의 혁신적 접근법
비전 언어 모델(VLM)은 개방형 시각적 질의응답(VQA)에 있어 큰 발전을 이룩했지만, 텍스트가 포함된 이미지의 경우 제대로 작동하지 않았습니다. 특히 기존에 있던 비전 언어모델은 텍스트가 풍부한 장면을 완전히 인식하지 못합니다. 논문에서는 이 문제를 해결하기 위해 BLIVA라는 새로운 모델을 소개합니다. 이 모델은 기존 접근법과 다르게 인코딩된 패치 임베딩을 직접 투영하는 방식을 채택해서 복잡한 세부 정보도 포착할 수 있게 합니다. 실험을 진행했을 때 BLIVA는 기존의 InstructBLIP 모델보다 성능이 크게 향상되었으며, 텍스트가 포함되어 있지 않은 이미지를 해석하는 능력도 입증되었습니다!

2️⃣StableVideo: 시간적 종속성을 활용한 일관된 비디오 편집 프레임워크
Diffusion 모델은 이미지와 동영상 생성에 있어 뛰어나지만, 동영상 내 오브젝트의 일관성 있게 편집이 어렵습니다. 논문에서 소개한 StableVideo는 시간에 따른 텍스트 기반 Diffusion 모델과 프레임 간 정보를 전파하는 메커니즘을 도입했습니다. 이 방법을 도입했을 때 StableVideo는 조금 더 일관성 있게 비디로 편집이 가능해졌습니다. 실제 실험에서도 StableVideo은 다른 SOTA 모델에 비해 더 우수한 편집 결과를 보여주었습니다!

3️⃣AutoGPTQ: 대규모 언어 모델의 접근성 향상을 위한 비트 조절
대규모 언어 모델은 텍스트 이해와 생성에 뛰어난 능력을 가질 수 있지만 비싼 GPU와 같은 하드웨어 요구 사항이 증가하고 있습니다. 이렇다보니 오픈소스 모델이 나와도 실제 로컬에서 돌리기 쉽지 않습니다. 허깅 페이스는 모든 사용자가 이러한 모델에 쉽게 접근할 수 있게 하기 위해 AutoGPTQ 라이브러리를 Transformers에 통합하였고, 이를 통해 사용자는 GPTQ 알고리즘으로 모델의 정밀도를 8, 4, 3, 2비트로 조정할 수 있습니다. 특히, 4비트 양자화는 정확도 저하가 적으며 추론 속도도 fp16 기준과 유사하다. 이 기능은 Nvidia와 AMD GPU에서 모두 사용 가능하며 현재 이준재님께서 CPU도 도전하고 있습니다!

📍단 이틀, 아이펠 6기 앵콜 모집 중!
AI학교 아이펠 리서치 과정 모집 중 → https://bit.ly/44cSNkr

7
0
윤현묵

윤현묵

[230825] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 즐거운 금요일입니다 :)

불금엔 역시 AI 뉴스 아닐까요?
뉴스보고 친구들과 토론까지 가능한 AI 뉴스 지금 전달드립니다 👍

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😃

1️⃣CoDeF: 시간적 일관성을 지니는 비디오 변환을 위한 새로운 표현 방식
CoDeF에 대해 들어보셨나요? CoDeF는 전체 비디오의 정적 콘텐츠를 집계하는 표준 콘텐츠 필드와 시간 축을 따라 각 프레임으로 변환을 기록하는 시간적 변형 필드로 이루어진 새로운 비디오 표현입니다. 이 두 필드는 대상 비디오를 재구성하기 위해 함께 최적화됩니다. CoDeF는 이미지 알고리즘을 표준 이미지에 적용하고, 그 결과를 전체 비디오에 전파하는 것을 지원합니다. 실험 결과, CoDeF는 이미지 간 변환을 비디오 간 변환으로 확장할 수 있으며 처리된 비디오에서 높은 프레임 간 일관성을 보여줍니다. 또한 물이나 스모그와 같은 비강체 물체를 추적하는 능력까지도 있다고 하니 매우 놀랍습니다.

2️⃣휴먼리프: 레이어별 접근을 통한 3D 인간 생성의 향상
2D 이미지를 기반으로 3D 인간을 생성하는 기술이 크게 발전하였습니다. 대부분의 모델은 한 번의 패스로 3D 인간을 생성하지만, 옷을 입은 인체의 다양한 레이어 특성은 무시되곤 합니다. 이를 극복하기 위해 레이어별 3D 인체 생성 모델인 휴먼리프(HumanLiff)를 도입했습니다. 휴먼리프는 기본적인 3D 인간 생성 후 레이어별로 옷을 점진적으로 추가합니다. 또한, 세밀한 3D 재구성을 위한 새로운 연산과 함께 3D 확산 모델 학습을 간소화하는 방법을 제안합니다.
실험 결과, 휴먼리프는 다른 최첨단 방법보다 뛰어난 성능을 보였다고 합니다.

3️⃣Strata-NeRF: 계층화된 3D 장면 표현을 위한 신경 방사 필드 확장
신경 방사 필드(NeRF)는 3D 장면 표현을 학습하여 사실적인 뷰를 생성하지만 대부분 단일 장면 또는 오브젝트에 집중합니다. 실제 세계의 장면은 여러 레벨에서 캡처될 수 있으며, 이를 원활하게 연결하면 더 몰입감 있는 경험을 제공할 수 있습니다. 이 문제점을 해결하기 위해 Strata-NeRF가 대안으로 제시되었는데요, Strata-NeRF는 벡터 양자화를 활용하여 여러 레벨의 장면을 암시적으로 캡처합니다. 실험 결과 Strata-NeRF는 계층화된 장면을 효과적으로 캡처하고, 아티팩트를 줄이며, 고해상도 뷰를 잘 합성해내는 것으로 확인되었습니다. 이제 3D 업계에도 많은 혁신을 가져올 것 같네요!

📍올 여름 마지막 기회! 놓치지 마세요.

AI학교 아이펠 6기 모집 마감 임박 → https://bit.ly/3OX29fF

6
0
윤현묵

윤현묵

[230824] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"


안녕하세요~ 점심식사 맛있게 하셨나요?
업무 전 가볍게 오늘의 AI 소식 보고 가세요~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요!

1️⃣자연어를 이용한 로봇 동작 학습: 로봇 기술 합성 방법론의 새로운 접근
로봇에게 대화형으로 새로운 작업을 가르치는 것은 로봇을 실제로 통합하는 관점에서 매우 중요한 과정입니다. 최근에는 대규모 언어 모델(LLM)의 발전을 통해 이 목표를 지원하는 방법이 모색되었지만, 일정 수준의 로봇 명령을 출력하는 것에는 여전히 어려움이 있습니다.
"로봇 기술 합성을 위한 언어에서는 로봇에게 새로운 동작을 가르치는 방법”으로 사용자의 자연어 입력을 통한 보상 함수를 제안합니다.
유니티는 LLM을 사용하여 보상 지정 코드로 번역하고 최적의 로봇 동작을 찾습니다. 이 시스템은 보상 번역기와 모션 컨트롤러의 두 부분으로 구성되며, 사용자의 명령을 보상 함수로 변환하고 이를 최적화하여 로봇 동작을 생성합니다. 정말 놀랍지 않나요?

2️⃣GPT-3.5 터보와 GPT-4의 미세 조정: 향상된 성능과 안전한 배포
GPT-3.5 터보는 현재 미세 조정이 가능하며, GPT-4에 대한 미세 조정은 올 가을쯤 제공될 예정입니다. 이를 통해 사용자는 모델을 사례에 맞게 최적화하여 성능을 향상시킬 수 있습니다.
초기 테스트에서 미세 조정된 GPT-3.5 터보는 특정 작업에서 GPT-4 수준의 성능을 보였습니다. 미세 조정은 출력의 간결성, 안정된 형식, 사용자 지정 톤 등을 개선하는 데 도움이 됩니다. 특히 미세 조정을 통해 프롬프트 크기를 줄이고 API 호출 속도를 높일 수 있습니다. 이 기술은 다른 기술과 함께 사용될 때 최대의 효과를 발휘하며 안전한 배포를 위해 모더레이션 API와 GPT-4 모더레이션 시스템을 사용하여 미세 조정 데이터를 확인합니다. 지금 바로 확인해보세요:)

3️⃣SeamlessM4T: 음성도 되고 텍스트도 번역가능한 다국어 번역 모델의 등장
인터넷과 모바일 기기의 전 세계적 확산으로 사람들은 다국어 콘텐츠에 더욱 쉽게 접근할 수 있게 되었고, 이에 따른 다국어 번역 능력의 중요성이 점차 증가하고 있습니다. SeamlessM4T는 100개에 가까운 언어를 지원하는 다기능 다국어 모델로, 음성과 텍스트의 자동 번역 및 전사를 수행합니다. 이 모델과 연관된 큰 규모의 번역 데이터 세트인 SeamlessAlign의 메타데이터도 곧 공개된다고 합니다.
Lionbridge는 SONAR와 스톱이라는 제품을 제공하여 커뮤니티의 데이터 활용을 도와주며, 모든 연구 발전은 fairseq2를 통해 지원됩니다. SeamlessM4T는 제한된 언어 지원과 복잡한 시스템 문제를 해결하여 다국어 번역 분야에서 큰 진전을 이룩하였습니다. 이 모델은 다양한 언어를 사용하는 사람들 사이의 효과적인 소통을 돕기 위해 개발되었습니다. 이제 정말 더 국경이 없어지겠네요!

📍올 여름 마지막 기회! 놓치지 마세요.
AI학교 아이펠 6기 모집 마감 임박 → https://bit.ly/3OX29fF

5
0
윤현묵

윤현묵

[230823] 모두의연구소가 전하는 "모두를 위한 AI 뉴스"

안녕하세요~ 오늘도 즐거운 AI 뉴스와 함께 점심식사 하시죠 :)


모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! 😄

1️⃣AI에 의식이 있는지 직접 실험해보고 의식이 들어갈 수 있는지 판단해보자!
인공지능 시스템이 의식을 가질 수 있는지 여부는 공학 뿐만 아니라 인문학에서도 주요하게 다루는 주제죠. 오늘 소개해드리는 논문에서는 다양한 신경과학적 의식 이론을 통해 AI의 의식을 평가하는 방법을 탐구합니다. 여러 의식 이론(반복적 처리 이론, 글로벌 작업 공간 이론 등)을 기반으로 의식이라는 지표를 정의하고 이를 기반으로 다양한 AI 시스템을 평가합니다. 결과적으로 현재의 AI는 의식이 없지만, 의식을 가진 AI를 개발하는 것이 불가능하지 않다는 결론을 도출했다고 해요. 이번 논문을 통해서 추후에 의식을 가진 AI를 개발하는 것은 충분히 가능한 사항이라는 것으로 전망되는데, 곧 있으면 의식이 있는 AI의 등장이 머지않았다고 생각합니다!

2️⃣생각의 그래프(GoT): LLM의 사고 향상과 인간처럼 추론하기
생각의 그래프(Graph of Thoughts; GoT)는 대규모 언어 모델(LLM)의 프롬프트 기능을 발전시킨 프레임워크로, 정보 단위('LLM 생각')를 정점으로 하고 그 사이의 종속성을 에지로 나타내는 그래프 형식을 사용합니다. 이를 통해 LLM의 사고를 결합하거나, 피드백 루프로 향상시킬 수 있습니다. GoT는 향상된 분류 품질과 비용 절감을 제공하며, 확장성이 뛰어나 새로운 프롬프트 체계에 적용될 수 있다고 합니다. 이로 인해 LLM 추론은 인간의 사고 방식과 한 발짝 더 가까워진 것 같네요~ 이렇듯 현재 프롬프트 엔지니어링 기술도 주요 AI 연구로 떠오르고 있으며 추후 의식에 대한 연구와 함께 같이 진행될거라고 생각합니다!

3️⃣인공지능도 협동을 하면 혼자 했을때보다 더 잘할 수 있을까?
AI 시스템은 인간의 지능을 뛰어넘었지만 여전히 오류를 범하고 일반화하는 데 어려움을 겪곤합니다. 오늘 마지막으로 소개해드리는 이 연구는 다양한 AI 에이전트로 구성된 팀이 단일 AI보다 더 나은 성과를 낼 수 있는지 조사했습니다. 딥마인드는 체스에서 이를 검증하며, 알파제로(AZ)를 확장하여 AZ_db라는 시스템을 개발했습니다. 아이디어를 생성하며, 가장 유망한 아이디어를 선택합 실험 결과, AZ_db는 AZ보다 더 많은 퍼즐을 해결하며 더 나은 성과를 보였다는데요! 이 연구는 AI 에이전트 팀에서도 다양성이 중요하며 문제 해결에 큰 자산이 될 수 있음을 보여주는 것 같아요~ 현재까지 대부분의 모델들은 앙상블 기법으로 문제를 해결했지만 이번 방법론은 최초로 팀 시스템을 도입했기에 앞으로 더 좋은 연구가 많이 나올 것 같네요!

📍올 여름 마지막 기회! 놓치지 마세요.
AI학교 아이펠 모집 마감 임박 → https://bit.ly/3OX29fF

4
0