윤현묵

윤현묵님의 아티클

윤현묵

윤현묵

[231102] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

안녕하세요, 모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다. 

  1. LoRAShear: 마이크로소프트의 효율적 LLM 크기 축소 기술

마이크로소프트는 계산 비용 문제를 해결하기 위해 LLM의 크기를 효율적으로 줄이는 LoRAShear 방식을 소개했습니다. LoRAShear는 LLM의 의존성 그래프를 생성하여 필요 최소한의 구조를 제거하고, 중복된 정보를 보존하면서 내재된 지식을 전송하는 방법으로 구조적 가지치기를 실행합니다. 손실된 지식 복구를 위한 동적 미세조정 기법이 포함되어 있으며, 이를 통해 LLM의 크기를 20% 줄이면서 1.0%의 성능 저하만을 겪었고, 다른 최신 기술보다 뛰어난 성능을 보였습니다.

https://huggingface.co/papers/2310.18356

  1. MM-VID: 복잡한 비디오 이해를 위한 멀티모달 시스템

MM-VID는 GPT-4V와 다양한 전문 도구를 결합하여 복잡한 비디오 이해를 돕는 시스템입니다. 이는 긴 비디오와 복잡한 스토리라인을 처리하기 위해 설계되었습니다. MM-VID는 비디오의 멀티모달 요소를 긴 텍스트 스크립트로 변환하며, 이 스크립트는 캐릭터의 움직임, 표정, 대화 등을 자세히 설명합니다. 이를 통해 LLM이 비디오 내용을 깊게 이해하게 되며, 오디오 설명, 캐릭터 식별 등의 고급 기능을 제공합니다. 실험은 MM-VID의 효과성과 인터랙티브 환경에서의 잠재력을 확인하였습니다.

https://huggingface.co/papers/2310.19773

  1. 0xide의 상용 클라우드 컴퓨터 

Oxide는 세계 최초의 상용 클라우드 컴퓨터를 발표하고 44백만 달러의 시리즈 A 투자를 유치했습니다. 이 회사는 클라우드 컴퓨팅이 모든 컴퓨팅 인프라의 미래라고 믿으며, 클라우드 컴퓨터는 구매가 가능해야 하며, 랙 수준의 설계와 하드웨어 및 소프트웨어의 공동 설계가 필요하다고 주장합니다. Oxide의 클라우드 컴퓨터는 전통적인 방식과 다르게 단순화된 설치 및 운영을 제공하며, 그들의 소프트웨어는 모두 오픈 소스로 제공됩니다. 이제 이 제품은 일반적으로 구매 가능하며 관심이 있는 사람들은 Oxide에 연락할 수 있습니다.

https://oxide.computer/blog/the-cloud-computer

  1. Turbot: 200개 이상의 오픈소스 리포지토리를 관리하는 방법

Turbot의 Steampipe는 여러 오픈소스 저장소를 가진 프로젝트로, 많은 저장소를 관리하려면 기술적 엄격함과 인간적 연결이 필요했습니다. Turbot는 커뮤니티에 중점을 둔 엔지니어링 실무를 결합합니다. 중요한 교훈으로는 빠른 응답을 유지하는 것, 초기 커뮤니케이션의 중요성, 기여자를 팀원처럼 대하는 것, 오래된 보고서로 진솔함을 유지하는 것, 지속적으로 문제를 해결하는 필요성, 일관성을 유지하는 것, 그리고 문서화의 중요성 등이 있습니다. 오픈소스 프로젝트가 번성하려면 사용자와 기여자의 참여가 필요하며, Steampipe는 기술과 인간의 연결을 통해 이를 달성하려고 노력하고 있습니다.

https://news.hada.io/topic?id=11610

—

🥇K-디지털 트레이닝 기관 최초 '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기 → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

7
1
윤현묵

윤현묵

[231101] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다. 

11월의 첫 출근길, SW/AI 뉴스 시작할게요!🙌

1.CodeFusion: 확산 기반 코드 생성을 위한 사전 학습된 모델

코드 작성 시 마지막 줄만 수정할 수 있는 개발자는 자주 처음부터 코드를 다시 작성해야 합니다. 이와 유사한 한계를 가진 자동 회귀 모델은 이전에 생성된 토큰을 쉽게 수정할 수 없습니다. 이 문제를 해결하기 위해, 인코딩된 자연어를 기반으로 한 CodeFusion이라는 사전 학습된 확산 코드 생성 모델을 제시합니다. CodeFusion은 Bash, Python, Microsoft Excel의 자연어로부터 코드 생성 작업에서 효과적이었으며, 최첨단 자동 회귀 시스템과 동등하거나 더 나은 성능을 보였습니다.

https://huggingface.co/papers/2310.17680

2.FP8: 저비트 형식을 활용한 대규모 언어 모델 학습의 효율화

이 논문은 대규모 언어 모델(LLM)의 효율적 학습을 위해 FP8 저비트 데이터 형식을 탐구합니다. LLM 학습 시 기울기나 최적화 상태와 같은 변수들이 저정밀 데이터 형식을 사용해도 모델의 정확도에 큰 영향을 미치지 않는다는 인사이트에 기반하여 FP8 자동 혼합 정밀도 프레임워크를 제안합니다. 이 방법은 8비트 그라디언트, 최적화 상태 및 분산 학습을 통합합니다. 실험적으로, H100 GPU에서 GPT-175B 모델 학습 시 이 프레임워크는 메모리 사용량을 42% 감소시키고 BF16 프레임워크보다 64% 더 빠르게 실행되었습니다. 이 방법은 대규모 파운데이션 모델 학습 비용을 줄이는 데 도움이 될 뿐만 아니라 다른 작업에도 적용 가능하여 미세 조정 비용 절감에도 기여할 수 있습니다.

https://huggingface.co/papers/2310.18313

3.스택 오버플로: 개발자의 79% 가 새로운 직업 고민

스택 오버플로우의 설문 조사에 따르면, 전 세계의 1,000명 이상의 개발자들 중 79%가 새로운 직업 기회를 찾거나 고려 중이며, 이는 이전보다 큰 증가를 보이며 새로운 경력과 도전에 더 관심이 있는 추세를 나타냅니다. 특히 신입과 후반 경력 개발자들 사이에 이직 경향이 높아지고 있으며, 이로 인해 제조 및 금융 서비스 분야에 숙련된 개발자들이 유입되고 있습니다. 개발자들은 더 나은 급여뿐만 아니라 호기심, 유연성을 중요하게 여기며, AI의 부상으로 생산성 향상을 위해 AI 도구를 사용하고 있으나, 학습에 대한 중요성은 감소하는 경향을 보입니다. 따라서 기업들은 경쟁적인 인재 유지를 위해 경쟁력 있는 급여와 유연성을 제공해야 할 것으로 보입니다.

https://www.developer-tech.com/news/2023/oct/30/stack-overflow-79-of-developers-considering-new-horizons/

4.임베딩: 임베딩이란 무엇이며 왜 중요한가

임베딩(Embeddings)은 낯선 용어와 함께 나오지만, 강력하고 흥미로운 기술입니다. 콘텐츠를 숫자 배열로 변환하는 기술로, 배열은 항상 일정한 길이를 가지며 이것은 임베딩 모델에 따라 정해집니다. 이 배열은 다차원 공간의 좌표처럼 생각할 수 있으며, 해당 위치는 콘텐츠의 의미를 나타냅니다. 임베딩을 사용하면 콘텐츠의 의미를 모델의 이해로 표현하고, 그 위치를 기반으로 다른 콘텐츠와 관련된 유용한 정보를 얻을 수 있습니다. 이러한 기술은 다양한 실제 문제에 적용될 수 있으며 중요한 역할을 합니다.

https://news.hada.io/topic?id=11593

🥇K-디지털 트레이닝 기관 최초 '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기 → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

5
0
윤현묵

윤현묵

[231031] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다. 10월의 마지막이네요, 오늘도 화요팅!👍

1.GPT-4V 성능 평가: 시각적 및 언어 이해의 장단점 분석

이 논문은 GPT-4V의 다양한 능력, 특히 시각적 이해와 언어 이해에 대한 성능을 평가합니다. 656개의 테스트 인스턴스를 통해 주요 결과를 도출했는데, GPT-4V는 영어 이미지 벤치마크에서 좋은 성능을 보이지만 중국어 텍스트 인식에는 실패했습니다. 또한 민감한 특성과 관련된 질문에서 일관되지 않은 반응을 보였으며, GPT-4(API)에 비해 언어 이해 성능이 떨어진다는 결과가 나왔습니다. 그러나 프롬프트를 통해 성능을 향상시킬 수 있으며, 비디오나 열화상과 같은 다른 형식에서는 큰 성능을 보이지 않았습니다. 이 연구는 GPT-4V의 장단점을 규명하며 향후 연구의 방향성을 제시합니다.

https://huggingface.co/papers/2310.16534

2.JudgeLM: 개방형 시나리오에서 대규모 언어 모델의 최적화된 판정 방법론

개방형 시나리오에서 대규모 언어 모델(LLM)을 평가하기 위한 새로운 방법으로 JudgeLM을 제안합니다. 이를 위해 대규모 고품질 데이터 세트와 벤치마크를 활용해 판정자를 미세 조정하고, 다양한 규모의 판정자를 학습시킨 뒤 분석합니다. 주요 편향들은 직위 편향, 지식 편향, 형식 편향으로 구분되며, 이를 개선하기 위한 다양한 기술이 도입됩니다. 결과적으로 JudgeLM은 최첨단의 판정 성능을 보이며, 매우 효율적입니다. 특히, 교사 판정자와의 일치율은 90% 이상으로, 인간의 일치율을 능가합니다. JudgeLM은 다양한 시나리오에서의 판정 능력을 갖추고 있습니다.

https://huggingface.co/papers/2310.17631

3.Kubernetes ingress2gateway 소개

Kubernetes의 네트워킹 세계에서 Ingress API는 서비스에 외부 접근을 관리하는 주요 도구였습니다. 그러나 Ingress는 여러 제한 사항이 있어 복잡한 애플리케이션과 증가하는 Kubernetes 클러스터의 요구 사항을 충족시키기 어려워졌습니다. 이를 극복하기 위해 Gateway API가 설계되었습니다. Gateway API는 트래픽 관리를 더 유연하고 확장 가능하게 만들며, 역할 지향적 접근법, 이식성, 표현력 및 확장성의 네 가지 핵심 원칙을 기반으로합니다. Gateway API는 곧 일반 사용 가능(GA) 릴리스를 앞두고 있으며, Kubernetes 1.24 이상 버전에서 지원합니다.

https://kubernetes.io/blog/2023/10/25/introducing-ingress2gateway/

4.백엔드를 Vercel에서 http://Fly.io로 마이그레이션 경험 공유

백엔드를 http://Fly.io로 변경한 이유와 이동 중에 겪었던 도전과제에 대해 설명합니다. Vercel에서 벗어나려는 주된 이유는 경량화된 서버 필요성과 가격 문제였습니다. Vercel은 비용 예측이 어려웠지만, http://Fly.io는 훨씬 저렴하게 서비스를 운영할 수 있었습니다. 그러나 이전 중에 Docker 이미지 크기, Fly 배포 시간 초과, 런타임 초과와 관련된 문제 등 여러 도전과제에 직면했습니다. 결론적으로, http://Fly.io로의 이전은 만족스러웠지만 도전적인 시간도 있었습니다. Vercel은 여전히 프론트엔드에 사용하고 있습니다.

https://www.openstatus.dev/blog/migration-backend-from-vercel-to-fly

🥇K-디지털 트레이닝 기관 최초 '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기(조기마감 예상) → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

6
0
윤현묵

윤현묵

[231030] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

안녕하세요~ 즐거운 월요일입니다 :)

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다.

1.드림크래프트3D': 2D 레퍼런스를 활용한 고충실도 3D 오브젝트 생성 혁신

드림크래프트3D는 고충실도의 일관된 3D 오브젝트 생성을 위한 계층적 방법을 제시합니다. 2D 레퍼런스 이미지를 활용해 지오메트리와 텍스처의 부스팅을 달성합니다. 뷰 종속 확산 모델을 사용하여 지오메트리의 일관성 문제를 해결하고, 부트스트랩 스코어 증류로 텍스처 향상을 목표로 합니다. 이 방법은 씬의 3D 지식을 통해 확산 모델을 최적화하며, 번갈아 최적화하여 3D 씬과 확산 모델 간의 상호 개선 효과를 창출합니다. 드림크래프트3D는 3D 콘텐츠 생성의 기술을 혁신적으로 발전시킵니다.

https://huggingface.co/papers/2310.16818

2.딥마인드의 대규모 데이터에서의 ConvNet 성능 평가: Vision Transformer와의 경쟁

대부분의 연구자들은 ConvNet이 소규모 또는 중간 크기의 데이터 세트에서만 잘 작동하며, 웹 규모의 데이터에서는 비전 트랜스포머에 미치지 못한다고 생각합니다. 그러나 딥마인드는 대규모 데이터 세트인 JFT-4B에서 ConvNet 아키텍처의 성능을 평가하며 이 믿음에 도전합니다. NFNet 모델 제품군을 다양한 컴퓨팅 예산과 네트워크 크기로 훈련시켰을 때, 비전 트랜스포머의 성능과 유사한 결과를 보입니다. 특히, 가장 효과적인 모델은 ImageNet에서 90.4%의 정확도를 보여줍니다.

https://huggingface.co/papers/2310.16764

3.Next.js 14 릴리즈

Next.js 14 버전이 공개되었습니다. 이번 버전에서는 Turbopack을 도입하여 로컬 서버 시작 시간을 최대 53.3% 단축하고, 코드 업데이트 속도도 최대 94.7% 향상시켰습니다. 'Server Actions' 기능이 안정화되어, 직관적인 데이터 변조와 향상된 사용자 경험을 제공합니다. 'Partial Prerendering' 기능의 프리뷰를 통해 초기 정적 응답과 동적 컨텐츠 스트리밍이 가능하게 되었습니다. 또한, Next.js 학습 코스가 새롭게 제공되어, 다양한 내용을 자세히 학습할 수 있게 되었습니다.

https://nextjs.org/blog/next-14

4.S3 랜섬웨어를 식별하고 대처하는 방법

디지털 환경에서 약 60%의 기업 데이터가 클라우드에 있으며, Amazon S3는 많은 기업의 데이터 저장의 핵심입니다. 그러나 S3는 중요한 데이터를 다루기 때문에 위협 요인에 노출될 수 있습니다. 효과적인 대응을 위해 S3 환경의 가시성을 확보하고 위협 시나리오를 이해하며, 보호 및 모범 사례를 적용해야 합니다. CloudTrail 및 서버 접근 로그를 사용하여 활동을 로깅하고, IAM 역할 및 S3 버전 관리와 같은 방법으로 보안을 강화할 수 있습니다. S3를 안전하게 보호하는 것은 랜섬웨어 공격과 지속적으로 발전하는 사이버 위협을 대비하는 데 중요합니다.

https://thehackernews.com/2023/10/the-rise-of-s3-ransomware-how-to.html

—

🥇K-디지털 트레이닝 기관 최초 '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기(조기마감 예상) → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

8
0
윤현묵

윤현묵

[231026] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다.

1.VLM의 시각적 오류 분석: HallusionBench를 이용한 접근법

대규모 언어 모델(LLM)은 비전-언어 모델(VLM)로 통합되어 이미지 추론에서 큰 개선을 가져왔습니다. 그러나 VLM은 이미지 컨텍스트 대신 선행 언어에 의존할 수 있으며, 비전 모듈의 약점으로 인해 잘못된 시각적 표현을 생성할 수 있습니다. 이러한 문제를 연구하기 위해 본 연구진은 HallusionBench 벤치마크를 도입하여 VLM의 실수와 개선 방법에 대한 새로운 인사이트를 제공합니다.

https://huggingface.co/papers/2310.14566

2.마트료시카 확산 모델을 활용한 고해상도 이미지 및 비디오 생성

확산 모델은 이미지와 비디오 생성에 유용하지만, 고차원 모델 학습은 여전히 어렵습니다. 본 연구에서는 마트료시카 확산 모델(MDM)을 도입하여 고해상도 이미지와 비디오 합성을 향상시킵니다. MDM은 여러 해상도의 입력을 처리하며, 저해상도에서 고해상도로 점진적인 학습이 가능하게 합니다. 이 방법은 다양한 벤치마크에서 효과적임이 입증되었으며, 최대 1024x1024픽셀 해상도의 이미지 생성과 강력한 제로샷 일반화 능력을 보여줍니다.

https://huggingface.co/papers/2310.15111

3.굿바이, Node.js Buffer

Node.js에서 'Buffer' 타입은 바이너리 데이터 처리의 핵심이었습니다. 그러나 지금은 'Uint8Array'라는 크로스플랫폼 자바스크립트 타입이 있습니다. Buffer는 Uint8Array의 확장 형태이지만 특정 메서드가 추가되어 브라우저와의 호환성에 문제가 있습니다. Buffer의 'slice' 메서드는 변경 가능한 세그먼트를 생성하는 반면, Uint8Array의 'slice'는 변경 불가능한 복사본을 생성합니다. 이 차이로 인해 예측하기 어려운 동작이 발생할 수 있습니다. 따라서, 안전하게 사용하기 위해서는 'Uint8Array'를 권장하며, Buffer의 특정 메서드 사용을 지양하는 것이 좋습니다.

https://sindresorhus.com/blog/goodbye-nodejs-buffer

4.Uber가 수천개의 마이크로서비스를 멀티 클라우드 플랫폼으로 이전한 방법

매주 Uber에서는 4,500명의 엔지니어와 자율 시스템을 통해 4,000개 이상의 마이크로서비스를 10만 번 이상 배포합니다. 이 서비스들은 전 세계의 수백 개의 팀에 의해 독립적으로 관리되며, 규모와 기능이 다양합니다. 그러나 이러한 서비스들은 공통된 특성을 가지고 있어 배포, 용량 관리 등 여러 측면에서 통합 및 간소화가 가능했습니다. 이 글은 그러한 통합 과정과 효율성에 대해 다룹니다.

https://news.hada.io/topic?id=11498

—

🥇K-디지털 트레이닝 기관 최초 '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기(조기마감 예상) → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

4
0
윤현묵

윤현묵

[231025] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다.

1.오픈 소스 LLM 에코시스템의 도입: h2oGPT와 H2O LLM Studio로 향상된 AI의 신뢰성 추구

대규모 언어 모델(LLM)은 AI 분야에서 혁명적인 변화를 가져왔으나, 편향과 유해한 텍스트 같은 위험 요소도 동반됩니다. 이를 해결하기 위해, 저희는 오픈 소스 LLM 에코시스템을 선보이며, 개방형 대안을 제공하려는 목적으로 h2oGPT 제품군과 H2O LLM Studio를 출시합니다. 이들은 Apache 2.0 라이선스 하에 완전 허용형으로 제공되며, H2O는 이러한 오픈 소스 모델이 AI의 발전과 신뢰성 향상에 기여할 것으로 믿습니다.

https://huggingface.co/papers/2310.13012

2.제너레이티브 AI의 윤리적·사회적 위험 평가: 계층적 프레임워크 및 접근 방식 소개

제너레이티브 AI 시스템은 다양한 분야에서 활용되고 있으나, 윤리적과 사회적 위험을 신중하게 고려해야 합니다. 새로운 백서에서는 AI의 사회적, 윤리적 위험을 평가하기 위한 세 가지 계층적 프레임워크를 제시하며, 현재의 안전성 평가의 격차를 지적합니다. 이를 보완하기 위한 다양한 평가 방법론과 접근 방식을 제안하며, AI의 안전성 평가에는 사회적 및 기술적 문제 모두를 고려해야 함을 강조합니다. 이러한 평가는 잘못된 정보 확산과 같은 실제 문제를 식별하고 대응할 수 있게 돕습니다.

https://www.deepmind.com/blog/evaluating-social-and-ethical-risks-from-generative-ai

3.Yarn 4.0 릴리즈

Yarn 4.x 버전이 1년 이상의 작업 끝에 공식적으로 출시되었습니다. 이번 버전에서는 Node.js 18+를 필요로 하며, 새 프로젝트에서는 Zero-Install이 기본적으로 활성화되지 않습니다. Corepack이라는 새로운 프로젝트를 통해 패키지 관리자의 설치와 사용이 더 간편해졌습니다. 또한, 보안을 강화한 'Hardened Mode'와 자바스크립트 기반의 제약 엔진이 도입되었습니다. 사용자 인터페이스의 개선, 성능 향상, 웹사이트의 새로운 디자인과 기능도 추가되었습니다. Yarn 4는 사용자 경험 개선과 학습 곡선 감소를 목표로 개발되었으며, 앞으로도 다양한 업데이트와 기능 개선이 계획되어 있습니다.

https://yarnpkg.com/blog/release/4.0

4.MSW 2.0 소개

MSW(Mock Service Worker)는 패키지에 처음 추가된 지 5년이 되었습니다. 2.0 버전은 MSW에 대한 중요한 업데이트로, Fetch API 프리미티브 지원과 관련된 많은 변경 사항을 포함하고 있습니다. 이전에는 기능적으로는 효과적이었지만 실제 웹 응답에 대한 교육적 가치가 떨어졌습니다. 2.0 버전에서는 Fetch API를 기반으로 요청과 응답을 표현하며, 이로 인해 개발자는 표준 JavaScript API를 사용하여 요청 핸들러를 작성할 수 있게 되었습니다. 이 업데이트에는 다양한 버그 수정 및 기능 향상이 포함되어 있습니다. MSW는 API 모의 솔루션으로 널리 사용되며, 지속적인 발전을 위해 프로젝트 후원을 부탁하고 있습니다.

https://mswjs.io/blog/introducing-msw-2.0/

—

🥇K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기 → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

7
0
윤현묵

윤현묵

[231024] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

안녕하세요~ 선선한 화요일입니다. 환절기 감기 조심하시고 뉴스 볼게요~

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다. 

  1. 3D-GPT: LLM 기반의 절차적 3D 모델링 프레임워크 소개

절차적 생성이 효율적인 자동화된 콘텐츠 생성을 위한 유망한 방법으로 각광받는 가운데 이 논문은 LLM을 활용한 3D 모델링 프레임워크인 3D-GPT를 소개하였습니다. 3D-GPT는 세 가지 핵심 에이전트를 통해 텍스트 지침을 기반으로 3D 모델링 작업을 분해 및 실행합니다. 이 시스템은 초기 장면 설명을 세부적으로 발전시키며, 텍스트에서 파라미터 값을 추출하여 3D 모델링 소프트웨어와 연동합니다. 실제 테스트를 통해 3D-GPT가 신뢰성 있게 작동하며, 인간 디자이너와 협업 가능하다는 것을 확인하였고, 블렌더와도 원활하게 호환됩니다. 이 연구는 LLM이 3D 모델링에서 큰 잠재력을 가지며, 이를 기반으로 하는 씬 생성 및 애니메이션에도 기여할 것임을 시사합니다.

https://huggingface.co/papers/2310.12945

  1. 인간 피드백을 활용한 안전한 강화 학습: Safe RLHF의 소개 및 적용

LLM의 발전으로 AI의 성능과 안전성 간의 균형 유지가 중요해지고 있으며, 유용성과 무해성의 목표 간의 긴장감은 큰 도전이 되고 있습니다. 이를 해결하기 위해 논문 저자들은 '인간 피드백을 통한 안전한 강화 학습(Safe RLHF)' 알고리즘을 도입하였습니다. Safe RLHF는 인간의 선호도를 명확하게 구분하여, 보상과 비용 모델을 독립적으로 학습시킵니다. 이 알고리즘은 라그랑지안 방법을 사용하여 두 목표 간의 균형을 미세 조정 중에 조절하며, 세 차례의 실험을 통해 기존 방법보다 우월한 성능과 안전성을 보였습니다. 특히, Safe RLHF를 사용하여 미세 조정된 알파카-7B는 사람의 평가에 따라 향상된 유용성과 무해성을 보였습니다.

https://huggingface.co/papers/2310.12773

  1. v0: 생성형 UI 발표

v0 생성형 UI 제품 소개입니다. 웹사이트 제작을 설명만으로 단순화시키는 제품으로, 프론트 개발과 인공 지능의 잠재력을 결합했습니다. v0에 대한 관심은 놀라운 수준으로, 3주 만에 100,000명이 대기 목록에 등록했습니다. 오늘, v0는 알파에서 베타로 전환되며 5,000명의 추가 사용자에게 접근을 제공하고, v0의 전체 기능을 이용하려는 사용자들을 위한 구독 플랜을 소개합니다. v0는 무료 플랜과 세 가지 유료 플랜을 제공하며, 각 세대는 크레딧으로 결제됩니다. 앞으로 더 많은 기능이 추가될 예정입니다.

https://vercel.com/blog/announcing-v0-generative-ui

  1. 2023년 최고의 React 기술 스택

2023년 프론트 개발자들을 위한 최적의 React 기술 스택을 정해보았습니다. 이 기술 스택에는 React, Next.js, Tailwind CSS, Prisma, Vercel 등이 포함됩니다. 이들은 학습하기 쉽고 사용하기 편리하며, 확장 가능한 제품을 지원하기에 충분히 강력합니다. 특히 Vercel은 Next.js 애플리케이션 호스팅을 위한 무료 계층을 제공합니다. 기술 스택을 선택할 때 간결함을 중점적으로 고려하고, 매니지드 서비스를 활용하며, 다양한 라이브러리와 프레임워크를 실험하는 것을 두려워하지 않아야 합니다.

https://www.reactremotejobs.com/the-best-react-tech-stack-for-indie-hackers-in-2023

🥇K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 커뮤니티형 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기 → https://bit.ly/3tmITjj

☑️ 쫓기지 않고 이끄는 6개월 AI 첫걸음 <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

5
0
윤현묵

윤현묵

[231023] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

모두의연구소는 지식을 나누며 함께 성장하는 국내 최대 AI 커뮤니티입니다.

1.자기 반성적 검색 증강 생성(Self-RAG): 적응적 검색과 통합을 위한 새로운 프레임워크

대규모 언어 모델(LLM)은 때로 부정확한 응답을 생성하지만, 검색 증강 생성(RAG) 방식으로 이를 개선할 수 있습니다. 그러나 기존 방식은 항상 고정된 수의 검색 구절을 사용하여 문제점이 있습니다. 이를 해결하기 위해 저희는 자기 반성적 검색 증강 생성(Self-RAG) 프레임워크를 제안합니다. 이는 필요에 따라 적응적으로 구절을 검색하고, 리플렉션 토큰을 활용하여 검색 결과와 자체 생성물을 통합합니다. 이 방법은 다양한 작업에서 기존 LLM 및 검색 증강 모델보다 우수한 성능을 보이며, 특히 사실 확인과 인용 정확도에 있어 큰 이점을 제공합니다.

https://huggingface.co/papers/2310.11511

2.Progressive3D: 점진적 편집을 통한 복잡한 텍스트-3D 콘텐츠 생성

최근의 텍스트-3D 생성 방법은 뛰어난 성능을 보이지만, 복잡한 프롬프트에 대한 3D 콘텐츠 생성이 어렵습니다. 이 문제를 해결하기 위해 본 연구에서는 Progressive3D라는 프레임워크를 도입하여 전체 3D 콘텐츠 생성 과정을 점진적인 편집 단계로 나누고, 각 단계에서 사용자가 지정한 영역만을 편집하도록 설계하였습니다. 중복 시맨틱 컴포넌트를 줄이는 기법도 도입하여 최적화의 효율성을 높였습니다. 실험 결과, Progressive3D는 복잡한 프롬프트에 대해 정확한 3D 콘텐츠를 생성하며, 다양한 텍스트-3D 방식에도 효과적임을 확인하였습니다.

https://huggingface.co/papers/2310.11784

3.Node.js 21.0.0 릴리즈

Node.js 21 버전이 출시되었습니다. 주요 업데이트로는 V8 자바스크립트 엔진의 11.8 버전 업데이트, 안정적인 fetch와 WebStreams, 새로운 실험적인 모듈 기본값 전환 플래그, 내장 WebSocket 클라이언트, 테스트 러너의 다양한 업데이트 등이 포함되어 있습니다. Node.js 20 버전이 장기 지원(LTS) 상태로 들어가면서, Node.js 21은 2024년 4월까지 '현재' 릴리즈 버전으로 지정될 예정입니다. 또한, V8 엔진, WebSocket, ESM 모듈 등에 다양한 변경사항과 기능 개선이 있습니다. 이 외에도 성능 향상과 관련된 여러 업데이트가 이루어졌습니다. 자세한 내용은 Node.js 공식 웹사이트에서 확인하실 수 있습니다.

https://nodejs.org/ko/blog/announcements/v21-release-announce

4.풀스택 개발자의 의미와 그 가치

"풀스택"이란 기술 분야에서 주로 사용되는 용어로, 하나의 분야에 대해 전반적으로 잘 아는 사람을 의미합니다. 풀스택 엔지니어는 기술 분야의 만능자로 볼 수 있으며, 창작자 경제의 성장과 함께 다양한 분야에서도 풀스택이라는 용어가 사용되기 시작했습니다. 풀스택이 되면 창업자, 직원, 창작자로서 더 능숙하게 활동할 수 있습니다. 풀스택은 특정 분야의 전문가가 되는 것만큼 중요하며, 이를 통해 스스로에게 더 큰 자유와 흐름을 느낄 수 있습니다. 풀스택의 개념은 전문적인 응용에서 뿐만 아니라 일상에서도 중요한 삶의 철학이 될 수 있습니다.

https://anuatluru.com/blog/fullstacksomething

🥇K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ 23년 경력 MS MVP 강창훈 주강사 직강! <자바스크립트 웹 풀스택> 1기 지원하기 → https://bit.ly/3tmITjj

☑️ AI/딥러닝을 6개월 동안 심도 있게! <AI학교 아이펠> 8기 지원하기 → https://bit.ly/44cSNkr

3
0
윤현묵

윤현묵

[231020] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

안녕하세요~ 즐거운 금요일입니다. 하루 더 파이팅 하시고, 불금 보내시죠
모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.

1.BitNet: 1비트 트랜스포머를 통한 대규모 언어 모델의 효율적 확장

대규모 언어 모델의 크기 증가에 따른 배포와 환경 문제를 해결하기 위해 BitNet이라는 확장 가능하고 안정적인 1비트 트랜스포머 아키텍처를 제안합니다. BitLinear를 도입하여 1비트 가중치 학습이 가능하게 했습니다. 실험 결과 BitNet은 메모리와 에너지 사용량을 줄이면서도 높은 성능을 보였고, 이는 대규모 언어 모델을 효과적으로 확장할 수 있는 새로운 방법을 제시한다는 것을 의미합니다

https://huggingface.co/papers/2310.11453

2.4K 4D: 실시간 4K 해상도의 동적 3D 장면 뷰 합성을 위한 4D 포인트 클라우드 방식

이 논문은 4K 해상도에서 동적 3D 장면의 실시간 뷰 합성을 목표로 4D 포인트 클라우드 표현인 4K 4D를 제안합니다. 이 표현은 속도와 품질을 극대화하기 위한 하드웨어 래스터화와 하이브리드 외형 모델을 사용하며, 차별화 가능한 깊이 필링 알고리즘을 통해 RGB 비디오에서 모델 학습이 가능하게 했습니다. RTX 4090 GPU를 사용하면 1080p 해상도에서 400 FPS 이상, 4K 해상도에서 80 FPS로 렌더링 가능하며, 기존 방법에 비해 30배 이상 빠르게 최첨단 렌더링 품질을 달성했습니다.

https://huggingface.co/papers/2310.11448

3.인기 지수에서 Java를 추월 중인 C#

TIOBE 지수에 따르면, C#과 Java의 인기 차이가 1.2%로 줄었으며, 이런 추세가 계속된다면 C#이 2개월 후 Java를 넘을 것으로 예상됩니다. 최근 조사에서 Java의 인기 하락의 주된 원인으로 오라클의 유료 라이선스 도입과 코틀린의 무료 제공이 영향을 미쳤다고 평가되었습니다. 반면, Microsoft는 C#을 무료 오픈 소스로 제공하며 개방성을 강화하였습니다. TIOBE 는 이 지수를 통해 프로그래밍 언어의 인기를 측정하며, 개발 전략 결정에 도움을 제공한다고 설명하였습니다.

https://visualstudiomagazine.com/articles/2023/10/17/tiobe-oct23.aspx?m=1

4.Jetbrains, Writerside 공개

Jetbrains 회사는 통합 문서 편집 도구 Writerside 제품을 공개하였습니다. Writerside 제품은 강력한 개발 환경을 제공하여 문서 작성, 테스트, 빌드, 게시가 용이합니다. 내장된 Git UI, 통합 빌드 도구와 자동화된 테스트를 통해 효과적인 문서 작성이 가능하며, Markdown과 XML의 장점을 결합하여 다양한 형식의 콘텐츠를 제작할 수 있습니다. 실시간 검사와 미리보기를 통해 문서의 품질을 보장하며, REST API 문서 생성 기능도 통합되어 있어 문서 작성의 효율성을 높입니다.

https://www.jetbrains.com/ko-kr/writerside/



🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ 오늘까지만! AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️
SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 1기 지원하기  → https://bit.ly/3tmITjj

6
0
윤현묵

윤현묵

[231019] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

안녕하세요~ 모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 

1.인컨텍스트 사전 학습: 연속된 문서 간 관계를 고려한 대규모 언어 모델 학습

대규모 언어 모델은 문서 완성을 위한 긴 형식의 생성에 능숙합니다. 현재의 모델은 짧은 문서 세트를 무작위로 연결하여 학습하지만, 연속된 문서 간의 관계를 고려하지 않습니다. 이를 해결하기 위해, 문서들이 서로 관련성을 가질 수 있게 "인컨텍스트 사전 학습" 방식을 제안합니다. 이 방식은 관련된 문서들의 순서를 재조정하여 학습에 이용합니다. 수십억 개의 문서를 효과적으로 정렬하기 위해 효율적인 최인접 이웃 검색 및 그래프 순회 알고리즘을 사용합니다. 결과적으로 인컨텍스트 학습은 복잡한 문맥 추론 작업에서 언어 모델의 성능을 크게 향상시키는 것으로 나타났습니다.

https://huggingface.co/papers/2310.10638

2.Llemma: Proof-Pile-2 데이터와 Code Llama 기반으로 한 대규모 수학 언어 모델

Llemma는 수학 전용의 대규모 언어 모델로, 과학 논문, 웹 데이터, 수학 코드를 포함한 Proof-Pile-2에서 학습된 Code Llama를 기반으로 만들어졌습니다. 이 모델은 MATH 벤치마크에서 기존 모델과 미출시된 미네르바 모델을 능가하는 성능을 보여주었습니다. 또한, 미세 조정 없이도 수학적 정리의 증명과 도구 사용이 가능하다는 특징이 있습니다. 70억 개와 340억 개의 매개변수를 가진 모델과 관련 코드 및 자료를 공개하였습니다.

https://huggingface.co/papers/2310.10631

3.개발자를 위한 5가지 Git 모범 사례

웹 개발의 빠른 환경에서 Git은 중요한 역할을 합니다. 변화를 추적하며 협업을 촉진하고 CI/CD 워크플로우에 따라 안정적인 업데이트를 제공합니다. Git은 다양한 사용 방식을 제공하는 훌륭한 도구이지만, 팀 작업시 모범 사례를 따르는 것이 중요합니다. 이 글에서는 Git의 덜 알려진 기능과 개발자가 따라야 할 5가지 모범 사례를 소개합니다.

https://deploybot.com/blog/5-git-best-practices-for-developers

4.상위 1% 엔지니어의 7가지 습관

FAANG(Facebook, Apple, Amazon, Netflix, Google) 과 같은 기업에서 일하면서, 성공한 엔지니어의 코드에서 공통된 습관이 있다는 것을 발견하였습니다. ‘코더가 아닌 엔지니어가 되라’, ‘코드는 컴퓨터만 위한 것이 아니라 인간을 위한 것입니다’, ‘코드 자체에서 벗어나기’, ‘일관된 표준 사용’, ‘간단한 코드 작성’, ‘예상치 못한 결과 허용하지 않기’, ‘자주 소통하기’ 등 최고의 엔지니어에게 발견된 패턴들과 규칙을 설명하였습니다. 

https://news.hada.io/topic?id=11362

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ [D-1] AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️
SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 1기 지원하기  → https://bit.ly/3tmITjj

5
0
윤현묵

윤현묵

[231018] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 오늘의 뉴스 시작해 볼까요?

1.TableGPT: 2D 관계형 테이블 이해를 위한 언어 모델 최적화 방안

GPT-3.5와 ChatGPT 같은 언어 모델은 다양한 작업 수행 능력을 갖추고 있지만, 2차원의 관계형 테이블 이해에는 한계가 있습니다. 이를 해결하기 위해 본 연구에서는 "테이블 튜닝"이라는 패러다임을 도입하여 언어 모델을 실제 테이블 데이터로 지속적으로 학습/미세 조정하였습니다. 이러한 접근법은 GPT-3.5 및 ChatGPT의 기존 성능을 뛰어넘는 테이블 이해 능력과 새로운 테이블 작업에 대한 강력한 일반화 능력을 보여줍니다.

https://huggingface.co/papers/2310.09263

2.LoftQ: 양자화와 LoRA 미세 조정을 위한 통합 프레임워크

양자화는 대규모 언어 모델(LLM) 서비스와 LoRA 미세 조정에서 중요한 역할을 합니다. 본 연구는 사전 학습된 모델에서 양자화와 LoRA 미세 조정을 동시에 적용하는 시나리오를 탐구하며, 이를 위해 새로운 양자화 프레임워크인 LoftQ를 제안합니다. LoftQ는 양자화된 모델의 불일치를 줄이고 일반화 능력을 향상시키기 위해 적절한 초기화를 제공합니다. 실험에서는 LoftQ가 다양한 자연어 처리 작업에서 기존 방법보다 더 우수한 성능을 보였으며, 특히 2비트 및 2/4비트 혼합 정밀도에서 뛰어난 결과를 나타냈습니다.

https://huggingface.co/papers/2310.08659

3.ElectricSQL, local first 앱을 위해 Postgres와 SQLite 사이의 액티브-액티브 동기화를 가능하게 하는 새로운 기술 ElectricSQL은 Postgres 중심의 새로운 버전으로, 형상 기반 동기화 모델과 type-safe 데이터 접근 라이브러리를 탑재하고 있습니다. 이 플랫폼의 목표는 local-first 기능을 기존 시스템에 쉽게 도입할 수 있게 하는 것입니다. ElectricSQL은 로컬에서의 SQLite와 클라우드의 Postgres 사이에서 양방향 능동적 동기화를 제공합니다. 이를 통해 앱은 즉시 반응성을 보이며, 데이터는 실시간으로 동기화됩니다. 또한, 오픈소스로 제공되어 누구나 사용 가능하며, Postgres 데이터 모델과 호환성을 가지고 있어서 새 앱 개발뿐만 아니라 기존 앱에도 적용 가능합니다. ElectricSQL은 현대적인 앱을 위한 동기화 솔루션으로 강력한 도구를 제공합니다.

https://electric-sql.com/blog/2023/09/20/introducing-electricsql-v0.6

4.Docker 10주년 - 우리가 올바르게 한 3가지, 잘못한 3가지

Docker는 최근 10주년을 맞이했습니다. 전 도커 엔지니어 Sam Alba는 Docker의 성공과 실패에 대해 반성하며 이를 공유했습니다. 올바르게 한 것 중 하나는 세계를 변화시킬 것이라는 확신 아래 컨테이너 기술에 주력했던 것입니다. 또한, 개발자들의 필요에 초점을 맞추고, 커뮤니티 구축에 투자했습니다. 반면 잘못된 점으로는 커뮤니티와 비즈니스 사이의 균형을 잡지 못했던 것, 초기부터 팀 문화와 핵심 가치를 명확히 정하지 않았던 것, 그리고 컨테이너를 모든 문제의 해결책으로 본 것 등을 들 수 있습니다. Sam은 Docker의 여정을 통해 얻은 교훈을 바탕으로 다음 10년에 대한 비전을 세우고 있습니다.

https://thenewstack.io/docker-at-10-3-things-we-got-right-3-things-we-got-wrong/

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ [D-2] AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️
SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 1기 지원하기  → https://bit.ly/3tmITjj

5
0
윤현묵

윤현묵

[231017] 모두의연구소가 전하는 “모두를 위한 SW/AI 뉴스”

안녕하세요~ 모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 오늘의 뉴스 시작해 볼까요?

1️⃣ pFedBreD: 브레그먼 다이버전스를 활용한 최적화된 개인화 연합 학습 프레임워크

기존 연합 학습(FL)은 데이터 공유 없이 모델 학습이 가능하지만, 로컬 데이터의 이질성으로 인한 성능 저하가 문제였습니다. 이를 해결하기 위한 개인화된 FL(PFL)은 글로벌 모델에서 개인화된 모델을 생성하지만, 일부 정보를 놓칠 수 있습니다. 본 연구에서는 이러한 문제를 해결하기 위해 각 클라이언트의 글로벌 모델에 개인화된 사전 지식을 주입하는 방식, 즉 브레그먼 다이버전스를 포함한 pFedBreD 프레임워크를 제안합니다. 이 방식은 로컬 목적함수를 정규화하고 개인화된 사전 지식을 분리하여 성능을 향상시킵니다. 실험 결과, 이 방법은 5개의 데이터 세트에서 최신 성능에 도달하며, 8개의 벤치마크에서 다른 방법보다 최대 3.5% 높은 성능을 보였습니다.
https://arxiv.org/abs/2310.09183

2️⃣ SGDD: 구조 정보를 포함한 효율적인 그래프 압축 방법
대규모 그래프 훈련은 효과적이지만 비용과 저장 공간 문제가 있습니다. 기존 그래프 압축 방식은 그래프의 구조 정보를 무시하는 경향이 있었으며, 이는 성능 저하로 연결되었습니다. 이 논문에서는 스펙트럼 분석을 통해 이 문제를 확인하고, 구조 정보를 명시적으로 포함하는 새로운 방식인 SGDD를 제안합니다. 이 방법은 원래의 그래프 구조 정보를 유지하면서도 압축된 그래프를 생성합니다. 실험 결과, SGDD는 9개의 데이터 세트에서 우수한 성능을 보였으며, 특히 YelpChi 데이터 세트에서는 원본 데이터 세트의 정확도를 거의 잃지 않고 그래프 크기를 크게 줄였습니다. 이 연구는 구조적 정보의 중요성을 강조하고, 그래프 압축에 있어서의 새로운 방향을 제시합니다.
https://arxiv.org/abs/2310.09192

3️⃣ Modern Node.js App 개발을 위한 ORM Top6
Node.js 기반의 웹 개발에서는 데이터베이스와의 복잡한 상호 작용이 자주 필요합니다. 이러한 상호 작용을 단순화해주는 중요한 도구가 ORM(Object-Relational Mapping) 라이브러리입니다. ORM은 객체 지향 프로그래밍과 관계형 데이터베이스 사이의 간극을 메워줌으로써, 개발자들이 복잡한 SQL 쿼리 없이 JavaScript 객체를 사용해 코드의 가독성을 향상시킬 수 있게 도와줍니다. 또한, 다양한 데이터베이스 시스템 간의 전환을 쉽게 하며, 코드의 재사용성을 높여줍니다. 이외에도 보안 강화와 개발 속도의 향상에 기여합니다. 주요 ORM 도구로는 Sequelize, TypeORM, Prisma 등이 있습니다.
https://amplication.com/blog/top-6-orms-for-modern-nodejs-app-development

4️⃣ PayPal이 하루 3,500억 건의 요청을 처리하는 데이터베이스를 구축한 방법
PayPal은 JunoDB라는 분산 키-값 데이터베이스를 공개적으로 사용하게 됐습니다. 이 데이터베이스는 RocksDB를 기반으로 하며, 하루에 3,500억 번의 요청을 처리하면서 99.9999%의 가용성을 유지합니다. JunoDB는 PayPal의 대부분의 핵심 백엔드 서비스에서 사용되며, 캐싱, 중복 처리 방지, 지연 시간 극복 등 다양한 용도로 활용됩니다. JunoDB의 디자인은 클라이언트 라이브러리, 프록시 서버, 스토리지 서버의 세 가지 구성 요소로 이루어져 있습니다. PayPal은 JunoDB를 통해 뛰어난 확장성, 일관성, 가용성, 성능을 달성하고 있습니다.
https://blog.quastor.org/p/paypal-built-database-serves-350-billion-requests-per-day

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️
SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 신청하기  → https://bit.ly/3tmITjj

6
0
윤현묵

윤현묵

[231016] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 선선한 월요일입니다. 요즘들어 감기에 걸리시는 분들이 많더라고요...
다들 따뜻하게 입고 오늘도 화이팅입니다!!

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.

1️⃣ [Prometheus: 오픈 소스 언어 모델로서의 장문 응답 평가 및 개선 모델]대형 언어 모델(GPT-4 같은)을 사용하는 것이 장문 응답 평가의 표준이 되었지만, 이러한 독점 모델에는 한계가 있습니다. 이 연구는 완전 오픈 소스 언어 모델인 Prometheus를 소개하며, 이는 적절한 참고 자료와 함께 제공될 때 GPT-4와 유사한 평가 능력을 가집니다. 새로운 데이터 세트인 피드백 컬렉션을 사용하여 Prometheus를 훈련하였고, 그 결과 Prometheus는 인간 평가자와 높은 상관관계를 보였으며, 다양한 벤치마크에서도 우수한 성능을 발휘했습니다. 이 연구는 Prometheus가 효과적인 평가자 언어 모델로서의 역량을 보여줍니다.
https://huggingface.co/papers/2310.08491

2️⃣ [KQG-CoT: 연쇄적 사고 기반의 지식 기반 질문 생성 방법]지식 기반 질문 생성(KBQG)은 논리적 형태를 자연어 질문으로 변환하는 작업입니다. 현재의 접근법은 주석이 달린 데이터에 많이 의존하며, 이는 리소스가 부족한 상황에는 적합하지 않습니다. 이 연구에서는 연쇄적 사고(CoT) 프롬프트에 기반한 새로운 프롬프트 방식, KQG-CoT를 제안합니다. 이 방식은 논리 형식을 기반으로 지원 논리 형식을 검색하고, 그를 기반으로 질문 생성 추론 사슬을 정의하는 프롬프트를 작성합니다. KQG-CoT+ 확장을 통해 프롬프트의 품질이 향상되었습니다. 실험 결과, 이 방식은 다른 프롬프트 기준선보다 우수한 성능을 보였으며, 특히 PathQuestions 데이터 세트에서 기존의 최고 성능을 능가하였습니다.
https://arxiv.org/abs/2310.08395

3️⃣ [LangNav: 언어 기반 내비게이션을 위한 지각적 표현 활용 방법]논문은 시각과 언어 탐색을 위한 지각적 표현으로 언어를 활용하는 방법을 연구합니다. 이 방법은 기존 비전 시스템을 통해 에이전트의 시각을 자연어 설명으로 변환하고, 사전 학습된 언어 모델을 미세 조정하여 내비게이션 지침을 제공합니다. 기존의 시각적 특징을 사용하는 대신, 이 연구는 언어를 지각 표현으로 활용합니다. R2R 비전 및 언어 내비게이션 벤치마크에서의 실험은 언어 기반 내비게이션(LangNav)의 능력을 확인하며, 몇 개의 골드 궤적만 사용하여도 강력한 기준선을 뛰어넘을 수 있음을 보여줍니다.
https://huggingface.co/papers/2310.07889

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️
SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 신청하기  → https://bit.ly/3tmITjj

3
0
윤현묵

윤현묵

[231013] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 즐거운 금요일입니다. 하루 빡시게 일하고 주말을 즐겨봅시다 :)
모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.

1️⃣ [MAD와 OmniposeAD: 다양한 포즈에서의 물체 이상 감지를 위한 데이터 세트 및 방법]물체 이상 감지는 중요한 머신 비전 분야로, 기존 데이터 세트는 포즈 각도의 다양성이 부족하며 포즈에 구애받지 않는 이상 검출의 실험 프로토콜 합의가 부재합니다. 이를 해결하기 위해 멀티 포즈 이상 탐지(MAD) 데이터 세트와 포즈 중심의 이상 탐지(PAD) 벤치마크를 개발하였습니다. MAD는 다양한 포즈의 레고 장난감을 기반으로 하며, 이를 바탕으로 포즈에 구애받지 않는 이상 징후 감지 방법 OmniposeAD를 제안합니다. 이 방법과 데이터 세트의 효과는 평가를 통해 확인되었으며, 오픈 소스 벤치마크 라이브러리도 제공하여 이 분야의 연구를 촉진하려고 합니다.
https://arxiv.org/abs/2310.07716

2️⃣ [OPEHF 프레임워크와 IHR 재구성: 휴먼 피드백을 활용한 정밀한 정책 외 평가]정책 외 평가(OPE)는 오프라인 궤적을 사용하여 정책의 성능을 추정하는 데 중요하지만, 휴먼 피드백(HF) 신호의 복잡성으로 인해 기존 방법에는 한계가 있습니다. 이를 개선하기 위해, 휴먼 피드백을 보다 정확하게 평가하는 OPEHF 프레임워크와 즉각적 인간 보상(IHR) 재구성 접근법을 제안합니다. 이 방법은 실제 실험과 시뮬레이션에서 테스트되었으며, 기존의 OPE 방식보다 훨씬 정확한 성능을 보였습니다.
https://arxiv.org/abs/2310.07123

3️⃣ [LLaMA와 Whisper를 활용한 크로스 모달 퓨전을 활용한 자동 음성 인식의 오류 수정 개선]자동 음성 인식(ASR)의 오류 수정을 위한 새로운 크로스 모달 퓨전 방법을 제안합니다. 이 기술은 음향 정보와 언어 정보를 결합하여 오류 수정의 새로운 방법을 탐구합니다. 전통적인 순위 기반 방법 대신, 이 접근법은 사전 학습된 음성 및 텍스트 모델을 활용하여 ASR의 정확도를 높입니다. 평가 결과, 제안된 방법은 n-최적 가설에 비해 37.66% 향상된 성능을 보였습니다.
https://arxiv.org/abs/2310.06434

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️
SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 신청하기  → https://bit.ly/3tmITjj

5
0
윤현묵

윤현묵

[과정 홍보] 모두의연구소 오름캠프 ‘자바스크립트 웹 풀스택’ 1기 모집

안녕하세요.

모두의연구소에서 새롭게 만든 자바스크립트 웹 풀스택 과정 1기 모집 중에 있습니다.

웹 개발자가 꿈인 분들에게 좋은 과정이 될 수 있어, 소개 차 홍보 글 남겨 봅니다.

“합격하는 개발자는 대체 뭐가 다를까?”

성공하는 ‘개발 스킬 황금 비율’은 따로 있다!

실전&기업 프로젝트로 현실 문제에 부딪쳐 보고,

남들에게 없는 소프트 스킬도 갖춘 독보적인 개발자로 성장하세요!🤗

모두의연구소에서 만든 성장형 SW/AI 교육 과정,

오름캠프 ’자바스크립트 웹 풀스택’ 과정만의 3가지✨

  • SW 최초, 독보적인 ‘5단계 성장 코칭 시스템’

  • 알 때까지 8번의 예습&복습으로 내 것으로 만드는 ‘기업 실전형 프로젝트’

  • 내 성장을 바로 눈으로 확인할 수 있는 ‘펜타곤 성장 리포트 피드백’

✅ 모집 마감: 11월 7일 화요일까지

✅ 지원하기: https://bit.ly/46w2mNm

7
0
윤현묵

윤현묵

[231012] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 요즘 날씨가 너무 좋네요, 다들 AI 뉴스보면서 즐거운 하루 시작하세요~

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.

1️⃣ [CodeTransOcean: 다양한 프로그래밍 언어 간의 코드 번역을 위한 대규모 벤치마크]코드 번역 기술은 프로그래밍 언어 간의 코드 변환에 중요하며, 현재 대부분의 데이터 세트는 주요 언어 쌍에만 중점을 둡니다. 이를 해결하기 위해 CodeTransOcean이라는 대규모 벤치마크가 구축되었습니다. 이는 여러 프로그래밍 언어 간의 번역을 지원하는 MultilingualTrans, 틈새 프로그래밍 언어의 번역을 지원하는 NicheTrans, 그리고 LLM을 이용한 번역의 컴파일 가능성을 평가하는 LLMTrans로 구성됩니다. 추가로 딥러닝 코드의 프레임워크 간 번역을 지원하는 DLTrans도 포함되어 있다. 이 데이터 세트는 다양한 언어 쌍에 대한 코드 번역 품질과 학습 효율성 향상에 기여하며, 새로운 평가 지표도 제안했습니다. LLM ChatGPT를 사용한 평가와 향후 연구 방향도 함께 제시되었습니다.
https://arxiv.org/pdf/2310.04951.pdf

2️⃣ [ALMT: 언어 가이드를 활용한 상호 보완적 멀티모달 감성 분석 모델]멀티모달 감성 분석은 다양한 정보 소스를 활용하여 효과적입니다. 그러나 여러 모달리티의 정보가 서로 상충되거나 관련성이 없을 수 있어 성능 향상에 제한이 있을 수 있습니다. 이 문제를 해결하기 위해 적응형 언어 가이드 멀티모달 트랜스포머(ALMT)가 제안되었으며, 이는 언어 특징의 안내를 받아 시각 및 오디오 특징에서 관련성 및 충돌을 억제하는 표현을 학습합니다. 이를 통해 모델은 효과적인 멀티모달 감성 분석을 위한 상호 보완적인 표현을 얻습니다. ALMT는 다양한 데이터 세트에서 우수한 성능을 보였으며, 이 메커니즘이 필요하고 유효하다는 것을 입증했습니다.
https://arxiv.org/pdf/2310.05804.pdf

3️⃣ [TPU v5e와 JAX를 활용한 SDXL 모델 최적화: 허깅 페이스의 대규모 이미지 생성 솔루션]SDXL과 같은 제너레이티브 AI 모델은 고품질의 콘텐츠 생성을 가능하게 하지만, 대형 이미지 생성 모델로 인해 프로덕션 환경에서 배포하는 데 큰 어려움과 비용이 발생합니다. 허깅 페이스는 이를 해결하기 위해 Google Cloud의 특별히 설계된 TPU v5e를 활용하여 JAX를 통해 SDXL 모델을 지원하게 되었습니다. 이는 대규모 AI 모델의 훈련 및 추론에 비용 효율적으로 최적화된 방법을 제공합니다. 데모는 여러 개의 TPU v5e-4 인스턴스에서 실행되며, 약 4초 안에 4개의 대형 이미지를 생성할 수 있습니다.
https://huggingface.co/blog/sdxl_jax

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

☑️ AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
☑️ SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 신청하기  → https://bit.ly/3tmITjj

4
0
윤현묵

윤현묵

[231011] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

오늘의 AI 뉴스 전달드려요~ 좋은하루 보내세요 :)


모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [MathCoder: 수학 방정식 추론 및 모델링을 위한 LLM]최근 GPT-4 코드 인터프리터는 자연어 기반의 코드 추론 및 실행 능력을 통해 어려운 수학 문제를 해결했습니다. 본 논문은 오픈소스 언어 모델을 미세 조정하여 수학 방정식의 코드 모델링과 추론 능력을 강화하는 방법을 제시하며, "MathCodeInstruct" 데이터 세트를 소개합니다. 이를 통해 "MathCoder"라는 모델이 개발되어 MATH(45.2%) 및 GSM8K(83.9%)에서 최고의 성능을 보였습니다. 특히, MathCoder는 GPT-4를 능가하는 성능을 MATH 데이터 세트에서 보였습니다.
https://huggingface.co/papers/2310.03731

2️⃣ [SANPO: 인간 중심적 장면 이해를 위한 구글의 다중 속성 비디오 데이터 세트]사람들은 일상에서 '자기 중심적' 관점으로 환경을 탐색하며, 이러한 관점은 다양한 기술에도 적용됩니다. 컴퓨터 비전에서는 객체와 환경 사이의 관계를 연구하여 3D 구조와 레이아웃을 파악하는 장면 이해의 중요성을 인식합니다. 자율주행과 같은 분야에서는 많은 센서를 활용하지만, 인간 중심의 내비게이션을 위한 데이터는 부족합니다. 이에 따라 구글 리서치는 실외 환경에서 인간의 자기 중심적 장면 이해를 위한 다중 속성 비디오 데이터 세트인 'SANPO'를 제안하였으며, 이는 실제 및 합성 데이터로 구성되어 있습니다.
https://blog.research.google/2023/10/sanpo-scene-understanding-accessibility.html

3️⃣ [RT-2-X와 X-임베디먼트: 구글 딥마인드의 범용 로봇 학습 리소스 및 모델]로봇은 전문 분야에서는 뛰어나나 다양한 분야에서의 활동에는 제약이 있습니다. 이를 극복하기 위해 구글 딥마인드는 다양한 로봇 유형을 위한 범용 로봇 학습 리소스 세트를 제공하는 오픈 X-임베디먼트 데이터 세트와 로봇 트랜스포머(RT) 모델인 RT-1-X를 출시했습니다. 단일 모델을 여러 로봇 구현의 데이터로 훈련하면 특정 로봇에 맞춘 모델보다 뛰어난 성능을 보이는 것이 확인되었습니다. 이러한 모델과 데이터 세트는 로봇 연구 커뮤니티에 큰 변화를 가져올 것으로 기대되며, 구글 딥마인드는 이를 공개하여 연구의 발전을 도모하고자 합니다.
https://www.deepmind.com/blog/scaling-up-learning-across-many-different-robot-types

🥇 K-디지털 트레이닝 기관 최초! '대통령 표창' 수상한 모두의연구소의 신뢰받는 교육

▷ AI/딥러닝을 심도 있게! AI학교 아이펠 7기 지원하기→ https://bit.ly/3OX29fF
▷ SW 과정 신규 오픈! <자바스크립트 웹 풀스택> 신청하기  → https://bit.ly/3tmITjj

6
0
윤현묵

윤현묵

[231010] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

이제 날씨가 제법 쌀쌀해졌습니다. 모두들 옷 따뜻하게 입고 감기 조심합시다!

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [AnyMAL: 멀티모달 신호의 텍스트 변환 및 강화된 성능을 위한 통합 모델]AnyMAL은 다양한 입력 모달리티 신호를 처리하여 텍스트 응답을 생성하는 통합 모델입니다. 이 모델은 LLaMA-2(70B)의 텍스트 기반 추론 능력을 기반으로 각 모달리티별 신호를 텍스트 공간으로 변환합니다. 우리는 멀티모달 명령어 세트를 활용하여 모델을 더욱 강화하였고, 이는 다양한 멀티모달 작업에서 최첨단 성능을 보입니다.
https://huggingface.co/papers/2309.16058

2️⃣ [Kandinsky: 확산 기법을 통합한 텍스트-이미지 생성을 위한 최첨단 아키텍처]텍스트-이미지 생성은 컴퓨터 비전의 핵심 분야로, 확산 기반 모델이 주요한 품질 향상을 가져왔습니다. 본 연구는 확산 기법과 이미지 선행 모델을 결합한 새로운 잠재 확산 아키텍처인 'Kandinsky1'을 제시하며, 33억 개의 파라미터를 포함하고 있습니다. 이 모델은 다양한 생성 모드를 지원하며, 친화적인 데모와 소스 코드를 공개했습니다. 실험 결과, 칸딘스키는 COCO-30K에서 8.03의 FID 점수를 기록, 최고의 오픈소스 성능을 보였습니다.
https://huggingface.co/papers/2310.03502

3️⃣ [DAMON과 DECO: 고밀도 3D 접촉 추론을 위한 새로운 데이터 세트 및 모델]인간의 신체 접촉을 통한 상호작용을 이해하는 것은 인간 중심 AI 구현의 핵심입니다. 본 연구에서는 RGB 이미지와 결합된 고밀도 3D 접촉 주석을 포함하는 새로운 데이터 세트인 DAMON을 제시하며, 이를 활용하여 신체와 물체 사이의 밀도 높은 3D 접촉을 추론하는 DECO 모델을 개발했습니다. DECO는 인간 관찰자의 접촉 관련 인사이트에 기반하여 신체와 장면의 상호작용을 추론합니다. 결과적으로, DECO는 기존 방법보다 뛰어난 성능을 보이며 실제 인간 상호작용에 잘 일반화됩니다. 아래 링크에서 코드 및 데모를 확인할 수 있습니다.
https://huggingface.co/papers/2309.15273

🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

5
0
윤현묵

윤현묵

[231006] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

안녕하세요~ 벌써 금요일입니다. 오늘이 지나면 또 3일간 쉴수가 있네요 :)
AI 뉴스 보면서 휴일 계획을 세워봐요!!

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [LLM의 자가 수정 한계와 새로운 연구 방향성]대규모 언어 모델(LLM)은 텍스트 생성 능력을 통해 혁신적인 기술로 자리매김하였습니다. 그러나, 생성된 콘텐츠의 정확성과 적절성에 대한 문제가 지적되고 있습니다. 이를 해결하기 위한 방법으로 자가 수정이 제안되었습니다. 그러나 본 연구는 LLM이 자신의 응답을 외부 피드백 없이 스스로 수정하는 데 한계가 있다는 결론을 내렸습니다. LLM의 자체 수정 시도는 때로는 성능 저하를 초래할 수 있습니다. 따라서, 이에 따른 연구 및 실용적인 적용을 위한 새로운 방향성을 제안합니다.
https://huggingface.co/papers/2310.01798

2️⃣ [ImagenHub: 조건부 이미지 생성 모델의 통합된 추론 및 공정한 비교를 위한 원스톱 라이브러리]최근에는 다양한 다운스트림 작업을 위한 조건부 이미지 생성 및 편집 모델이 많이 개발되었습니다. 그러나 실험 조건의 불일치로 공정한 비교가 어렵습니다. 본 논문은 이를 해결하기 위한 원스톱 라이브러리인 ImagenHub를 제안하며, 통합된 추론 파이프라인과 포괄적인 평가 가이드라인을 도입합니다. 이를 통해 조건부 이미지 생성 모델의 공정한 비교와 진척 상황의 지속적 추적이 가능해집니다.
https://huggingface.co/papers/2310.01596

3️⃣ [SmartPlay: LLM 에이전트의 다양한 기능을 평가하는 벤치마크]최근 대규모 언어 모델(LLM)이 큰 잠재력을 보였지만, 에이전트로서의 능력을 평가하는 벤치마크가 부족합니다. 연구진들은 이를 위한 벤치마크인 SmartPlay를 소개하며, 이는 6가지 게임으로 구성되어 있고, 각 게임은 LLM 에이전트의 9가지 중요한 기능에 도전합니다. SmartPlay는 각 게임 테스트를 통해 LLM의 다양한 기능을 분석할 수 있게 합니다. 이 벤치마크는 LLM의 성능 평가와 현재의 연구 격차를 파악하는 기준이 됩니다.
https://huggingface.co/papers/2310.01557

🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

6
0
윤현묵

윤현묵

[231005] 모두의연구소가 전하는 “모두를 위한 AI 뉴스”

다들 추석은 잘 보내셨나요~?
날씨도 이제 점점 쌀쌀해지고 있습니다. 다들 감기 조심하시고 AI 뉴스 확인해볼까요?

모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다. 오늘의 AI 뉴스 시작해 볼게요!

1️⃣ [Show-1: 텍스트-비디오 생성을 위한 효율적인 하이브리드 확산 모델]대규모 텍스트-비디오 확산 모델(VDM) 분야에서의 발전에도 불구하고, 기존 모델들은 계산 비용이 높은 픽셀 기반 VDM이나 텍스트와 비디오의 정확한 정렬이 어려운 잠재 기반 VDM에 의존하는 경향이 있었습니다. 이 연구에서는 텍스트-비디오 생성을 위한 새로운 하이브리드 모델인 Show-1을 제안하며, 이 모델은 픽셀 기반 VDM으로 저해상도 비디오를 생성한 뒤, 잠재 기반 VDM을 사용해 이를 고해상도로 업샘플링합니다. 결과적으로 Show-1은 텍스트와 비디오의 정확한 정렬이 가능하면서도 픽셀 기반 VDM보다 훨씬 효율적입니다.
https://huggingface.co/papers/2309.15818

2️⃣ [Emu: 고품질 이미지 세트를 활용한 텍스트-이미지 모델의 품질 튜닝]웹 스케일의 이미지-텍스트 쌍을 활용해 텍스트-이미지 모델을 학습하면 다양한 시각적 개념을 생성할 수 있지만, 높은 품질의 이미지 생성에는 한계가 있습니다. 이 연구에서는 이러한 문제를 해결하기 위해 품질 튜닝 방법을 제안합니다. 이 방법은 작은 규모의 고품질 이미지 세트를 사용하여 미세 조정을 진행하여 생성 품질을 크게 향상시키는 것을 중점으로 합니다. 11억 개의 이미지-텍스트 쌍으로 학습한 모델을 수천 개의 고품질 이미지로 미세 조정한 결과, Emu라는 모델이 82.9%의 승률로 뛰어난 성능을 보였습니다. Emu는 최신 SDXLv1.0과 비교해도 높은 선호도를 보였으며, 제안된 품질 튜닝 방식은 다양한 아키텍처에도 효과적으로 적용될 수 있음을 입증하였습니다.
https://huggingface.co/papers/2309.15807

3️⃣ [PIXART-alpha: 고품질 저비용 텍스트-이미지 생성을 위한 효율적인 확산 모델]최첨단 텍스트-이미지(T2I) 모델의 큰 훈련 비용은 CO2 배출을 증가시키고 혁신을 방해하고 있습니다. 이 연구에서는 효율적인 훈련 비용으로 최첨단 이미지 생성 기술과 경쟁하는 Transformer 기반 T2I 확산 모델인 PIXART-alpha를 제시합니다. 이 모델은 훈련 전략의 분해, 효율적인 T2I 트랜스포머 디자인, 정보성이 높은 데이터 활용의 세 가지 핵심 설계를 기반으로 합니다. 결과적으로 PIXART-alpha는 기존 모델들에 비해 매우 빠른 훈련 속도를 보여주며, 훈련 비용과 CO2 배출량을 크게 줄였습니다. 이 모델은 이미지 품질, 예술성, 의미 제어에서 우수한 성능을 보였으며, 고품질 저비용 생성 모델의 구축에 새로운 기회를 제시합니다.
https://huggingface.co/papers/2310.00426

🥇 K-디지털 트레이닝 훈련기관 최초!

'대통령 표창' 수상한 모두의연구소의 AI학교 아이펠 입학하기! → https://bit.ly/3OX29fF

6
0