이미지 생성AI, 뼛속까지 알아보자 (EPIK 소개부터 DALL-E, StableDiffusion 기술까지)
이번주 내내 인스타를 한껏 핫하게 달군 컨텐츠가 있습니다.
바로 Epik, AI 사진 편집 앱인데요, 이번에는 90년대 미국 Yearbook 컨셉으로 AI 프사를 생성할 수 있는 기능을 출시했습니다.
Epik - AI 사진 편집
출시 이후로부터 오늘까지 128.9K번 사람들이 사용을 했고, (이건 심지어 오늘 아침 몇시간 전에 88K였음), 지금은 "현재 AI 이어북 이용자가 급격히 증가하여, 서비스 이용이 지연되고 있습니다. 잠시 후 다시 이용해주세요"라고 팝업이 뜹니다.
이틀전까지만 해도 결제창까진 들어갈 수 있었는데, 그것도 솔드아웃이었습니다. (가격은 30분 안에 생성하려면 8900원, 그 이후의 시간에 나오는건 가격이 더 쌌는데 기억이 안납니다 🥲)
저도 해보고 싶어서 어제 새벽에 이용자 수가 줄어든 틈을 타서 겨우 접속을 해서 결제까지 했는데 30분 안에는 절대 안나오고 한 두시간 이상 기다려야 나오더라구요. 생각해보니 그럼 왜 8900원을 냈지
그 새벽에도 대기자 명단이 제 앞으로 885명이었고, 순간 이 시간에도 에픽 팀은 밤을 새면서 서버가 안 터지길 기도하고 있겠지? 라는 생각이 들었습니다. 화이팅입니다.
에픽은 서버가 터지도록 이렇게 바이럴을 타게 될 수 있었던 이유는 무엇일까요?
알고보니까 에픽은 스노우 자회사더라구요..!
스노우는 저번에도 AI 프사 기능으로 몇백억을 벌었던데 이번에도 미친듯이 벌게 될 것 같습니다.
생각해보니 저는 개인적으로 이런 이미지 생성 필터들이 나올때마다 돈을 지불해서라도 했던 것 같아요. 처음에 렌사가 나왔을때도 그렇고, 스노우 AI 프로필도 그렇고 가격이 다 10,000원 이하여서 이 정도면 지불할만하다고 생각했던 것 같습니다.
하지만 제 원래 성격 상 게임할때도 현질을 안하는 스타일이고, 굳이 사야되지 않는거라면 돈을 지불하지 않는 성격임에도 불구하고 스노우는 어떻게 제 지갑을 열게 했을까요?
아마도 FOMO 전략을 진짜.진짜. 잘 활용한 것 같아요.
저번 AI 프로필때도 그렇고 한 두명이 하다가 백명씩 하고, 천명씩 입소문을 타게 되면서 인플루언서부터 연예인들까지 해서 올리면 그 입소문 속도는 어마무시하게 퍼지게 됩니다.
이번 AI Yearbook은 처음에 연예인들이 직접 해서 올리거나, 아님 아이돌 팬분들께서 자신이 덕질하는 아이돌 사진들을 넣고 나온 결과물들을 공유하면서 점점 입소문을 타게 된 것 같아요.
그렇게 점점 일반인들 사이에서도 이런 필터를 알게되고, 댓글을 통해 다들 "이거 어떤 앱인가요?"라고 물어보고 있었습니다. (저도 댓글 통해 알게됨)
물론 모든 필터들이 이렇게 바이럴을 탈 수 있는 건 아닙니다.
스노우가 진짜 잘하는건 사람들이 정말 재미있어할만한, 그리고 여성 분들을 타겟한 '예쁘게' 나올 수 있는 컨셉 샷들을 잘 찾아내는 것 같습니다.
이번에 이어북 필터로 생성한 결과물들을 보면서 가장 많이 놀랐던 건 확실히 퀄리티 차이였습니다.
사진의 화질부터, 사람 얼굴의 눈, 코, 입, 눈썹, 얼굴형 모양까지 정말 세밀하게 잡았더라구요.
보통의 이미지생성 앱들은 다른 얼굴의 템플렛 위에 유저 인풋 얼굴을 넣는 것이기 때문에 원본 템플렛 사진의 얼굴형을 따라가거나 원본 얼굴의 눈 위치, 눈 모양을 따라가기 마련이어서 내 자신과 닮았다는 느낌을 느끼기가 어려웠습니다. 하지만 이번 이어북 컨셉 사진들은 모든 세밀한 부분들이 제 얼굴과 닮았다는 느낌이 들었습니다.
예전 스노우 AI 프로필 결과물과 이번 이어북 컨셉 결과물을 비교하자면:
제가 예민해서 그런거일수도 있지만 예전 버젼(흑백 사진)은 눈 주변 쌍꺼풀 라인이나 아이래쉬가 겹쳐 보인다거나 있으면 안될 선들이 하나씩 생성되기도 했습니다.
최신 버젼 (이어북 사진)은 자세히 줌인해봐도 이상하게 생성된 부분이 얼굴쪽에 전혀 없습니다. (목걸이가 잘 생성안되긴 했네요)
예전의 렌사(가장 왼쪽 사진)와 비교하면 퀄리티는 정말 놀라울 따름입니다.
그럼 이걸 만드는 법 + 가격은?
오늘 아침에 결과물을 받자마자 저도 만들어보고 싶어서 인터넷에 있는 모든 소스 코드들을 뒤졌던 것 같아요.
저는 오늘 Stable Diffusion과 DALL-E를 사용해서 둘다 만들어봤는데, 일단 가격상으로
DALL-E는 OpenAI의 API를 쓰기 때문에 가격이 나감. 이미지 4개 정도 생성한 결과 $0.20정도 차감됨.
Stable Diffusion은 오픈소스 코드이기 때문에 가격이 나가진 않지만 GPU가 필요함!!! 이래서 GPU 비용이 나간다..라는 소리가 나오게 됩니다.
DALL-E
저는 오늘 DALL-E로는 Midjourney처럼 (아래 이미지)
처음에 유저가 "브랜드 이미지를 만들어줘"를 누르면
결과값을 2-4개 정도 뱉어내고,
그 4개의 결과물 중에 원하는 버젼을 클릭하면
그 버젼에 맞게 더욱 사진을 고도화 시킬 수 있는 프로젝트를 하나 개발했습니다.
Stable Diffusion
DALL-E로는 text-to-image 기능만 만들어서 이제 본격적으로 스노우 AI 프로필과 같은 Image-to-image 기능을 돌려보고 싶었어요.
어떤 패키지들이 있는지 둘러보다가 Stable Diffusion XL이라는걸 발견했는데 기존의 Stable Diffusion 모델들보다는 예전 훨씬 더 높아지 성능의 이미지 결과물들을 생성한다고 나와있습니다.
모든 기술 documentation은 여기에 있습니다.
https://huggingface.co/docs/diffusers/api/pipelines/stable_diffusion/stable_diffusion_xl
이런 이미지생성 모델들을 돌리려면 transformer, diffusion 모델들을 돌릴 수 있는 GPU가 필요한데 NVIDIA GPU를 가진 동생분이 계시는데 컴퓨터 비번을 안알려줘서 못쓰고 결국 제 맥북에서 돌릴 수 있는 방법만 계속 찾았어요.
구글 Colab이라는 곳을 쓰면 누구나 브라우저를 통해 임의의 Python 코드를 작성하고 실행할 수 있습니다.
더 기술적으로 설명하면 Colab은 호스팅된 Jupyter 노트북 서비스로, 설정하지 않고 사용 가능하며 GPU를 포함한 컴퓨팅 리소스를 무료로 사용할 수 있습니다!!
이런식으로 GPU를 무료로 사용할 수 있어요. 환경설정에서 런타임 유형 변경을 누르면 T4 GPU를 쓸 수 있는 환경으로 세팅할 수 있습니다.
Stable Diffusion documentation에서 제공하는 기본 소스 코드를 Colab에서 돌려봤습니다.
import torch
>>> from diffusers import StableDiffusionXLImg2ImgPipeline
>>> from diffusers.utils import load_image
>>> pipe = StableDiffusionXLImg2ImgPipeline.from_pretrained(
... "stabilityai/stable-diffusion-xl-refiner-1.0", torch_dtype=torch.float16
... )
>>> pipe = pipe.to("cuda")
>>> url = "https://huggingface.co/datasets/patrickvonplaten/images/resolve/main/aa_xl/000000009.png"
>>> init_image = load_image(url).convert("RGB")
>>> prompt = "a photo of an astronaut riding a horse on mars"
>>> image = pipe(prompt, image=init_image).images[0]그 결과 말을 타고 있는 우주비행사가 나왔어요.
이제 AI 이어북, AI 프로필과 같은 사진들을 만들기 위해서는 조금 더 많은 사진들과 적절한 prompting과 더 자세한 변수값들이 필요할 것 같아요. (10X AI University에서 더욱 상세하게 공개할 예정입니다!)
예를 들어, num_inference_steps=15라는 변수값의 숫자를 높일때마다 사진의 퀄리티가 더 높게 나옵니다.
혹은 negative_prompt의 변수값에는 '이런 유형의 사진들이 절대 나오지 않게 해줘'라고 명시할 수 있습니다.
마무리
오늘은 이미지 생성AI의 활용 사례부터 기술적으로 어떻게 만드는지에 대해 간략히 알아보는 글을 다뤘습니다. 더 많은 활용 사례들이 떠오르신다면 댓글에 달아주세요! 저도 요즘 계속 고민하고 있어서.. 어떤 프로젝트들을 만들어보는게 좋을까요? 🤔
이미지 생성AI는 이렇게 프로필 컨셉 필터로만 활용할때 가장 빛을 내는 걸까요? 브랜드/프로덕트 생성AI 이미지, 혹은 태형님의 https://recipe-p.com/ 와 같은 AI stock image 같은 것들은 평상시에 자주 활용하시나요? 궁금합니다!
깨알 홍보: 10X AI University
10X AI University의 4주차 커리큘럼에서는 이렇게 생성AI 툴들을 활용한 다양한 프로젝트들을 만드는 법을 알려드릴 예정이니 많은 관심 부탁드리겠습니다!
Week 4 생성AI
AI 프로필 이미지 생성하기 / 브랜딩 프로덕트 사진 만들기 (DALL-E, Stable Diffusion)
동영상에 AI 목소리와 AI 음악 입히기 (elevenlabs tts)
댓글
로그인 후 댓글을 남길 수 있습니다.
이미지 제너레이션 관련 다양하게 활용해본결과 1.개인이 쓰기엔 정말 완벽 (우연의효과) 의도한대로 다 나오면 럭키. 그러나 상업적 목적 아니면 뭐 그럭저럭 나쁘지 않다가 아니고 완벽 ㅋㅋㅋ 2.웹랜딩.피피티 제작 인공지능....이것도 그냥저냥 초안잡을때나 적당. 결론 부분부분적으로 활용해가면 정말 좋다. 전체를 의도한대로 하기엔 아직은 아닌듯 하고. 결국엔 기획(의도) 작업이 정말 중요하고 스토리텔링 부분도 중요. 단일 이미지나 단일 컨텐츠 기타등등은 완전할 정도. 챗지피티보단 바드가 훨씬 똑똑하다. 제너레이션 플랫폼은 갓퀄 레오나르도.ai 많이 습니다. 아니 종종 ㅋㅋㅋ