황현지
회사에 다닐 때는 월요일마다 일어나기가 그렇게 싫었는데,
팀 스모어톡을 시작한 뒤의 1년 6개월을 돌아보니, 월요병이 없었다.
힘들지만 재밌다!
이 밈은 정말 사실이었나보다 😆
플라멜 Flamel v0.9
톤앤매너를 유지하는 가장 쉬운 디자인 방법
황현지
회사에 다닐 때는 월요일마다 일어나기가 그렇게 싫었는데,
팀 스모어톡을 시작한 뒤의 1년 6개월을 돌아보니, 월요병이 없었다.
힘들지만 재밌다!
이 밈은 정말 사실이었나보다 😆
플라멜 Flamel v0.9
톤앤매너를 유지하는 가장 쉬운 디자인 방법
황현지
다음 AI 이미지 중 한국 전통 건축 양식을 따르고 있는 이미지는 무엇일까요?
[스모어톡의 딥테크 팁스 과제, “아시아향 이미지 생성형 AI 개발”의 의미]
AI 디자인 어시스턴트, 플라멜에는 주기적으로 엄선된 컬렉션이 업로드 되고 있습니다. 드디어 선선한 바람이 불어오면서 어느새 추석이 한걸음 앞으로 다가왔기에 추석 컬렉션을 업로드 중입니다.
위의 이미지는 플라멜에서 ”매우 단순한 2D 그래픽 디자인, 하단에 전통 검은색 기와의 한국 지붕을 정면에서 본 모습 배치. 배경은 밤하늘 느낌의 보라색, 분홍색 그라데이션, 오른쪽 상단에 부분적으로 보이는 달이 따뜻한 빛을 던지고, 지붕 위에 몇 마리 새가 앉아 있어 평화로운 분위기.” 로 생성한 결과입니다.
생성을 마치고, 의문이 들었습니다.
과연 이 이미지들이 한국 전통 가옥의 지붕을 제대로 구현한 것일까?
그렇게 한중일 건축양식에 대한 조사에 돌입했습니다.
한중일의 전통적인 주택은 언뜻 유사하지만 명확한 차이를 가지고 있었습니다. 한국의 지붕은 대부분의 경우 부드러운 곡선미를 자랑한다고 합니다. 가로로 긴 형태의 지붕에서 가운데 길쭉한 가로선이 살짝 휘어있는 곡선의 형태인 것이죠. 또한, 지붕이 2단으로 나뉘면서 아래쪽도 살짝 더 휘어 지붕 끝이 부드럽게 올라가게 됩니다. 일본은 전체적으로 직선형이면서 단순하고 절제된 느낌이 나타납니다. 중국은 지붕 끝이 하늘을 향해 치솟은 날카로운 형태인 경우가 많다고 하네요.
말하자면 위의 이미지에서 1번이 일본, 2번이 한국, 4번이 중국과 가깝다고 볼 수 있습니다.
이렇게 스터디한 내용을 참고해서 더 높은 퀄리티의 새로운 리소스를 다음과 같이 구현했습니다.
이밖에 다양한 가을 컬렉션이 플라멜에 계속 업데이트 되고있으니 확인해보세요 🌝
추석 컬렉션을 만들면서 느낀 어려움은 이뿐만이 아닙니다. 사과와 배를 구현하려하는데, “한국 배” 스타일이 나타나지 않는다거나, 한국식으로 보자기를 묶은 선물을 구현하기 어렵다거나 하는 식입니다. 과일 상자에 가지런히 담겨 흰색 과일망에 하나씩 감싸져 있는 모습은 또 어떻게 표현할지 참 어렵기만 합니다.
(플라멜로
" 심플한 흰색 테이블에 사과와 한국 배가 올라가 있는 모습"을 생성한 결과)
이러한 현상은 미드져니로 만들었을때도 마찬가지입니다. 어도비 파이어플라이를 사용하면, 한국 배의 색깔 정도는 구현되지만 배의 모양은 여전히 우리에게 익숙하지 않은 모습이네요.
(상-미드져니로
"korean pear"를 생성한 결과, 하-Adobe Firefly로 "korean pear"를 생성한 결과)
스모어톡은 올 하반기 딥테크 팁스 과제에 선정되어 3년간 15억을 지원받습니다.
당시 단 4인의 팀원으로 이루어낸 기록적 성과였는데요, 여기서 진행하는 스모어톡의 R&D 과제는 바로 “동아시아향 이미지 생성형 AI 모델 개발”입니다. 해당 과제로 바로 위에서 느낀 문제점을 해결하고자 합니다.
떡볶이, 라면, 과일과 같은 음식부터 시작해서 특정 장소와 행사가 그 예시입니다. 다음은 openAI의 Dall-E가 생성한 “추운 겨울, 따뜻한 마룻 바닥에서 라면 먹고 있는 한국 남자 아이” 모습입니다. 언뜻 라면 같지만, 자세히 보면 정체 모를 국수입니다. 아무리 바꿔달라고 요청해보아도 역부족입니다.
서양의 오리엔탈리즘을 풍자적으로 표현한 것으로 잘 알려진 LIM KIM의 Yellow라는 노래를 아시나요? 이 노래의 뮤비를 보면, 언뜻 동양풍이지만 국적 불명의 온갖 것들이 섞여 묘한 불쾌감을 느낄 수 있습니다. 현재의 이미지 생성형AI의 결과물이 바로 이런 느낌입니다. 아시아 안에서도 한중일의 차이를 우리는 느낄 수 있고, 이는 민감한 이슈로 종종 논란이 되기도 합니다. 앞으로 우리의 생활에 깊숙이 들어올 AI에서 이것은 반드시 해결되어야 하는 문제입니다.
(상-Adobe Firefly로
"한복을 입고 귀엽게 인사 하는 4살 여자 아이"를 생성한 결과, 하-Dall-E로 " 서울 명동 거리, 식당이 즐비한 사진"을 생성한 결과)
미국 여행을 가서 엽서 등 문구류가 있는 곳을 둘러보면, 매우 투박한 느낌의 일러스트들이 주를 이루고 있습니다. 보통의 한국인이라면 별로 선호하지 않는 그런 스타일입니다. 현재의 이미지 생성형AI는 이런 스타일의 일러스트에 더 특화되어 있습니다. 다음은 Dall-E가 생성한 “에펠탑 앞에서 돗자리에 누워 피크닉을 즐기는 사람들” 일러스트 이미지입니다. 어떤 느낌인지 감이 오시나요? 🧐
반면 우리나라는 상당히 추상화되고, 귀여운 형태의 일러스트 스타일이 인기가 많습니다. 한국에서 인기가 많은 카카오톡 이모티콘 캐릭터를 보면 이해가 가실 것입니다. 이런 스타일은 한국 뿐만 아니라 일본, 대만 등의 지역에서도 많은 인기를 끌고있죠. 하지만 지금의 이미지 생성형AI는 아무리 추상화되고 귀여운 이미지를 만들려고 해도 반복적으로 다시 명확한 형태로 돌아가게 됩니다.
이러한 문제는 단순히 다량의 데이터가 있다고해서 해결되는 문제는 아닙니다.
우선 실제 현실에 적용되기 위한 정확한 문제 정의가 필요합니다. 스모어톡은 한국에서 2년 간 이미지 생성형 AI에만 집중해 깊은 고민을 해왔습니다. 이미 50만건 이상의 유저 데이터를 확보하고 있고, 프로덕트를 통해 지속적으로 데이터를 축적하고 있습니다. 현장의 데이터를 기반으로 깊은 고민을 통해 문제를 정의하고, 연구를 설계합니다.
또한 '막대한 양의 데이터를 어떻게 분류하고 라벨링할 것이며, 모델을 어떻게 효율적으로 학습하고, 편리하게 사용할 것인가’는 현재의 AI 사회에서 최전선에 있는 생성형 AI 종합 예술이라고 할 수 있습니다. 스모어톡에는 데이터 구축, 멀티모달AI, 이미지 생성형AI를 전문으로 연구해 온 팀원들이 있습니다.
이 중요한 문제를 함께 풀어 나가는 종합 예술을 리딩하실 AI Lead, 이를 함께 구현해나가주실 AI engineer(예정), 그리고 최종적으로는 Product-Maket Fit을 찾아 MAU 100만의 프로덕트로 함께 성장시켜나가주실 Product Manager, Frontend Developer 직군을 채용하고 있습니다.
스모어톡은 적은 인원으로 빠르고 가볍게 운영되고 있습니다. 소수의 인원에게 막대한 권한과 책임이 주어지고, 적극적으로 성장을 지원합니다. 첫 공식 채용 관련 자세한 내용은 다음 채용 페이지를 참고 부탁드립니다.
마지막으로, 오늘이 백일인 너무 귀여운 조카 생각에 Adobe Firefly로 생성해본 “돌잔치에서 돌잡이를 하고 있는 1살짜리 한국 남자 아이” 이미지를 남기며 글을 마무리합니다 🪨😆
플라멜 Flamel v0.9
톤앤매너를 유지하는 가장 쉬운 디자인 방법
황현지
CTO님이 직접 두바이 초콜릿 만들어주는 팀 스모어톡..🍫
AI 이미지 생성툴, 플라멜을 만들고 있는 팀 스모어톡입니다.
CTO @조현영 님은 팀을 위해 두바이 초콜릿까지 만들고 계시네요 ㅎㅎ
키다이프부터 직접 만드셨다고 합니다 😆 맛있네요..
감성적인 편집은 @Hongmin Park 님의 objet를 사용했습니다.
플라멜 Flamel v0.9
톤앤매너를 유지하는 가장 쉬운 디자인 방법
황현지
플라멜 Flamel v0.9
톤앤매너를 유지하는 가장 쉬운 디자인 방법
황현지
단 3주만에 국내 최초 경제지와 기사 이미지 생성 MOU를 이뤄낸 과정
스모어톡은 지난 4월 30일 서울경제와 MOU를 맺고 기사 이미지 자동 생성 기능을 제공하고 있다. 기사 본문을 그대로 넣으면 최적의 스타일과 장면의 이미지가 생성되는 방식이다. 이는 단 3주 만에 이루어낸 쾌거였다. 이 과정은 창업 관련 책 중에서도 감명깊게 읽었던 "아이디어 불패의 법칙"의 그것과 많이 닮아있었기에 이를 공유해보고자 한다.
글을 작성하기 앞서 우선 이는 감사히도 적극적으로 도와주신 분들이 계셨기에 가능했음을 밝힌다. 하지만 준비가 되어 있어야 기회를 잡을 수 있다는 것을 많이 느꼈던 경험이었다.
우리가 멤버십 기업으로 있는 AI양재허브에서 서울경제를 연결해주신다는 연락이왔다. 감사히도 AI양재허브에 속해있는 수많은 스타트업 중 서울경제 측에서 직접 협업할 만한 회사 5개를 추려 소개를 요청해주신 것이었다. 작년에 많은 기업들을 상대하며 B2B 소통에는 골든 타임이 있다는 것을 뼈저리게 느꼈었기에 빠르게 오프라인 미팅을 세팅하였다.
감사히도 우리 사무실에서 담당 부장님을 뵐 수 있었고, 현재 어떤 과정으로 기사 이미지가 사용되는지, 해당 workflow에 녹아들려면 어떻게 해야하는지에 대한 니즈 파악을 빠르게 진행했다. 언론사의 실무 구조에 대해서는 잘 알지 못했기에 바보같은 질문도 많았는데, 정말 자세히 설명해주셔 파악이 용이했다. 그 당시의 플라멜 기능으로는 현업에 사용하기에 매우 한계가 있는 점에 대한 피드백도 받았다.
플라멜의 기존 자동 프롬프트 튜닝 엔진은 유저가 “원하는 장면”을 입력하면 유저가 의도한 바를 생성하기 위해 프롬프트가 튜닝되는, 즉 유저의 의도에 수렴하는 구조였다. 이에 기사 내용 전체를 입력하여 AI의 상상력에 맞겨 알아서 추천되기를 바라고 사용한다면 유저 입장에서 실망스러운 것이 당연했다.
하지만 이는 우리가 자동 프롬프트 튜닝 엔진 개발 당시 이미 고민한 적이 있었던 안건이었다. 플라멜 클로즈 베타 당시 유저의 의도는 크게 2가지로 나뉜다는 것을 알았다.
1) 유저가 정확히 원하는 것이 있는, AI는 시키는 걸 최대한 잘하면 되는 케이스 하나, 2) 그리고 유저가 AI의 상상력을 극대화하여 알아서 적당한 것을 추천해주기를 바라는 케이스 하나.
플라멜에 적용된 것은 전자였으나, 후자에 대해서도 가능성을 미리 테스트했었기에 빠르게 구현 가능 할 것이라고 확신했다. 이에 인간지능의 POC를 시작했다.
아직 프로덕트에 연결되어있지 않은 신규 프롬프트 튜닝 모듈을 직접 사람이 진행하고, 결과값에 대한 텍스트로 이미지 생성은 플라멜을 사용하는 방식이었다. 이럴 경우 만족스러운 결과가 나왔을 때 단기간에 프로덕트에 바로 적용할 수 있었다. 다행히 일주일 만에 어느정도 만족스러운 결과를 얻을 수 있었다. 이를 프로덕트에 넣기 위한 수정 개발 과정을 거치고 바로 기업 계정에 세팅하여 단 5일 만에 실무자가 직접 테스트할 수 있도록 했다.
이 과정이 내게는 Do things that don’t scale, 아이디어 불패의 법칙의 MVP 방식처럼 느껴졌다. 바로 개발을 하는 것이 아닌, 1) 니즈 파악을 위한 문을 만들어두고, 2) 사람이 한땀한땀 만들어 제공하며 반응을 확인하고, 3) 큰 니즈가 있는 것으로 판단되면 그때 개발하고 제공하는 방식이다. 우리의 상황에 대응해보자면 다음과 같다.
우리 프로덕트에 아직 들어가있지는 않았지만 긴 글에 대한 이미지 생성이 가능함을 명시해두었다.
우리의 능력을 보았을때 빠른 시일 내에 구현 후 실제 서비스에 넣는것이 가능하다고 생각되는 선에서 소개서를 전달하여 니즈를 파악한다.
작업은 인간지능으로 직접 진행하고, 고객 피드백을 받는다. 매우 반복적이고 비효율적인 구조였지만 피드백에 즉각 대응할 수 있었다.
정말 사용할 만한 퀄리티가 나오면 개발에 대한 기한을 설정하여 고객에게 양해를 구하고 서비스에 넣어 제공한다.
여기서 속도가 매우 중요하다. 피드백에 대응하고, 이를 실제 유저가 서비스할 때 까지의 시간을 최소화해야 물 들어올 때 노젓는 것(?)이 가능하다.
이를 가능하게 한 플라멜의 정말 중요했던 포인트가 있으니, 바로 “매우 유연하고 효율적인 어드민 페이지”이다. 능력자 CTO @조현영 님 덕에 우리 서비스는 거의 자체적으로 comfyUI 같은, 모듈형 구조가 어드민으로 구현되어있다. 이에 다양한 파이프라인을 거치는 이미지 생성 과정을 아주 약간의 수정만 진행한다면 어드민을 통해 유저에게 제공할 수 있게끔 세팅 되어있다. 덕분에 실제 실무자 분들이 사용하기까지 개발에는 5일이 채 소요되지 않았다.
운도 정말 좋았지만 결국 다년간 쌓아온 LLM 기술과 이미지 생성을 위해 이미 했던 수많은 고민, 그리고 미래를 고려한 시스템 개발로 인해 성과 도출이 가능했다고 생각한다.
실무를 담당하시는 기자 분들이 사용할 수 있도록 바로 제공해드린 뒤, 플라멜은 서울경제 내 AI 이미지가 적용될 수 있는 분야 기사에서 꾸준히 사용되고 있다. 기자 분들이 chatGPT를 비교적 많이 사용하시다보니 기사 이미지로 Dall-E를 사용하는 경우를 심심치 않게 볼 수 있는데, 서울 경제에서는 OpenAI의 Dall-E보다 플라멜이 5배 이상 많이 사용되었다. 플라멜에서 기사 본문 내용을 그대로 넣고 자동으로 장면이 추천되어 생성되는 것이 호응을 얻고 있는 것으로 보인다.
글에서 이미지는 매우 중요한 역할을 한다. 썸네일이라면 글을 요약하여 표현함으로써 클릭을 유도한다. 글 안에 들어가는 이미지는 글에 대한 이해를 돕고, 적절한 환기로 집중력을 잃지 않게 도와주기도 한다.
기사 이미지에는 특정 인물의 얼굴 등 실사를 사용하는 것이 중요한 경우도 많지만, 그렇지 않은 경우도 많다. 지금까지 아쉬웠던 점은 후자의 경우에 크게 의미없는 천편일률적인 이미지들이 사용된다는 점이었다. 기사 작성 자체가 훨씬 중요하기 때문에 이미지에 많은 시간을 쓸 수 없는것이 당연하다. 빠르게 적절한 이미지 자료를 찾기도 어렵고, 매번 필요한 이미지를 요청하여 제작하기도 어렵다.
이에 이런 크게 의미 없는 기사 이미지들을 심심치 않게 봤을 것이다.
어떤 사건이 벌어진 기사의 경우 수사기관 건물 또는 폴리스 라인 이미지
AI 관련한 기사의 경우 알고리즘 느낌이 나는 인포그래픽 이미지
날씨 관련한 기사의 경우 거리에 사람들이 걸어가는 이미지
현재는 플라멜을 활용하여 이렇게 내용을 적절하게 표현한 이미지들이 사용되고 있다.
이는 비단 기사만이 아니라, 다양한 글 콘텐츠에 유사하게 적용되고 있는 상황이다. 이를 이미지 생성 AI로 해결할 수 있다. 하지만 이미지 생성 모델은 원하는 장면을 텍스트로 입력하면 이를 구현해내는 방식이다. 정확히 원하는 이미지가 있다면 그대로 활용하면 되지만, 장면조차 모르거나 그런걸 생각할 시간이 없다면
여전히 무용지물이다. 즉, 긴 글에 어울리는 이미지를 자동 추천하여 생성하는 기능은 다른 파이프라인을 가져가야 한다.
스모어톡은 다년간의 LLM 기술을 통해 이러한 파이프라인을 최적화하였다. 해당 기능은 현재 일반 사용자는 사용할 수 없고 기업 고객에만 커스터마이즈하여 제공하고 있다. "긴 글에 대한 자동 이미지 추천 및 생성" 기능에 관심이 있다면 아래 링크를 통해 확인해보기 바란다.
*해당 기능은 기업 고객에만 별도 제공 됩니다.
사용에 관심이 있으신 경우 댓글 또는 아래 링크를 통해 문의해주세요 :)
플라멜 Flamel v0.9
톤앤매너를 유지하는 가장 쉬운 디자인 방법
아직 포스트가 없습니다.