(2024 AI Part 2) It's the ML, stupid
안녕하세요,
AI 이미지 어시스턴트, 플라멜(Flamel)을 만들고 있는 이정민 입니다.
2024년 AI 생태계에 대한 개인적인 생각을 4편으로 나누어 적어보고자 했는데 아직 첫 번째 파트(링크)만 작성하고 정신이 없었네요.
작성하지 않고 버티면 2024년도 다 갈 것 같아서, 오늘은 새벽에라도 작성해보고자 합니다.
여튼 오늘은 두 번째 내용입니다.
--
2024년에는 Business Layer 에서 활약하는 팀이 등장해야만 한다.
기술이 필요하다. 그래서 기본적으로 AI 스타트업은 ML 엔지니어가 필요하다.
단순히 기술만 있다고 이기는 것도 아니다. 제품으로서 바라보아야 한다.
이미 사용자에게 AI는 AGI 이다. AGI를 표방하는 UI/UX를 기획해야 한다.
--
3줄 요약:
간단히 생각해서는 모두에게 동일한 조건이기 때문에 AI 프로덕트에서 차별화 시키기 어렵다.
ML 엔지니어, 또는 그에 준하는 관심을 가지고 갖고 노는 사람이 팀에 필요하다.
참고로 학력 보다는 ML에 대한 관심과 직접 갖고 놀 수 있는 Python 실력이 중요.
어차피 모델링은 왠만하면 OpenAI, 또는 빅테크가 다 하려고 할 것이다.
그래서 ML 엔지니어는 이미 존재하는 모델의 사용성을 극대화 시키는 사람이 중요할 수 있다.
2. 기술이 필요하다. 그래서 기본적으로 AI 스타트업은 ML 엔지니어가 필요하다.
본 글의 제목을 짓는데 영감을 받은 문장은 1992년 미국 대선의 판도를 뒤흔들어 빌 클린턴 전 대통령이 당선하는 데 큰 공헌을 한 캐치프레이즈인 It's the economy, stupid (바보야, 문제는 경제야) 입니다.
문제를 재정의하고 핵심을 바라보게 만든 바로 그 문장입니다.
이 문장에 녹아든 철학은 현재 AI 생태계를 관통하고 있다고 생각이 됩니다.
ChatGPT 의 파괴적인 능력과 성장을 바라본 사람들에게 OpenAI 의 GPT 'API' 는 엄청난 기회를 단번에 가질 수 있는 기회처럼 보였습니다.
그 결과 2022년 초부터 시작된 생성 AI 스타트업에 대한 관심은 2023년을 원년으로 하여 폭발적으로 성장했습니다.
무려 29배 이상 늘어난 AI 스타트업의 설립 횟수는 이를 방증합니다.
AI가 쉬워졌다는 뜻이겠죠?
문제는 쉬워졌기 때문에 프로덕트가 우후죽순 등장하게 되고,
API 기반으로 한 서비스가 성능적인 측면에서 차별성을 보이는 것이 쉽지 않기 때문에 문제가 발생합니다. 오죽하면 아래와 같은 밈이 나왔을까 싶습니다.

버티컬 영역 중 검색에서 엄청난 성장세를 거두고 있는 Perplexity AI 도 이 문제에서 자유로울 수 없기는 마찬가지입니다. 얼마나 많은 Hater 에 시달렸으면 CEO 인 Aravind 가 wrapper 에 대한 오해를 해명하는 트윗을 올렸을까 생각이 듭니다.

우리는 디스콰이엇에서도, 그리고 프로덕트 헌트에서도 AI 프로덕트를 시도 때도 없이 접하고 있습니다. 2023년 새로 런칭한 there's an ai for that 또한 엄청난 수의 AI 프로덕트가 계속해서 공개되고 있기 때문에 디렉토리 서비스로서 기능할 수 있었고, 프로덕트 헌트의 방문자 수를 뛰어 넘는 관심을 받게 되었습니다. 이 외에도 OpenAI 가 공개한 AI store, GPTs 에도 수많은 버전의 AI 가 공유되고 있습니다.

그렇기에 최근 일각에서 AI 서비스, AI 스타트업에 대한 위기론이 불거지는 것은 당연한 일일지도 모릅니다. 뭔가 새로운 것이 나오기는 하는데 '그게 그거' 같은 상황.
AI 서비스에 대한 위기론 (링크)

AI “tarpit” ideas 에 대한 경고 (링크) - 개인적으로 개발하면서 함께 정말 재밌게 들었습니다.

특히 두 번째 영상에서 도메인이 명확하다면 비싼 최신 모델을 바로 추구하기 보다는 모델을 최적화해서 프로토타이핑을 하라는 이야기가 나옵니다. '최적화' 라는 단어가 의미심장한데요.
제가 속한 이미지 생성 분야와 관련해서 간단히 이야기를 해보자면,
한국에서 가장 많은 관심을 받는 분야인 AI 프로필을 생성하는 방식은 사실 기업마다 거의 비슷할 것입니다.
기본적으로 Fine-tuning 을 해서
기존 템플릿 이미지를 기반으로 한 i2i 를 통해 이미지를 생성했을 가능성이 높아 보입니다.
얼굴 영역만 마스킹 해서 inpainting 을 했을 수도 있고요.

그런데, 기업 입장에서 같은 아이템에도 차별성을 부여할 수 있는 방식은 여러가지입니다.
학습에 사용되는 리소스 (시간, GPU 비용)를 줄여서 가격을 낮춘다
이미지의 품질을 높인다 (미적으로 괜찮게 보이게 한다)
요청하는 사진에 대한 기준 (얼굴이 크게 나온 사진만 가능, 혹은 최소 5장 이상) 을 낮추어 사용자가 이미지를 공유하는 데 있어 부담을 줄인다
이걸 하려면, 이미지 생성 모델의 원리를 대략적으로라도 이해해야 하며 최신 기술 및 라이브러리에 대한 관심이 필요합니다. 그런 점이 AI 스타트업에 ML 엔지니어 (=ML 에 관심이 아주 많고 실험 정신이 가득한 사람) 가 꼭 존재해야만 하는 이유라고 할 수 있습니다.
이는 사실 저, 개인만의 생각이 아닙니다.
그 전에 잠시 다른 얘기를 좀 하면, 미국 내 AI 스타트업과 관련하여 가장 크게 관심을 받는 배치 프로그램 (시즌 별 다수의 투자 대상 기업을 모집하는 방식) 으로 2가지가 존재합니다.
바로 AI Grant 와 Converge 입니다.
우선 AI Grant(링크) 는 전 Github CEO 인 Nat Friedman 과 YC 파트너 인 Daniel Gross 가 만든 AI 스타트업만을 위한 배치 프로그램이며 올해 3번째 기수를 맞이할 예정입니다.
Alumni 를 보면 Perplexity, Cursor, Replicate, Flair, Chroma, Pika Labs 등이 있고, 현재 트렌딩 프로덕트에 있는 Jenni AI (@David Park) 도 Batch 2기 출신입니다.

다음으로 Converge(링크) 는 OpenAI 내 투자 기관인 OpenAI Startup Fund 가 직접 AI 스타트업에 투자하는 프로그램입니다. 올해 2번째 기수를 맞이할 예정입니다.
Alumni 를 보면 Descript, Harvey, Mem 이 있고, 한국에서도 AI 튜터 앱으로 유명한 Speak 도 Converge 1 출신입니다. 주로 OpenAI 의 LLM API 를 활용하는 스타트업입니다.

다시 돌아와서 이 프로그램들의 이야기를 왜 꺼냈나?
이 프로그램의 지원서를 들여다 보기 위함입니다.
사실 지원서가 웹페이지 기준 스크롤 조금 내리면 끝나는 정도의 분량입니다.
엄청난 수의 팀이 지원을 해서 인지 구구절절 작성한 글을 볼 여유가 없어서 한 줄로 요약해서 설명해라, 30초~1분 정도 길이의 비디오를 첨부해라 의 질문으로 판단하는 것 같습니다.
그리고 꼭 들어가는 문항.
창업자의 프로필을 적어야 합니다. 그런데 이미지를 잘 살펴봐주세요.
AI Grant

Converge

공통점이 눈에 들어오시나요?
바로 3개의 SNS 계정을 요청한다는 점입니다. LinkedIn, Twitter and Github.
일단 서구권 비즈니스 환경에서 LinkedIn 은 한국, 일본에서의 명함 그 이상의 역할을 하기 때문에 이해가 됩니다.
다음으로 Twitter. 미국을 기준으로 보면 Bootstrapper 를 포함한 창업가 뿐만 아니라 ML 엔지니어가 본인의 기술을 뽐내는 자리이기도 합니다.
마지막으로 Github. 당연히 개발 실력 있나를 물어보는 항목이겠죠?
그렇습니다.
AI 스타트업은 적어도 한 명 이상 AI 를 이해할 수 있는(=혹은 정말 관심이 많은) 사람이 있어야 합니다.
물론 Github 이 ML 만을 위한 공간이 아니긴 합니다. 전반적인 개발 경력을 본다는 뜻인데, 적어도 위 2개 프로그램에서는 AI 모델을 가지고 어떻게 갖고 놀고 있나에 더 주목하여 Github 을 바라보고 있는 상황입니다.
다행히도 AI 분야는 오픈 소스에 대해 대단히 호의적인 생태계입니다.
즉, 기술을 쉽게 받아들여 활용해볼 수 있는 여지가 있다는 뜻입니다. LLM 등의 거대 모델에 대한 학습 비용을 생각해보면 참 운이 좋다라는 생각이 들기도 합니다.

그런데 거꾸로 생각해보면, 기술을 그렇게 쉽게 공유해도 되나라는 걱정을 할 수도 있는데, 이는 어차피 소수의 능력자가 이 판을 흔들고 대다수의 팔로워가 따라가는 형태라는 뜻일 수도 있습니다.
그렇다면 대다수가 모델에 대한 접근 권한이 있고, 대다수가 비슷한 조건에서 모델을 활용해 서비스를 제공한다면, 과연 어디에서 우리가 소비자에게 가치를 줄 수 있을 지 보아야 합니다.
생각해보면 주요 AI 기업들은 자체 모델을 보유하고 있습니다.
이유를 생각해보면, 이미 해당 팀들은 이미 PMF 를 찾았기 때문에 (그리고 이미 연구 핵심 역량을 보유한 팀이었기 때문에) 단순한 Prototyping 에서 벗어나 사용자를 Lock-in 시킬만한 UX 를 제공해야 했고, 이는 결국 '최적화'를 해야 한다 라는 결론에 이르기 때문입니다.

하다 못해 빅테크가 아닌 소규모 스타트업도 자체 모델을 공개하기 시작했습니다.
이미지를 기준으로 말씀드리면,
먼저 미드저니의 미적인 이미지 생성 모델에 대항하기 위해,
Playground AI (YC S19) 가 SDXL 모델 구조에 자체 데이터로 사전 학습을 진행한 모델을 공개했습니다.

다음으로 어도비의 저작권 침해 없는 이미지 생성 모델에 대항하기 위해,
Bria AI (어떻게 아시고, 한국의 Top-tier VC 에이티넘인베스트먼트에서 투자 집행) 가 스톡이미지 제공 업체 Getty image, alamy 와 제휴하여 사전 학습을 진행한 모델을 공개했습니다.

마지막으로 아예 벡터 스타일의 이미지 생성이 잘 안되는 문제를 풀고자,
Recraft AI (AI grant Batch 1, 이후 Khosla Ventures 투자 집행) 가 직접 수집한 고품질의 데이터를 디자이너와 라벨링하여 사전 학습을 진행한 모델을 서비스에 런칭했습니다. IR 덱을 보면 데이터에서의 우위를 팀의 강점으로 내세우는 것을 확인할 수 있습니다.

이렇게만 보면,
일반 팀에게는 AI 스타트업으로서의 기회를 잡지 못하는 건가 라는 생각이 들 수도 있습니다.
왜냐하면 사전 학습은 최소 수천만원에서 수억원이 드는 액션이기 때문입니다.
그런데 사실 제가 언급한 ML 엔지니어는 단순히 관련 공부를 오래한 석/박사를 의미하는 것이 아니라 ML 에 관심이 아주 많고 실험 정신이 가득한 사람을 지칭하는 단어였습니다.
있는 기술을 빠르게 잘 가져와 사용해 관심을 얻은 하나의 사례를 보여드리면,
Real-time Drawing 으로 유명한 서비스 중에 하나가 Krea AI 입니다.
여기는 유럽에서 미국으로 건너와서 22년 부터 매일 이미지 생성 AI 만 생각하던 개발자로 구성된 팀이었습니다. 그런데 사실 생성 이미지를 모아서 보여주는 초기 서비스는 엉망에 가까웠습니다.
이것도 나름 개선된 편...
그런데 23년 3월 OpenAI 내 유명 ML 엔지니어 Yang Song 님께서 제안한 Consistency Model 을 23년 10월 칭화대 학생인 Allen Luo 가 직접 구현해 본 모델을 공개하게 됩니다.
이 모델의 장점은 (생성할 이미지는 이미 가야 할 방향이 정해져 있으니 빠르게 생성되는 과정에 대한 궤적에 시작점을 올려두어) 적은 수의 노이즈 제거 과정으로 최종 이미지를 찾는다 = 엄청 빨리 이미지를 만들 수 있다 는 것이었습니다.
그리고 Fal.ai 라는 GPU 기반 API 제공 업체가 이 모델을 Real time 으로 사용할 수 있는 서비스를 공개하게 되고, 모든 이미지 AI 에 관한 소식을 지켜보던 Krea ai 팀은 "이거다!" 하고 4일 만에 제작해 서비스를 x.com 에 공개하게 됩니다. 이는 엄청난 반향을 일으키게 됩니다.
"내가 대충 윤곽만 잡으면 그림이 나오네...? 이제까지 없던 사용자 경험인데...!"

결국 당당히 a16z 팀의 눈에도 들어오게 됩니다.

그래서 저희가 Krea 로 부터 배울 점은
입니다.
사실 이러한 이유로 최근에 저도 개발에만 전념하고 있습니다;