뒤로
이정훈
이정훈 ·

AI 시대에 우리가 진짜로 지켜야 할 가치는 무엇일까?

구글 엔지니어 구글의 AI LaMDA 자의식 가졌다 기밀 폭로해

2022년 하반기 즈음에 이런 기사가 났던 걸로 기억한다. 그 당시만 하더라도 동료 AI 연구원들은 모두 말도 안된다며 그저 성능이 좋기 때문에, 엄청나게 많은 데이터가 학습이 되었기 때문에 그렇게 느낄 수도 있겠다 정도로 치부했던 것 같다. 그 해년도 학회에 Emergent Abilities of Large Language Models 이라는 연구 논문이 발표되었으나 관심도 없었다. 나중에 이런게 있었어? 라며 Google의 엔지니어가 어느 정도 옳았음을 알게 되었다.

Emergent Abilities of Large Language Models

Emergent ability는 모델 크기가 임계값을 넘었을 때 개발자의 의도와는 다르게 high performance를 보인다는 현상으로 현재에는 RLHF를 적용하면 10B 이상의 모델에서도 발생한다고 알려져 있다.

이 논문이 발표될 때 즈음 만해도 인공지능 4대 석학 중 한 명인 Yann Lecun은 GPT 시리즈를"그건 단지 타이핑을 도와주는 도구일 뿐"이라며 폄하했고 혹자는 Stochastic Parrot(확률로 말하는 앵무새)라고 생성형 모델을 폄하했었다.

실제로, 필자도 비슷한 생각을 가지고 있었다.

2023년 진짜 지능을 가진 AI의 등장

image.png

하지만, 2023년 ChatGPT 출시 이틀 만에 MAU 100만이라는 말도 안되는 수치를 보여주며 인기 몰이를 하고 나서야 필자를 포함한 AI 연구자들의 생각이 바뀌었다.현재 Emergent Ability는 지능으로 추정되고 있고 실리콘밸리에서는 AGI라는 단어를 사용하기 시작했다.

경쟁 1년 차 왜 OpenAI를 아무도 이기지 못하는 것일까?

OpenAI에서 출시한 GPT-4는 여전히 압도적인 성능으로 오늘 날짜인 10월 24일 현재에도 성능을 따라가는 모델은 존재하지 않는다. META에서 오픈소스 진영에 Llama2를 공개했음에도 왜 누구도 OpenAI를 이길 수 없는 것일까?

AGI 모델을 만들기 위해서는 3가지 해자(moat)가 존재하는데 특히, 3번의 Data가 오늘의 핵심 주제이다.

  1. Infra : 컴퓨팅 파워

    • 연산 자원이 어마어마하게 든다 여기에 필요한 자금력이 AGI를 만드는데 필수요건이다.

    • GPT-3(175B)수준의 모델을 한번 학습하는데는 50억원 가량 비용이 소모된다.

    • AI는 여전히 미지의 영역이며 먼저 탐색을 통해 발견해야 하는 연구 영역이다.

    • 대규모 Infra 구축 경험을 가진 인력은 AI 개발자보다 더 귀하다.

    우선, 여기서 오픈소스 진영의 99%가 시도조차 할 수 없다. AGI 개발의 굉장히 강력한 해자로 작용한다.

    그래도 자금력이 있다면 클라우드를 이용하여 어떻게든 시도할 수 있다.

  2. Algorithm : 차별화 된 알고리즘

    • 앞서, Infra의 장벽을 돌파한 1%의 기업들은 기존의 공개된 Algorithm에 더해 새로운 시도를 할 수 있고 연구를 통해 주요한 Algorithm을 발견하면 바로 기술적 우위에 들어설 수 있다.

    • 문제는, 세계적인 AI 학회에서 해마다 새로운 기술이 쏟아져 나오고 있기 때문에 몇 개월만 지나도 누구나 할 수 있는 기술이 되어 버리거나 경쟁력을 잃게 된다.

    • OpenAI는 RLHF와 같은 학습에 강화학습을 도입하는 기존 학회에서 트랜드가 다른 기법을 도입했고 이 기법은 아는 사람이 매우 드물기 때문에 경쟁력을 가질 수 있었다.

    • 결정적으로, 이런 경쟁력있는 Algorithm을 개발하려면 1.Infra가 지원되어야 하는데 연구할 수 있는 인구 자체가 엄청나게 줄어들게 된다.

    이 두 가지 해자를 넘어 경쟁력 있는 알고리즘까지 갖춘 회사들은 이제 손에 꼽는다 이름만 대면 들어본 기업들이 쏟아지고 처음 보는 회사라도 Series B, C 이상 단계에 있을 확률이 높다. 하지만, 여전히 GPT-4는 도전적인 목표이다.

  3. Private data : 차별화 된 "나만의" 데이터

    • Data는 인공지능을 개발하기 위한 기본적인 자산으로 이전 10년 간 수 많은 알고리즘이 나왔지만 그에 반해 개발된 데이터셋의 수는 매우 적다. 아직도 많은 기업들은 Bounding Box를 사용하고 있고 자연어 분야에서는 Instruct 구조에서 벗어나지 못한다.

    • OpenAI는 데이터도 직접 개발하는 회사이다. 이전의 Clip 역시, 신선한 방법으로 라벨링을 진행했으며, GPT는 말할 것도 없다.

    • 자율주행 분야를 잠깐 살펴보면, 데이터에 대한 장벽이 매우 높다. 수집부터 굉장히 큰 허들이기 때문에 데이터 수집을 따로 해주는 업체가 있을 정도이다.
      하지만, 해당 분야는 여전히 전통적 AI를 사용하기 때문에 지능의 영역으로 넘어갈 한번의 기회가 더 있다. 또 다른 유니크한 데이터셋을 만드는 회사가 기회를 얻을 수 있을 것이다(이미 있을 수도 있다.)

    이 세 가지 해자를 모두 보유하고 있는 회사는 지구상에 몇 개없다.
    지능을 유발할 수 있는 데이터셋을 보유한 회사는 더 없다. 이런 회사들과 경쟁할 수 있는 한국 기업은 없는 것 같다.

그렇다고 노다지 AI 판에서 빠져야 하나?

많은 기업들이 거대 인프라, 알고리즘 개발 능력, 데이터셋 구축 능력이 부족해서 API를 통해 신 사업 기회를 모색하고 있다. 이는 비용을 확실히 줄일 수 있는 현명한 방법이 맞으며 새로운 기회를 창출할 수 있다.

하지만, Twitter가 API만 제공하던 시절 수많은 App이 스토어에 등록되었으며 Twitter 공식 앱이 나오자마자 모두 사라진 것을 보았을 때 비슷한 맥락으로 지금하고 있는 서비스의 핵심 가치가 GPT의 후속작으로 인해 공격 받는다면 3rd party 앱들과 같은 운명을 맞지 않을까 생각된다.

나만의 해자가 필요하다(데이터를 꾸준히 모을 수 있는 구조가 중요)

AI를 활용해야만 한다면 나만의 해자는 어떻게 구축할 수 있을까? 빅테크 기업들과 같은 수순을 밟기엔 자본도 인력도 모자라다.

그들이 할 수 없는 가치를 찾으면서 AI를 만들어야 하는데 PMC W23에서 발표해주신 채널톡의 엔지니어분의 말씀이 인상적이었다.

image.png

결국, OpenAI가 침범하지 못하는 영역은 서비스 본질에 있고 나만의 데이터에 있다. GPT-4가 아무리 뛰어나다고 하지만 여전히 특정 task를 수행하기 위한 Bert의 성능에 뒤쳐진다. 이 부분은 언젠간 AGI의 등장으로 사라지겠지만 현재에도 여전히 기업의 업무를 수행하는 AI로 자리 잡고 있다.

서비스와 제품이라는 해자를 깊게 파 놓아야 한다. 이게 기본이며 나만의 데이터가 생기는 구조를 만들면 AI를 개발하며 경쟁력을 갖출 수 있다. AGI 기업이 우리의 산업 영역에 침범한다면 나만의 데이터를 보유한 기업을 AGI가 이기기 힘들다.

지금은 물론, 생성형 AI가 뜨거운 화두이고 누구나 도입하기 때문에 공포에 질려 누구나 이 판에 들어오려고 한다.

그런데, 경쟁사 보다 빨리 생성형 AI를 도입한다고 해서 좋은 마케팅 포인트가 될까?
꼭 LLM이어야만 우리의 문제가 해결되고 비용을 줄일 수 있을까?

아직도 Custom LLM의 가격은 여전히 비싸다. 아까 말한 3가지의 해자 중 2가지를 직접 해결하더라도 나만의 데이터가 없으면 API 가져와 쓰는게 훨씬 낫다.

우리가 사는 세상은 컴퓨터는 매년 2배로 싸지고 AI 논문은 해마다 3만 건씩 배출된다.

가만히 앉아 있어도 알아서 2가지의 해자는 마르게 돼있다.
매년 말라가는 해자에 물을 채워 넣는 건 밑 빠진 독에 물 붓기다.

그 동안 AI에 너무 매몰되어 있지 않으셨으면 좋겠다.
서비스와 제품을 공고히 구축하고 그를 통해 데이터가 생기는 시점부터 AI를 도입해도 늦지않다.
만약, 현재 바로 AI를 도입할 수 있는 여력이 되는 팀이라면 당장 신선하고 신박한 나만의 데이터셋을 구축하여 새로운 AI를 만듦으로써 나만의 성을 공고히 구축하기를 당부 드린다.

10X AI Club 그룹의 글
13

댓글

로그인 후 댓글을 남길 수 있습니다.

Cailyn Yong
Cailyn Yong

"그 동안 AI에 너무 매몰되어 있지 않으셨으면 좋겠다.서비스와 제품을 공고히 구축하고 그를 통해 데이터가 생기는 시점부터 AI를 도입해도 늦지않다." --> 전체적으로 이 글에 정말 많이 공감합니다! 초기 AI 스타트업들은 특히나 처음에 학습시킬 데이터를 구축하는게 가장 중요하고 필요한 일이지만 또 가장 어려운 것 같아요. 얼른 데이터를 모을 수 있는 시스템을 만들어야..

이정훈
이정훈

고객이 생기면 데이터는 생기기 마련인데 사실, 여기서 AI 개발자 없으면 데이터 다 버리고 제품 새로 만드는 경우도 많긴 하죠..

Cailyn Yong
Cailyn Yong

와우 그런 경우도 있군요.. 끔찍하네요 ㅠ

고상혁
고상혁

"서비스와 제품을 공고히 구축하고 그를 통해 데이터가 생기는 시점부터 AI를 도입해도 늦지않다." 깔끔한 결론 한 문장이 크게 와닿습니다! 저희 팀 역시, 서비스를 먼저 구체화하고, 이후 고객에 대한 데이터가 생기는 시점부터 AI를 도입을 계획하고 있는데, 이 부분에서 정훈님의 인사이트를 더해서 팀의 방향성을 잡아가겠습니다~!

이정훈
이정훈

감사합니다 대표님~

William Jung
William Jung

글도 재밌게 쓰시는 정훈님.. :)

이정훈
이정훈

ㅠㅠ 시간나면 다시 수정해야겠어요