뒤로
허형준
허형준 ·

On Device ML이 바꿀 미래


들어가기에 앞서, 


 On device 머신러닝은 쉽게 말해 스마트폰이나 웹앱에서 돌아가는 머신러닝 모델이다. 한때 화제가 되기도 했었던 구글의 티처블머신이 대표적인 활용 사례다. 즉, 서버를 거치지 않고 머신러닝 모델을 전달할 수 있는 기술이다. 



 이 기술이 바꿀 미래를 설명하기 전 간단히 장점을 짚고 넘어가자면, 적은 지연 시간과 데이터를 오로지 사용자 디바이스 내에서 처리할 수 있고, 인터넷 연결이 없어도 머신러닝 서비스를 제공할 수 있다는 장점이 있다. 동시에 머신러닝 서비스를 제공하기 위한 서버가 필요 없어 서버 사용료 및 데이터 전달 비용을 절약할 수 있다. 특히 이미지 및 영상처리의 경우 네트워크 비용과 머신러닝 서버 사용료를 줄여 비용 부담이 발생하지 않는다.


 다만, 제공할 수 있는 머신러닝 서비스에도 한계가 있다. 대부분의 기술이 이미지와 영상처리에만 한정되어 있다는 부분과 거대 모델과 빅데이터를 활용할 수 없다. 대표적으로 최근 화제인 GPT 모델과 같은 서비스는 돌릴 수 없다. 또한 사용자 디바이스 내에서 작동하는 만큼 사용자마다 성능 부분에서도 동일하지 못할 가능성이 있다. 구형 스마트폰에서는 아예 동작하지 않거나 버벅거리는 등의 문제 또한 무시할 수 없다.


 이걸 가지고 놀기에는 문제가 없지만, 딱 그 정도 수준이다. 프로덕션으로는 부족한 부분이 많다. 그렇기에 지금도 계속 발전하고 있고 앞으로도 가능성이 많은 분야다. 예상외로 이쪽 분야를 모르시는 분들도 있고 개인적으로도 흥미롭게 공부하고 있는 분야라 이번 기회에 포스트를 작성해보려고 한다.


컴퓨터 비전 머신러닝 ❤️ On Device ML


 쉽게 말해 테슬라가 라이다 센서 버리고 집중한 분야. 컴퓨터 비전이다. 사물을 인식하고 그 사물이 가지고 있는 정보를 추출하는 분야인데, 사실 꽤 역사가 깊다. 요약하자면, 63년도에 래리 로버츠가 컴퓨터 비전이라는 개념으로 논문을 작성했고 이때부터 관련 연구가 활발히 지속되었다. 그 이후로 몇 가지의 유의미한 성과를 내다가, 2000년쯤 얼굴 인식과 더불어 관련 기술이 등장하고 스마트폰의 보급 이후로 더 가속된다. 이렇게 데이터가 쌓아감에 따라 그 유명한 이미지넷이라는 데이터베이스를 기반으로 대회가 열렸다. 2012년도부터 정확도가 향상되고 이는 컴퓨팅 파워 증가, 알고리즘 개선이 됨에 따라 인식 정확도에 기여하는 결과를 내보였다.



 위 사진은 이미지넷 대회 인식 오차율 그래프인데, 2012년도부터 진화하다가 급기야 사람의 오차율인 5%을 넘어서 이제는 사람보다 인공지능이 사물을 더 잘 구분한다. 물론 데이터가 충분한 상태라는게 조건이지만.


 이와 같은 기술을 모바일 환경에서도 사용할 수 있다면 얼마나 좋을까. 그러기 위해서는 경량화가 필요하다. 데이터 학습은 성능 좋은 컴퓨터에서 수행하고 출력된 모델을 가지고 웹에서 동작하도록 만들어야 한다. 문제는 모바일의 성능이다. 


다행스럽게도 2012년도를 기점으로 모바일 분야에서 그래픽 처리 분야가 놀랍도록 향상되었다. 대부분 게임 퍼포먼스에 초점을 맞추어 개발되었지만, 이 행운은 모바일 머신러닝 시장에도 불어왔다. 적어도 최소한의 모델 계산을 수행할 그래픽 성능은 나와주어야 하니 말이다. 



적용 분야


그럼 On Device ML이 필요하거나 적용되는 시장은 어떤 분야일까. 


 예상하셨듯, 이미지 처리이다. 사실 아직 모바일 성능에서 빅데이터를 다루거나 파라미터가 큰 모델을 불러오고 고성능을 요구하는 모델을 돌리기에는 버겁다. 그래서 CNN 모델을 중심으로 생태계가 성장했고 앞으로도 비슷한 방향성을 가지고 성장할 것으로 예상된다. 이미지의 경우 픽셀 해상도를 낮출 수 있고 (데이터 및 모델 최적화 가능), 이미지를 서버로 보내고 정보를 받아오는데 네트워크 비용이 많이 들며 (절약 가능), 실시간 처리를 제공해야 한다. 이러한 특징 덕분에 디바이스 내에서 머신러닝을 제공하는데에 이점이 있다.


 추가로 관련 기능도 적어보면 다음과 같다.


얼굴 인식 및 분류

https://google.github.io/mediapipe/solutions/face_detection Google Mediapipe에서 제공하는 얼굴 인식인데 생각보다 성능이 괜찮다. 


포즈 검출

개인적으로 개발한 Mesh recovery 구현체. 


개인정보 보호 추천 알고리즘

 동시에 개인정보에 민감한 곳에도 머신러닝 기술을 접목할 수 있다. 유튜브 알고리즘이나 기타 플랫폼 사업자들이 유저의 개인정보로 하도 별의별 학습을 돌리니 데이터 법안이 요즘 들어 까다로워지고 있다. 이는 기업이 유저 정보를 마음대로 수집할 수 없다는 뜻이기도 하고 스타트업 입장에서는 데이터가 필요한데 막막할 수 있다. 여기에 디바이스에서 사용자 로컬 검색 기록을 기반으로 추천 알고리즘을 개선한다면 개인정보 보호도 할 수 있고 사용자 입장에서는 보다 투명한 관리가 가능해진다.


 요새 ChatGPT나 빅데이터를 활용한 생성형 인공지능들이 주목받으며 이쪽 시장에 대한 수요가 급증하고 있다. 반면 너무 생성형 AI 중심으로 주제가 쏠리는 것 같아, 다른 머신러닝 분야도 간단하게나마 살펴보았다. 혹시 관련 데모나 기술이 궁금하신 분들은 아래 링크를 참고하시면 된다.


https://www.tensorflow.org/js/demos?hl=ko


Home | mediapipe


https://project-awesome.org/aaronhma/awesome-tensorflow-js

너겟

오픈소스 영상편집 소프트웨어

9

댓글

로그인 후 댓글을 남길 수 있습니다.

Paul Na
Paul Na

의미있는 수준은 결국 서버 연결이 필요할거라 봅니다.