밤코딩 밤치

밤코딩 밤치님의 아티클

밤코딩 밤치

밤코딩 밤치

현대자동차에 데이터를 납품합니다

Blue Collaboration Stickerbomb Interview Instagram Post.png

현대자동차는 해시스크래퍼의 고도화된 웹크롤링 및 데이터 전처리 솔루션을 도입하여, 대량의 데이터를 신속하게 수집·전처리한 후 현대차 데이터담당자에게 전달하고 있습니다. 이를 통해 현대차는 전달받은 정제 데이터를 바탕으로 심층 분석을 진행하며, 보다 정확하고 효율적인 의사결정을 지원받고 있습니다.

더불어, 해시스크래퍼는 고객사의 안정적인 데이터 수집 환경 구축을 위해 전용 서버 요금제인 DC-ENTERPRISE를 다수 장기간 사용하기로 계약하였으며, 이 계약은 작년 중순에 체결되었습니다. DC-ENTERPRISE 전용 서버 요금제는 매달 고정 비용을 지불하는 방식으로, 개별 고객사에 전용 인프라를 제공하여 데이터 수집과 전처리 속도를 크게 향상시킵니다. 해시스크래퍼의 전담 엔지니어가 배정되어 빠르고 정확한 오류 대응을 지원함으로써, 고객사는 예측 가능한 비용 관리와 함께 고성능의 안정적인 데이터 솔루션을 제공받게 됩니다.

해시스크래퍼의 첨단 기술과 DC-ENTERPRISE 전용 서버를 통한 안정적 인프라 지원은 현대자동차의 디지털 경쟁력을 한층 강화하는 데 기여하고 있습니다. 현대차 데이터담당팀은 전달받은 데이터를 분석하여 운영 효율성 제고와 혁신적인 서비스 개발에 박차를 가하고 있으며, 이를 통해 미래 모빌리티 및 고객 맞춤형 서비스 분야에서 선도적인 역할을 수행할 것으로 기대됩니다.

앞으로도 해시스크래퍼는 고객사의 데이터 기반 혁신을 지원하기 위해 최상의 기술과 서비스를 지속적으로 제공하며, 더 많은 기업들이 디지털 전환에 성공할 수 있도록 노력할 것입니다.

#현대자동차 #해시스크래퍼 #웹크롤링 #데이터전처리 #데이터분석 #디지털전환 #전용서버 #대량데이터수집 #미래모빌리티 #고객맞춤형서비스 #혁신

1
0
밤코딩 밤치

밤코딩 밤치

MacMini M4로 AWS RDS 대체하여 연 5,000만원 절약합니다.

최근 해시스크래퍼의 인프라를 AWS에서 직접 운영 환경으로 전환하면서, 놀랍게도 비용 절감 효과를 크게 누릴 수 있었습니다.

기존에는 AWS RDS가 가장 큰 비용 부담이었는데, 한 달 AWS 비용으로 새로운 Mac mini(M4) 를 구입해 웹서버, 데이터베이스 서버 등 다양한 용도로 활용하고 있습니다. 고환율 시대에 월 단위로 나가는 클라우드 비용을 줄이고, 그 예산을 마케팅에 투자할 수 있게 된 점이 정말 큰 이점입니다.

물론 서버 직접 운영에는 고민할 부분도 있습니다.

1. 정전 후 자동 부팅 문제 – Mac mini에 해당 기능이 있긴 하지만, 실제 작동을 확인 못해서 아직은 조금 불안하네요. UPS를 도입하거나, 차후에는 고사양 맥북으로 대체를 고민 중입니다.

2. 백업 자동화 – 최근에는 하루 500만~1,000만 건의 작업으로 인해 대규모 데이터를 다루면서, 백업에 걸리는 1시간 이상의 시간이 고민이긴 합니다.

그럼에도 불구하고, 클라우드 종량 과금 구조에서 탈피하여 장비 직접 구매로 전환한 덕분에, 고환율 속에서도 비용 효율을 극대화할 수 있었습니다. 이렇게 줄인 비용을 다른 비즈니스 활동에 활용하고 있다는 점이 정말 뿌듯하네요~

CleanShot 2025-02-08 at 00.18.03@2x.jpgCleanShot 2024-12-21 at 20.42.55@2x 2.JPG

CleanShot 2025-02-08 at 00.26.36@2x.jpg

#해시스크래퍼 #웹크롤링 #AI #빅데이터

1
0
밤코딩 밤치

밤코딩 밤치

해시스크래퍼 상반기 회고 (부제: 데이터 분석의 미래와 우리의 선택)

2024년 상반기를 돌아보며, 저는 우리 회사 해시스크래퍼의 여정을 객관적인 시각에서 살펴보고자 합니다. 지난 몇 년간 데이터 분석 분야는 급격히 변화해왔고, 우리는 그 속에서 방향을 잡기 위해 노력해왔습니다. 이번 글에서는 우리 회사가 상반기 동안 겪은 경험을 바탕으로 데이터 분석 업계의 변화와 이에 대한 우리의 대응 전략을 공유하고자 합니다.

1. 사용자 성장, 그리고 그 뒤에 놓인 과제들

올해 상반기, 해시스크래퍼의 활성 사용자 수는 75% 증가했습니다. 이는 블로그를 통해 Technical documentation를 공개하며 관련 종사자들, 특히 대기업 종사자들의 관심을 끌어모은 결과입니다. 그러나 성장의 이면에는 여전히 풀어야 할 숙제가 있습니다. 대기업들이 데이터 사이언스 분야에 투자하기 시작한 것은 대략 5년 전부터였지만, 여전히 대기업들도 데이터 분석 인력을 3~5명 수준으로 유지하고 있는 경우가 많습니다.

2. AI의 발전과 데이터 분석가의 미래

AI는 데이터 분석의 패러다임을 재편하고 있습니다. ChatGPT와 Claude Artifacts 같은 AI 도구들이 데이터를 분석하고 코딩을 자동화하면서, 데이터 분석가의 가치와 역할은 재정의되고 있습니다. 우리도 AI 도구를 도입하여 데이터 분석의 상당 부분을 자동화했지만, 이러한 발전이 데이터 분석가의 입지를 좁히고 그 가치를 평가절하할 가능성에 대해서도 고민하고 있습니다. 특히, AI가 데이터 분석가보다 더 효율적이고 저렴한 대안으로 비춰질 위험이 있습니다.

3. 데이터 분석 과정에서의 기술 의존성

현재 데이터 분석 과정은 크게 세 단계로 나눌 수 있습니다: 데이터 소싱(크롤링/스크래핑) → 분석 → 시각화. 놀랍게도, 이 세 단계 모두 외부 기술에 크게 의존하고 있는 상황입니다. 소싱은 우리가 직접 수행하지만, 분석은 AI 도구에 의존하고, 시각화는 PowerBI나 태블로와 같은 외부 솔루션에 맡기고 있습니다. 이러한 기술 의존성은 데이터 분석가의 전문성을 축소시키고, 나아가 그들의 존재 가치를 위협하는 요소가 될 수 있습니다.

4. 매출 성장과 그 너머의 고민

올해 상반기 동안 해시스크래퍼는 작년 동기 대비 134%의 매출 성장을 기록했습니다. 1월부터 8월까지를 기준으로 보면, 매출은 107% 성장했습니다. Google Analytics(GA) 데이터 기준으로도 활성 사용자가 75% 증가했습니다. 이러한 수치는 잠재고객에게 우리 회사가 많이 알려질수록 매출이 증가한다는 사실을 다시 한번 확인시켜줍니다. 그러나 매출 규모는 여전히 크지 않으며, AI의 발전 속에서 많은 스타트업이 무너지고 있는 상황에서 새로운 아이템 개발은 매우 큰 리스크를 동반합니다. 우리는 사업 분야를 넓히지 않고 현재 핵심 역량에 집중하면서 매출을 증대시킬 방법을 찾고 있습니다.

5. 팀의 변화와 새로운 전략

우리 팀에는 변화가 있었습니다. 회사의 미션과 비전에 공감하는 직원들은 남아있고, 그렇지 않은 3명의 개발자는 떠났습니다. 인력이 줄어듦에 따라, 수익이 나지 않는 계약이나 우리가 하던 일과 다른 분야의 프로젝트들은 모두 정리했습니다. 이제 우리는 '데이터 수집을 가장 잘하는 회사'라는 명성을 얻기 위해 한 가지 중요한 결정을 내렸습니다. 단발성 고객은 과감히 포기하고, 장기적이며 규모가 큰 고객사와의 관계에 집중하며, 그들을 VVIP처럼 대하고 있습니다.

6. AI 기술 발전에 따른 스크래핑(크롤링) 업계의 변화

최근 AI 기술의 발전은 스크래핑(크롤링) 업계에도 큰 변화를 가져오고 있습니다. 기존에는 크롤러를 개발하는 과정에서 분산 처리나 IP 차단 문제를 해결하기 위해 개발자들이 많은 시간을 투자해야 했습니다. 하지만 이제는 이러한 기술적 문제들을 플랫폼이 자동으로 해결해주는 시대가 되었습니다. 그럼에도 불구하고 여전히 개발자들은 크롤링 코드를 직접 작성해야 하는 현실입니다.

하지만 앞으로의 변화는 이마저도 뒤흔들 것으로 보입니다. 불과 1년 전만 해도 대형 언어 모델(LLM)이 처리할 수 있는 토큰의 한계가 있었지만, 이제 조만간 메가 단위의 HTML을 LLM이 한 번에 해석할 수 있는 수준에 도달할 것으로 예상됩니다. 이와 같은 코딩 능력과 사실상 무제한에 가까운 토큰 처리량의 결합은 크롤러 코드 작성마저도 AI가 대신할 수 있음을 의미합니다.

이로 인해, 크롤러 개발에 필요한 인력 수요는 빠르게 감소할 가능성이 큽니다. 앞으로 1년 내로, 크롤러 개발 인력의 필요성 자체가 크게 줄어들 것이고, 이는 업계의 인력 구조와 역할에 상당한 영향을 미칠 것입니다. AI가 더 복잡한 크롤링 작업을 자동으로 처리할 수 있게 되면서, 개발자들은 점점 더 고도화된 문제 해결과 데이터 활용 전략에 집중해야 할 필요가 생기고 있습니다.

마무리하며: 우리는 어디로 가고 있는가?

이번 상반기는 우리가 스스로의 방향성을 더욱 확고히 하고, 빠르게 변화하는 시장에 어떻게 적응해야 하는지에 대한 중요한 교훈을 준 시기였습니다. AI와 데이터 분석의 결합은 물론, 스크래핑(크롤링) 분야의 변화도 우리에게 새로운 도전 과제를 던져주고 있습니다. AI가 크롤링 코드까지 자동으로 생성할 수 있는 수준으로 발전함에 따라, 크롤러 개발 인력의 필요성은 점점 더 줄어들 것입니다. 이는 우리 회사가 데이터 수집과 같은 핵심 역량에 더욱 집중하면서도, 변화하는 환경에 맞춘 새로운 전략을 수립해야 함을 의미합니다.

이러한 변화 속에서도 해시스크래퍼는 '데이터 수집을 가장 잘하는 회사'라는 명성을 쌓기 위해 최선을 다할 것입니다. 사업 분야를 넓히기보다는 현재의 강점에 집중하며, 더 많은 기업들이 우리의 가치를 인정해 주기를 기대합니다. 앞으로도 우리는 배우고, 적응하며, 성장할 것입니다. 긴 글을 읽어주셔서 감사합니다.

CleanShot 2024-09-06 at 08.55.26@2x.jpgCleanShot 2024-09-06 at 08.59.44@2x.jpgCleanShot 2024-09-06 at 10.05.01.jpg
6
2
밤코딩 밤치

밤코딩 밤치

메이커 스프린트 2기에 지원합니다 (AI 뉴스 스니핑 서비스)

기대하던 메이커 스프린트 2기에 지원했습니다.

회사내부에서 잘 개발하면 될 것을 왜 디스콰이엇 메이커 스프린트에 참여했는지 궁금하실것 같아서 저의 생각을 공유해 보려고해요.

  1. 초기 사용자 확보

  2. 게으름을 스스로 이기기 힘들어서

  3. 똑똑한 유저들의 피드백을 받고 싶어서

  4. 마케팅에 큰 도움이 되기 때문에 (뉴스레터, 인터뷰, 배너 등록 등 리워드를 기대하고 있습니다)

위와 같은 이유로 메이커 스프린트에 지원하게 되었습니다.

[초기 사용자 확보]

처음 서비스를 시작할 때, 내 제품을 써줄 사용자를 찾는 건 마치 사막에서 동전 찾기 처럼 어렵죠. 하지만 이 스프린트에 참여하면 모두가 서로의 고객이 되어줘서, 내가 애타게 찾던 첫 사용자들을 손쉽게 확보할 수 있어요. 처음 만난 사람들에게서 ’와! 이거 정말 좋다!’라는 반응을 직접 듣게 되는 경험은 말로 표현할 수 없을 만큼 짜릿할것 같습니다.

[게으름을 스스로 이기기 힘들어서]

우리 모두의 마음속에는 ‘내일부터 할게’라는 작은 악마가 숨어있어요. 이 스프린트에 참가하면, 3주 동안 같은 목표를 향해 달리는 동료들과 함께 할 수 있어서 게으름을 이길 수 있는 강력한 동기부여가 됩니다. 마치 마라톤을 함께 뛰는 것처럼, 서로 격려하며 끝까지 포기하지 않고 달릴 수 있게 해주죠.

[똑똑한 유저들의 피드백을 받고 싶어서]

세상에는 정말 똑똑한 사람들이 많아요. 그리고 그들의 피드백은 우리가 미처 생각하지 못한 새로운 시각을 열어줍니다. 이 스프린트에서는 다양한 배경을 가진 유저들과 소통하면서, 그들의 솔직한 피드백을 받을 수 있어요. 그 피드백을 통해 제품을 더 똑똑하게 발전시킬 수 있는 기회를 얻는 거죠.

[마케팅에 큰 도움이 되기 때문에]

마케팅은 제품의 성패를 좌우하는 중요한 요소이죠. 이 스프린트에서는 뉴스레터, 인터뷰, 배너 등록 등 다양한 리워드를 기대할 수 있어요. 이런 홍보 기회는 제품의 인지도를 높이고, 더 많은 사용자들에게 다가갈 수 있는 최고의 방법이죠. 마치 로켓에 탑승한 것처럼, 단기간에 많은 사람들에게 제품을 알릴 수 있는 기회를 놓치지 마세요!

저희 팀이 만들고자 하는 서비스는 다음과 같습니다.

지원서에 작성한 내용을 그대로 적어볼게요~

Problem:

우리 회사 또는 경쟁사의 뉴스를 모니터링 하고 싶어요.

그런데 회사이름을 키워드로 검색하게 되면 쓸데 없는 기사가 검색되기도하고, 뉴스를 하나하나 읽어볼 시간도 많지 않아요.

낚시성 제목에 낚이는 경우도 많습니다.

Solution:

AI로 우리에게 꼭 필요한 뉴스를 필터링하고, 기사를 분류(카테고리 분류)하며, 중요도도 3단계로 구분합니다.

기사의 핵심 내용을 5줄로 요약하여 주요 내용 및 엔티티(회사명, 장소, 인물, 숫자 등)를 정리해서 읽기 쉽게 만들어 줍니다.

분석된 기사는 이메일이나 카카오톡으로 알림을 발송해드려요.

어떻게 개발하고 구현할 계획인가?

현재 아이디어가 거의 정리된 상태이며, 기술적인 검토가 완료되었습니다.

메이커 스프린트를 통해서 사용자의 피드백을 받고 기획에 반영할 예정입니다.

SaaS 웹서비스로 출시할 예정이고, 무료와 유료 모두 사용할 수 있도록 개발 될 예정입니다.

현재 가장 고민하고 있는 것, 메이커 스프린트를 통해서 해결할 것?

가설을 검증하고 사용자 반응을 통해서 기획/UX를 개선할 예정입니다.

또한 가격체계도 검증하려고 합니다.

메이커 스프린트 2기에 꼭 참가하고 싶습니다. 하지만 20팀만 뽑는다고하여 조금 걱정이되기도 하네요 ㅎㅎ

저희 팀이 떨어지더라도 꾸준히 개발과정을 기록하고 공유하여 피드백을 받을 수 있었으면 좋겠습니다.

참고로 이 서비스는 기업 뿐만 아니라 개인도 사용할 수 있도록 만들 예정이니 많은 호응 부탁드려요😍

11
1
밤코딩 밤치

밤코딩 밤치

달러💰 이렇게 비싸져도 되냐?! AWS를 탈출하고 비용절약하자!

안녕하세요, 저는 2013년부터 AWS를 사용해왔지만, 최근 회사에서는 자체 서버를 구축하기로 결정했습니다. 오늘은 이 과정과 그 이유, 그리고 여러분께 도움이 될만한 조언들을 공유하려고 합니다.

왜 AWS에서 자체 서버로 전환했는가?

AWS는 확장성과 안정성, 보안 측면에서 많은 장점을 가지고 있습니다. 특히, 사용자가 폭증할 때 유연하게 대처할 수 있다는 점이 큰 장점입니다. 그러나 우리의 경우 B2B 서비스를 제공하기 때문에 사용자가 급격하게 늘어날 가능성이 적습니다. B2B의 경우 계약 프로세스에서 계약 건수를 조절할 수 있기 때문에 확장성에 있어 큰 문제가 없습니다. 실제로 해시스크래퍼가 창업된 이후로 그러한 경험을 겪은 적은 없습니다. 따라서, 비용 절감을 위해 자체 서버를 구축하기로 했습니다.

전환 과정에서의 도전 과제와 해결 방법

아직 많은 부분을 이전하지는 않았지만, 데이터베이스, 스테이징 서버, 신규 개발 중인 서비스 등을 내부 서버로 옮겼습니다. 현재까지는 큰 어려움 없이 진행되고 있습니다. 물리적인 서버 자원을 잘 활용하면 비용 면에서 큰 이점을 얻을 수 있습니다.

자체 서버 운영의 장기적인 이점

자체 서버를 운영함으로써 우리는 비용 절감뿐만 아니라 기존의 물리적 서버 자원을 최대한 활용할 수 있었습니다. 보안 강화나 성능 향상 등도 충분히 달성할 수 있다고 생각합니다.

다른 개발자와 IT 회사에 주는 조언

서버 인프라 기술이 계속 발전하면서 인프라 설정과 운영이 더 쉬워졌습니다. GPT 같은 도구를 활용하면 서버 설정에 대한 많은 힌트를 얻을 수 있습니다. 이를 통해 복잡한 가이드를 읽는 시간을 줄이고, 시행착오를 줄여 예전보다 인프라 설정에 큰 시간을 들이지 않아도 됩니다. 물리적 서버를 저렴하게 구입한 후, GPT를 활용해 서버를 구축하면 큰 비용 절감 효과를 기대할 수 있습니다.

애플 실리콘 칩과 도커의 활용

또한, 저는 애플 실리콘 칩, 특히 Mac Mini M1이나 M2를 추천합니다. 이 제품들은 가격 대비 성능이 매우 뛰어나며, 안정성도 높습니다. 도커를 이용하면 배포도 매우 쉽게 할 수 있어, 서버 운영을 더 효율적으로 만들 수 있습니다.

다단계 인증(MFA)을 통한 보안 강화

자체 서버에서도 AWS에서 제공하는 높은 수준의 보안을 유지하기 위해, 다단계 인증(MFA)을 도입할 수 있습니다. 이를 통해 보안을 한층 강화할 수 있습니다. 다음은 다단계 인증을 자체 서버에 구현하는 방법에 대한 간단한 가이드입니다.

  1. MFA 솔루션 선택: Google Authenticator, Authy, Yubikey와 같은 솔루션을 선택합니다.

  2. 서버 구성: 사용자 인증 흐름에 MFA 단계를 추가합니다. 사용자가 ID와 비밀번호를 입력한 후, MFA 토큰을 입력해야만 로그인할 수 있도록 합니다.

  3. API 통합: MFA 솔루션에서 제공하는 API를 사용하여 애플리케이션 서버와 통합합니다.

  4. 사용자 인터페이스: 로그인 페이지에 MFA 입력 필드를 추가하고, MFA 설정 페이지를 만들어 사용자가 자신의 MFA 장치를 등록하거나 관리할 수 있도록 합니다.

  5. 백엔드 로직: 사용자 인증 시, ID와 비밀번호를 검증한 후 MFA 토큰을 검증하는 단계를 추가합니다.

  6. 테스트 및 배포: 다양한 시나리오에서 테스트를 진행하여 보안이 잘 작동하는지 확인하고, 서버에 변경 사항을 배포합니다.

추가적인 궁금증

Q: 자체 서버로 전환하면서 데이터 보안에 대해 어떻게 대비하고 계신가요? AWS는 기본적으로 높은 수준의 보안 서비스를 제공하는데, 자체 서버에서는 이를 어떻게 보완하고 있는지 궁금합니다.

A: 보안에 있어서는 ChatGPT의 도움을 받아 다양한 보안 조치를 취하고 있습니다. 먼저, 접근 권한 관리 측면에서 IP 대역 설정과 ID 및 패스워드 관리 외에도 다단계 인증을 도입해 보안을 강화했습니다. 물리적 보안 측면에서는 서버가 위치한 데이터 센터의 출입 통제와 감시 시스템을 통해 보호하고 있습니다. 또한, 정기적인 보안 점검과 취약점 분석을 통해 잠재적인 위협을 사전에 차단하고 있습니다. 백업 전략으로는 주기적인 데이터 백업과 외부 스토리지에 대한 저장을 통해 데이터를 안전하게 보호하고 있습니다.

또한, 물리적 서버를 여러 대 운영하면서 데이터베이스 복제(리플리케이션)를 통해 데이터의 안전성을 높이고 있습니다. 여러 서버에 데이터를 분산하여 운영하기 때문에 백업에 대한 위험 요소가 상당히 줄어들었고, 데이터 손실의 위험을 최소화할 수 있습니다. 웹서버 역시 여러 물리 서버에서 운영함으로써 안정성을 높였습니다.

Q: AWS에서 자체 서버로 이전하는 과정에서 예상치 못한 문제나 추가 비용이 발생한 사례가 있었나요? 그렇다면 이를 어떻게 해결하셨는지도 궁금합니다.

A: 예상치 못한 문제나 추가 비용 발생 사례로는 초기 서버 설정 과정에서의 호환성 문제와 일부 하드웨어 업그레이드 필요성이 있었습니다. 특히, 기존의 소프트웨어와 하드웨어 간의 호환성 문제로 인해 예상보다 많은 시간과 비용이 소요되었습니다. 이를 해결하기 위해 GPT의 도움을 받아 호환성 문제를 빠르게 진단하고 해결할 수 있었으며, 추가적으로 필요한 하드웨어 업그레이드는 신중한 계획을 통해 비용을 최소화할 수 있었습니다. 전체적으로는 초기 설정 비용이 있었지만, 장기적인 비용 절감 효과는 여전히 매우 긍정적입니다.

Q: 자체 서버로의 전환이 개발자들에게 어떤 영향을 미쳤나요? 팀의 업무 방식이나 효율성에 변화가 있었는지도 궁금합니다.

A: 자체 서버로의 전환은 개발자들에게 새로운 도전이자 기회가 되었습니다. 처음에는 서버 관리와 설정에 대한 추가 학습이 필요했지만, GPT의 도움을 받아 필요한 지식과 기술을 빠르게 습득할 수 있었습니다. 이 과정에서 팀의 협업이 강화되고, 서버 관련 문제를 해결하는 데 있어 더 많은 주도성을 가지게 되었습니다. 결과적으로, 인프라 관리에 대한 이해도가 높아져 개발 효율성도 향상되었습니다.

Q: 자체 서버 운영을 시작한 후, 시스템의 성능 모니터링과 최적화는 어떻게 진행하고 계신가요?

A: 우리는 다양한 모니터링 도구를 활용해 시스템 성능을 지속적으로 모니터링하고 있습니다. 주요 성능 지표를 실시간으로 확인하고, 문제가 발생할 경우 자동 알림을 통해 신속하게 대응하고 있습니다. 또한, 주기적인 성능 리뷰와 최적화 작업을 통해 시스템의 안정성과 효율성을 유지하고 있습니다. 이를 통해 서비스 가용성을 높이고, 사용자 경험을 최적화할 수 있었습니다.

MFA 구현 관련 코드는 아래 블로그에서 확인해주세요!

해시스크래퍼

코딩없이, 가장 쉽고 빠른 웹 데이터 크롤링

13
2