Tracer

내 서비스랑 갖다 쓰는 외부 API가 조용히 틀릴 때까지 잡아내는 모니터

0 팔로워

소개

Tracer는 혼자 운영하는 서비스랑 거기서 갖다 쓰는 외부 API를 감시하려고 직접 만들고 있는 모니터에요. 서버가 죽었는지뿐 아니라 200은 뜨는데 응답 값이 조용히 틀린 경우까지 보는 데 초점을 맞추고 있어요. 지금은 제 것들로 직접 써보면서 다듬는 중이고, 요즘은 문제를 잡은 다음에 어디까지 자동으로 손대게 할지를 풀고 있습니다.

포스트

심우석

심우석

서비스가 죽기 전에 먼저 알고 싶어서 도구를 만드는 개발자(_ _ )

새벽에 알림이 우르르 울려서 깼어요. 뭐 하나 죽었구나 싶어 폰 들고 부랴부랴 켰는데, 막상 다 멀쩡하더라고요.

허탈한 것보다 좀 부끄러웠어요. 제 서비스인데 이게 정상일 때 무슨 값인지도 모르고 있었거든요. 경보 기준을 그냥 감으로 박아놓고, 그럴듯하게 때려맞히고 있었던 셈이죠. 결국 그동안 실제로 들어온 값들을 한참 들여다보고 나서야 기준을 다시 잡았어요. 그제야 좀 조용해졌고요.

사실 제가 굴리는 건 대단한 것도 아니에요. 웹 몇 개랑 API 하나, 테스트용 하나 정도. 트래픽 많은 것도 아니고요. 근데도 200 떴으니 됐겠지로는 안심이 안 돼서, 값까지 보는 걸 직접 만들어서 2주째 제 것들 보고 있어요.

근데 요즘 더 파고드는 건 그 반대예요. 헛알람도 이렇게 잘 내는 주제에, 진짜로 뭔가 틀렸을 때 사람 안 거치고 어디까지 자동으로 손대게 둘지요. 내 감이 그렇게 틀렸는데 자동한테 맡겨도 되나 싶고, 잘못 건드리면 오히려 더 크게 터지니까요. 그 선을 어디다 둘지 만들면서 계속 고민 중이에요.

다들 자기 서비스나 갖다 쓰는 외부 API가 이상해지면 어떻게 대응하세요? 그때그때 수동으로 고치시는지, 아니면 cron이나 스크립트로 자동으로 처리하는 거 이미 돌리고 계신지 궁금해요.

Tracer

내 서비스랑 갖다 쓰는 외부 API가 조용히 틀릴 때까지 잡아내는 모니터

0
0

댓글

로그인 후 댓글을 남길 수 있습니다.

아직 댓글이 없습니다.