David
읽음으로써 가치를 제공하는 글을 씁니다.
G2BMarket이 결국 "공공데이터를 기업 중심으로 다시 묶는" 서비스라, 시작은 무조건 데이터 수집이다. 그런데 막상 해보니 "긁어온다"는 말이 너무 순진했다. 진짜 일은 어느 소스를 어디까지 믿을지 정하는 것이었다.
지금 모으는 소스는 대충 이렇다.
나라장터 API: 공고, 사전규격, 낙찰, 계약. 사업 쪽 핵심.
공공데이터포털: 나라장터랑 연계된 공공 데이터.
국민연금 사업장 공개 데이터: 고용 흐름 참고용. "이 회사 사람이 늘고 있나"를 12개월로 보려고.
공정위/통신판매 등 공개 사업자 데이터: 아직 우리가 모르는 신규 사업자를 발굴하는 후보 풀.
겪은 것: 소스마다 "말투"가 다르다
같은 회사인데 소스마다 이름 표기가 미묘하게 다르다. 띄어쓰기, (주)/주식회사, 지점 표기… 사람 눈엔 같은 회산데 기계 눈엔 남남이다. 이걸 하나로 붙이는(=매칭) 게 수집보다 훨씬 골치였다.
그리고 데이터가 "있다"고 다 쓸 수 있는 것도 아니었다. 갱신 주기가 제각각이라, 어떤 건 어제 것이고 어떤 건 몇 달 전 상태다. 그래서 화면에 뭘 보여줄 때 "이건 참고용이고 실제랑 다를 수 있다"는 전제를 계속 깔아야 했다. 이 감각이 없으면 그냥 틀린 정보를 자신 있게 보여주는 서비스가 된다.