Han

Han

일본 금융계에서 일하는 데이터 사이언티스트입니다.

소셜 링크

프로덕트

포스트

전체 보기
Han

Han

일본 금융계에서 일하는 데이터 사이언티스트입니다.

신용 모델은 승인한 고객의 결과만 보고 학습합니다. 그런데 정작 평가는 거절한 사람까지 포함한 전체 신청자에게 하죠. 승인된 사람만 본 모델을 전체에 그대로 들이대면 편향됩니다. 이 표본 선택 편향을 바로잡는 게 거절 추론(reject inference)입니다.

신용 리스크 업계에선 수십 년 된 표준 주제인데, 막상 파이썬 도구가 비어 있었습니다. R에는 있는데 파이썬 스코어카드 라이브러리들은 거절 추론을 아예 다루지 않더군요. 그래서 직접 만들어 공개했습니다.

rejectkit은 고전 기법 여덟 가지를 scikit-learn 스타일 한 API로 묶었습니다. 진짜 차별점은 따로 있어요. 거절 추론은 만능이 아니라 어떤 데이터에선 오히려 손해를 봅니다. 그래서 "이 보정이 내 데이터에서 정말 도움이 되는지"를 먼저 재는 벤치마크(MaskedRejectBenchmark)를 넣었습니다. 실제로 합성 데이터에선 거의 손해였는데, 실데이터(Kaggle Home Credit)에선 손실의 7~8%를 회복했습니다. 데이터마다 다르니 믿고 쓰지 말고 먼저 측정하자는 게 이 라이브러리의 메시지입니다.

신용이나 대출 ML뿐 아니라, 합격한 사람만 결과가 보이는 모든 선택 편향 상황에도 같은 원리가 적용됩니다. 채용 성과 예측이나, 플래그된 건만 라벨링되는 사기 탐지 같은 것들이요.

pip install rejectkit 로 바로 쓸 수 있고, 배경과 실험은 블로그에 정리해 뒀습니다.

GitHub: https://github.com/HangilKim11/rejectkit
PyPI: https://pypi.org/project/rejectkit/
글: https://han-co.com/ko/blog/rejectkit

rejectkit

승인한 고객만 보고 배운 신용 모델의 편향을 바로잡는 거절 추론 라이브러리. 쓰기 전에 내 데이터에서 효과 있는지부터 평가해 줍니다. (파이썬 오픈소스)

0
0
Han

Han

일본 금융계에서 일하는 데이터 사이언티스트입니다.

외국어로 일할 때 진짜 어려운 건 '번역'이 아니라 '톤'입니다.
"이거 너무 무뚝뚝한가? 너무 격식인가? 상사에게 이렇게 보내도 되나?"
30초면 쓸 메시지를 10분씩 붙잡다가 결국 직역해서 보내고 후회하죠.

ToneBridge는 초안을 적절한 업무 톤으로 다시 써줍니다.

• 한·일·영·중 4개 언어, 어떤 방향이든
• 8가지 톤 모드 (정중 / 부드러운 거절 / 상사·고객 / 사과+리마인드…)
• 단순 번역이 아니라 '왜 이 표현인지'까지 설명 — 번역기가 아닌 코치
• 크롬 확장: Gmail·Slack·LinkedIn에서 텍스트 선택 → Ctrl+Shift+Y → 사이드 패널에서 바로

일본에서 외국어로 일하며 매일 겪던 문제라 직접 만들었습니다.
무료로 시작 — 월 10회, 비밀번호 없이 이메일만.

피드백 환영합니다 🙏

ToneBridge

번역이 아니라 '톤'을 고쳐주는 다국어(한·일·영·중) 업무 메시지 코치

0
0