LLM 시험지 & 채점기
AI한테 일을 맡기기 전에 시험을 보게 하는 오픈소스 테스트 러너·채점기
0
0 팔로워
소개
업무를 맡길 AI를 못 믿어서, 먼저 시험을 보게 하는 테스트 러너와 채점기를 만들었습니다.
- 맞다/틀리다가 아니라 사고 등급으로 채점합니다. 치명(되돌릴 수 없음)·위험·누락·무해 — 치명이 0이면 내놓고, 1이면 점수가 높아도 못 내놓습니다
- 함정을 심은 예제 시험지 29문제가 들어 있습니다 (폭만 다른 상품 2종, 같은 숫자로 시작하는 상품 5종 같은)
- 실전에서 물린 방어 로직들 — 잘린 JSON 복구, 판정 우선 채점, 답안 원본 저장 후 재채점
- AI 채점관(judge.py)으로 채점기 자체를 검증합니다. 실제로 이 AI 채점관이 제 코드 채점기의 버그 2개를 잡았습니다
만들면서 제일 많이 틀린 건 AI가 아니라 정답지를 쓴 저였습니다. 그 이야기는 velog "AI 검증" 시리즈에 정리하고 있습니다. MIT 라이선스, 전부 공개입니다.
포스트
아직 포스트가 없습니다.
댓글
로그인 후 댓글을 남길 수 있습니다.
아직 댓글이 없습니다.