프로덕트

포스트

전체 보기
백도연

백도연

프론티어 모델 안 쓰고, 오픈웨이트 35B를 "같은 링에서" 붙여봤습니다

모델명 미제공 벤치마크

안녕하세요.

저희는 AI 에이전트들이 실제 회사 운영 업무, 예를 들면 이슈 분류 / 실행 / 판단을 자율로 처리하는 시스템을 만들고 있습니다.

여기서 제일 중요한 건 코딩 실력보다도 "다음에 뭘 할지" 판단하는 능력이더라고요.

  • 이 일을 끝낼지
  • 검토로 넘길지
  • 막혔다고 선언할지

같은 판단입니다.

문제는, 이걸 프론티어 API로 전부 돌리면 비용을 감당하기 어렵다는 것이었습니다.

그래서 저희가 받아 쓰는 스톡 오픈웨이트 35B 모델을 같은 하니스에 올려 비교했습니다.

아래 2.89점 모델은 저희가 학습한 모델이 아니라, 검증 대상으로 사용한 기성 오픈웨이트 모델입니다.


그런데 "잘 만들었다"를 어떻게 증명할까요?

그래서 먼저 벤치마크 하니스부터 만들었습니다.

어떻게 측정했나

  • Frozen

    • 실제 운영 로그에서 추출한 N=116 사례
    • 정답을 한 번 고정하고 이후 변경하지 않음
  • Blinded

    • LLM 심판에게 모델명을 알려주지 않고 1~5점으로 채점
  • Native

    • 각 모델을 각자의 실행 방식 그대로 사용
  • 유효성 검증

    • 무의미 baseline 대비 판별력 +1.77 확인

결과

Overall score, 1~5점 기준

모델 점수
Claude Opus 3.43
Claude Sonnet 3.20
Claude Haiku 3.09
스톡 오픈웨이트 35B 2.89
Baseline 1.12

저희 도메인에서 스톡 오픈웨이트 35B 모델은 Haiku 판단 품질의 약 93%에 도달했습니다.

2.89 / 3.09 ≈ 93%

비용은 Haiku 대비 13.5%였습니다.


정정 공지

이전 판(2026-07-16까지)은 Haiku 점수를 2.80으로 싣고 parity를 주장했습니다.

그런데 이후 검증 과정에서 문제가 발견됐습니다.

기존 2.80 점수는 Haiku만 CLI 경로로 생성했고, 나머지 모델들은 API 경로를 사용했습니다.

또한 116건 중 5건에서 Haiku 응답이 스스로 모델 정체를 드러내는 문제가 있었습니다.

그래서 동일 subset을 API 경로로 재생성하고 다시 판정했습니다.

그 결과:

  • Haiku: 2.80 → 3.09
  • paired 변화: +0.34
  • n=97
  • 자기정체 노출: 5건 → 0건
  • 관련 이슈: TON-3150

외부에서 지적받은 게 아니라 저희가 먼저 발견했고, 그래서 기존 수치와 주장도 직접 수정했습니다.


그래서 실제로 동급인가?

같은 케이스를 기준으로 paired 비교한 결과:

  • n=90
  • 차이 (35B − Haiku) = -0.26
  • 95% CI [-0.51, -0.01]
  • paired t-test: p = 0.045

즉 평균 점수 기준으로는 35B 모델이 Haiku보다 근소하게 낮았습니다.

다만 같은 90건에 대한 부호검정에서는:

  • 승: 25
  • 패: 39
  • 무: 26
  • p = 0.103

으로 유의하지 않았습니다.

그래서 저희 주장은:

"이겼다"도 아니고,

"구분되지 않는다(parity)"도 아니고,

"Haiku보다 근소하게 낮다"입니다.


비용은?

비용도 같은 자체 호스팅 경로에서 실측했습니다.

환경:

  • Qwopus3.6-35B-A3B
  • Q4_K_M
  • RTX 3090 1대
  • llama-server

실측 비용:

$0.378 / 1,000 decisions

이 하니스에서 Claude Haiku 기준 비용 대비:

13.5%

즉 약:

1 / 7.4 비용

입니다.

단, 이 값은 해당 모델 / 하드웨어 / 배포 경로 기준 실측값이기 때문에 다른 조건에서는 별도 측정이 필요합니다.


만들면서 배운 것 / 방법론 / 차트

👉 https://codennect.co.kr/benchmark.html?utm_source=disquiet&utm_medium=community&utm_campaign=makerlog

비슷한 고민을 하고 계시면 편하게 물어보세요.

저희는 현재:

  • 고객사 모델 파인튜닝
  • 에이전트 판단 품질 평가
  • 운영형 AI 에이전트

쪽을 만들고 있습니다.

Codennect

주 안에 브라우저에서 만져보는 첫 데모—LLM 파인튜닝·멀티 에이전트 오케스트레이션을 사내 데이터·보안 요건에 맞춰 제품으로 만듭니다.

0
0