Codennect

주 안에 브라우저에서 만져보는 첫 데모—LLM 파인튜닝·멀티 에이전트 오케스트레이션을 사내 데이터·보안 요건에 맞춰 제품으로 만듭니다.

0 팔로워

소개

AI 제품을 소개할 때 가장 애매한 순간은 데모는 보이는데, 어디까지가 실제로 검증된 범위인지 알기 어려울 때라고 생각합니다. Codennect는 LLM 파인튜닝과 멀티 에이전트 오케스트레이션을 설계하고, 4주 안에 브라우저에서 만져보는 첫 데모로 가설을 검증하는 AI/제품 스튜디오입니다. 사내 데이터와 업무 흐름을 기준으로 RAG·파인튜닝·오케스트레이션을 연결하고, 필요하면 API 또는 온프레미스/사내망 환경으로 통합합니다. 격리 실행과 민감정보 비유출을 고려한 보안 설계도 기본값입니다. 포트폴리오에서는 무엇을 만들었는지뿐 아니라, 어디까지가 데모·공개 샘플·정적 시나리오인지도 함께 밝힙니다. AI OS Core: 합성 UI를 사용하는 AI 운영 화면입니다. 고객 데이터나 실시간 운영 성과를 주장하지 않습니다. Boardwalk: 익명화된 공개 샘플을 바탕으로, 문제·역할·산출물을 따라가 볼 수 있는 사례입니다. Governance Office: 정적 데모와 공개 JSON으로 검토 가능한 범위를 보여주는 사례입니다. 브라우저·접근성 검증 수치도 제품 성과가 아니라 검증 결과로 구분해 표시합니다. AI 기능을 넣었다보다 무엇이 재현 가능하고 어디까지가 데모인지가 먼저 보이게 하는 것이, 실제 협업 대화에 더 도움이 되는지 확인하고 싶습니다. 비슷한 AI/제품 시스템을 만들거나 검증해야 하는 팀이라면, 아래 링크에서 사례를 보고 어떤 정보가 더 필요했는지 한 줄 남겨 주세요. 구체적인 협업/검토 문의도 같은 링크에서 받습니다. https://codennect.co.kr/contact/?utm_source=ton3941&utm_medium=community&utm_campaign=restart_7d_20260804

포스트

백도연

백도연

프론티어 모델 안 쓰고, 오픈웨이트 35B를 "같은 링에서" 붙여봤습니다

모델명 미제공 벤치마크

안녕하세요.

저희는 AI 에이전트들이 실제 회사 운영 업무, 예를 들면 이슈 분류 / 실행 / 판단을 자율로 처리하는 시스템을 만들고 있습니다.

여기서 제일 중요한 건 코딩 실력보다도 "다음에 뭘 할지" 판단하는 능력이더라고요.

  • 이 일을 끝낼지
  • 검토로 넘길지
  • 막혔다고 선언할지

같은 판단입니다.

문제는, 이걸 프론티어 API로 전부 돌리면 비용을 감당하기 어렵다는 것이었습니다.

그래서 저희가 받아 쓰는 스톡 오픈웨이트 35B 모델을 같은 하니스에 올려 비교했습니다.

아래 2.89점 모델은 저희가 학습한 모델이 아니라, 검증 대상으로 사용한 기성 오픈웨이트 모델입니다.


그런데 "잘 만들었다"를 어떻게 증명할까요?

그래서 먼저 벤치마크 하니스부터 만들었습니다.

어떻게 측정했나

  • Frozen

    • 실제 운영 로그에서 추출한 N=116 사례
    • 정답을 한 번 고정하고 이후 변경하지 않음
  • Blinded

    • LLM 심판에게 모델명을 알려주지 않고 1~5점으로 채점
  • Native

    • 각 모델을 각자의 실행 방식 그대로 사용
  • 유효성 검증

    • 무의미 baseline 대비 판별력 +1.77 확인

결과

Overall score, 1~5점 기준

모델 점수
Claude Opus 3.43
Claude Sonnet 3.20
Claude Haiku 3.09
스톡 오픈웨이트 35B 2.89
Baseline 1.12

저희 도메인에서 스톡 오픈웨이트 35B 모델은 Haiku 판단 품질의 약 93%에 도달했습니다.

2.89 / 3.09 ≈ 93%

비용은 Haiku 대비 13.5%였습니다.


정정 공지

이전 판(2026-07-16까지)은 Haiku 점수를 2.80으로 싣고 parity를 주장했습니다.

그런데 이후 검증 과정에서 문제가 발견됐습니다.

기존 2.80 점수는 Haiku만 CLI 경로로 생성했고, 나머지 모델들은 API 경로를 사용했습니다.

또한 116건 중 5건에서 Haiku 응답이 스스로 모델 정체를 드러내는 문제가 있었습니다.

그래서 동일 subset을 API 경로로 재생성하고 다시 판정했습니다.

그 결과:

  • Haiku: 2.80 → 3.09
  • paired 변화: +0.34
  • n=97
  • 자기정체 노출: 5건 → 0건
  • 관련 이슈: TON-3150

외부에서 지적받은 게 아니라 저희가 먼저 발견했고, 그래서 기존 수치와 주장도 직접 수정했습니다.


그래서 실제로 동급인가?

같은 케이스를 기준으로 paired 비교한 결과:

  • n=90
  • 차이 (35B − Haiku) = -0.26
  • 95% CI [-0.51, -0.01]
  • paired t-test: p = 0.045

즉 평균 점수 기준으로는 35B 모델이 Haiku보다 근소하게 낮았습니다.

다만 같은 90건에 대한 부호검정에서는:

  • 승: 25
  • 패: 39
  • 무: 26
  • p = 0.103

으로 유의하지 않았습니다.

그래서 저희 주장은:

"이겼다"도 아니고,

"구분되지 않는다(parity)"도 아니고,

"Haiku보다 근소하게 낮다"입니다.


비용은?

비용도 같은 자체 호스팅 경로에서 실측했습니다.

환경:

  • Qwopus3.6-35B-A3B
  • Q4_K_M
  • RTX 3090 1대
  • llama-server

실측 비용:

$0.378 / 1,000 decisions

이 하니스에서 Claude Haiku 기준 비용 대비:

13.5%

즉 약:

1 / 7.4 비용

입니다.

단, 이 값은 해당 모델 / 하드웨어 / 배포 경로 기준 실측값이기 때문에 다른 조건에서는 별도 측정이 필요합니다.


만들면서 배운 것 / 방법론 / 차트

👉 https://codennect.co.kr/benchmark.html?utm_source=disquiet&utm_medium=community&utm_campaign=makerlog

비슷한 고민을 하고 계시면 편하게 물어보세요.

저희는 현재:

  • 고객사 모델 파인튜닝
  • 에이전트 판단 품질 평가
  • 운영형 AI 에이전트

쪽을 만들고 있습니다.

Codennect

주 안에 브라우저에서 만져보는 첫 데모—LLM 파인튜닝·멀티 에이전트 오케스트레이션을 사내 데이터·보안 요건에 맞춰 제품으로 만듭니다.

0
0

댓글

로그인 후 댓글을 남길 수 있습니다.

아직 댓글이 없습니다.