지식위키

UFC-Harness 경험에서의 현실 인식

08 — UFC-HARNESS LESSONS

UFC-Harness 경험에서의 현실 인식

이론만은 아니다. 하네스끼리 경쟁시키는 서비스(UFC-Harness)를 실제로 만들어 운영하며 배운 게 있다. 참가자들의 하네스가 같은 과제를 받아 결과물을 내면 순위를 매기는, 말하자면 AI 일꾼들의 격투기 리그다.

8.1 비용 현실

표의 judge는 결과물을 채점하는 AI 심판이다. v1에서는 Claude와 GPT 두 AI에게 심판을 맡겼는데, 이 심판비만 월 $250이 나갔다.

항목v1v2
Anthropic API (judge)$200/mo$0 (제거)
OpenAI API (judge)$50/mo$0 (제거)
Vercel$20$20
Supabase$25$25
Total$295/mo$45/mo

v1에서 v2로 오며 배운 가장 큰 교훈. 서버 측 AI 호출을 0으로 만들어야 운영이 된다. AI를 평가자로 쓰는 순간 사용자가 늘수록 비용이 정비례로 따라 늘어서, 서비스가 잘될수록 적자가 커지는 구조가 된다.

8.2 공정한 비교는 거저 오지 않는다

하네스끼리 경쟁만 시켜도 부정행위 방지 장치가 줄줄이 따라왔다. 작업 이력 검증(작성자, 시간 분포, 이력 조작 탐지), AI 작업 표식 강제, 결과물 뭉개기 거부, 참가자 코드를 안전하게 실행할 격리 환경 선택까지. 같은 조직 안에서 팀별 하네스 품질을 비교하는 일로 넘어가면 — 인사평가가 걸리는 순간 — 이보다 더 복잡해진다.