지식위키

10축 비교 매트릭스

10축 비교 매트릭스

한 줄 요약

7개 코딩 에이전트 하네스를 똑같은 10개 잣대로 1~5점 채점한 성적표다. 점수 자체보다 “누가 어디서 강하고 무엇을 포기했나”의 지도를 한눈에 보려고 배운다.

그림

flowchart TD
    R["공통 루브릭 10축<br/>1점=약함 · 5점=핵심강점"] --> S{"7개 대상에<br/>같은 잣대 적용"}
    S --> A["행 = 축 10개"]
    S --> B["열 = 대상 7개"]
    A --> M["비교 매트릭스<br/>셀 = 점수"]
    B --> M
    M --> T[합계 50점 만점]
    T --> W["총평 한 줄<br/>강점·발목"]
    W --> D["심층분석·아이디어로 연결"]
flowchart LR
    C["Codex<br/>46점 1위"] -.프로덕션급.-> X[지향점]
    O["ouroboros<br/>45점 2위"] -.스펙우선 철학.-> X
    H["OMC<br/>44점 3위"] -.오케스트레이션.-> X
    G["gajae<br/>43점 4위"] -.좁은표면 방법론.-> X
    L["Claude Code<br/>42점"] -.표준 호스트.-> X
    P["내 패턴<br/>42점"] -.이중모델 검증.-> X
    F["fable-ish<br/>33점 7위"] -.경량 정직함.-> X

쉽게 풀기

비교표 하나를 어떻게 읽는지 단계로 풀어 본다.

  1. 잣대를 먼저 통일한다. AI 두뇌에 작업대·연장·안전장치·검수절차를 붙여 “혼자 일하는 일꾼”으로 만든 것이 하네스다. 그 일꾼을 공정하게 비교하려면 면접관이 모든 지원자에게 같은 질문 10개를 던져야 한다. 그 10개 질문이 곧 10축이다(아키텍처, 컨텍스트, 툴, 오케스트레이션, 가드레일, 검증, 자기개선, 상태, 배포/DX, 철학).
  2. 칸마다 점수를 매긴다. 표는 행이 질문(축), 열이 지원자(대상), 칸이 그 질문에 대한 1~5점이다. 5점은 “이 분야가 핵심 강점”, 1점은 “거의 없음”이다.
  3. 세로로 더하면 종합 등수가 나온다. 50점 만점에 Codex 46점이 가장 높고 fable-ish 33점이 가장 낮다. 단, 낮은 점수가 곧 나쁨은 아니다 — fable-ish는 “검증 게이트 하나만 잘하자”며 나머지를 일부러 비워 둔 경량 도구다. 면접에서 만능형은 점수가 높지만, 한 가지만 칼같이 하는 전문가도 그 자리에선 최고일 수 있다.
  4. 가로로 읽으면 그 축의 승자가 보인다. 예를 들어 ‘검증 루프’ 줄을 가로로 보면 6개가 4점으로 묶이고 ‘내 패턴’만 5점이다 — 이 분야에선 내 패턴이 한 발 앞선다는 뜻이다.

[!note] 점수를 오해하지 않기

  • 합계가 높다 = “두루 잘한다”, 합계가 낮다 = “못한다”가 아니다. 정체성이 또렷한 전문가는 일부러 어떤 축을 0순위에서 뺀다.
  • 동률이 많은 축(예: 철학 7개 전원 5점)은 “모두가 공들이는 기본기”라는 신호다.
  • 한 도구만 튀는 축(예: 검증 루프의 내 패턴)은 “그 도구의 진짜 차별점”일 확률이 높다.

핵심 정리

10축 × 7대상 점수표 (행=축, 열=대상, 셀=1~5점)

Claude CodeCodexOMCgajae-codeouroborosfable-ish내 패턴최고 / 최저
아키텍처/포지셔닝4554554최고 Codex·OMC·ouroboros·fable-ish(5) / 최저 Claude Code·gajae·내패턴(4)
컨텍스트 엔지니어링5555535최고 6개 동률(5) / 최저 fable-ish(3)
툴/확장5544524최고 Claude Code·Codex·ouroboros(5) / 최저 fable-ish(2)
오케스트레이션4454525최고 OMC·ouroboros·내패턴(5) / 최저 fable-ish(2)
가드레일/안전4545334최고 Codex·gajae(5) / 최저 ouroboros·fable-ish(3)
검증 루프4444445최고 내패턴(5) / 최저 6개 동률(4)
자기개선/반복3343423최고 OMC·ouroboros(4) / 최저 fable-ish(2)
상태/영속성4555544최고 Codex·OMC·gajae·ouroboros(5) / 최저 Claude Code·fable-ish·내패턴(4)
배포/DX4544433최고 Codex(5) / 최저 fable-ish·내패턴(3)
철학/차별점5555555최고 7개 전원 동률(5) / 최저 없음
합계 (50점 만점)42464443453342최고 Codex(46) / 최저 fable-ish(33)

대상별 한 줄 총평 (점수 = 정체성, 발목 = 약점)

  • Claude Code (42) — 4기둥(컨텍스트/툴/가드레일/검증)을 표준화하고 확장 표면 자체를 1급 플러그인으로 메타화한 호스트 하네스. 발목: 코어 블랙박스, 약한 하드 게이트.
  • Codex (46, 1위) — 120+ 크레이트 물리분해·4중 독립 가드레일·강력한 영속성·최상급 DX를 갖춘 프로덕션급 단일 에이전트. 발목: 멀티에이전트·모델 중립성 보강 필요.
  • oh-my-claudecode (44, 3위) — Claude Code 위에 19에이전트·tmux 팀 런타임·11훅을 얹어 오케스트레이션 깊이를 극대화한 디스트리뷰션. 발목: 거대 번들·fail-open 훅이 안전·감사성에 그림자.
  • gajae-code (43, 4위) — 표면을 의도적으로 좁혀(4스킬+4에이전트) 모호성 게이팅·sha256 영수증·fail-closed 검증으로 방법론을 못박은 멀티런타임 beta. 발목: 사양 복잡도·실전 미검증.
  • ouroboros (45, 2위) — 소크라테스 인터뷰→Seed→Double-Diamond→온톨로지 진화를 이벤트소싱으로 구현한 CLI 중립 Agent OS. 발목: 실행 권한 가드레일이 약점.
  • fable-ish (33, 7위) — “검증 통과 전 완료 금지”를 훅 3개+스킬 1개로 압축한 정직한 경량 단일 플러그인. 발목: 정규식 휴리스틱 의존·좁은 표면.
  • 내 패턴 (42) — Claude=오케스트레이터/게이트, Codex=격리 워커의 이중모델 비대칭 분업에 물리 게이트·자체승인 금지 검증회로를 코드로 강제. 발목: 하네스 레벨 자동 강제·DX가 약점.

실제 예시

이 표는 빈손으로 만든 게 아니라 공통 루브릭을 모든 대상에 똑같이 적용해 뽑았다. 채점 규칙의 골격은 다음과 같다.

# 출처: /mnt/d/6study/10_프레임워크분석/_분석축_루브릭.md
점수 척도: 1~5 (1=없음/약함, 5=핵심강점)
대상 7종: Claude Code · Codex · OMC · gajae-code · ouroboros · fable-ish · 내 패턴

10축(=표의 행):
 1 아키텍처/포지셔닝   "어디에 얹히고 무엇으로 만들었나"
 2 컨텍스트 엔지니어링  "모델에 뭘 보여주나"
 3 툴/확장             "무엇을 시킬 수 있나"
 4 오케스트레이션      "여러 일꾼을 어떻게 부리나"
 5 가드레일/안전       "함부로 못 하게 어떻게 막나"
 6 검증 루프           "제대로 했는지 어떻게 확인하나"
 7 자기개선/반복       "스스로 고쳐가며 반복하나"
 8 상태/영속성         "기억을 어떻게 남기나"
 9 배포/DX             "쓰기·깔기 얼마나 쉽나"
10 철학/차별점         "이건 무엇이 특별한가"

표 한 칸(예: ‘검증 루프 × 내 패턴 = 5점’)을 읽는 법:

행(축)   = 검증 루프      → "제대로 했는지 어떻게 확인하나"
열(대상) = 내 패턴
셀(점수) = 5             → 이 축의 단독 최고점(나머지 6개는 4점)
근거     → 물리 게이트 + 자체승인 금지 검증회로를 코드로 강제
해석     → "검증"이 내 패턴의 진짜 차별점이다

요약 & 셀프체크

  • 같은 10축으로 채점하면 Codex(46)가 종합 1위, fable-ish(33)가 최저지만, 최저점은 “일부러 비워 둔 전문가”라는 신호다.
  • 표는 행=축, 열=대상, 셀=점수로 읽고, 가로로 보면 그 분야 승자, 세로로 보면 종합 등수가 나온다.
  • 동률 많은 축은 공통 기본기, 한 도구만 튀는 축(검증 루프의 내 패턴 등)은 그 도구의 차별점이다.

스스로 답해 보기:

  1. fable-ish가 33점으로 꼴찌인데도 ‘나쁜 도구’라고 단정하면 안 되는 이유는?
  2. ‘검증 루프’ 축에서 내 패턴만 5점인 것이 무엇을 말해 주나?
  3. 합계 점수가 같은 Claude Code와 내 패턴(둘 다 42)은 어떤 축에서 서로 강·약이 엇갈리나?

연결

_분석축_루브릭 · HOME · 20_비교분석/축별_심층분석 · 20_비교분석/독창아이디어_모음

[!tip] 채점 방법론 (Claude ↔ Codex 교차검증) 이 매트릭스는 한 사람의 인상평이 아니라, 모든 분석 에이전트(Claude·Codex)가 동일한 10축 루브릭으로 각 대상을 분해·점수화한 뒤 합의한 결과다. 산출물 형식은 대상당 ① 한 줄 정의+아키텍처/언어 ② 10축 점수표+근거(파일 인용) ③ 독창 아이디어/강점/약점 ④ Claude 분석 ↔ Codex 교차검증(불일치·보정)으로 규정되어 있다(출처: /mnt/d/6study/10_프레임워크분석/_분석축_루브릭.md). 즉 점수의 신뢰 근거는 “두 모델이 같은 잣대로 따로 보고 맞춰 봤다”는 데 있다.