10축 비교 매트릭스
10축 비교 매트릭스
한 줄 요약
7개 코딩 에이전트 하네스를 똑같은 10개 잣대로 1~5점 채점한 성적표다. 점수 자체보다 “누가 어디서 강하고 무엇을 포기했나”의 지도를 한눈에 보려고 배운다.
그림
flowchart TD
R["공통 루브릭 10축<br/>1점=약함 · 5점=핵심강점"] --> S{"7개 대상에<br/>같은 잣대 적용"}
S --> A["행 = 축 10개"]
S --> B["열 = 대상 7개"]
A --> M["비교 매트릭스<br/>셀 = 점수"]
B --> M
M --> T[합계 50점 만점]
T --> W["총평 한 줄<br/>강점·발목"]
W --> D["심층분석·아이디어로 연결"]
flowchart LR
C["Codex<br/>46점 1위"] -.프로덕션급.-> X[지향점]
O["ouroboros<br/>45점 2위"] -.스펙우선 철학.-> X
H["OMC<br/>44점 3위"] -.오케스트레이션.-> X
G["gajae<br/>43점 4위"] -.좁은표면 방법론.-> X
L["Claude Code<br/>42점"] -.표준 호스트.-> X
P["내 패턴<br/>42점"] -.이중모델 검증.-> X
F["fable-ish<br/>33점 7위"] -.경량 정직함.-> X
쉽게 풀기
비교표 하나를 어떻게 읽는지 단계로 풀어 본다.
- 잣대를 먼저 통일한다. AI 두뇌에 작업대·연장·안전장치·검수절차를 붙여 “혼자 일하는 일꾼”으로 만든 것이 하네스다. 그 일꾼을 공정하게 비교하려면 면접관이 모든 지원자에게 같은 질문 10개를 던져야 한다. 그 10개 질문이 곧 10축이다(아키텍처, 컨텍스트, 툴, 오케스트레이션, 가드레일, 검증, 자기개선, 상태, 배포/DX, 철학).
- 칸마다 점수를 매긴다. 표는 행이 질문(축), 열이 지원자(대상), 칸이 그 질문에 대한 1~5점이다. 5점은 “이 분야가 핵심 강점”, 1점은 “거의 없음”이다.
- 세로로 더하면 종합 등수가 나온다. 50점 만점에 Codex 46점이 가장 높고 fable-ish 33점이 가장 낮다. 단, 낮은 점수가 곧 나쁨은 아니다 — fable-ish는 “검증 게이트 하나만 잘하자”며 나머지를 일부러 비워 둔 경량 도구다. 면접에서 만능형은 점수가 높지만, 한 가지만 칼같이 하는 전문가도 그 자리에선 최고일 수 있다.
- 가로로 읽으면 그 축의 승자가 보인다. 예를 들어 ‘검증 루프’ 줄을 가로로 보면 6개가 4점으로 묶이고 ‘내 패턴’만 5점이다 — 이 분야에선 내 패턴이 한 발 앞선다는 뜻이다.
[!note] 점수를 오해하지 않기
- 합계가 높다 = “두루 잘한다”, 합계가 낮다 = “못한다”가 아니다. 정체성이 또렷한 전문가는 일부러 어떤 축을 0순위에서 뺀다.
- 동률이 많은 축(예: 철학 7개 전원 5점)은 “모두가 공들이는 기본기”라는 신호다.
- 한 도구만 튀는 축(예: 검증 루프의 내 패턴)은 “그 도구의 진짜 차별점”일 확률이 높다.
핵심 정리
10축 × 7대상 점수표 (행=축, 열=대상, 셀=1~5점)
| 축 | Claude Code | Codex | OMC | gajae-code | ouroboros | fable-ish | 내 패턴 | 최고 / 최저 |
|---|---|---|---|---|---|---|---|---|
| 아키텍처/포지셔닝 | 4 | 5 | 5 | 4 | 5 | 5 | 4 | 최고 Codex·OMC·ouroboros·fable-ish(5) / 최저 Claude Code·gajae·내패턴(4) |
| 컨텍스트 엔지니어링 | 5 | 5 | 5 | 5 | 5 | 3 | 5 | 최고 6개 동률(5) / 최저 fable-ish(3) |
| 툴/확장 | 5 | 5 | 4 | 4 | 5 | 2 | 4 | 최고 Claude Code·Codex·ouroboros(5) / 최저 fable-ish(2) |
| 오케스트레이션 | 4 | 4 | 5 | 4 | 5 | 2 | 5 | 최고 OMC·ouroboros·내패턴(5) / 최저 fable-ish(2) |
| 가드레일/안전 | 4 | 5 | 4 | 5 | 3 | 3 | 4 | 최고 Codex·gajae(5) / 최저 ouroboros·fable-ish(3) |
| 검증 루프 | 4 | 4 | 4 | 4 | 4 | 4 | 5 | 최고 내패턴(5) / 최저 6개 동률(4) |
| 자기개선/반복 | 3 | 3 | 4 | 3 | 4 | 2 | 3 | 최고 OMC·ouroboros(4) / 최저 fable-ish(2) |
| 상태/영속성 | 4 | 5 | 5 | 5 | 5 | 4 | 4 | 최고 Codex·OMC·gajae·ouroboros(5) / 최저 Claude Code·fable-ish·내패턴(4) |
| 배포/DX | 4 | 5 | 4 | 4 | 4 | 3 | 3 | 최고 Codex(5) / 최저 fable-ish·내패턴(3) |
| 철학/차별점 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 최고 7개 전원 동률(5) / 최저 없음 |
| 합계 (50점 만점) | 42 | 46 | 44 | 43 | 45 | 33 | 42 | 최고 Codex(46) / 최저 fable-ish(33) |
대상별 한 줄 총평 (점수 = 정체성, 발목 = 약점)
- Claude Code (42) — 4기둥(컨텍스트/툴/가드레일/검증)을 표준화하고 확장 표면 자체를 1급 플러그인으로 메타화한 호스트 하네스. 발목: 코어 블랙박스, 약한 하드 게이트.
- Codex (46, 1위) — 120+ 크레이트 물리분해·4중 독립 가드레일·강력한 영속성·최상급 DX를 갖춘 프로덕션급 단일 에이전트. 발목: 멀티에이전트·모델 중립성 보강 필요.
- oh-my-claudecode (44, 3위) — Claude Code 위에 19에이전트·tmux 팀 런타임·11훅을 얹어 오케스트레이션 깊이를 극대화한 디스트리뷰션. 발목: 거대 번들·fail-open 훅이 안전·감사성에 그림자.
- gajae-code (43, 4위) — 표면을 의도적으로 좁혀(4스킬+4에이전트) 모호성 게이팅·sha256 영수증·fail-closed 검증으로 방법론을 못박은 멀티런타임 beta. 발목: 사양 복잡도·실전 미검증.
- ouroboros (45, 2위) — 소크라테스 인터뷰→Seed→Double-Diamond→온톨로지 진화를 이벤트소싱으로 구현한 CLI 중립 Agent OS. 발목: 실행 권한 가드레일이 약점.
- fable-ish (33, 7위) — “검증 통과 전 완료 금지”를 훅 3개+스킬 1개로 압축한 정직한 경량 단일 플러그인. 발목: 정규식 휴리스틱 의존·좁은 표면.
- 내 패턴 (42) — Claude=오케스트레이터/게이트, Codex=격리 워커의 이중모델 비대칭 분업에 물리 게이트·자체승인 금지 검증회로를 코드로 강제. 발목: 하네스 레벨 자동 강제·DX가 약점.
실제 예시
이 표는 빈손으로 만든 게 아니라 공통 루브릭을 모든 대상에 똑같이 적용해 뽑았다. 채점 규칙의 골격은 다음과 같다.
# 출처: /mnt/d/6study/10_프레임워크분석/_분석축_루브릭.md
점수 척도: 1~5 (1=없음/약함, 5=핵심강점)
대상 7종: Claude Code · Codex · OMC · gajae-code · ouroboros · fable-ish · 내 패턴
10축(=표의 행):
1 아키텍처/포지셔닝 "어디에 얹히고 무엇으로 만들었나"
2 컨텍스트 엔지니어링 "모델에 뭘 보여주나"
3 툴/확장 "무엇을 시킬 수 있나"
4 오케스트레이션 "여러 일꾼을 어떻게 부리나"
5 가드레일/안전 "함부로 못 하게 어떻게 막나"
6 검증 루프 "제대로 했는지 어떻게 확인하나"
7 자기개선/반복 "스스로 고쳐가며 반복하나"
8 상태/영속성 "기억을 어떻게 남기나"
9 배포/DX "쓰기·깔기 얼마나 쉽나"
10 철학/차별점 "이건 무엇이 특별한가"
표 한 칸(예: ‘검증 루프 × 내 패턴 = 5점’)을 읽는 법:
행(축) = 검증 루프 → "제대로 했는지 어떻게 확인하나"
열(대상) = 내 패턴
셀(점수) = 5 → 이 축의 단독 최고점(나머지 6개는 4점)
근거 → 물리 게이트 + 자체승인 금지 검증회로를 코드로 강제
해석 → "검증"이 내 패턴의 진짜 차별점이다
요약 & 셀프체크
- 같은 10축으로 채점하면 Codex(46)가 종합 1위, fable-ish(33)가 최저지만, 최저점은 “일부러 비워 둔 전문가”라는 신호다.
- 표는 행=축, 열=대상, 셀=점수로 읽고, 가로로 보면 그 분야 승자, 세로로 보면 종합 등수가 나온다.
- 동률 많은 축은 공통 기본기, 한 도구만 튀는 축(검증 루프의 내 패턴 등)은 그 도구의 차별점이다.
스스로 답해 보기:
- fable-ish가 33점으로 꼴찌인데도 ‘나쁜 도구’라고 단정하면 안 되는 이유는?
- ‘검증 루프’ 축에서 내 패턴만 5점인 것이 무엇을 말해 주나?
- 합계 점수가 같은 Claude Code와 내 패턴(둘 다 42)은 어떤 축에서 서로 강·약이 엇갈리나?
연결
_분석축_루브릭 · HOME · 20_비교분석/축별_심층분석 · 20_비교분석/독창아이디어_모음
[!tip] 채점 방법론 (Claude ↔ Codex 교차검증) 이 매트릭스는 한 사람의 인상평이 아니라, 모든 분석 에이전트(Claude·Codex)가 동일한 10축 루브릭으로 각 대상을 분해·점수화한 뒤 합의한 결과다. 산출물 형식은 대상당 ① 한 줄 정의+아키텍처/언어 ② 10축 점수표+근거(파일 인용) ③ 독창 아이디어/강점/약점 ④ Claude 분석 ↔ Codex 교차검증(불일치·보정)으로 규정되어 있다(출처:
/mnt/d/6study/10_프레임워크분석/_분석축_루브릭.md). 즉 점수의 신뢰 근거는 “두 모델이 같은 잣대로 따로 보고 맞춰 봤다”는 데 있다.