8 · 모델 전략¶

NERV는 작업의 성격에 따라 서로 다른 등급의 모델을 의도적으로 배정한다. 오케스트레이션·고급 생성에는 강한 모델을, 구조화 추출·결정론적 plumbing에는 가벼운 모델을 쓰고, 종합·분류 단계는 내부 배정 정책에 따라 Codex(일상 종합 gpt-5.6-terra · 코드 진단·MAGI 합의 축 gpt-6-astra · 원고 축 gpt-5.6-sol · 제한적 luna)에 라우팅한다. 대부분의 정확성 단계는 Claude에 남고, Codex direct 경로는 독립 Python controller가 담당한다.
이 모델 배정은 2 · NERV-RASM 모형의 C4(이종 실행·종합 엔진) 를 실제 모델 자원으로 구현한 것이다 — 결정론 코드와 이종 LLM을 단계별로 배정하는 그 원리의 구체화이다.
모델 배지: Fable 5.1 Opus 5 Sonnet 5 Haiku 4.5 · Codex 위임 = Codex(gpt-5.6 terra/sol/luna · gpt-6-astra) 라우팅 단계 보유.
한눈에
- 모델 4종 배정 — Fable 5.1 × 2(최상위 추론) · Opus 5 × 8(오케스트레이터/고급 생성) · Sonnet 5 × 25(NLG/추론) · Haiku 4.5 × 4(구조화 추출/plumbing)
- Codex 라우팅 14 — 13개는 Claude 내부 MUST delegate, wiki-compounder 1개는 luna direct transaction shadow
- 멀티-LLM 합의 — MAGI 시스템이 Claude + Codex(GPT-5.6) + Antigravity(Gemini) 3대 LLM을 교차 검증에 활용
- 유지 영역 5종 — 한국어 법적·윤리 문서·정밀 HTML/CSS 슬라이드·내레이션 대본·다회차 추론·영문 정중 응대는 Claude 강점이라 위임하지 않음
8.1 모델 배정 원칙¶
NERV에 등록된 39개 Claude 서브에이전트는 작업 성격에 따라 4개 모델 등급으로 나뉩니다. 강의 전용 5개는 등록 모델 분포에 포함되지만 현재 강의 도메인에서 호출하지 않는다.
| 등급 | 모델 | 개수 | 적용 기준 | 대표 사례 |
|---|---|---|---|---|
| 최상급 | Fable 5.1 | 2 | 다회차 소크라틱 추론 · 고위험 논증 종합 | 연구 아이디어 토론 파트너, R&R 재투고 대응 |
| 상급 | Opus 5 | 8 | 오케스트레이션 · 다회차 reasoning · 고급 생성 | 일정 추적, 콘텐츠 설계 오케스트레이터, IRB 문서, PI 문체 재작성 |
| 중급 | Sonnet 5 | 25 | 자연어 생성(NLG) · 분석 · 추론 중심 | 방법론 분석, 학술 문체 검사, 논문 탐색, 섹션 작성 |
| 경량 | Haiku 4.5 | 4 | 구조화 추출 · 결정론적 plumbing | 논문 요약, 키워드 태깅, 라이브러리 건강 감시, 에이전트 설치 |
최상급(Fable 5.1) 배정 2개 — Opus 5 위의 최상위 추론 티어이다(2026-07-24 Fable 승격, 2026-09-02 Fable 5.1 세대 승계 — 동일 티어·동일 단가, 앵커 A/B 동급). 저빈도·대화형이면서 오류 비용이 큰 판단·논증 작업 — 소크라틱 다회차 토론과 R&R 재투고 논증 종합 — 에 한정 배정한다.
| 에이전트 | 소유 캐릭터 | 기능 |
|---|---|---|
research-idea-discussant |
리츠코 | 소크라틱 다회차 연구 아이디어 토론(추론-바운드) |
reviewer-response-helper |
아스카 | R&R 재투고 수렴 분석·Rebuttal 논증(고위험 저빈도) |
경량(Haiku 4.5) 배정 4개 — 출력이 구조화되어 있거나 결정론적 처리가 핵심인 작업이다.
| 에이전트 | 소유 캐릭터 | 기능 |
|---|---|---|
paper-summarizer |
레이 | 논문 요약(구조화 추출) |
keyword-tagger |
레이 | 키워드/태그 추천(taxonomy 매핑) |
library-health-monitor |
레이 | 라이브러리 정합성 감시 + 리포트(구조화 출력) |
agent-installer |
리츠코 | 외부 서브에이전트 자동 설치 plumbing(결정론적) |
설계 원칙: 모델 등급은 능력 과잉을 줄이고 비용을 작업에 맞추는 수단이다. 구조화 추출에 상급 모델을 쓰지 않고, 다회차 오케스트레이션에 경량 모델을 쓰지 않는다. 분포 검증: NERV 원본 저장소 루트에서
python3 scripts/check_agent_inventory.py실행(인벤토리 SSOT).
8.2 Codex(gpt-5.6) 라우팅 14개¶
GPT 쿼터를 적극 활용하기 위해 다음 14개 에이전트가 Codex 단계로 라우팅된다. 이 중 13개는
특정 종합·분류 단계에서 Codex 위임이 강제(MUST delegate)이며, wiki-compounder는 표준 post-sync에서
Claude 없이 Codex를 직접 호출하는 transaction shadow다.
역할 분담 원칙
- Claude 잔류 — 13개 nested 경로의 파일 I/O, 인용 추출·검증, 할루시네이션 방지
- Codex 위임 — 종합·분류·랭킹·자연어 보고서 생성(GPT 계열이 강한 단계)
- Fallback — nested 경로는 시스템 오류 시에만 Claude 폴백; wiki direct shadow는 rollback하고 Sonnet으로 폴백하지 않음
- 티어 매핑(2026-09-06 현재) — 일상 종합은 terra, 코드 진단·MAGI 합의 축(agent-council CASPAR·Discord MAGI·patrol 일일 종합·github-import-evaluator·paper-code-auditor·codex_lint)은 2026-09-06 gpt-6-astra 승격(업시프트, 무측정 원칙), 원고 축은 sol 잔류(게이트 임계값 sol lock-in),
wiki-compounder는 2026-08-22 nerv-bench 근거로 luna 1건
캐릭터별 14개 목록¶
| 캐릭터 | 개수 | 에이전트 | Codex 위임 단계(요약) |
|---|---|---|---|
| 레이 | 3 | keyword-tagger |
본문 → kebab-case taxonomy 의미 매핑 + 계층 태그 |
note-linker |
노트 간 의미적 유사도 평가 + 링크 후보 랭킹 | ||
wiki-compounder |
luna direct read-only proposal + 임시 vault transaction 검증 | ||
| 카오루 | 5 | related-paper-finder |
다수 후보 관련성 스코어링 + Top-N 종합 |
citation-network-explorer |
네트워크 지표 → 자연어 보고서 종합 | ||
research-trend-analyzer |
다년도 트렌드 자연어 보고서 종합 | ||
source-comparator |
다중 소스 비교 매트릭스 + 합의/불일치 종합 | ||
paper-code-auditor |
논문 수치 클레임 ↔ 공개 코드 매칭 검증 | ||
| 아스카 | 2 | academic-style-checker |
영문 학술 문체 개선 제안 종합(한국어는 Claude) |
research-gap-identifier |
6-유형 갭 분류 + Feasibility×Impact 매트릭스 | ||
| 리츠코 | 1 | github-import-evaluator |
저장소 코드 스타일/구조 정합성 진단 |
| 마리(영문) | 3 | methods-writer |
영문 Methods 본문 생성(Python 결정론 + Claude 의미 검증 병행) |
results-writer |
영문 Results 본문 생성(동일 하이브리드 검증) | ||
abstract-generator |
영문 초록 본문 생성(동일 하이브리드 검증) | ||
| 합계 | 3 + 5 + 2 + 1 + 3 = 14 |
(이력) 레이의
paper-summarizer·methodology-analyzer는 A/B 3회 측정(2026-07-04~11) 끝에 종합 단계를 Claude Sonnet 5 직접 수행으로 확정하고 위임 목록에서 제외됐다(16 → 14).마리의 위임은 영문 트랙 한정이다. 한국어 작성은 PI 문체 학습이 핵심이라 별도 처리하며, 글쓰기 에이전트의 한국어 법적/윤리 문서는 위임하지 않는다(§8.5 참조).
8.3 Codex 호출 표준 패턴¶
NERV에서 Codex 위임은 다음 표준 패턴으로 호출한다.
codex exec --sandbox read-only --skip-git-repo-check \
-c model="gpt-5.6-terra" -c model_reasoning_effort="medium" -
--sandbox read-only— 읽기 전용 샌드박스(파일 수정 불가, 종합·분류 단계에 적합)--skip-git-repo-check— 임의 작업 디렉터리에서 호출 가능-c model_reasoning_effort="medium"— 추론 강도 medium- 끝의
-— 프롬프트를 stdin으로 전달 -c model=— inline 모델 핀 필수 (미지정 시 CLI 설정 기본값으로 떨어지므로 위임 경로에서는 배정된 terra/sol/luna/astra를 명시한다).
8.4 멀티-LLM 합의 (MAGI)¶
NERV의 교차 검증 시스템 MAGI는 3대 LLM을 병렬로 활용해 서로 다른 계열의 판정과 불일치를 함께 제시한다. 다만 이종 모델 호출이 통계적 독립성을 보장하지는 않으며, 합의가 단일 모델의 편향을 실제로 줄이는지는 별도 평가가 필요하다.
| LLM | 역할(코드네임) | 비고 |
|---|---|---|
| Claude(Opus 5) | 의장(MELCHIOR) · 합의 도출 | 추론·종합 주도 |
| Codex(GPT-5.6) | 교차 검토자(CASPER) | 코드/설정·수치 관점 |
| Antigravity(Gemini) | 교차 검토자(BALTHASAR) | 제3의 관점 |
- 정기 순찰과
wiki_health는 비용 최적화를 위해 Claude + Codex 2대, 23시의daily_audit·research_progress는 3대 Full Council로 운영한다. - 익명 cross-review 후 의장(Claude)이 합의문을 도출하는 3단계 구조이다.
- 단일 LLM의 만장일치가 곧 진실은 아니라는 전제 위에서, 서로 다른 모델 계열을 의도적으로 섞는다.
8.5 Claude 유지 영역¶
다음 5종은 내부 배정 정책상 Claude에 유지하며 Codex 위임을 하지 않는다(한국어 문체·정중 톤·정밀 생성 등 현재 판단에 따른 배정으로, 모델군 전체의 우열 주장은 아니다).
| 작업 | 담당 에이전트 | 위임하지 않는 이유 |
|---|---|---|
| 한국어 법적/윤리 문서 | irb-document-writer(마리) |
IRB 신청서·동의서의 한국어 법적·윤리 문체 |
| 정밀 강의 슬라이드(정의 등록 유지) | lecture-slide-maker(신지·강의 호출 중단) |
HTML/CSS 디자인 패턴 정밀 생성 |
| 내레이션 대본(정의 등록 유지) | narration-script-writer(신지·강의 호출 중단) |
구술체 대본의 정밀 생성 |
| 다회차 연구 토론 | research-idea-discussant(리츠코) |
소크라틱 다회차 추론 |
| 영문 정중 응대 | reviewer-response-helper(아스카) |
R&R 재투고의 영문 정중 톤 |
원칙: 위임은 "GPT가 더 잘하는 종합/분류 단계"에 한정하고, 한국어 문체·정밀 디자인·다회차 추론·정중한 영문 응대처럼 Claude가 강한 영역은 그대로 둡니다.
강의 콘텐츠 제작 도메인은 2026-06-21 관련 에이전트 호출을 중단했다. 위 강의 슬라이드·내레이션 에이전트는 실행 정의와
active등록 상태, Codex 비위임 정책을 유지하지만 현재 강의 도메인에서는 호출하지 않는다.
요약¶
- 등록 모델 분포 — Fable 5.1 × 2 · Opus 5 × 8 · Sonnet 5 × 25 · Haiku 4.5 × 4로, 능력 과잉 없이 작업에 맞춰 비용을 조절한다.
- Codex 라우팅 14 — 13개 nested 경로는 Codex(gpt-5.6 terra/sol · gpt-6-astra)에 MUST delegate하고, wiki-compounder는 gpt-5.6-luna direct transaction shadow로 운용한다.
- 멀티-LLM 합의 — MAGI가 Claude + Codex + Antigravity(Gemini) 3대 LLM을 교차 검증에 활용해 단일 모델 편향을 완화한다.
- 유지 영역 5종 — Claude 강점 영역(한국어 법적·윤리 문서·정밀 슬라이드·내레이션·다회차 추론·영문 정중 응대)은 위임 대상에서 제외한다.