9 · 시스템 평가¶

이 장의 목적은 NERV의 규모를 능력 점수로 환산하는 것이 아니라, 현재 확인되는 구현·운영 상태와 설계되었지만 아직 검증되지 않은 주장을 구분하는 데 있다.
46개 등록 실행 단위, 3종의 모델 계열, 44개 launchd 잡은 시스템의 구현 규모와 기능 커버리지를 나타낸다. 이 수치만으로 산출물 품질, 연구 생산성, 자율성 또는 연구성과 개선을 추론할 수는 없다.
평가의 지위
이 평가는 자가 평가이며 외부 독립 검증을 받지 않았다. 근거는 내부 인벤토리, 설정, 실행 기록, 평가 보고서와 사고 대응 기록이다. 따라서 이 장은 구현 여부와 운영 상태를 기술할 수 있지만, NERV의 효과나 다른 환경에 대한 일반화 가능성을 입증하지 않는다.
9.1 종합 점수·등급 철회¶
이전 판의 종합 등급 A−(84/100)와 8개 차원의 0–100점 평가는 철회한다.
해당 평가는 구현 수량, 기능 범위, 운영 장치의 존재와 실제 효과를 같은 척도에 배치했다. 또한 차원별 체크항목, 원자료, 배점 함수, 불확실성, 민감도와 등급 경계가 종합 판정을 재현할 수 있을 만큼 공개되지 않았다. 자동 집행이 되지 않거나 실증되지 않은 항목에도 수치가 부여되었다.
| 이전 표현 | 개정 처리 | 이유 |
|---|---|---|
| 종합 A−(84/100) | 철회 | 서로 다른 증거 수준을 단일 점수로 합산할 근거 부족 |
| 규모·생애주기 커버리지 92점 | 구현 규모로 재분류 | 46개 정의와 기능 범위는 성능 또는 효과 지표가 아님 |
| 멀티-LLM 오케스트레이션 90점 | 구성 현황으로 재분류 | 모델 수와 라우팅 규칙만으로 품질 향상을 입증할 수 없음 |
| 자동화 깊이 88점 | 예약작업 커버리지로 재분류 | 잡 수는 실행 성공률·시간 절감·신뢰성을 나타내지 않음 |
| 자가 평가·메타인지 87점 | 내부 운영 점검으로 재분류 | 내부 진단 도구의 존재는 인지능력이나 효과의 증거가 아님 |
| 회복 탄력성·자가 치유 80점 | 장애 탐지·복구 지원으로 범위 축소 | 완전한 폐루프 자동 복구가 확인되지 않음 |
| 지식 복리 66점 | 설계됨·미실증 | 자동 축적 체인이 동결되어 있고 수동 경로가 중심임 |
기존 8차원 점수 HTML 위젯도 평가 근거와 함께 철회하며, 별도의 점수 위젯으로 대체하지 않는다.
9.2 평가 규율¶
이 장은 증거를 다음 세 층으로 구분한다.
| 증거 층 | 포함하는 항목 | 허용되는 해석 | 허용되지 않는 해석 |
|---|---|---|---|
| 구현 규모·커버리지 | 등록 정의 수, 역할 수, 모델 계열 수, 잡 수, 스키마·규칙 수 | 어떤 구성요소와 기능 범위가 마련되어 있는지 | 능력, 품질, 자율성 또는 효과의 크기 |
| 운영 증거 | 활성 설정, 예약 실행, 로그, 경보, 내부 점검과 사고 대응 기록 | 해당 장치가 실제 운영 경로에 존재하는지 | 장기간 가용성, 성공률, 비용 절감 또는 연구성과 개선 |
| 결과 증거 | 정확도, 결함 탐지율, 처리시간, 비용, PI 개입시간, 재사용률 | 비교조건에서 측정된 시스템 효과 | 기준선·원자료·불확실성이 없는 효과 주장 |
상태 표기는 다음 의미로 사용한다.
| 표기 | 의미 |
|---|---|
| 구현 확인 | 코드·설정·인벤토리에서 구성요소의 존재가 확인됨 |
| 운영 중 | 내부 기록상 반복 실행 또는 실제 사용 경로가 존재함 |
| 부분 구현 | 일부 구성요소는 작동하지만 종단 간 자동 집행은 제한적임 |
| 동결·수동 경로 | 자동 경로가 중지되어 있으며 사람이 명시적으로 개시하는 경로만 남아 있음 |
| 미구현 | 설계 계약은 있으나 실행기가 없거나 비활성화되어 있음 |
| 설계됨·미실증 | 의도한 작동 원리는 정의되어 있으나 결과 효과가 측정되지 않음 |
| N/A(미검증) | 현재 자료로 결과 수준의 판정을 내릴 수 없음 |
9.3 현재 확인되는 구현·운영 상태¶
| 영역 | 확인된 사실 | 현재 상태 | 결과 판정 |
|---|---|---|---|
| 역할·실행 단위 | Claude 정의 39개와 Python 실행 단위 7개, 합계 46개 등록 정의가 7개 역할군에 배치되어 있다. 강의 전용 Claude 정의 5개는 현재 강의 도메인에서 호출되지 않는다. | 구현 확인 | N/A(미검증) — 정의 수와 생애주기 범위는 라우팅 정확도나 산출물 품질을 나타내지 않는다. |
| 이종 모델 실행 | Claude·Codex·Gemini 계열을 작업 성격에 따라 배정하며, 14개 정의에는 Codex 강제 위임 규칙이 설정되어 있다. | 구현 확인·운영 중 | N/A(미검증) — 3종 모델과 강제 위임 규칙의 존재만으로 단일모델 대비 우월성을 주장할 수 없다. |
| 예약 자동화 | 44개 launchd 잡이 논문 추천, 전문가 다이제스트, 라이브러리 점검, 백업, 카드뉴스, 웹툰, CV 동기화 등 일·주 단위 작업을 담당한다. |
운영 중 | N/A(미검증) — 잡 수는 실행 성공률, 산출물 채택률 또는 PI 시간 절감과 같지 않다. |
| 운영 관측 | Lab Director 대시보드, 6축 능력치 트래커, 구조화 로그, Discord 운영 채널, 잡 인벤토리와 SSOT 드리프트 점검 경로가 있다. silent-fail-monitor는 매일 23:55 예약작업 자체의 미실행 여부를 점검한다. |
운영 중 | 운영 상태를 관찰하는 장치가 존재한다. 관측 정확도와 경보의 완전성은 N/A(미검증)이다. |
| 품질 검사 | 0.0–1.0으로 정규화된 8개 품질 임계값, explore/produce/publish 모드 정책과 학술 원고용 결정론적 paper-verifier 2종이 구성되어 있다. |
부분 구현 | 검사기가 연결된 경로의 규칙 존재를 의미한다. 결함 탐지율·오통과율·오차단율은 N/A(미검증)이다. |
| 장애 탐지·복구 지원 | 공유 silent-fail 래퍼 21개가 23개 잡을 보호한다. MAGI Patrol은 12시·18시·23시에 9개 루트를 점검한다. Resilience v2에는 5개 활성 규칙과 pre-commit·SessionStart 훅이 있다. |
운영 중·부분 구현 | 장애 탐지와 복구 절차를 지원한다. 폐루프 자동 복구 또는 일반적인 회복 효과는 N/A(미검증)이다. |
| 사고 대응 기록 | 과거 대량 plist 손상 사고에 대해 탐지·원인 파악·복구·재검증의 4단계 대응 기록이 있다. |
운영 이력 있음 | 특정 사고의 복구 사례다. 다른 장애에 대한 평균 복구시간이나 재발 방지 효과를 대표하지 않는다. |
| 연구기억 | file-per-fact 메모리와 Knowledge Wiki 인프라가 존재한다. 자동 지식축적 체인은 동결되어 있으며 현재는 PI가 개시하는 수동 /compound 경로가 중심이다. |
동결·수동 경로 | 설계됨·미실증 — 재사용률, 탐색시간 감소와 연구품질 개선은 N/A(미검증)이다. |
| 배포 범위 | 단일 Mac mini에서 한 명의 PI를 지원한다. HA·노드 이중화·멀티테넌시는 제공하지 않는다. | 현행 운영 범위 | 단일 사용자·단일 노드 밖의 가용성 및 확장성은 평가하지 않았다. |
수량의 해석
46개 정의는 46개의 검증된 능력을 뜻하지 않는다. 44개 예약잡은 44개의 성공한 자동화를 뜻하지 않으며, 3종 모델은 서로 독립된 세 개의 진실 판정자를 뜻하지 않는다. 수량은 구현 범위의 분모로 사용할 수 있지만 결과 점수로 환산하지 않는다.
9.4 부분 구현·미구현·미실증 항목¶
| 항목 | 현행 상태 | 이 장의 판정 |
|---|---|---|
| 계약형 핸드오프 | 스키마는 정의되어 있으나 자동 핸드오프 트래픽과 필수필드 누락에 대한 자동 반려는 제한적이다. | 부분 구현 |
| 자동 MAGI Gate (v1 — LLM 교차검증) | "전 핸드오프 × 3대 LLM 자동 개입" 실행기는 저장소 이력 전체에 존재한 적이 없다(2026-07-25 감사). 게이트가 개입할 자동 핸드오프 트래픽도 0으로 실측됐다. 실제 LLM 교차 검토는 magi-patrol과 PI 명시 호출 agent-council이 수행한다. 해당 실행기는 앞으로도 만들지 않는다(NON-GOAL). |
미구현 · 종결 |
| MAGI Gate v2 등록부 (결정론 게이트) | 10개 핸드오프 중 3개에 차단형 게이트가 구현·가동 중이다(변환 품질 · 인용 검증 · DOI 무효 차단). 전부 결정론 검사이며 LLM을 호출하지 않는다 — 따라서 v1이 약속한 LLM 교차검증의 이행이 아니다. 나머지 7개는 L0(검문 없음)이며 지을 계획이 없다. 설정값 enabled는 로그 축적 확인 전까지 false다. |
부분 구현 (3/10 · 결정론 한정) |
| 지식 복리 | 자동 축적 체인은 동결되었고 수동 /compound 경로만 중심적으로 사용된다. 장기 재사용 또는 성과 향상 자료가 없다. |
설계됨·미실증, 결과는 N/A(미검증) |
| 운영 자기교정 | Patrol과 모니터는 이상을 탐지하고 경보 또는 수정 제안을 제공한다. 코드·설정 변경에는 PI 또는 유지관리자의 판단과 재검증이 필요하다. | 장애 탐지·복구 지원 수준 |
| "자가 치유"·"메타인지" | 시스템 상태를 기록하고 이상을 감시하는 운영 장치는 있으나, 인간과 같은 자기이해나 일반적 자율복구를 입증하는 자료는 없다. | 해당 명칭을 성능 판정에 사용하지 않음. 결과는 N/A(미검증) |
| 연구성과 향상 | 라우팅·검토·자동화·기억 구조가 연구품질, 속도, 비용 또는 PI 인지부하를 개선한다는 비교실험이 없다. | N/A(미검증) |
MAGI Patrol이나 수동 agent-council의 존재는 종결된 자동 MAGI Gate(v1)를 대신 구현한 것으로 계산하지 않는다. MAGI Gate v2 등록부의 결정론 게이트 3종도 마찬가지다 — 그것들은 실재하고 실제로 차단하지만, v1이 약속한 것은 LLM 교차검증이었으므로 v2를 v1의 이행으로 계상하지 않는다. 등급 체계의 이름이 같다는 것이 기능이 같다는 뜻은 아니다. 마찬가지로 위키 저장소와 수동 축적 경로의 존재는 지식 복리효과의 증거로 계산하지 않는다.
9.5 nerv-evaluate 내부 지표의 위치¶
가장 최근의 nerv-evaluate 기록은 다음과 같다.
| 실행일 | 버전 | 내부 결과 | 해석 범위 |
|---|---|---|---|
| 2026-07-18 | v22 | B+ · 23/28 | 해당 도구의 체크리스트와 판정 규칙에 따른 내부 운영 점검 결과 |
nerv-evaluate는 시스템 건강도, 운영 드리프트와 개선 상태를 내부 기준으로 점검하는 별도 도구다. 이 장에서 철회한 8차원 역량 자가평가와는 평가항목·척도·목적이 다르다.
따라서 B+ · 23/28은 다음과 같이 제한해 해석한다.
- 내부 평가 도구가 2026-07-18 실행에서 기록한 결과다.
- 외부 표준 벤치마크나 제3자 감사 결과가 아니다.
- 철회된 A−(84/100)와 환산하거나 추세선으로 연결할 수 없다.
- 연구 산출물의 정확성, 자동화 효과 또는 시스템 전체의 성숙도 등급을 의미하지 않는다.
9.6 결과 평가에 필요한 자료¶
NERV의 효과를 평가하려면 구현 수량과 별도로 과업 단위의 결과 자료와 비교조건이 필요하다.
| 평가하려는 주장 | 필요한 결과 지표 | 필요한 비교조건 | 현재 판정 |
|---|---|---|---|
| 역할 조직이 배정을 개선한다 | 전문가 판정 대비 라우팅 정확도, 재배정률, 오배정 비용 | 역할 라우팅 대 단순·무역할 라우팅 | N/A(미검증) |
| 계약형 핸드오프가 누락을 줄인다 | 필수정보 누락률, rejection율, 재작업 횟수 | 계약 스키마 사용 대 무계약 조건 | N/A(미검증) |
| 다중모델 검토가 품질을 높인다 | 기준자료 대비 결함 탐지율, 오통과율, 오차단율 | 단일모델·단일검토자 조건 | N/A(미검증) |
| 예약 자동화가 운영 부담을 줄인다 | 잡 성공률, 미실행률, 처리시간·비용, PI 개입시간 | 수동 또는 자동화 이전 기준선 | N/A(미검증) |
| 품질 게이트가 출판 오류를 줄인다 | 인용·사실·통계 오류율, 차단 후 잔존 결함, 재작업 비용 | 게이트 적용·미적용 조건 | N/A(미검증) |
| 지식축적이 복리효과를 낸다 | 위키 재사용률, 검색 성공률, 과업시간, 중복작업률, 산출물 품질 | 무위키 조건 또는 종단 전후 비교 | N/A(미검증) |
| 운영 감시가 복구성을 높인다 | 탐지시간, 평균 복구시간, 재발률, 경보 정밀도·재현율 | 감시 적용 전후 또는 통제 기간 | N/A(미검증) |
향후 수치 평가나 등급을 제시하려면 최소한 다음 정보를 함께 공개해야 한다.
- 평가 단위, 관찰 기간과 시스템 버전
- 항목별 원자료, 제외 기준과 결측 처리
- 기준선과 비교조건
- 체크항목, 가중치와 배점 함수
- 등급 경계와 사전 정의된 판정 규칙
- 불확실성 구간과 가중치 변화에 대한 민감도
- 기준자료 작성 및 오류 판정 절차
- 가능하면 운영체계 밖의 독립 검토 또는 재현 평가
이 조건이 갖춰지기 전에는 단일 종합 점수와 등급을 제시하지 않는다.
9.7 성숙도 서술¶
현재 자료로 확인되는 NERV의 상태는 다음과 같다.
- 구현층: 7개 역할군, 46개 등록 실행 단위, 이종 모델 라우팅과 연구 생애주기의 여러 기능 경로가 구성되어 있다.
- 운영층: 44개
launchd잡, 모니터링, 순찰, 로그와 일부 결정론적 검증기가 단일 사용자·단일 노드 환경에서 운영된다. - 보증층: 품질 임계값과 검증 경로 일부가 구현되어 있고 결정론 차단 게이트 3종(MAGI Gate v2 등록부)이 가동되나, 계약형 핸드오프의 자동 반려와 LLM 교차검증형 자동 게이트(v1)는 종단 간 집행되지 않는다(종결).
- 기억층: 저장 인프라와 수동 축적 경로는 존재하지만 자동 지식축적 체인은 동결되어 있다.
- 효과층: 연구품질, 생산성, 비용, PI 개입시간, 지식 재사용과 일반화 가능성은 비교자료가 없어 N/A(미검증)이다.
NERV는 다수의 실행 단위, 이종 모델 경로, 예약작업과 운영 감시 장치를 갖춘 연구 자동화 구현체다. 이 설명은 현재 구성과 운영 범위에 한정된다. LLM 교차검증형 자동 MAGI Gate(v1)는 미구현·종결이고(v2 등록부의 결정론 게이트 3종은 그 이행이 아니다) 지식 복리는 설계됨·미실증 상태이므로, 시스템 규모를 성능·자율성·연구성과의 증거로 해석하지 않는다.
모형 수준의 기여와 효과 주장의 경계는 2 · NERV-RASM 모형의 「학술적 기여와 그 경계」를, MAGI의 현행 운영 경로는 7 · 교차 시스템을, 전체 구현 인벤토리는 10 · 부록을 참고한다.