TECHNOLOGY STRATEGY REPORT · 대외비(사내용)

AI 에이전트 실행 세계(ESTC·NWM·SWM) 기반
RAG+XAI 기술 고도화 전략

AX혁신기업창의기술개발사업 「RAG+XAI 기반의 항만 야드 운영 최적화 기술개발과 실증」 연계
— ㈜심스리얼리티 자체 기술력 확보 방안 —
과제번호 RS-2026-25528293  |  수행기간 2026.04.01 ~ 2027.12.31 (1년 9개월)  |  컨소시엄 ㈜심스리얼리티(주관) · ㈜토탈소프트뱅크(공동) · 한진부산컨테이너터미널㈜(수혜)
참고자료 ① DEVMENTO 특별 세미나 「AI 에이전트 실행 세계」(이주환, 2026.7.14) ② 연구개발계획서(신청용, 2026.2.10)  |  작성 생성AI 전문 연구원 허상훈 · 2026.7.22
목차
  1. 개요 및 목적 — 왜 "실행 세계"인가
  2. 진단 — 현행 RAG+XAI 아키텍처의 실행 세계 관점 갭 분석
  3. 적용 전략 — ESTC·NWM·SWM을 RAG+XAI에 이식하기
  4. 연차별 실행 로드맵 — 과제 일정에 내재화
  5. 기대효과 및 KPI 연계 — 자체 기술 자산화
  6. 운영·거버넌스 — 세계는 문서가 아니라 운영 자산이다

1.개요 및 목적 — 왜 "실행 세계"인가

1.1 배경

당사는 2026년 4월부터 AX혁신기업창의기술개발사업으로 「RAG+XAI 기반의 항만 야드 운영 최적화 기술개발과 실증」(총 연구개발비 863,400천 원, 정부지원 647,500천 원)을 수행 중이다. 과제의 최종 목표는 부산신항 3부두(HJNC) 운영본부를 대상으로, 자연어 질의를 통해 컨테이너 장치위치 운영 이력 분석·결정·보고를 지원하는 'AI 지능형 장치위치 결정 최적화 시스템'을 구축·실증하는 것이다. 핵심 성과 지표는 리핸들링(재취급) 개선과 운영 의사결정 신뢰도 90% 수준 실증이다.

한편, 2026년 7월 14일 DEVMENTO 특별 세미나 「AI 에이전트 실행 세계 — 조직의 도메인을 에이전트 친화적으로 모델링하기」(이주환, Swit Technologies 대표)는 엔터프라이즈 AI 에이전트가 PoC를 넘어 프로덕션에서 실패하는 근본 원인을 "모델의 지능 부족이 아니라, 지능이 발 디딜 세계(World)의 부재"로 진단하고, 그 해법으로 ESTC 문법, NWM/SWM 이중 계층, 월드 모델 캔버스, 7단계 뉴로심볼릭 런타임 루프를 제시했다.

세미나의 핵심 명제 — "에이전트에게 필요한 것은 더 큰 모델이 아니라, 더 정확한 세계다."
본 과제의 핵심 명제 — "결과값만 통보하는 기존 AI의 한계를 넘어, 판단의 근거(Why)를 설명해주는 지능형 의사결정 지원."
두 명제는 같은 문제의식의 다른 표현이며, 결합 시 강력한 차별화 기술이 된다.

1.2 본 보고서의 목적

본 보고서는 세미나에서 제시된 실행 세계 설계 방법론을 본 과제의 RAG+XAI 6계층 아키텍처(A.입력/이해 → B.라우터/오케스트레이터 → C.데이터/지식 파이프라인 → D.설명(XAI) → E.생성(LLM) → F.사용자 출력)에 어떻게 적용·활용할지를 구체화하여, 다음 세 가지를 달성하는 것을 목적으로 한다.

1.3 핵심 개념 요약 (세미나 자료 기준)

NWM

뉴럴 월드 모델 — 열린 층

관측을 해석하고, 상태를 추정(Belief)하고, 변화를 예측하고, 행동을 제안한다. 산출물은 어디까지나 확률적 가설. LLM·관측·그라운딩·추정상태·다이내믹스·플래너의 6부품.

SWM

심볼릭 월드 모델 — 닫힌 층

허용된 상태와 전이를 명세하고, 적법성을 판정하고, 사실을 확정하고, 변화를 기록한다. 온톨로지/월드 DSL·상태·전이·제약·SSOT·실행&커밋의 6부품.

ESTC

실행 가능한 세계의 최소 문법

Entity(무엇이 존재하는가) · State(지금 무엇이 사실인가) · Transition(무엇이 바뀔 수 있는가) · Constraint(언제 허용되는가). 하나만 빠져도 세계는 무너진다.

협업 4대 원칙 — ① NWM은 후보를 만든다(Proposal) ② SWM은 가능한 후보만 남긴다(Adjudication) ③ SWM만 사건을 확정한다(Commit) ④ NWM은 결과를 학습·갱신한다(Update). 지능은 제안권을 갖고, 세계는 판결권을 갖는다.

2.진단 — 현행 RAG+XAI 아키텍처의 실행 세계 관점 갭 분석

2.1 실패 3계보를 항만 야드 시나리오에 대입하면

세미나가 정의한 세 가지 실패 양식은 본 과제 실증 환경에서 다음과 같이 구체적으로 나타날 수 있다.

실패 유형정의 (세미나)항만 야드에서의 발생 시나리오발생 지점
실행 환각
Hallucination
세계를 잘못 읽는 실패. 존재하지 않는 상태를 있다고 추정하고 그 위에서 실행RAG가 개정 전 SOP 문서를 근거로 "블록 1A 적치 가능"을 추천하나, 실제로는 해당 블록이 점검 중 폐쇄 상태. LLM이 "조치했습니다"라고 답하지만 TOS에는 반영된 사실이 없음NWM에서 시작 — 입력·해석 간극(A·C·E 계층)
실행 탈주
Runaway
허용되지 않은 경로로 움직이는 실패. 가드의 구멍으로 지능이 미끄러짐위험물 컨테이너 격리 거리·중량 제한 등 하드 룰을 우회한 이적(Relocate) 경로를 추천하고, 운영자가 근거 화면만 믿고 그대로 실행SWM에서 시작 — 규칙·집행 간극(B 계층 가드)
경계 붕괴
Collapse
세계의 경계 자체가 무너지는 실패. 무엇이 현재이고 무엇이 허용인지 불분명RAG 검색 결과(과거 사례·추정)와 TOS 실시간 확정 데이터가 같은 Evidence Pack 안에 동급으로 섞여, 추정과 확정이 서로 다른 '현재'를 가리킴. 야간 교대 후 운영자마다 다른 판단레이어 사이 — NWM 추정과 SWM 확정의 정렬 상실
주의: "허위화된 세계에서, 더 정교한 LLM은 잘못을 더 매끄럽게 수행할 뿐이다." — 2차년도에 LLM·XAI를 고도화해도, 세계 계층이 없으면 설명이 정교한 오답이 될 수 있다. 이것이 실증 단계 최대 기술 리스크다.

2.2 현행 A~F 계층의 실행 세계 관점 평가

본 과제 아키텍처는 이미 SWM적 요소를 부분적으로 내장하고 있다(강점). 그러나 명시적 세계 계층으로 승격되지 않아 갭이 존재한다.

과제 구성요소실행 세계 관점 평가판정
A. 질의 스키마(JSON) 표준화
Intent/Entity 정의
의도(Intent)↔타입(Type) 교환의 초기형. 다만 '질의'의 어휘일 뿐, '세계'의 어휘(온톨로지·월드 DSL)까지는 미도달NWM 우수 SWM 미흡
B. Rule/Policy 기반 라우터
+ 2차년도 오케스트레이션(DAG)
가드(Guard)의 맹아. 그러나 현재 역할은 '데이터 소스 선택'이지 '전이 적법성 판정'이 아님. 판정 대상이 질의이지 행동 후보가 아님가드 초기형 판정 범위 협소
C. Hybrid VectorDB + CDC
TOS 정형 + 비정형 지식
SSOT의 물리적 기반은 확보. 그러나 '확정 데이터(TOS)'와 '추정 지식(문서·사례)'이 동일 검색 평면에 있어 경계 붕괴 위험SSOT 기반 보유 추정/확정 미분리
D. XAI (SHAP·인과분석·UQ)
신뢰도·불확실성 평가
Belief(추정 상태)의 정량화 장치로 탁월. MC Dropout 불확실성은 세미나의 '추정을 신뢰의 형태로 안정화'와 정확히 일치NWM Belief 우수
E. 환각 방지·근거 ID 인용 강제
판단 유보(Fail-Safe, τ 임계)
인간 개입(H) 계층의 맹아. 불확실성 τ 초과 시 답변 대신 판단 유보 — 세미나의 '초과 시 인간 검토로 격상(escalate)'과 동일 사상H 계층 보유
F. 운영자 피드백 화면
+ 라우팅 로그·감사 기록(2차년도)
감사·학습(A) 계층의 기반. 다만 운영자의 '적용' 결정이 커밋 사건으로 형식화되어 있지 않아 재보정 신호로 쓰기 어려움감사 기반 보유 커밋 미사건화

2.3 종합 갭 4가지

갭 1 · 명시적 월드 DSL 부재

질의 스키마는 있으나 야드 세계의 상태·전이·제약을 기계가 집행 가능한 형식으로 고정한 문법이 없다. 에이전트가 암묵적 세계 모델을 스스로 짓는 여지가 남는다.

갭 2 · 추정(Belief)과 확정(Committed)의 미분리

Evidence Pack 안에서 RAG 유사사례(추정)와 TOS 실시간 값(확정)이 동급으로 취급된다. "재취급 가능성 85%"는 Belief이지 사실이 아니다.

갭 3 · 커밋(Commit) 개념 부재

추천 → 운영자 적용 → TOS 반영의 흐름에서 '사건 확정'이 형식화되어 있지 않다. 커밋이 없으면 가능성만 떠도는 유령 세계가 된다.

갭 4 · 세계 개정 체계 부재

SOP 개정, 정책 임계 변경, 선석 체계 개편 시 세계를 함께 갱신하는 버저닝·카나리·거버넌스가 없다. 세계 허위화(World Falsification)의 입구다.

3.적용 전략 — ESTC·NWM·SWM을 RAG+XAI에 이식하기

전략 1ESTC 기반 「항만 야드 월드 DSL」 설계

과제 1차년도 산출물인 '항만 도메인 Intent/Entity 정의서''질의 스키마(JSON) 표준 정의서'를 월드 DSL의 어휘 사전으로 승격시킨다. UML/BPMN을 다시 만드는 것이 아니라, 이해의 언어 위에 집행의 언어를 한 층 증축하는 것이다.

문법항만 야드 세계에서의 정의과제 산출물과의 연결
E
엔티티
Container(컨테이너), YardBlock/Slot(장치 블록·슬롯), YardCrane·YT(장비), Vessel(선박), WorkOrder(작업지시), Operator(운영자) — 공식 타입과 식별자(ID)로 고정Intent/Entity 정의서 → 월드 온톨로지로 확장. 별칭(Alias) 해석은 열고(NWM), 공식 타입·ID는 닫는다(SWM)
S
상태
컨테이너: IN_GATE → YARD_STACKED → REHANDLE_PENDING → RELOCATED → LOADED / 블록: OPEN·CONGESTED·CLOSED / 장비: IDLE·ASSIGNED·MAINTENANCE — 허용된 좌표의 열거TOS(CATOS) 상태 코드 체계를 상태 좌표로 정규화. 좌표에 없는 상태는 이 세계에 존재하지 않는다
T
전이
StackContainer(적치), RehandleContainer(재취급), RelocateContainer(이적), AssignCrane(장비 배정) — from/to/guard/escalate/emit의 형식으로 규격화2차년도 오케스트레이터의 실행 계획(DAG)의 단위 작업을 전이 타입으로 형식화
C
제약
하드 룰: 위험물(IMDG) 격리 거리, 단수 제한·중량 역전 금지, 크레인 간섭 반경, 선석 시간창 / 정책: 블록 혼잡도 상한, 재취급률 임계, 자동 승인 한도Rule/Policy 라우팅 정책 관리 규칙 → 전이 가드로 격상. 하드 룰과 최종 판정은 닫고, 정책 맥락 해석은 연다

월드 DSL 예시 — "재취급(Rehandle) 전이 하나를 해부하면" (세미나의 RequestRefund 예시를 야드 도메인으로 번안):

transition RehandleContainer {
  from:  YARD_STACKED
  to:    REHANDLE_PENDING
  guard {
    imdg_segregation_ok(container, target_slot)      // 위험물 격리 거리 하드 룰
    tier_weight_ok(target_slot, container.weight)     // 단수·중량 제한
    crane_interference_free(assigned_crane, slot)      // 장비 간섭 반경
    container.moves_today <= POLICY.max_rehandle       // 재취급 횟수 정책 임계
  }
  escalate_if uncertainty > τ or vessel.priority == EMERGENCY   // 판단 유보 → 운영자 검토
  emit RehandleCommitted { evidence_pack_id, xai_weights, operator_id, timestamp }
}

이 코드 한 조각에 S(출발 상태), T(도달 형식), C(하드 룰 2종+정책), H(인간 개입 격상), A(감사 이벤트 발행)가 전부 담긴다. 과제의 판단 유보(Fail-Safe τ)와 Evidence Pack이 DSL 문법 안에 자연스럽게 자리 잡는 점에 주목.

전략 2NWM 6부품 ↔ 과제 계층 매핑 — "해석 스택"의 재정렬

NWM 부품 (세미나)본 과제 대응 요소고도화 포인트
1. LLM — 언어 이해·구조화A계층 로컬 LLM 기반 NLU + E계층 설명형 답변 생성 LLMLLM은 '언변'일 뿐임을 설계에 명시 — 교체 가능한 층위로 유지(온프레미스 모델 교체 대비)
2. 관측 Perception — 원시 관측의 인코딩C계층 TOS 정형 데이터 수집(CDC), IoT 센서, 이벤트 로그관측 → 엔티티·상태 언어 번역기를 표준화 (O 계층). 시계열 분리 관리 활용
3. 그라운딩 Grounding — 현재 좌표를 SSOT에 정박Evidence Pack + 근거 메타데이터 관리(출처·시점·신뢰도)핵심 격상: RAG의 '참고'가 아니라 SSOT 정박으로. Evidence 항목에 committed/inferred 구분 필드 신설
4. 추정 상태 Belief — 불완전 관측의 신뢰화D계층 신뢰도·불확실성 평가(베이지안 근사, MC Dropout, 데이터 품질 스코어링)불확실성 U를 Belief의 공식 속성으로 — "재취급 확률 85%±σ"를 추정층 산출물로 명시 표기
5. 다이내믹스 Dynamics — 전개 예측 시뮬레이터D계층 하이브리드 SCM(그레인저 인과, 시계열), 장치율 예측·시뮬레이션인과계수(γ) 기반 원인 Top-N을 '행동하기 전 생각할 시간'으로 위치 부여
6. 플래너 Planner — 전이 후보 생성·우선순위B계층(2차년도) 복합 질의 분해·실행 계획(DAG) + 야드 작업 추천(권고안 A/B)추천을 '전이 후보(Candidate)' 형식으로 출력 — 아무리 신뢰도가 높아도 제안일 뿐

전략 3SWM 6부품 ↔ 과제 계층 매핑 — "집행 스택"의 신설·격상

SWM 부품 (세미나)본 과제 대응 요소고도화 포인트
1. 온톨로지·월드 DSLIntent/Entity 정의서, 질의 스키마 → 항만 야드 월드 DSL(신설)전략 1 참조. 1차년도 정의서 작성 시 DSL 어휘를 염두에 두고 설계
2. 상태 StateTOS 상태 코드 → 허용 상태 좌표 열거'현재값'이 아니라 '가능한 상태의 문법'으로 문서화
3. 전이 Transition전이 스키마(신설) — 재취급·이적·배정오케스트레이터 DAG의 단위를 전이 타입으로 규격화
4. 제약 ConstraintRule/Policy 정책 관리 규칙 → 전이 가드불변식·하드 룰을 세계가 스스로 무너지지 않게 하는 뼈대로 분리 선언
5. SSOT 상태 저장소TOS(CATOS) DB = 유일 공식 기록면선언적 격상: "야드의 현재는 오직 TOS가 확정한다. RAG 검색 결과·챗봇 로그·LLM 답변은 SSOT가 아니다"를 아키텍처 원칙 1조로 명문화
6. 실행 & 커밋F계층 운영자 피드백 화면의 '적용' 결정 + 감사 로그운영자 승인 → TOS 반영을 커밋 이벤트(emit)로 사건화. Evidence Pack ID·XAI 가중치·승인자·시각을 하나의 커밋 레코드로 봉인
아키텍처 원칙(신설 제안) — ① 야드의 현재는 오직 TOS(SSOT)가 확정한다 ② RAG·XAI·LLM의 모든 산출물은 전이 후보(제안)다 ③ 후보는 반드시 가드 판정을 통과해야 하며, 거부조차 사유와 함께 반환된다 ④ 확정된 사건만이 다음 추론의 출발점이 된다.

전략 47단계 뉴로심볼릭 런타임 루프의 이식

세미나의 7단계 루프를 본 과제 파이프라인 용어로 번역하면, 기존 A~F 계층이 하나의 루프로 재편된다. 파란 단계는 NWM(확률·제안), 초록 단계는 SWM(판정·확정)이 주도한다.

① NWM 주도의도 파악·관측 번역NLU가 자연어 질의를 질의 스키마로, TOS/IoT 신호를 엔티티·상태 언어로 번역 (A·C계층)
② NWM 주도전이 후보 생성RAG 검색 + XAI 예측 + 플래너가 허용된 전이 형식(T)에 맞춰 권고안 A/B 제안 (B·D계층)
③ SWM 주도가드 판정상태(S)와 제약(C)을 근거로 허용/거부 판결. 거부 시 사유("제약 C2 위반")와 함께 반환
④ SWM 주도실행·커밋통과한 전이만 운영자 승인을 거쳐 집행, RehandleCommitted 등 사건으로 확정 (F계층)
⑤ SWM 주도SSOT 스냅샷 게시확정 사실의 공식 기록면을 CDC로 게시 — 다음 루프의 출발점 (C계층)
⑥ NWM 주도그라운딩추정 상태(Belief)를 SSOT의 사실로 교정 — Evidence Pack의 추정/확정 정렬
⑦ NWM 주도다이내믹스 재보정확정 결과를 학습 피드백으로 예측 모델 갱신 — MLOps/RAGOps·RLHF와 접속
↺ 다음 루프 — 매 단계가 사전에 설계된 세계를 참조한다

주목할 점: 본 과제의 Self-Correction 라우팅 피드백 루프(2차년도)와 MLOps/RAGOps 체계는 이미 ⑥·⑦단계를 계획하고 있다. 부족한 것은 ③·④·⑤단계의 형식화이며, 이것이 본 전략의 투자 초점이다.

전략 5항만 야드 「월드 모델 캔버스」 — 완성된 한 장

세미나의 11칸 캔버스를 본 과제 도메인으로 채운 결과. 이 한 장이 채워지는 순간, 설계자(당사)와 에이전트(RAG+XAI 시스템)는 같은 세계를 공유한다.

캔버스 칸항만 야드 세계의 답
① 목적·범위 M야드 상태 변경(재취급·이적·배정)을 운영 정책 범위 안에서 안전하고 일관되게 지원·집행한다
② 엔티티·온톨로지 E컨테이너·블록/슬롯·장비(YC/YT)·선박·작업지시·운영자 — 공식 타입과 ID로 고정
③ 정체성·SSOTCATOS TOS DB가 유일한 공식 기록면 — RAG 검색 결과·챗봇 로그는 기록면이 아니다
④ 상태 공간 SIN_GATE→YARD_STACKED→REHANDLE_PENDING→RELOCATED→LOADED / 블록 OPEN·CONGESTED·CLOSED
⑤ 추정 vs 확정"재취급 확률 85%, 주원인 화주 A 긴급 반출 패턴" = Belief(추정) · TOS 커밋된 상태만 사실(확정)
⑥ 허용된 전이 TRehandleContainer: YARD_STACKED → REHANDLE_PENDING 외 전이 타입 카탈로그
⑦ 가드·제약·정책 CIMDG 격리·중량/단수·간섭 반경(하드 룰) + 혼잡도·재취급 임계(정책) / 초과 시 격상
⑧ 관측·번역 OTOS 이벤트 로그·IoT 센서·CDC 스트림 → 엔티티·상태 언어로 번역되는 입구
⑨ 판정·결과 계약 V허용/거부 + 근거(위반 제약 ID, XAI 기여도, Evidence Pack) + 최신 상태를 반환하는 형식
⑩ 인간 개입 H불확실성 U > τ, 긴급 선박, 정책 한도 초과 시 판단 유보 → 운영본부 검토·승인 (Fail-Safe)
⑪ 감사·학습 훅 A라우팅 로그·감사 기록(Audit Trail)·커밋 이력·운영자 피드백 → 재보정과 RLHF의 재료

4.연차별 실행 로드맵 — 과제 일정에 내재화

별도 과제를 새로 만드는 것이 아니라, 이미 계획된 과제 항목 안에 실행 세계 요소를 내재화한다. 추가 공수는 설계 규율 수준이며, 산출물 품질과 심사 대응력을 높인다.

4.1 1차년도 (2026.04 ~ 2026.12) — "세계의 어휘와 문법 심기"

과제 계획 항목 (기존)실행 세계 내재화 작업 (추가)산출물 강화
항만 도메인 Intent/Entity 정의 (4~7월)Entity 정의 시 공식 타입·식별자 체계를 월드 온톨로지 규격으로 작성. 별칭 사전(열림)과 공식 타입(닫힘)을 분리Intent·Entity 정의서 → 야드 월드 온톨로지 v0.9
질의 스키마(JSON) 표준화 (5~8월)질의 스키마와 별도로 상태 좌표 열거표(S)와 전이 타입 초안(T) 문서화 — TOS 상태 코드 기반출력 규격 정의서 + ESTC 명세서 v1
질의 라우터 Core 구현 (7~11월)Rule/Policy 라우터 규칙 중 하드 룰과 정책을 구분 태깅 — 2차년도 가드 격상 대비라우팅 정책 관리 규칙(가드 예비 분류 포함)
Evidence Pack 정의 (7~11월)evidence_items에 provenance 필드 신설: committed(TOS 확정) / inferred(RAG·모델 추정) + 시점(as-of) 필수화Evidence Pack 정의서 v1.1 — 추정/확정 분리형
1차년도 PoC (11~12월)PoC 시나리오에 실패 3계보 테스트 케이스 포함: 폐쇄 블록 추천(환각), 격리 위반 경로(탈주), 추정·확정 불일치(붕괴)PoC 결과 보고서 — 세계 무결성 검증 절 추가

4.2 2차년도 (2027.01 ~ 2027.12) — "판정·커밋·루프 닫기"

과제 계획 항목 (기존)실행 세계 내재화 작업 (추가)산출물 강화
지능형 라우터/오케스트레이션 고도화 (1~7월)실행 계획(DAG)의 단위 작업을 전이 타입으로 규격화하고, DAG 실행 전 가드 판정 단계(③)를 정식 편입. Hybrid Routing의 Fast/Semantic Track과 병행오케스트레이션 설계서 + 가드 판정 명세
XAI 근거 가중치·불확실성 (3~7월)불확실성 U를 Belief 공식 속성으로, τ 초과 시 escalate_if 경로를 DSL 문법으로 구현 — H 계층 완성XAI 분석 모델 설계서 + 판단 유보 프로토콜
확장형 Evidence Pack + audit_ref (1~7월)routing_context·execution_plan에 커밋 레코드(승인자·시각·적용 결과) 연결 — 판정·결과 계약(V) 완성확장 구조 정의서 — 커밋 사건화 포함
사용자 출력 계층 UI/UX (7~10월)권고안 화면에 '제안(Belief)'과 '확정(Committed)' 시각 구분, 거부 시 위반 제약 ID 표기. 운영자 '적용' 버튼 = 커밋 이벤트 발행의사결정 지원 UI — 제안/확정 이중 표기
실증 및 검증 (11~12월, HJNC)Lab Shadow Test에 월드 버저닝·카나리 롤아웃 적용: 세계 개정판을 일부 질의 트래픽에서 먼저 검증 후 Field Pilot 승격실증 결과보고서 — 세계 운영 체계 실증 포함

5.기대효과 및 KPI 연계 — 자체 기술 자산화

5.1 과제 성능지표 6종과 실행 세계 설계의 인과 관계

과제 성능지표 (목표치)실행 세계 설계가 기여하는 메커니즘
1. 질의 처리 경로 적절성 95% (2027)라우팅 판단 인자가 자연어가 아니라 ESTC 어휘(엔티티·상태·전이 타입)로 이산화되어 경로 결정의 모호성이 구조적으로 감소
2. 질의 처리 실패율 ≤5%닫힌 전이 형식과 가드 판정 덕에 실패가 '조용한 오류'가 아닌 '사유 있는 거부'로 전환 — 재시도·격상 경로가 설계되어 있음
3. RAG Top-K 근거 검색 정확도 88%provenance(committed/inferred)·as-of 메타데이터로 재정렬 품질 향상, 낡은 문서가 확정 데이터를 밀어내는 오염 차단
4. XAI 근거 설명 일관성 85%설명의 준거가 '같은 세계(SSOT+월드 DSL)'로 고정되어 질의·시점이 달라져도 설명 논리가 흔들리지 않음
5. 불확실성 기반 판단 유보 실행률 90%escalate_if가 DSL 문법 요소로 강제되어 유보가 모델 재량이 아닌 세계의 규칙이 됨 — 지표 달성의 구조적 보장
6. RAG 지식 베이스 정형 데이터 연동 실시간성 2초 이내SSOT 스냅샷 게시(⑤단계)와 CDC 파이프라인이 단일 공식 기록면 기준으로 정렬되어 조회 경로가 단순화

5.2 자체 기술 자산 3종 — 회사에 남는 것

① 항만 야드 월드 DSL

도메인 어휘·상태·전이·가드의 집행 가능 명세. 외산 TOS 벤더가 단기간에 복제할 수 없는 도메인 지식의 코드화 자산. 특허 출원(RAG+XAI 하이브리드 엔진) 명세서의 청구항 구체화에도 직접 활용

② 월드 모델 캔버스 방법론

11칸 질문의 골격은 산업을 초월한 범용 설계 언어 — 항만에서 검증 후 해양·제조·물류 신규 과제 제안 시 그대로 재적용. 신규 도메인 진입 속도가 자산이 됨

③ Evidence Pack v2 스키마

추정/확정 분리 + 커밋 사건화 + audit_ref를 갖춘 근거 표준. Intelligent Yard Copilot(지식·교육)과 RAG+XAI Optimizer(최적화) 두 제품 라인의 공통 코어로 기능

5.3 경쟁 우위 관점

글로벌 1위 Navis(N4)와의 비교에서 본 과제의 차별점은 "블랙박스가 아닌 설명 가능한 최적화"였다. 실행 세계 계층이 더해지면 차별화가 한 단계 깊어진다: "설명 가능한(XAI) 것을 넘어, 판정 가능하고(Adjudicable) · 재현 가능하고(Replayable) · 감사 가능한(Auditable) 야드 AI". 이는 보수적인 항만 산업의 AI 수용성 문제(계획서 SWOT의 위협 요인)에 대한 가장 직접적인 응답이며, 세계 자체가 특정 LLM·벤더에 종속되지 않는 전략 인프라이므로 온프레미스 모델 교체·업그레이드에도 자산이 보존된다.

6.운영·거버넌스 — 세계는 문서가 아니라 운영 자산이다

6.1 세계 허위화(World Falsification) 대응

설계가 끝난 순간부터 세계는 늙기 시작한다. HJNC 현장에서는 SOP 개정, 선석 체계 변경, 신규 장비 도입, 화주 정책 변경이 상시 발생한다. 세계가 이를 반영하지 못하면 에이전트는 잘못된 세계 안에서 매우 일관되게 추론하며, 올바른 추론이 더 설득력 있는 오류를 만든다.

운영 장치적용 방안과제 연계
월드 버저닝온톨로지·상태 좌표·전이·가드의 개정을 코드처럼 버전 관리. "무엇이 언제 왜 바뀌었는지"를 추적 가능한 역사로 유지감사 로그·audit_ref 체계에 세계 버전 ID 필드 추가
카나리 롤아웃개정된 세계(예: 신규 혼잡도 임계)를 일부 질의 트래픽에서 먼저 검증 후 전체 적용Lab Shadow Test → Field Pilot 단계 전략과 자연 정합
거버넌스세계 개정의 책임 구조 명시: HJNC 운영본부(현장 요구) → 당사(반영·검증) → 컨소시엄 협의(승인). "현업이 요구하고 IT가 받아 적는" SI 방식으로는 살아 있는 세계를 굴릴 수 없음전략적 협업 계획의 HJNC 실무진 도메인 지식 검증 체계를 세계 개정 위원회로 발전
4대 간극 모니터링입력–해석 / 규칙–집행 / 신념–상태 / 정책–현실 간극을 정기 점검하는 월드 헬스 체크 지표화MLOps/RAGOps 성능 모니터링 대시보드에 편입

6.2 리스크 및 완화

리스크완화 방안
DSL 설계 공수가 1차년도 일정을 압박전이 1종(재취급)만 완전 규격화하는 세로 절단(vertical slice) 전략 — 세미나 워크숍 방식("엔티티 3개 + 되돌릴 수 없는 전이 1개")대로 최소 시작
SWM 과잉 확장 → 경직된 자동화의 감옥4대 원칙의 균형 유지: 별칭 해석·정책 맥락·유사사례는 계속 NWM에 열어 둠. 닫는 것은 공식 타입·확정 상태·하드 룰·최종 판정뿐
NWM 월권 → 추정이 확정처럼 행동Evidence Pack provenance 필드와 UI의 제안/확정 이중 표기로 시각·데이터 양쪽에서 차단
TOS(CATOS) 연동 제약으로 커밋 사건화 지연공동기관 토탈소프트뱅크가 CATOS 원개발·공급사인 컨소시엄 구조를 활용 — API 인터페이스 규격 공동 정의 시 커밋 이벤트 항목 포함

6.3 결론 — 오늘 가져갈 세 가지

1. 문제는 에이전트(모델)가 아니라 세계다 — 세계를 설계하지 않으면, RAG+XAI 시스템은 스스로 지은 암묵적 세계 위에서 실증에 임하게 되고, 우리는 그 잠재 세계에 설계당하는 피설계물이 된다.

2. 본 과제는 이미 좋은 출발점을 갖고 있다 — Evidence Pack(그라운딩), Rule/Policy 라우터(가드 맹아), 판단 유보 Fail-Safe(인간 개입), 감사 로그(학습 훅). 필요한 것은 신규 개발이 아니라 ESTC 문법과 7단계 루프로의 형식화·격상이며, 이는 과제 일정 안에서 내재화 가능하다.

3. 세계는 운영 자산이다 — 항만 야드 월드 DSL·월드 모델 캔버스·Evidence Pack v2는 과제 종료 후에도 남아, 해양·제조·물류로 확장되는 당사의 실행 질서 축적 인프라가 된다. 그 규모와 순서를 정하는 것은 리더의 결정이다.

본 보고서는 ① DEVMENTO 특별 세미나 「AI 에이전트 실행 세계 — 조직의 도메인을 에이전트 친화적으로 모델링하기」(이주환, Swit Technologies, 2026.7.14) 발표자료와 ② 「RAG+XAI 기반의 항만 야드 운영 최적화 기술개발과 실증」 연구개발계획서(신청용, RS-2026-25528293)를 근거로 작성되었습니다. · ㈜심스리얼리티 사내 기술전략 문서 · 2026.07.22