규제 환경(GxP)을 위한 AI를 개발한다는 사람들마다 지식 그래프(Knowledge Graph)를 입에 올린다. 하지만 정작 가장 중요한 본질을 이야기하는 사람은 거의 찾아볼 수 없다.
솔루션 업체들의 데모에는 화려한 노드와 링크가 얽힌 Neo4j 대시보드가 등장한다. 투자 유치 발표 자료에는 ’GraphRAG’라는 단어가 마치 마법의 주문처럼 적혀 있다. 아키텍처 다이어그램을 보면 데이터 계층과 에이전트 사이에 ’지식 그래프’라는 상자 하나를 덩그러니 그려놓고, 마치 그 상자를 채우는 것은 사소한 일인 양 취급한다.
전혀 그렇지 않다. 진짜 어려운 부분은 바로 **온톨로지(Ontology)**다. 온톨로지를 잘못 설계하면, 그 위에 올라가는 하류의 모든 시스템은 허울뿐인 연극에 불과하다.
그래프는 단순한 데이터베이스가 아니다
제약 업계에 ‘지식 그래프’ 솔루션을 판매하는 벤더들을 포함해, 대다수가 가장 먼저 저지르는 실수가 있다.
지식 그래프는 단순히 품질관리시스템(QMS) 기록을 밀어 넣은 Neo4j 데이터베이스가 아니다. 문서와 문서 사이에 화살표를 이어 붙인 문서 저장소도 아니며, 관계형 데이터베이스 겉면에 그래프 뷰를 얹어놓은 것도 아니다.
시맨틱 지식 그래프(Semantic Knowledge Graph)란 “기록이 무엇을 의미하는지, 서로 어떻게 연관되는지, 어떤 규칙의 지배를 받는지, 그리고 각 주장을 뒷받침하는 증거가 무엇인지”를 기계가 해석할 수 있도록 구축한 공식적인 도메인 모델이다.
이 차이는 GxP 규제 환경에서 생사를 가를 만큼 결정적이다. 단순한 그래프 데이터베이스는 기껏해야 “시스템 A가 요구사항 B와 연결되어 있다” 정도만 알려준다. 반면 시맨틱 지식 그래프는 다음과 같이 답할 수 있다:
“시스템 A는 21 CFR Part 11.10(a) 규제에서 파생된 요구사항 B를 구현하고 있으며, 이는 적격성 평가 시험 OQ-042를 통해 위험이 완화되었고, 해당 시험은 2025년 3월 15일 제인 스미스의 승인을 거쳐 증거 EV-042를 생성했으며, 이 전체 증거 체인은 최근 정기 검토일까지 유효했다.”
FDA 실사관이 요구하는 답은 후자다. 전자는 그저 눈요기용 데모에 불과하다.
3가지 계층 (그리고 구축 순서가 절대적인 이유)
규제 환경에서 실제로 통과할 수 있는 AI 아키텍처는 세 개의 계층으로 구성되며, 이 순서는 결코 타협할 수 없다:
계층 1 — 마스터 데이터 패브릭 (Master Data Fabric): 표준화되고(canonical), 버전이 잠겨 있으며, ALCOA+ 데이터 무결성 원칙을 준수하는 골든 레코드(golden records)다. 시스템, 요구사항, 시험, 위험, 규제 조항, 공급업체 등의 데이터가 포함된다. ERP, LIMS, QMS, DMS, 문서관리(EDM), 장비 시스템으로부터 엔티티 해결(entity resolution)을 거쳐 정합성을 맞춘 원천 데이터다.
계층 2 — 시맨틱 지식 그래프 (Semantic Knowledge Graph): 의미(meaning)를 부여하는 계층이다. 표준 엔티티들 사이의 타입이 지정된 관계, 온톨로지가 강제하는 스키마, 출처(provenance) 메타데이터가 포함된 버전 관리 엣지, 규제 조항 매핑 등이 여기에 속한다. 데이터가 비로소 ’지식’으로 승격되는 지점이다.
계층 3 — AI 에이전트 (AI Agents): 변경 영향 평가, 정기 검토, 밸리데이션 패키지 생성, 감사 추적 감시 등의 작업을 수행한다. 에이전트는 그래프를 ’탐색’할 뿐, 절대로 임의로 ’수정’하지 않는다.
데이터가 표준화되기도 전에 그래프부터 구축하려 드는 것은 2024~2025년 수많은 기업들이 겪었던 뼈아픈 착각이다. 쓰레기 데이터를 그래프로 엮으면 탐색 가능한 쓰레기가 나올 뿐이다. LLM은 이를 바로잡지 못하며, 오히려 오염된 데이터 사이에서 존재하지도 않는 가짜 연결고리를 더 빠르게 지어낼 뿐이다.
온톨로지가 가장 어려운 본질이다
사람들은 늘 Neo4j냐 Neptune이냐 GraphDB냐를 따진다. Cypher냐 SPARQL이냐, 프로퍼티 그래프냐 RDF냐를 두고 논쟁한다. 그런 것들은 인프라 레벨의 결정일 뿐이다. 중요하긴 하지만, 시스템의 진정한 가치가 머무는 곳은 아니다.
진짜 가치는 온톨로지에 있다. 즉, GxP 세상에 어떤 유형의 개체들이 존재하는지, 개체 간에 어떤 관계가 성립할 수 있는지, 어떤 제약조건이 충족되어야 하는지, 그리고 어떤 규칙을 논리적으로 추론해낼 수 있는지를 엄밀하게 정의한 형식적 모델이다.
GxP 온톨로지는 ComputerizedSystem, ValidationArtifact, Regulation, Risk, Supplier, DataFlow 같은 클래스(Class)를 정의한다. 그리고 HAS_GAMP_CATEGORY, SATISFIES_CLAUSE, MITIGATED_BY, PRODUCES 같은 관계(Relationship)를 규정한다. 나아가 “모든 CriticalRisk 노드는 최소 하나 이상의 ControlMeasure 엣지를 가져야 한다”거나 “모든 ValidationArtifact는 반드시 버전 정보와 ALCOA 태그를 포함해야 한다”는 제약조건을 강제한다.
이것은 단순한 데이터베이스 스키마가 아니다. 실행 가능한 논리로 코딩된 도메인 모델이다. SHACL 형태 검증을 통해 데이터 입력 시점에 규제 위반 데이터를 원천 차단할 수 있다. 또한 OWL 추론 규칙을 통해 시스템 A의 변경이 시스템 B의 적격성 평가 상태에 영향을 미친다는 사실을, 사람이 일일이 코딩하지 않아도 전이 폐포(transitive closure)를 통해 자동으로 도출해낼 수 있다.
온톨로지가 있기에 그래프가 비로소 시맨틱(의미론적)해진다. 온톨로지가 없으면 문자열 레이블이 붙은 흔한 프로퍼티 그래프에 불과하지만, 온톨로지가 있으면 규제 현실을 기계가 완벽히 이해할 수 있는 지적 모델이 된다.
그리고 여기서 직시해야 할 불편한 진실이 있다: 아직 전 세계 어디에도 상용 수준의 GxP 온톨로지를 오픈소스로 공개한 곳이 없다. 폐쇄적인 QMS 벤더들(Veeva, MasterControl, Kneat 등)은 내부적인 온톨로지를 갖고 있지만 플랫폼 안에 꽁꽁 잠가두었다. 오픈소스 생태계에는 범용 바이오메디컬 온톨로지만 존재할 뿐, GAMP 5 카테고리와 CSA 위험 등급, Part 11 조항, ALCOA+ 속성을 속성 수준에서 1:1로 매핑해 둔 규제 온톨로지는 전무하다.
최초로 개방형(open), 거버넌스 검증 완료, 버전 잠금이 적용된 GxP 온톨로지를 내놓는 벤더가 생태계의 기반 기저(substrate) 전쟁에서 승리할 것이다. 온톨로지를 코드로 작성하기 어려워서가 아니라, 업계 전체가 합의(agree)하기가 극도로 어렵기 때문이다.
엣지(Edge) 자체가 감사 추적이다
시맨틱 지식 그래프의 모든 관계선(엣지)은 메타데이터를 담고 있다. 단순히 “시스템 A에 요구사항 B가 있다”로 끝나지 않는다:
- 누가 이 관계를 단언(assert)했는가 (Part 11 전자서명)
- 언제 단언했는가 (시간 동기화된 타임스탬프)
- 원천 문서의 어느 버전이 이를 뒷받침하는가
- 이전 버전의 해시값은 무엇이었는가
- 왜 변경되었는가 (변경 제어 번호 연동)
- ALCOA+ 규정 준수 여부가 증명되었는가
이 메타데이터 덕분에 그래프는 규제 당국 앞에서 방어 가능한(defensible) 체계가 된다. 관계 그 자체가 감사 대상이 될 수 있다. 실사관이 “시스템 X에 대한 밸리데이션 증거를 제시하라”고 요구할 때, “관련성이 있어 보이는” PDF 문서를 검색해 던져주는 것이 아니라 출처가 완벽히 보증된 노드들의 그래프 탐색 경로를 그대로 제시할 수 있게 된다.
그래프 자체가 곧 감사 추적이다. 별도의 분리된 로그 테이블이나 화면 캡처가 아니다. 그래프 구조 그 자체가 규제 준수 증거를 물리적으로 인코딩하고 있는 것이다.
에이전트는 쓰지 않는다. 탐색할 뿐이다.
규제 방어가 가능한 견고한 GxP AI 플랫폼과, FDA 경고 서한(Warning Letter)을 받게 될 위험한 장난감을 가르는 결정적인 아키텍처 원칙이다.
LLM은 그래프의 주인이 아니다. LLM이 마음대로 노드를 생성하거나, 존재하지 않는 관계를 발명하거나, 온톨로지를 고칠 수 없다. 오직 이미 검증되고 버전이 잠긴 기존 관계망을 **탐색(traverse)**하고, 그 결과물을 바탕으로 초안을 작성할 뿐이다.
그리고 대단히 중요한 원칙: LLM이 자체적으로 Cypher 쿼리를 즉석 생성하게 해선 안 된다. 복잡한 멀티홉(multi-hop) 질의에서 Text-to-Cypher의 정확도는 연구실 수준의 실험일 뿐 상용 규제 환경에서 쓸 수 있는 수준이 아니다. 대신 각 에이전트에는 변경 제어 관리를 받는 파라미터화된 사전 작성 Cypher 템플릿 라이브러리가 제공된다. LLM은 상황에 맞는 템플릿을 선택하고 필요한 파라미터만 채워 넣는다. 만약 새로운 탐색 경로가 필요하다면 변경 제어 티켓을 발행해 새 템플릿을 추가하고 검증해야지, 런타임에 LLM의 임기응변에 맡겨서는 안 된다.
LLM은 구조화된 데이터 위에서 추론하되, 그 구조는 철저히 인간의 거버넌스와 결정론적 검증 체계 아래에 두는 원칙이다.
기술 스택 (그리고 왜 특정 툴은 덜 중요한가)
참고로 현재 업계의 기술적 컨센서스는 다음과 같다:
- 그래프 데이터베이스: 운영 워크로드에는 Neo4j Enterprise (Cypher 쿼리 디버깅이 쉽고, 벡터 검색이 내장되어 있으며 생태계가 성숙함). AWS 중심 환경이라면 Amazon Neptune. 엄격한 OWL 형식 추론이 필수라면 GraphDB나 Stardog 같은 RDF 트리플 저장소.
- 온톨로지: 작성에는 LinkML (하나의 YAML로부터 Pydantic 클래스, OWL, SHACL을 동시 생성). 시각적 편집에는 Protégé. 제약조건 검증에는 SHACL.
- 데이터 파이프라인: 계층 1에서 계층 2로의 CDC(Debezium/Kafka). 엔티티 해결에는 Splink. 관계형-RDF 매핑에는 R2RML.
- 에이전트 계층: 변경 관리되는 파라미터화 Cypher 템플릿. 원시 DB 접근이 아닌 시맨틱 연산을 노출하는 MCP 서버. 템플릿 ID와 바인딩된 파라미터가 모두 기록되는 Langfuse 관측성.
하지만 솔직히 말해 온톨로지가 올바르고 데이터 거버넌스가 확립되어 있다면, 구체적인 데이터베이스 제품 선택은 부차적인 문제다. Neo4j든 Neptune이든 Stardog이든 모두 제 역할을 한다. 경쟁자가 쉽게 넘볼 수 없는 진정한 해자는 인프라가 아니라 시맨틱 도메인 모델이다.
아직 아무도 출시하지 못한 영역
2026년 8월 현재, 폐쇄형 QMS 벤더 중 1차 공급자(first-party) MCP 서버를 공식 출시한 곳은 없다. 상용 수준의 GxP 온톨로지를 오픈소스로 공개한 곳도 없다. 고객이 데이터를 온전히 통제하면서 계층 1부터 계층 3까지 이어지는 아키텍처를 엔드투엔드로 구현해 낸 곳도 없다.
현재 “AI 기반 밸리데이션”을 표방하는 대다수 업체들은 기존 문서 저장소 위에 LLM 래퍼(wrapper)를 씌워 파는 것에 불과하다. 진정한 계층 2(시맨틱 지식 그래프) 없이 계층 3(에이전트)만 성급하게 얹은 꼴이다. 에이전트는 단일 QMS 테이블을 읽다가 존재하지도 않는 허구의 관계를 지어내고, 그렇게 생성된 산출물은 규제 당국의 실사를 결코 버텨낼 수 없다.
진짜 기회는 그래프를 독립적이고, 거버넌스가 확립되었으며, 버전이 잠긴 단일 기저(substrate)로 공급하는 데 있다. 그 기저 위에서 사내 독자 에이전트든 오픈소스 에이전트든 누구나 Part 11 감사 추적을 완벽히 보증받으며 탐색할 수 있게 만드는 것이다.
맺으며
LLM은 언제든 갈아치울 수 있다. 하지만 온톨로지는 대체 불가능하다.
내일 당장 Claude를 최신 GPT로 바꾼다 해도, 검증된 코퍼스, 시맨틱 모델, 규제 매핑, 출처 추적 체계는 고스란히 남는다. 그것이 바로 시스템의 진정한 해자다.
지식 그래프는 단순한 소프트웨어 기능이 아니다. 규제 환경에서 AI 에이전트의 출력을 법적으로 방어 가능하게 만들어주는 필수 인프라다. 그리고 온톨로지 — GxP 세계가 무엇을 뜻하는지를 형식적이고, 버전 관리되며, 기계 판독 가능한 논리로 모델링한 결과물 — 야말로 아직 그 누구도 제대로 완성하지 못한 그 인프라의 가장 핵심적인 알맹이다.
이 온톨로지를 가장 먼저 올바르게 구축하는 자가 향후 모든 GxP AI 서비스가 딛고 설 토대를 지배하게 될 것이다.