기업 문서와 데이터를 AI가 이해하고 검색할 수 있는 Retrieval-Augmented Generation 시스템을 구축합니다. BM25와 의미 검색을 RRF로 결합한 하이브리드 검색과 근거 인용으로 신뢰할 수 있는 답변을 제공합니다. 폐쇄망 설치형 Private RAG 플랫폼 Bailey RAG를 직접 개발·운영한 경험을 바탕으로 합니다.
공공기관 · 금융 · 국방처럼 민감 데이터를 다루는 조직에게 외부 클라우드 RAG는 선택지가 되기 어렵습니다. Bailey RAG는 임베딩 · 검색 · 생성의 모든 과정이 기관 내부에서 끝납니다 — 문서도, 질의도, 답변도 외부망으로 나가지 않습니다.
파싱 · 임베딩 · 검색 · 생성이 100% 기관 인프라에서 실행됩니다. 망분리(에어갭) 환경에 그대로 설치되어 문서 한 줄도 외부 클라우드로 전송되지 않습니다.
개인정보보호법 · 공공기관 보안지침 · 망분리 요건을 충족합니다. 대외비 근거의 외부 전송 자동 차단과 변조 불가 감사 추적으로 규제 대응을 코드로 강제합니다.
토큰당 과금이 없습니다. 질의량이 폭증해도 비용이 비례해 늘지 않는 온프레미스 고정 비용 구조로 외부 API 의존성과 종량 과금 리스크를 제거합니다.
한국어 임베딩 · 리랭킹 · 로컬 LLM에 기관 고유 용어와 문서 형식(HWP 등)을 더해 튜닝합니다. 범용 클라우드 모델보다 우리 조직 문맥에 정확합니다.
문서 수집 → 청킹 → 임베딩(bge-m3) → pgvector(HNSW) 저장 → 하이브리드 검색(BM25+RRF) → LLM 생성(Ollama) → 근거 인용까지 7단계 파이프라인.
표면적인 결과만 보여드리지 않습니다. 검색 정확도를 끌어올리는 모든 단계를 프로덕션 레벨에서 직접 구현하고 도메인에 맞춰 튜닝합니다.
BM25(키워드)와 임베딩 벡터(의미)를 RRF(Reciprocal Rank Fusion)로 융합해 정확한 용어도, 모호한 문맥도 놓치지 않습니다.
1차 검색 상위 후보를 bge-reranker-v2 교차 인코더로 재정렬하고 MMR 다양화로 중복을 줄여 컨텍스트 품질을 높입니다.
의미 기반 분할 · 부모-자식(parent-child) · 오버랩 튜닝으로 문맥 보존과 검색 정밀도를 동시에 확보합니다.
HyDE · 멀티쿼리 · 쿼리 확장 · Step-back 프롬프팅으로 짧고 모호한 질문도 검색 의도에 맞게 보정합니다.
답변에 근거 [n]을 인용 · 하이라이트하고, 근거 밖 주장을 검증해 환각(Hallucination)을 억제합니다.
bge-m3(1024차원 다국어) 임베딩과 pgvector(HNSW) 인덱스로 수천만 청크를 밀리초 단위로 근사 탐색합니다.
top-k 재정렬 · 컨텍스트 예산(budget) 관리 · 중복 제거로 LLM에 들어가는 근거의 밀도와 적합성을 극대화합니다.
Faithfulness · Answer Relevancy · Recall@k 등 RAG 지표와 사용자 👍/👎 피드백으로 품질을 지속 측정 · 개선합니다.
Stanford STORM 6단계로 관점 발굴 → 다관점 질문 → 검색 → 개요 → 본문 → 요약까지 근거 인용 보고서를 자동 생성합니다.
이전 맥락을 기억하는 멀티턴 대화와 서버 저장 대화 기록으로 후속 질문과 맥락 기반 재질의를 지원합니다.
보안 등급 · 기간 · 부서 · 문서 유형 등 메타데이터 조건으로 검색 범위를 좁히고 권한 밖 문서를 원천 제외합니다.
PDF · DOCX · HWP · PPTX · XLSX와 스캔 이미지(OCR)를 레이아웃 · 표 구조까지 추출해 인덱싱합니다.
사내 문서를 올리면 인용 답변 · 다관점 보고서 · 보안 거버넌스까지 — 폐쇄망에서 실제 동작하는 Private RAG 플랫폼 Bailey RAG의 핵심 화면입니다.
업로드한 사내 문서를 근거로 인용([n]) 답변을 생성합니다. 벡터(의미)와 BM25(키워드)를 RRF로 융합한 하이브리드 검색, 인용 클릭 시 원본 PDF 근거 하이라이트, 대외비 포함 토글, 서버에 저장되는 대화 기록을 제공합니다.
주제만 입력하면 Stanford STORM 6단계(관점 발굴 → 다관점 질문 → 하이브리드 검색 → 개요 → 본문 → 핵심 요약)로 다관점 보고서를 근거 인용과 함께 자동 생성합니다.
PDF · DOCX · HWP · 이미지(OCR) 문서를 업로드하면 파싱 → 청킹 → 임베딩(bge-m3) → 인덱싱이 자동 진행됩니다. 단계별 진행 현황과 문서 · 청크 · 용량 집계, 암호 인증 기반 원본 다운로드를 지원합니다.
pgvector(HNSW) 저장소의 인덱스 유형 · 크기 · 벡터 수 등 내부 지표를 확인하고 청크 본문을 검색 · 탐색합니다. 팀 · 프로젝트별 독립 컬렉션(워크스페이스)으로 지식베이스를 분리 운영합니다.
문서 보안 등급(일반 · 대외비)별 등급 필터 검색과 대외비 근거의 외부 클라우드 전송 자동 차단으로 정보 유출을 막습니다. 민감정보(이메일 · 전화 · 주민 · 카드) 자동 마스킹, RBAC 권한 매트릭스, 전 활동 감사 로그를 제공합니다.
파싱 · 임베딩 · 검색 · 질의응답 · 보고서 생성이 100% 로컬(Ollama)에서 동작하고, 외부 연계(MCP · 클라우드 LLM)만 DMZ로 분리됩니다. 모델 Hot-swap 무중단 교체와 함께 원클릭 설치 · Electron 데스크톱 앱 · 폐쇄망 오프라인 번들 · Kubernetes 배포를 지원합니다.
폐쇄망에서 실제 동작하는 Bailey RAG 콘솔의 핵심 기능 화면 10개를 아래로 스크롤하며 차례대로 둘러보세요. 질의응답·STORM 파이프라인은 실제 동작 흐름을 그대로 재현한 인터랙티브 데모로, 화면이 보이면 자동으로 재생됩니다.
주제에 대한 다양한 이해관계자 관점을 자동 도출합니다.
각 관점별 심층 질문을 생성해 검색 범위를 확장합니다.
BM25 + 벡터 검색으로 사내 문서 근거를 수집합니다.
수집된 근거를 바탕으로 보고서 구조를 설계합니다.
섹션별 본문을 근거 인용과 함께 작성합니다.
전체 보고서의 핵심 요약을 생성해 마무리합니다.
※ 위 화면은 실제 제품(Bailey RAG)의 동작 흐름을 재현한 인터랙티브 데모 시뮬레이션입니다.
사내 문서를 올리는 것만으로 조직의 지식을 활용하는 다양한 업무 자동화를 구축할 수 있습니다. 아래는 Bailey RAG로 바로 구현 가능한 대표 시나리오입니다.
민감 데이터를 다루는 조직에 필요한 등급 · 권한 · 마스킹 · 감사 통제를 기본으로 설계했습니다. 보안은 옵션이 아니라 플랫폼의 토대입니다.
일반 · 대외비 · 기밀 등 문서별 보안 등급을 부여하고, 등급에 따라 검색 · 열람 · 외부 전송 정책을 차등 적용합니다.
사용자 권한 밖의 문서는 검색 결과와 근거 컨텍스트에서 원천 제외됩니다. "보이지 않아야 할 문서"가 답변에 새지 않습니다.
주민번호 · 카드번호 · 연락처 · 이메일 등 민감정보를 자동 탐지하고, 권한 · 맥락에 따라 응답 시점에 동적으로 마스킹합니다.
대외비 근거가 외부 클라우드 LLM으로 전송되려 하면 정책으로 자동 차단하고 로컬 모델로 폴백하며 CRITICAL 이벤트로 기록합니다.
질의 · 업로드 · 등급 변경 · 다운로드 · 차단 등 모든 활동을 Append-only 원장에 기록해 추적성과 사고 대응을 보장합니다.
메뉴 · 문서 · 기능 단위로 읽기 · 생성 · 수정 · 삭제 · 실행(R/C/U/D/X) 권한을 역할 기반으로 세밀하게 통제합니다.
팀 · 프로젝트별 독립 인덱스로 지식베이스를 분리하고 교차 컬렉션 검색을 차단해 부서 간 정보 격벽을 유지합니다.
SAML 2.0 · OIDC · LDAP로 기관 인증 체계와 연계해 단일 로그인과 중앙 계정 · 권한 관리를 지원합니다.
외부 의존 없이 폐쇄망에서 완결되는 오픈소스 기반 스택입니다. GPU 가속부터 CPU-only 환경까지 기관 인프라에 맞춰 구성합니다.
qwen2.5(3B/7B/14B) · llama3.1 · 한국어 특화 모델을 Ollama로 서빙합니다. 모델 Hot-swap 무중단 교체를 지원하며, 망분리 시에만 DMZ로 외부 LLM(Claude 등)을 선택 연계합니다.
bge-m3(1024차원 다국어) 임베딩과 bge-reranker-v2-m3 Cross-Encoder 리랭커를 사용합니다. 기관 도메인 데이터로 파인튜닝해 정확도를 높입니다.
PostgreSQL + pgvector(HNSW) 벡터 인덱스와 BM25 키워드 인덱스를 RRF로 융합합니다. 수천만 청크 규모에서도 밀리초 단위 검색을 보장합니다.
FastAPI · Redis · RQ 워커 기반으로 비동기 인덱싱과 스트리밍 생성을 처리합니다. Docker · Kubernetes로 컨테이너화 · 고가용 구성이 가능합니다.
PDF · DOCX · HWP · PPTX · XLSX · 이미지(OCR)를 레이아웃 · 표 구조까지 추출하고 의미 기반으로 청킹해 검색 정확도를 끌어올립니다.
GPU 가속 환경은 물론 GPU가 없는 폐쇄망도 지원합니다. GGUF 양자화 경량 모델로 CPU-only 환경에서도 실용적인 응답 속도를 확보합니다.
인터넷이 차단된 망분리 환경부터 자체 클라우드 · Kubernetes까지, 기관 인프라에 맞는 설치 옵션과 기존 시스템 연계를 제공합니다.
인터넷이 없는 망분리 환경에 모델 · 컨테이너 이미지 · 의존성을 일괄 포함한 오프라인 번들로 설치합니다. 외부 다운로드가 전혀 필요 없습니다.
기관 서버실 · 프라이빗 클라우드에 설치합니다. 데이터와 모델이 기관 통제 경계를 벗어나지 않습니다.
Docker Compose · Kubernetes로 컨테이너 오케스트레이션과 고가용(HA) · 수평 확장 구성을 지원합니다.
Preload · Warmup · Drain 절차로 서비스 중단 없이 모델을 교체 · 업데이트합니다. 폐쇄망에서도 오프라인 번들로 갱신합니다.
원클릭 설치 스크립트와 Electron 데스크톱 앱으로 개인 PC 설치형까지 지원합니다.
MCP 외부 데이터 연계, REST · OpenAPI, SSO(SAML · OIDC · LDAP), Webhook으로 기관 인증과 기존 시스템 · 데이터에 매끄럽게 연결됩니다.
큰 투자 전에 작은 POC로 효과를 먼저 검증합니다. 진단부터 폐쇄망 정식 운영까지 단계별로 리스크를 줄이며 진행합니다.
대상 문서 · 인프라 · 보안 요건을 분석하고 가장 효과가 큰 적용 시나리오를 함께 도출합니다.
대상 문서를 수집 · 정제하고 보안 등급을 분류합니다. 청킹 · 인덱싱 전략을 도메인에 맞게 설계합니다.
핵심 시나리오를 폐쇄망(또는 격리 환경)에 PoC로 구축하고 검색 정확도 · 응답성 · 근거 품질을 정량 측정합니다.
실사용자 대상 파일럿으로 현업 검증을 거치고, 피드백을 바탕으로 청킹 · 검색 · 프롬프트를 튜닝합니다.
폐쇄망에 정식 배포하고 모니터링 · 재색인 · 모델 업데이트 체계를 갖춰 지속적으로 정확도와 안정성을 높입니다.
7개 그룹 · 17개 화면으로 구성된 엔터프라이즈 4-Layer 아키텍처 — pgvector · BM25 · bge-m3 · Ollama 기반.
도입을 검토하는 기관에서 가장 많이 묻는 질문을 정리했습니다.