로컬 LLM(Ollama)과 클라우드 LLM(Claude)을 폐쇄망에서 안전하게 운영합니다. 모델 무중단 교체, 구성요소 관제, 오프라인 배포까지 — 자체 개발한 Private RAG 플랫폼 Bailey RAG에 실제 구현된 LLM 운영 체계를 제공합니다.
모델 무중단 교체부터 구성요소 관제 · 모니터링 · 런타임 튜닝까지 — Bailey RAG에 실제 구현된 폐쇄망 LLM 운영 기능입니다.
Preload(모델 확인) → Warmup(메모리 예열) → Switch(기본 모델 전환) → Drain(진행 요청 정리) 4단계로 기본 모델을 무중단 교체합니다. 각 질의가 자체 모델을 지정하므로 진행 중 작업이 끊기지 않으며, 예열 시간·소요 시간과 교체 이력이 감사 로그에 기록됩니다.
설치된 모델 목록을 파라미터 크기 · 양자화 · 용량 · 메모리 로드 상태(로드됨/대기)와 함께 관리합니다. Ollama 연결 상태와 총 모델 수 · 총 용량을 확인하고, 질의별로 사용할 모델을 지정합니다.
기본은 로컬 Ollama, 옵션으로 클라우드 Claude를 함께 운영합니다. 대외비 등급 근거는 외부 클라우드 LLM으로 전송되기 전에 자동 차단되고, 외부 연계(MCP·클라우드)만 DMZ로 분리되어 폐쇄망 보안을 유지합니다.
postgres · redis · api · worker · ollama 등 컨테이너 구성요소의 상태 · 역할 · 포트를 한 화면에서 보고, 시작 / 정지 / 재시작을 제어합니다. 구성요소별 실시간 컨테이너 로그를 스트리밍으로 확인합니다.
자원(LLM) · 실행 작업 큐(Redis + RQ) · 평균 tok/s · 평균 응답 시간(초) · 활성 세션 · 로컬 처리율을 통합 대시보드로 추적합니다. 지식베이스 · 거버넌스 · RAG 핵심 지표를 한눈에 관제합니다.
검색 융합(벡터 · BM25 가중치 · RRF k) · 생성(temperature · 최대 토큰) · 청킹(크기 · 오버랩 · top-k) · 시스템 프롬프트를 화면에서 실시간 조정하고 DB에 저장합니다. 답변 만족도 피드백과 리랭커(bge-reranker) A/B 비교로 품질을 개선합니다.
Bailey RAG가 실제로 사용하는 폐쇄망 LLM 운영 스택.
로컬 LLM 런타임은 Ollama, 임베딩은 bge-m3(1024차원), 재순위는 bge-reranker를 사용합니다. 기본 LLM은 qwen2.5 계열이며 옵션으로 Claude API를 연동합니다.
벡터 · 문서 · 감사 로그는 PostgreSQL + pgvector(HNSW)에 저장하고, 비동기 인덱싱 작업은 Redis + RQ 워커로 처리합니다. API는 FastAPI로 제공합니다.
Docker Compose 멀티스테이지로 전체 스택을 한 번에 기동하고, 오프라인 번들(.tar · docker save)과 OS별 설치 스크립트로 폐쇄망에 100% 로컬 설치합니다. Kubernetes와 Electron 데스크톱 앱 배포도 지원합니다.