대용량 데이터에서 비즈니스 인사이트를 추출합니다. 데이터 수집·정제·통합 파이프라인부터 비식별화·분석·예측 모델링까지, 의료·공공·제조 분야의 실제 데이터 플랫폼 구축 경험으로 지원합니다.
데이터 파이프라인 · 통합 플랫폼 · 비식별화 · 예측 모델 · 의미 검색 · 시각화까지.
ERP · 공공 API · 문서 등 이기종 데이터 소스를 수집 · 정제 · 통합하는 파이프라인을 구축합니다. 비동기 작업 큐(Redis · RQ)로 대용량 처리를 분산하고, 오류 복구와 데이터 품질 검증을 자동화합니다.
정형 · 비정형 데이터를 한곳에 모으는 데이터 통합 플랫폼과 연구자용 데이터 안심존(OpenLab)을 구축합니다. PostgreSQL 등 RDB와 파일 저장소를 결합해 안전한 데이터 활용 환경을 제공합니다.
개인정보(이메일 · 전화 · 주민번호 · 카드번호)를 자동으로 탐지 · 마스킹하고 보안 등급 · 접근 권한을 적용합니다. 민감 데이터를 안전하게 활용하는 비식별화 · 안심존 체계를 구현합니다.
제조 품질 예측, 이상 탐지 등 도메인 특화 AI 모델을 개발합니다. 공정 센서 · 운영 데이터를 학습해 불량 · 이상 징후를 사전에 감지하고, 학습 · 평가 · 배포까지 운영합니다.
문서 · 비정형 데이터를 임베딩(bge-m3)해 pgvector(HNSW)에 적재하고, 키워드(BM25)와 의미 검색을 융합한 하이브리드 검색으로 대규모 데이터에서 필요한 정보를 정확히 찾습니다.
처리 작업 · 자원 · 품질 · 핵심 지표를 실시간 대시보드(ECharts)로 시각화합니다. 역할별 맞춤 뷰와 활동 로그로 데이터 운영 현황을 한눈에 관제합니다.
코드베일리가 실제 사업과 자체 솔루션(Bailey RAG)에서 사용하는 데이터 스택.
Python · FastAPI로 데이터 처리 API를, Redis + RQ로 비동기 인덱싱 · 배치 작업을 처리합니다. 공공 SI는 Java · Spring으로 구축합니다.
PostgreSQL과 pgvector(HNSW)로 정형 데이터와 벡터를 함께 저장 · 검색하고, 비식별화 엔진으로 민감정보를 보호합니다.
PyTorch · scikit-learn으로 예측 · 이상 탐지 모델을, bge-m3로 임베딩을, ECharts로 데이터 시각화를 구현합니다.