통합 데이터 레이어
구조화 데이터와 비구조화 데이터를
하나로 묶는 레이크하우스.
별도 ETL 없이 SQL 한 줄로
모든 데이터에 접근합니다.
왜 레이크하우스가 필요한가
기업 데이터는 DB 테이블, 문서 파일, 로그,
임베딩 벡터 등 다양한 형태로 흩어져 있습니다.
이를 분석하려면 보통 ETL 파이프라인을
구축하고 데이터 웨어하우스에 적재해야 합니다.
Lakehouse는 이 과정을 제거합니다.
구조화 + 비구조화, 하나의 쿼리로
PostgreSQL 테이블 데이터와 Silo에 저장된 Parquet 파일을 하나의 SQL 인터페이스로 함께 조회할 수 있습니다. 별도의 ETL 없이 원본 데이터에 직접 접근합니다.
분석 워크로드 분리
운영 DB에 분석 쿼리를 실행하면 성능에 영향을 줍니다. Lakehouse 레이어로 분석 데이터를 분리하면 운영 DB 부하 없이 대규모 집계를 수행할 수 있습니다.
데이터 내보내기 자동화
테이블 데이터를 Parquet, CSV, JSON 형식으로 주기적으로 자동 내보내기할 수 있습니다. 외부 BI 도구나 데이터 웨어하우스 연동에 활용됩니다.
구성 요소
Lake Engine
PG 카탈로그 + Silo 스토리지 + Parquet 엔진을 통합하는 코어.
Parquet Engine
Parquet 파일 읽기/쓰기, 필터링, 통계 조회, 머지를 처리.
Lake Catalog
외부 테이블과 Parquet 파일의 메타데이터를 PostgreSQL에서 관리.
Export Pipeline
스케줄 기반 데이터 내보내기. Parquet, CSV, JSON 지원.
External Table
외부 데이터 소스를 가상 테이블로 등록. SQL로 직접 쿼리 가능.
활용 시나리오
AI 학습 데이터 관리
RAG용 문서, 임베딩 벡터, 메타데이터를 Parquet로 관리하고 AI 파이프라인에 직접 공급합니다.
운영 데이터 분석
Crown CDC로 들어온 실시간 데이터를 Lakehouse에서 집계하여 대시보드에 반영합니다.
데이터 아카이빙
오래된 운영 데이터를 Parquet로 내보내고 Silo에 장기 보관합니다. 필요 시 SQL로 조회 가능.
MonolithDB 통합
Lakehouse는 MonolithDB의 분석 레이어입니다. Silo(오브젝트 스토리지)에 Parquet 파일을 저장하고, Crown(CDC)으로 실시간 데이터를 수집하고, Analytics 모듈과 연계하여 집계 결과를 제공합니다.