데이터 레이크
Data Lake
DL・레이크
정형·반정형·비정형 데이터를 다양한 형식으로 보관하고, 필요에 따라 처리·분석할 수 있게 하는 저장 기반이다. 원본뿐 아니라 정제된 데이터도 저장할 수 있다.
Glossary
공부하며 만난 개념을 짧게 정리합니다. 더 깊은 설명은 관련 글에서 이어집니다.
전체 8개 용어
Data Lake
DL・레이크
정형·반정형·비정형 데이터를 다양한 형식으로 보관하고, 필요에 따라 처리·분석할 수 있게 하는 저장 기반이다. 원본뿐 아니라 정제된 데이터도 저장할 수 있다.
Data Lakehouse
레이크하우스・Lakehouse
데이터 레이크의 파일 기반 저장에 테이블의 트랜잭션·스키마 관리 등 웨어하우스의 데이터 관리 기능을 결합한 아키텍처다. 같은 데이터 기반에서 SQL 분석과 다양한 처리 작업을 지원한다.
Data Mart
DM・마트
특정 부서나 분석 주제에 맞춰 구성한 데이터 영역이다. 상세 데이터나 집계 결과를 테이블·뷰 등으로 제공하며, 반드시 별도 저장소일 필요는 없다.
Data Warehouse
DW・웨어하우스
여러 원천의 데이터를 분석에 적합한 공통 구조로 통합해 저장하고 조회하는 시스템이다. 운영 업무의 개별 거래 처리보다 여러 데이터를 함께 분석하는 데 초점을 둔다.
Lazy Evaluation
지연 연산
연산 결과가 필요할 때까지 실제 계산을 미루는 평가 방식이다. 예를 들어 Spark에서는 변환을 기록해 두고 액션이 결과를 요구할 때 필요한 계산을 수행한다.
Cross-Origin Resource Sharing
교차 출처 리소스 공유
서버가 HTTP 헤더로 허용할 출처를 알려 주어, 브라우저가 다른 출처의 응답을 스크립트에 제공할지 판단하는 방식이다. 사용자 인증이나 API 접근 권한 검사를 대신하지 않는다.
DO・듀러블 오브젝트・듀러블 객체
고유한 ID별로 실행 상태와 영속 저장소를 함께 제공하는 Cloudflare의 컴퓨팅 서비스다. 같은 ID로 들어오는 요청을 하나의 객체에서 조정하며, 카운터나 실시간 협업 상태 등을 관리할 수 있다.
Spark Cache
스파크 캐시
Apache Spark에서 RDD나 DataFrame의 계산 결과를 파티션 단위로 저장해 후속 작업에서 재사용하는 기능이다. cache()나 persist()로 저장을 지정하고, 액션이 필요한 파티션을 계산할 때 결과를 저장한다. 저장 위치는 대상 API와 저장 수준에 따라 메모리 또는 디스크 등이 될 수 있다.
일치하는 용어가 없습니다.
다른 검색어를 입력하거나 태그 필터를 바꿔 보세요.