PE Notes · DB
빅데이터 모델링, 평가, 시각화
5V와 스타·스노우플레이크·NoSQL 모델, 분류·회귀·군집 평가지표, 목적별 차트와 시각화 원칙을 정리합니다.
양이 커지고 형식이 섞이면, 정규화된 ERD만으로 분석을 받기 어렵습니다. 빅데이터는 쌓는 일이 아니라 모델 → 평가 → 로 결정을 만드는 파이프입니다.
5V와 모델링
| 특성 | 뜻 |
|---|---|
| Volume | 대용량 |
| Velocity | 실시간·스트림 |
| Variety | 정형·반정형·비정형 |
| Veracity | 품질·신뢰 |
| Value | 분석으로 얻는 가치 |
웨어하우스는 가운데 사실 테이블(매출, 수량)과 주변 차원(시간, 상품, 고객, 지역)인 가 기본입니다. 집계가 단순합니다. 차원을 다시 정규화하면 스노우플레이크가 되고, 중복은 줄고 조인은 늘어납니다.
| 모델 | 잘 맞는 데이터 |
|---|---|
| Key-Value | 세션, 캐시 |
| Document | JSON 반정형 |
| Graph | 관계 탐색, 추천 |
| Time-Series | 센서, 시세 |
| 람다 / 카파 | 배치+스트림 / 스트림 중심 |
평가
분류는 의 TP·FP·TN·FN에서 정확도, , , , 를 냅니다. 불균형이면 정확도만 쓰지 않습니다.
회귀는 MAE, RMSE(이상치에 민감), R²입니다. 군집은 , 엘보우(WSS 꺾임), Davies-Bouldin입니다.
시각화
목적은 비교(막대), 추세(선), 분포(히스토그램·박스), 비율(파이·트리맵), 관계(산점·히트맵), 지리, 텍스트, 네트워크로 나눕니다. 원칙은 군더더기 제거, 축을 왜곡하지 않기, 같은 값은 같은 색, 단위 표기, 색각 배려입니다.
수집(Kafka) → 저장(객체 저장소) → 처리(Spark/Flink) → 모델 → 지표 → 대시보드가 한 줄입니다. 자연어 질의에 차트까지 붙는 경로, 스트림 대시보드, 설명 가능한 예측 그림이 그다음입니다.