데이터마트와 데이터전처리 개념

데이터마트란?

데이터 분석하기에 앞서 분석하는 목적과 주제, 부서별로 데이터를 수집하고 변형해서 모으는 좀더 작은 형태의 데이터 웨어하우스라고 생각하면 됩니다. 즉, 흩어져있는 데이터를 수집해서 사용자의 목적에 맞게 구성했다고 하면 정답은 데이터마트가 됩니다.

이때 R에서 제공하는 패키지인 reshape, sqldf, plyr을 활용하여 데이터마트를 개발할 수 있습니다.

데이터 전처리란?

데이터 전처리는 미리 사전에 처리한다는 의미로, preprocessing인데요. 데이터를 전처리한다는 건 데이터를 정제하고 분석 변수를 처리하는 과정을 말합니다.

  • 정제하는 과정은 이전 포스팅에서 다루었던 결측값과 이상값을 처리하는 과정을 말합니다.
  • 분석 변수를 처리하는 과정은 변수를 선택하고, 차원 축소, 파생변수 생성, 불균형한 데이터를 처리하는 클래스 불균형, 변수 변환 과정을 말합니다.

요약변수란?

합계, 평균, 횟수 등과 같이 기존 데이터에서 기초적인 통계 자료를 추출한 변수를 말합니다.

파생변수란?

파생변수는 새롭게 생성된 변수인데요. 특정 목적을 가지고 조건을 만족하는 변수를 새롭게 생성했다면 파생변수입니다.

데이터마트 개발에 활용되는 R 패키지

  1. reshape
    • 대표적으로 특정 변수를 녹여서 다른 변수에 대한 좀 더 자세한 데이터를 만드는 melt 함수와 주조하는, 즉 melt를해서 녹은 데이터를 새롭게 가공시키는 cast 함수가 있습니다.
    • 만약, 특정변수를 나눈다는 내용이있고, 재결합하는 함수를 제공하며, 데이터 재구성이 가능하게하는 cast함수가 있다?라면, 정답은 reshape가 됩니다.
  2. sqldf
    • sql 을 활용하는 패키지로, SAS에서 PROC SQL 같은 역할을 합니다.
  3. plyr
    • 입력되는 데이터와 출력되는 데이터 구조에 따라서 다양한 함수를 제공합니다. 그 중에서도 apply함수를 기반으로하는 데이터 처리 기능을 제공합니다.
    • summarize: 데이터 요약 / transform: 기존 데이터에 추가
  4. data.table
    • 인덱스를 만들어서 연산이나 검색을 효율적으로 할 수 있는 데이터 구조입니다. 데이터프레임과 비교했을 때 4배에서 100배에 가깝게 빠른 속도로 데이터를 다룰 수 있게 합니다.

예상문제

문제 1

다음 중 데이터마트에 대한 설명으로 가장 적절한 것은?

① 기업의 모든 데이터를 통합하여 저장하는 가장 큰 저장소이다.
② 분석 목적이나 부서별 요구에 맞게 데이터를 수집하고 가공한 소규모 데이터 저장소이다.
③ 결측값과 이상값만 따로 저장하는 공간이다.
④ 원본 데이터를 수정하지 않고 그대로 보관하는 공간이다.

정답: ②

해설: 데이터마트는 데이터 웨어하우스보다 작은 범위의 데이터 저장소로, 특정 부서나 분석 목적에 맞게 데이터를 구성한 형태입니다.

문제 2

다음 중 요약변수와 파생변수에 대한 설명으로 옳은 것은?

① 요약변수는 특정 조건에 따라 새롭게 생성한 변수이다.
② 파생변수는 평균, 합계, 횟수와 같이 통계값을 계산한 변수이다.
③ 요약변수는 기존 데이터에서 합계, 평균, 횟수 등을 계산한 변수이다.
④ 요약변수와 파생변수는 같은 의미이다.

정답: ③

해설: 요약변수는 합계, 평균, 횟수처럼 기존 데이터를 요약하여 만든 변수입니다. 파생변수는 분석 목적에 따라 기존 변수를 활용해 새롭게 생성한 변수입니다.

문제 3

다음 중 R 패키지와 기능의 연결이 올바르지 않은 것은?

① reshape – melt와 cast 함수를 활용한 데이터 재구성
② sqldf – SQL 문법을 활용한 데이터 처리
③ plyr – apply 계열 함수를 기반으로 한 데이터 처리
④ data.table – 그래프와 시각화 기능 제공

정답: ④

해설: data.table은 대용량 데이터를 빠르게 검색하고 연산하기 위한 패키지입니다. 그래프와 시각화를 위한 대표적인 패키지는 ggplot2입니다

관련 글 보기