빅데이터를 위한 Parquet 포맷

·
데이터베이스
Parquet에 대해 알게된 배경인턴 프로젝트를 진행하며 수십GB 수준의 데이터를 다루게 되었다. 데이터 파이프라인을 구축하기 위해 우선 s3에 원본 데이터를 그대로 적재해 데이터 레이크를 구축하고 데이터들을 s3에서 호출해 전처리 및 분석하여 전처리된 데이터셋을 구축하고 있었다. 기존에 학교에서 배울 때처럼 데이터들의 형식을 csv로 저장하고 있었는데 저장된 데이터를 전처리를 위해 불러오면서 문제가 발생했다.기업 데이터에는 각 기업들을 식별하는 고유번호가 있었는데 이 데이터를 저장할 때는 문제가 없었으나 저장한 후에 다시 불러오는 과정에서 pandas가 숫자로만 이루어진 이 컬럼을 보고 자동으로 숫자형으로 타입을 추론해 앞쪽의 0을 전부 지워버리는 문제가 발생했다.이 문제를 해결하기 위해 다양한 방법을..