AWS SAA-C03AWS 허브발행일 2025. 11. 6.원본 https://blog.naver.com/jword_/224066802293 ↗

[SAA-C03] 데이터 분석 레이어

[SAA-C03] 데이터 분석 레이어 — #개발자의도구들 #AWSSAA #AWSS3 #AWSRedshift #AWSGlue #AWSKinesis #AWSLake ...

#SAA-C03#Naver Blog

#개발자의도구들 #AWSSAA #AWSS3 #AWSRedshift #AWSGlue #AWSKinesis #AWSLake

​

\* AWS SAA 도전기 목록: https://blog.naver.com/jword\_/224028873217

​

🎯목표

애플리케이션에서 발생하는 모든 데이터는 잠재적인 가치를지닌다.

AWS에서 데이터의 잠재적 가치를 발견하기 위해 데이터 분석을 수행할 수 있다.

​

데이터 분석에는 다음과 같은 단계를 가진다.

  1. 데이터 저장
  2. 데이터 수집 및 이동
  3. 데이터 분석 / 쿼리
  4. 머신러닝 / 고급 분석
  5. 데이터 거버넌스 관리

​

각 단계별로 어떤 서비스가 사용되는지 알아보자

데이터 저장

storage Layer

📌S3

비정형 데이터 저장소

  • CSV
  • Json
  • Log
  • image

​

👉Data Lake의 중심 저장소이다.

javascript 코드 예제
                                    “Data Lake”, “store raw data”, “durable and scalable storage”

​

📌RDS / DynamoDB

정형 데이터 저장소

​

👉트랜잭션 데이터(OLTP)

javascript 코드 예제
                                    “application data”, “OLTP”, “row-based storage”

*OLTP: Online Transaction Processing

📌RedShift

대규모 분석을 위한 컬럼 기반 데이터 웨어하우스

  • OLAP(Online Analytical Processing)

​

👉대량의 정형 데이터를 빠르게 분석

javascript 코드 예제
                                    “Data warehouse”, “complex queries”, “BI tools”, “columnar storage”

데이터 수집 \* 이동

Ingestion & ETL Layer

javascript 코드 예제
                                    *ETL Layer: 데이터 엔지니어링에서 다양한 소스의 데이터를 수집하고,
분석에 적합한 형태로 가공하여 단일 저장소(데이터 웨어하우스, 데이터 레이크 등)에
저장하는 일련의 데이터 통합 프로세스 및 아키텍처 계층

📌AWS Glue

ETL서비스, 크롤러로 메타데이터 자동생성

👉S3 → RedShift/ Athena로 데이터 이동 시

javascript 코드 예제
                                    “ETL”, “data catalog”, “schema discovery”, “serverless data integration”

📌Kinesis Data Filrehose / Streams

실시간 스트리밍 데이터 수집

👉로그, IoT, 실시간 이벤트 수집

javascript 코드 예제
                                    “real-time streaming data”

📌AWS DMS(Data Migration Service)

DB 간 데이터 복제 및 마이그레이션

👉온프레미스 → AWS DB 이전

javascript 코드 예제
                                    “migrate database to AWS”

데이터 분석 / 쿼리

Analytics Layer

📌Amazon Athena

S3에 저장된 데이터를 SQL로 직접 질의

  • 서버리스
  • Presto 기반

👉S3 데이터 쿼리 관련

javascript 코드 예제
                                    “query data in S3”, “serverless SQL”, “no ETL needed”

📌Amazon Redshift Spectrum

Redshift가 S3데이터를 외부 테이블로 쿼리

​

👉Redshift + S3 혼합 분석

javascript 코드 예제
                                    “query S3 data from Redshift”

📌Amazon EMR

Hadoop. Spark 등 빅데이터 프레임워크 실행

​

👉대규모 데이터 처리(비정형 + 복잡한 반환)

javascript 코드 예제
                                    “Hadoop/Spark”, “big data processing”, “custom framework”

머신러닝 / 고급 분석

AL/ML Layer

📌SageMaker

머신러닝 모델 학습 및 배포

​

👉데이터 기반 예측/분류 문제

javascript 코드 예제
                                    “train ML models”, “Jupyter notebook”, “deploy endpoints”

데이터 거버넌스 / 관리

Governance & Catalog

📌AWS Glue Data Catalog

데이터셋의 메타데이터 중앙 저장소

​

👉여러 서비스가 동일한 데이터 스키마 참조시

javascript 코드 예제
                                    “central metadata store”, “schema registry”

📌AWS Lake Formation

S3기반 데이터레이크 권한 관련, 접근 제어

​

👉Data Lake 보안 관리 자동화

javascript 코드 예제
                                    “data lake governance”, “fine-grained permissions”

시험 tip

목표사용 서비스핵심 포인트
원본 로그/데이터 저장S3확장성, 내구성, Data Lake 중심
정형 데이터 분석용 웨어하우스RedshiftOLAP, BI, 대규모 SQL 분석
데이터 변환 및 이동Glue서버리스 ETL, Data Catalog
즉석 쿼리 (ETL 없이)AthenaS3 데이터에 SQL 실행
대용량 분산처리EMRHadoop/Spark 기반, 커스텀 분석
실시간 데이터 스트림Kinesis실시간 수집, 분석
머신러닝SageMaker모델 학습, 배포
데이터 거버넌스Lake Formation권한 제어, 중앙 관리
문제 상황정답 서비스이유
“S3에 저장된 데이터를 SQL로 분석하고 싶다. 서버 관리 없이.”AthenaS3 직접 쿼리, 서버리스
“S3에 저장된 데이터를 정제 후 Redshift로 적재하고 싶다.”GlueETL + 크롤러 + Data Catalog
“매일 수 TB의 데이터를 분석해야 한다. 고성능 SQL 분석 필요.”Redshift데이터 웨어하우스, 컬럼 기반, 병렬 처리
“Spark를 사용해 커스텀 데이터 파이프라인을 만들고 싶다.”EMR커스텀 프레임워크 실행 가능
“데이터 레이크에 접근 제어를 중앙에서 관리하고 싶다.”Lake FormationFine-grained permission 제어
“Redshift에서 S3 데이터를 직접 쿼리하고 싶다.”Redshift SpectrumRedshift 외부 테이블 기능
“온프레미스 DB를 AWS로 실시간 복제하고 싶다.”DMS데이터 마이그레이션 전용 서비스

​