기본 콘텐츠로 건너뛰기
Google Cloud Documentation
문서
  • 시작하기
  • Google Cloud 시작하기
  • 제품 목록
  • Cloud Customer Care
  • 추천 제품
  • Agent Platform
  • Apigee API 관리
  • BigQuery
  • Compute Engine은
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • Google Kubernetes Engine
  • Looker
  • 크로스 프로덕트 도구
  • 액세스 및 리소스 관리
  • 비용 및 사용량 관리
  • 코드형 인프라
  • SDK, 언어, 프레임워크, 도구
  • 기술 분야
  • AI 및 ML
  • 애플리케이션 개발
  • 애플리케이션 호스팅
  • 컴퓨팅
  • 데이터 분석 및 파이프라인
  • 데이터베이스
  • 분산, 하이브리드, 멀티 클라우드
  • 업종별 솔루션
  • 이전
  • 네트워킹
  • 모니터링 가능성 및 모니터링
  • 보안
  • Storage
/
콘솔
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
로그인
  • Managed Service for Apache Spark
무료로 시작하기
개요 가이드 참조 샘플 리소스
Google Cloud Documentation
  • 문서
    • 더보기
    • 개요
    • 가이드
    • 참조
    • 샘플
    • 리소스
  • 콘솔
  • 개요
  • 주요 개념
  • Managed Service for Apache Spark 서버리스
    • 개요
    • Managed Service for Apache Spark 서버리스 등급
  • 클러스터의 Managed Service for Apache Spark
  • 서버리스 및 클러스터 배포 비교
  • GKE의 Managed Service for Apache Spark
  • 시작하기
  • 서버리스
    • 서버리스 Spark 일괄 워크로드 만들기
  • 클러스터
    • 클러스터 만들기
    • 클러스터에 Spark 작업 제출
    • Spark 튜토리얼
      • Gemini를 사용하여 Spark 애플리케이션 개발
      • Spark로 공개 데이터 세트 분석
      • Spark MLlib을 사용한 감정 분석
  • GKE
    • Kubernetes에서 Spark 작업 실행
  • 개발
  • 서버리스
    • 서버리스 구성
      • 커스텀 컨테이너 사용
      • GPU 사용
      • 동적 워크로드 스케줄러 사용
      • 네트워크 구성
      • Spark 런타임 버전
        • 개요
        • Spark 런타임 버전 3.0
        • Spark 런타임 버전 2.3
        • Spark 런타임 버전 2.2
        • Spark 런타임 버전 1.2
      • 서비스 계정
      • Spark 속성
      • 스테이징 버킷
    • 일괄 워크로드 및 세션 만들기
      • 서버리스 Spark 일괄 워크로드 만들기
      • 서버리스 대화형 세션 및 세션 템플릿 만들기
      • 서버리스 Spark Connect 클라이언트 사용
      • 서버리스 배치 및 노트북 세션에 JupyterLab 사용
      • 서버리스 템플릿 사용
        • 개요
        • Cloud Spanner에서 Cloud Storage로
        • Cloud Storage에서 BigQuery로
        • Cloud Storage to Cloud Spanner
        • Cloud Storage에서 Cloud Storage로
        • Cloud Storage에서 JDBC로
        • Hive to BigQuery
        • Hive to Cloud Storage
        • JDBC to BigQuery
        • JDBC to Cloud Spanner
        • JDBC to Cloud Storage
        • JDBC에서 JDBC로
        • Pub/Sub에서 Cloud Storage로
    • Lakehouse 런타임 카탈로그에서 메타데이터가 포함된 Apache Iceberg 테이블 만들기
    • 데이터 변환 및 Apache Iceberg에 쓰기
    • BigQuery 커넥터를 Spark와 함께 사용
      • 개요
      • BigQuery 테이블 쿼리
    • BigQuery Studio 노트북에서 PySpark 코드 실행
    • 최적화
      • 워크로드 리소스 자동 확장
      • Spark 워크로드 자동 조정
      • Lightning Engine 사용
        • Lightning Engine으로 배치 워크로드 및 세션 가속화
        • 네이티브 쿼리 실행 자격 도구 실행
      • 서버리스 Spark 솔루션 가속기
  • 클러스터
    • 데이터 처리
      • Spark 구성
        • Spark 종속 항목 관리
        • Spark 환경 맞춤설정
        • 동시 쓰기 사용 설정
        • Spark 성능 향상
        • Spark 조정
        • Lightning Engine 사용
      • Spark 작업 실행
        • 콘솔 사용
        • 명령줄 사용
        • REST API 탐색기 사용
          • 클러스터 만들기
          • Spark 작업 실행
          • 클러스터 업데이트
          • 클러스터 삭제
        • 클라이언트 라이브러리 사용
      • Hadoop 작업 실행
      • Spark Scala 작업 작성 및 실행
      • Trino 실행
      • Flink 실행
      • Hive 실행
      • Pig 실행
      • HBase 실행
      • Python 실행
        • Python 환경 구성
        • Python용 Cloud 클라이언트 라이브러리 사용
      • 데이터 커넥터 사용
        • Spark BigQuery 커넥터 사용
          • 개요
          • BigQuery 커넥터 코드 샘플
        • Cloud Storage 커넥터 사용
        • Spark Spanner 커넥터 사용
    • 데이터 레이크 및 레이크 하우스
      • 데이터 탐색 및 추출
      • 데이터 변환
      • BigQuery에 데이터 로드
      • Spark로 레이크하우스 만들기
      • 메타스토어 구성
      • BigLake metastore에서 메타데이터가 포함된 Apache Iceberg 테이블 만들기
      • Iceberg 사용
      • 델타 사용
      • Hudi 사용
    • 데이터 과학 노트북 및 UI
      • 노트북 사용
        • 개요
        • 클러스터에서 Jupyter 노트북 실행
        • 노트북에서 유전체학 분석 실행
        • JupyterLab 확장 프로그램을 사용하여 서버리스 Spark 워크로드 개발
      • 구성요소 게이트웨이 사용
    • 데이터 소스 및 스토리지
      • 데이터 소스에 연결
      • Cloud Storage에 연결
      • BigQuery에 연결
      • Hive를 BigQuery에 연결
      • Bigtable에 연결
      • Pub/Sub Lite에 연결
    • 관리 및 데이터 거버넌스
      • Fleet 관리
      • 계보
        • Spark 데이터 계보 사용 설정
        • Hive 데이터 계보 사용 설정
    • 클러스터 구성
      • 구성요소
        • 개요
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • Hive WebHCat
        • Hudi
        • Iceberg
        • Jupyter
        • Pig
        • Presto
        • Ranger
          • Ranger 설치
          • Ranger 사용
            • Kerberos와 Ranger 사용
            • Ranger를 사용하여 캐싱 사용 설정 및 권한 축소
            • Ranger 스키마 백업 및 복원
        • Solr
        • Trino
        • Zeppelin
        • Zookeeper
      • 이미지 클러스터링
        • 개요
        • 서비스
        • 클러스터 이미지 버전
          • 개요
          • 3.0.x 출시 이미지 버전
          • 2.3.x 출시 이미지 버전
          • 2.2.x 출시 이미지 버전
          • 2.1.x 출시 이미지 버전
      • 컴퓨팅 옵션
        • 머신 유형
        • GPU
        • 최소 CPU 플랫폼
        • 가변형 VM
        • 보조 작업자
        • 로컬 솔리드 스테이트 드라이브
        • 부팅 디스크
        • 연결된 하이퍼디스크
    • 클러스터 만들기
      • 개요
      • 네트워크 구성
        • 개요
        • 보안 태그 사용
        • Private Service Connect 구성
      • 클러스터 리전 선택
      • 자동 영역 배치 사용 설정
      • 클러스터 삭제 예약
      • 초기화 작업 사용
      • 클러스터 메타데이터 설정
      • 클러스터 속성 설정
      • 클러스터 웹 인터페이스 사용 설정
      • 고가용성 클러스터 만들기
      • 노드 그룹 클러스터 만들기
      • 부분 클러스터 만들기
      • 0 크기 클러스터 만들기
      • 단일 노드 클러스터 만들기
      • 단독 테넌트 클러스터 만들기
      • 커스텀 이미지 만들기
    • 클러스터 관리
      • 필터링 라벨 설정
      • 클러스터 확장
      • 클러스터 시작 및 중지
      • 클러스터 자동 확장
        • 개요
        • 클러스터 시작 및 중지
        • 클러스터 중지 예약
      • 클러스터 다시 만들기
      • 클러스터 순환
      • 클러스터 업데이트 및 삭제
      • SSH를 사용하여 클러스터에 연결
      • 권장사항 준수
        • 개요
        • 클러스터 및 작업 유연성과 효율성 극대화
      • 클러스터 데이터 관리
        • Hadoop 데이터 스토리지
        • 스토리지 유형 선택
        • 클러스터 데이터 캐시
        • 셔플 데이터 오프로드
        • 클러스터 로그 보기
    • 작업 관리 및 조정
      • 작업 수명
      • 작업 다시 시작
      • 워크플로 템플릿 사용
        • 개요
        • 매개변수화
        • YAML 파일 사용
        • 클러스터 선택기 사용
        • 인라인 워크플로 사용
      • 워크플로 조정
        • GitHub 템플릿
        • 워크플로 예약 솔루션
        • 워크플로 템플릿 사용
        • Cloud Composer 사용
        • Cloud Functions 사용
        • Cloud Scheduler 사용
  • GKE
    • 노드 풀 만들기
    • GKE 가상 클러스터 다시 만들기
    • GKE 커스텀 컨테이너 이미지 만들기
    • GKE 클러스터 확장
    • GKE virtualcluster 삭제
    • 출시 버전
  • 관리 및 거버넌스
  • 서버리스
    • 권한 및 역할
    • 페르소나 및 서버리스 IAM 역할
    • Apache Spark용 서버리스에서 CMEK 사용
    • 기본 보안 조치
    • Secret Manager 사용
    • 커스텀 제약조건 만들기
  • 클러스터
    • 보안 권장사항
    • 사용자 인증
      • Apache Spark용 관리형 서비스에 인증
      • 개인 클러스터 인증
      • 직원 ID 제휴
    • 역할 지정
      • 권한 및 역할
      • Apache Spark용 관리형 서비스 보안 주체
      • 세분화된 IAM
      • Kubernetes 역할 할당
    • 서비스 계정
    • 클러스터 보호
      • Kerberos를 사용하여 멀티테넌시 보호
      • 서비스 계정을 사용하여 멀티테넌시 보호
      • 메모리 암호화
      • 데이터 암호화 키 관리
      • Ranger 승인 서비스 사용 설정
      • Secret Manager 사용자 인증 정보 공급자 사용
      • Hive metastore 클러스터 만들기 및 보호
    • 커스텀 제약조건 만들기
    • Assured Workloads
    • FedRAMP 규정 준수
    • Kerberos 사용
    • VPC 서비스 제어
    • 직원 액세스 권한 설정
  • 모니터링 및 문제해결
  • 서버리스
    • AI 기반 Gemini Cloud Assist로 워크로드 조사
    • 서버리스 워크로드 및 세션 모니터링
      • 일괄 워크로드 모니터링
      • 대화형 세션 모니터링
      • Spark 측정항목
      • 데이터 계보 사용 설정
      • 리소스 사용량 프로파일링
      • Resource Manager 감사 로그
    • 서버리스 워크로드 및 세션 문제 해결
      • 배치 및 세션 생성 실패 문제 해결
      • 배치 및 세션 연결 문제 해결
  • 클러스터
    • AI 기반 Gemini Cloud Assist로 클러스터 및 작업 조사
    • 클러스터 및 작업 모니터링
      • 개요
      • Apache Spark용 관리형 서비스 측정항목
      • 측정항목 알림 만들기
      • 리소스 사용량 프로파일링
      • 로그 분석
        • Apache Spark용 관리형 서비스 로그
        • 작업 출력 로그
        • 감사 로그
    • 클러스터 문제 해결
      • 클러스터 진단 데이터 보기
      • 클러스터 생성 문제 해결
    • 작업 문제 해결
      • 작업 문제 해결
      • 메모리 오류 문제 해결
      • 작업 지연 문제 해결
      • 작업 기록 보기
      • 워크플로 템플릿 문제 해결