기본 콘텐츠로 건너뛰기
문서
close
시작하기
Google Cloud 시작하기
제품 목록
Cloud Customer Care
추천 제품
Agent Platform
Apigee API 관리
BigQuery
Compute Engine은
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
크로스 프로덕트 도구
액세스 및 리소스 관리
비용 및 사용량 관리
코드형 인프라
SDK, 언어, 프레임워크, 도구
기술 분야
AI 및 ML
애플리케이션 개발
애플리케이션 호스팅
컴퓨팅
데이터 분석 및 파이프라인
데이터베이스
분산, 하이브리드, 멀티 클라우드
업종별 솔루션
이전
네트워킹
모니터링 가능성 및 모니터링
보안
Storage
/
콘솔
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
로그인
Managed Service for Apache Spark
무료로 시작하기
개요
가이드
참조
샘플
리소스
문서
더보기
개요
가이드
참조
샘플
리소스
콘솔
개요
주요 개념
Managed Service for Apache Spark 서버리스
개요
Managed Service for Apache Spark 서버리스 등급
클러스터의 Managed Service for Apache Spark
서버리스 및 클러스터 배포 비교
GKE의 Managed Service for Apache Spark
시작하기
서버리스
서버리스 Spark 일괄 워크로드 만들기
클러스터
클러스터 만들기
클러스터에 Spark 작업 제출
Spark 튜토리얼
Gemini를 사용하여 Spark 애플리케이션 개발
Spark로 공개 데이터 세트 분석
Spark MLlib을 사용한 감정 분석
GKE
Kubernetes에서 Spark 작업 실행
개발
서버리스
서버리스 구성
커스텀 컨테이너 사용
GPU 사용
동적 워크로드 스케줄러 사용
네트워크 구성
Spark 런타임 버전
개요
Spark 런타임 버전 3.0
Spark 런타임 버전 2.3
Spark 런타임 버전 2.2
Spark 런타임 버전 1.2
서비스 계정
Spark 속성
스테이징 버킷
일괄 워크로드 및 세션 만들기
서버리스 Spark 일괄 워크로드 만들기
서버리스 대화형 세션 및 세션 템플릿 만들기
서버리스 Spark Connect 클라이언트 사용
서버리스 배치 및 노트북 세션에 JupyterLab 사용
서버리스 템플릿 사용
개요
Cloud Spanner에서 Cloud Storage로
Cloud Storage에서 BigQuery로
Cloud Storage to Cloud Spanner
Cloud Storage에서 Cloud Storage로
Cloud Storage에서 JDBC로
Hive to BigQuery
Hive to Cloud Storage
JDBC to BigQuery
JDBC to Cloud Spanner
JDBC to Cloud Storage
JDBC에서 JDBC로
Pub/Sub에서 Cloud Storage로
Lakehouse 런타임 카탈로그에서 메타데이터가 포함된 Apache Iceberg 테이블 만들기
데이터 변환 및 Apache Iceberg에 쓰기
BigQuery 커넥터를 Spark와 함께 사용
개요
BigQuery 테이블 쿼리
BigQuery Studio 노트북에서 PySpark 코드 실행
최적화
워크로드 리소스 자동 확장
Spark 워크로드 자동 조정
Lightning Engine 사용
Lightning Engine으로 배치 워크로드 및 세션 가속화
네이티브 쿼리 실행 자격 도구 실행
서버리스 Spark 솔루션 가속기
클러스터
데이터 처리
Spark 구성
Spark 종속 항목 관리
Spark 환경 맞춤설정
동시 쓰기 사용 설정
Spark 성능 향상
Spark 조정
Lightning Engine 사용
Spark 작업 실행
콘솔 사용
명령줄 사용
REST API 탐색기 사용
클러스터 만들기
Spark 작업 실행
클러스터 업데이트
클러스터 삭제
클라이언트 라이브러리 사용
Hadoop 작업 실행
Spark Scala 작업 작성 및 실행
Trino 실행
Flink 실행
Hive 실행
Pig 실행
HBase 실행
Python 실행
Python 환경 구성
Python용 Cloud 클라이언트 라이브러리 사용
데이터 커넥터 사용
Spark BigQuery 커넥터 사용
개요
BigQuery 커넥터 코드 샘플
Cloud Storage 커넥터 사용
Spark Spanner 커넥터 사용
데이터 레이크 및 레이크 하우스
데이터 탐색 및 추출
데이터 변환
BigQuery에 데이터 로드
Spark로 레이크하우스 만들기
메타스토어 구성
BigLake metastore에서 메타데이터가 포함된 Apache Iceberg 테이블 만들기
Iceberg 사용
델타 사용
Hudi 사용
데이터 과학 노트북 및 UI
노트북 사용
개요
클러스터에서 Jupyter 노트북 실행
노트북에서 유전체학 분석 실행
JupyterLab 확장 프로그램을 사용하여 서버리스 Spark 워크로드 개발
구성요소 게이트웨이 사용
데이터 소스 및 스토리지
데이터 소스에 연결
Cloud Storage에 연결
BigQuery에 연결
Hive를 BigQuery에 연결
Bigtable에 연결
Pub/Sub Lite에 연결
관리 및 데이터 거버넌스
Fleet 관리
계보
Spark 데이터 계보 사용 설정
Hive 데이터 계보 사용 설정
클러스터 구성
구성요소
개요
Delta Lake
Docker
Flink
HBase
Hive WebHCat
Hudi
Iceberg
Jupyter
Pig
Presto
Ranger
Ranger 설치
Ranger 사용
Kerberos와 Ranger 사용
Ranger를 사용하여 캐싱 사용 설정 및 권한 축소
Ranger 스키마 백업 및 복원
Solr
Trino
Zeppelin
Zookeeper
이미지 클러스터링
개요
서비스
클러스터 이미지 버전
개요
3.0.x 출시 이미지 버전
2.3.x 출시 이미지 버전
2.2.x 출시 이미지 버전
2.1.x 출시 이미지 버전
컴퓨팅 옵션
머신 유형
GPU
최소 CPU 플랫폼
가변형 VM
보조 작업자
로컬 솔리드 스테이트 드라이브
부팅 디스크
연결된 하이퍼디스크
클러스터 만들기
개요
네트워크 구성
개요
보안 태그 사용
Private Service Connect 구성
클러스터 리전 선택
자동 영역 배치 사용 설정
클러스터 삭제 예약
초기화 작업 사용
클러스터 메타데이터 설정
클러스터 속성 설정
클러스터 웹 인터페이스 사용 설정
고가용성 클러스터 만들기
노드 그룹 클러스터 만들기
부분 클러스터 만들기
0 크기 클러스터 만들기
단일 노드 클러스터 만들기
단독 테넌트 클러스터 만들기
커스텀 이미지 만들기
클러스터 관리
필터링 라벨 설정
클러스터 확장
클러스터 시작 및 중지
클러스터 자동 확장
개요
클러스터 시작 및 중지
클러스터 중지 예약
클러스터 다시 만들기
클러스터 순환
클러스터 업데이트 및 삭제
SSH를 사용하여 클러스터에 연결
권장사항 준수
개요
클러스터 및 작업 유연성과 효율성 극대화
클러스터 데이터 관리
Hadoop 데이터 스토리지
스토리지 유형 선택
클러스터 데이터 캐시
셔플 데이터 오프로드
클러스터 로그 보기
작업 관리 및 조정
작업 수명
작업 다시 시작
워크플로 템플릿 사용
개요
매개변수화
YAML 파일 사용
클러스터 선택기 사용
인라인 워크플로 사용
워크플로 조정
GitHub 템플릿
워크플로 예약 솔루션
워크플로 템플릿 사용
Cloud Composer 사용
Cloud Functions 사용
Cloud Scheduler 사용
GKE
노드 풀 만들기
GKE 가상 클러스터 다시 만들기
GKE 커스텀 컨테이너 이미지 만들기
GKE 클러스터 확장
GKE virtualcluster 삭제
출시 버전
관리 및 거버넌스
서버리스
권한 및 역할
페르소나 및 서버리스 IAM 역할
Apache Spark용 서버리스에서 CMEK 사용
기본 보안 조치
Secret Manager 사용
커스텀 제약조건 만들기
클러스터
보안 권장사항
사용자 인증
Apache Spark용 관리형 서비스에 인증
개인 클러스터 인증
직원 ID 제휴
역할 지정
권한 및 역할
Apache Spark용 관리형 서비스 보안 주체
세분화된 IAM
Kubernetes 역할 할당
서비스 계정
클러스터 보호
Kerberos를 사용하여 멀티테넌시 보호
서비스 계정을 사용하여 멀티테넌시 보호
메모리 암호화
데이터 암호화 키 관리
Ranger 승인 서비스 사용 설정
Secret Manager 사용자 인증 정보 공급자 사용
Hive metastore 클러스터 만들기 및 보호
커스텀 제약조건 만들기
Assured Workloads
FedRAMP 규정 준수
Kerberos 사용
VPC 서비스 제어
직원 액세스 권한 설정
모니터링 및 문제해결
서버리스
AI 기반 Gemini Cloud Assist로 워크로드 조사
서버리스 워크로드 및 세션 모니터링
일괄 워크로드 모니터링
대화형 세션 모니터링
Spark 측정항목
데이터 계보 사용 설정
리소스 사용량 프로파일링
Resource Manager 감사 로그
서버리스 워크로드 및 세션 문제 해결
배치 및 세션 생성 실패 문제 해결
배치 및 세션 연결 문제 해결
클러스터
AI 기반 Gemini Cloud Assist로 클러스터 및 작업 조사
클러스터 및 작업 모니터링
개요
Apache Spark용 관리형 서비스 측정항목
측정항목 알림 만들기
리소스 사용량 프로파일링
로그 분석
Apache Spark용 관리형 서비스 로그
작업 출력 로그
감사 로그
클러스터 문제 해결
클러스터 진단 데이터 보기
클러스터 생성 문제 해결
작업 문제 해결
작업 문제 해결
메모리 오류 문제 해결
작업 지연 문제 해결
작업 기록 보기
워크플로 템플릿 문제 해결