Ir para o conteúdo principal
Documentação
Começar
Começar a usar o Google Cloud
Lista de produtos
Cloud Customer Care
Produtos em destaque
Agent Platform
Gerenciamento de APIs da Apigee
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
Ferramentas de vários produtos
Gerenciamento de recursos e acesso
Gerenciamento de custos e uso
Infraestrutura como código
SDK, linguagens, frameworks e ferramentas
Áreas de tecnologia
IA e ML
Desenvolvimento de aplicativos
Hospedagem de aplicativos
Computação
Pipelines e análises de dados
Bancos de dados
Distribuído, híbrido e multicloud
Soluções por setor
Migração
Rede
Observabilidade e monitoramento
Segurança
Storage
/
Console
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Managed Service for Apache Spark
Comece sem custos financeiros
Visão geral
Guias
Referência
Exemplos
Recursos
Documentação
Mais
Visão geral
Guias
Referência
Exemplos
Recursos
Console
Visão geral
Principais conceitos
Serviço Gerenciado para Apache Spark sem servidor
Visão geral
Níveis sem servidor do Serviço Gerenciado para Apache Spark
Serviço Gerenciado para Apache Spark em clusters
Comparar implantações sem servidor e de cluster
Serviço Gerenciado para Apache Spark no GKE
Começar
Sem servidor
Criar uma carga de trabalho em lote do Spark sem servidor
Clusters
Criar um cluster
Enviar um job do Spark para um cluster
Tutoriais do Spark
Usar o Gemini para desenvolver aplicativos Spark
Analisar conjuntos de dados públicos com o Spark
Análise de sentimento com o Spark MLlib
GKE
Executar um job do Spark no Kubernetes
Desenvolver
Sem servidor
Configurar sem servidor
Usar contêineres personalizados
Usar GPUs
Usar o Dynamic Workload Scheduler
Configuração de rede
Versões do ambiente de execução do Spark
Visão geral
Versão 3.0 do ambiente de execução do Spark
Versão 2.3 do ambiente de execução do Spark
Versão 2.2 do ambiente de execução do Spark
Versão 1.2 do ambiente de execução do Spark
Contas de serviço
Propriedades do Spark
Bucket de preparo
Criar cargas de trabalho e sessões em lote
Criar uma carga de trabalho em lote do Spark sem servidor
Criar sessões interativas e modelos de sessão sem servidor
Usar o cliente do Spark Connect sem servidor
Usar o JupyterLab para sessões de notebook interativas e em lote sem servidor
Usar modelos sem servidor
Visão geral
Cloud Spanner para Cloud Storage
Cloud Storage para BigQuery
Cloud Storage para Cloud Spanner
Cloud Storage para Cloud Storage
Cloud Storage para JDBC
Hive para BigQuery
Hive para Cloud Storage
JDBC para o BigQuery
JDBC para Cloud Spanner
JDBC para Cloud Storage
JDBC para JDBC
Pub/Sub para Cloud Storage
Criar uma tabela do Apache Iceberg com metadados no catálogo de tempo de execução do Lakehouse
Transformar dados e gravar no Apache Iceberg
Use o conector do BigQuery com o Spark
Visão geral
Consultar tabelas do BigQuery
Executar código PySpark em notebooks do BigQuery Studio
Otimizar
Escalonar automaticamente os recursos de carga de trabalho
Ajustar automaticamente as cargas de trabalho do Spark
Usar o Lightning Engine
Acelere cargas de trabalho e sessões em lote com o Lightning Engine
Executar a ferramenta de qualificação de execução de consultas nativas
Aceleradores de solução Spark sem servidor
Clusters
Tratamento de dados
Configurar o Spark
Gerenciar dependências do Spark
Personalizar o ambiente do Spark
Ativar gravações simultâneas
Melhorar a performance do Spark
Tune Spark
Usar o Lightning Engine
Executar jobs do Spark
Usar o console
Usar a linha de comando
Usar o REST APIs Explorer
Criar um cluster
executar um job do Spark
Atualizar um cluster
Excluir um cluster
Usar as bibliotecas de cliente
Executar jobs do Hadoop
Gravar e executar jobs do Spark Scala
Executar o Trino
Executar o Flink
Executar o Hive
Executar Pig
Executar o HBase
Executar Python
Configurar o ambiente Python
Usar as bibliotecas de cliente do Cloud para Python
Usar conectores de dados
Usar o conector do BigQuery para Spark
Visão geral
Exemplos de código do conector do BigQuery
Usar o conector do Cloud Storage
Usar o conector do Spark Spanner
Data lakes e lake houses
Analisar e extrair dados
Transformar dados
Carregar dados no BigQuery
Criar um lakehouse com o Spark
Configurar metastores
Criar uma tabela do Apache Iceberg com metadados no metastore do BigLake
Usar o Iceberg
Usar Delta
Usar o Hudi
Notebooks e interfaces de ciência de dados
Usar notebooks
Visão geral
Executar um notebook Jupyter em um cluster
Executar uma análise genômica em um notebook
Usar a extensão do JupyterLab para desenvolver cargas de trabalho do Spark sem servidor
Usar o Gateway de componentes
Origens e armazenamento de dados
Conectar-se às fontes de dados
Conectar-se ao Cloud Storage
Conectar-se ao BigQuery
Conectar o Hive ao BigQuery
Conectar ao Bigtable
Conectar ao Pub/Sub Lite
Administração e governança de dados
Gerenciamento de frotas
Linhagem
Ativar a linhagem de dados do Spark
Ativar a linhagem de dados do Hive
Configurar clusters
Componentes
Visão geral
Delta Lake
Docker
Flink
HBase
Hive WebHCat
Hudi
Iceberg
Jupyter
Pig
Presto
Ranger
Instalar o Ranger
Usar o Ranger
Usar o Ranger com Kerberos
Usar o Ranger com armazenamento em cache e redução de escopo
Fazer backup e restaurar um esquema do Ranger
Solr
Trino
Zeppelin
Zookeeper
Agrupar imagens
Visão geral
Serviços
Versões de imagens do cluster
Visão geral
Versões de imagem de lançamento 3.0.x
Versões de imagem de lançamento 2.3.x
Versões de imagem de lançamento 2.2.x
Versões de imagem de lançamento 2.1.x
Opções de computação
Tipos de máquina
GPUs
Plataforma mínima de CPU
VMs flexíveis
Workers secundários
Unidades de estado sólido locais
Discos de inicialização
Hyperdisks anexados
Crie clusters
Visão geral
Configurar uma rede
Visão geral
Usar tags seguras
Configure o Private Service Connect
Selecionar uma região do cluster
Ativar a colocação em zona automática
Programar a exclusão do cluster
Usar ações de inicialização
Definir metadados do cluster
Definir propriedades do cluster
Ativar interfaces da Web do cluster
Criar um cluster de alta disponibilidade
Criar um cluster de grupo de nós
Criar um cluster parcial
Criar um cluster de escala zero
Criar um cluster de nó único
Criar cluster de locatário individual
Criar uma imagem personalizada
Gerenciar clusters
Definir rótulos para filtragem
Escalonamento de clusters
Iniciar e interromper clusters
Escalonar clusters automaticamente
Visão geral
Iniciar e parar um cluster
Programar a interrupção do cluster
Recriar um cluster
Rotação de clusters
Atualizar e excluir um cluster
Usar SSH para se conectar a um cluster
Siga as práticas recomendadas
Visão geral
Maximizar a flexibilidade e a eficiência de clusters e jobs
Gerenciar dados de cluster
Armazenamento de dados Hadoop
Selecione o tipo de armazenamento
Dados do cluster de cache
Descarregar dados de embaralhamento
Acessar registros do cluster
Gerenciar e orquestrar jobs
Vida útil de um job
Reiniciar jobs
Usar modelos de fluxo de trabalho
Visão geral
Parametrização
Usar arquivos YAML
Usar seletores de cluster
Usar fluxos de trabalho in-line
Orquestrar fluxos de trabalho
Modelos do GitHub
Soluções de programação de fluxo de trabalho
Usar modelos de fluxo de trabalho
Usar o Cloud Composer
Usar o Cloud Functions
Usar o Cloud Scheduler
GKE
Criar pools de nós
Recriar um cluster virtual do GKE
Criar uma imagem de contêiner personalizada do GKE
Escalonar clusters do GKE
Excluir um cluster virtual do GKE
Versões
Administrar e governar
Sem servidor
Permissões e papéis
Personas e papéis do IAM sem servidor
Usar a CMEK com o Serverless para Apache Spark
Medidas de segurança padrão
Usar o Secret Manager
Criar restrições personalizadas
Clusters
Práticas recomendadas de segurança
Autenticar usuários
Autenticar no Managed Service for Apache Spark
Autenticar clusters pessoais
Federação de identidade da força de trabalho
Atribuir papéis
Permissões e papéis
Principais do Managed Service for Apache Spark
IAM granular
Atribuir papéis para o Kubernetes
Contas de serviço
Clusters seguros
Multilocação segura usando Kerberos
Multilocação segura usando contas de serviço
Criptografar a memória
Gerenciar chaves de criptografia de dados
Ativar o serviço de autorização do Ranger
Usar o provedor de credenciais do Secret Manager