Ir para o conteúdo principal
Google Cloud Documentation
Documentação
  • Começar
  • Começar a usar o Google Cloud
  • Lista de produtos
  • Cloud Customer Care
  • Produtos em destaque
  • Agent Platform
  • Gerenciamento de APIs da Apigee
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • Google Kubernetes Engine
  • Looker
  • Ferramentas de vários produtos
  • Gerenciamento de recursos e acesso
  • Gerenciamento de custos e uso
  • Infraestrutura como código
  • SDK, linguagens, frameworks e ferramentas
  • Áreas de tecnologia
  • IA e ML
  • Desenvolvimento de aplicativos
  • Hospedagem de aplicativos
  • Computação
  • Pipelines e análises de dados
  • Bancos de dados
  • Distribuído, híbrido e multicloud
  • Soluções por setor
  • Migração
  • Rede
  • Observabilidade e monitoramento
  • Segurança
  • Storage
/
Console
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
  • Managed Service for Apache Spark
Comece sem custos financeiros
Visão geral Guias Referência Exemplos Recursos
Google Cloud Documentation
  • Documentação
    • Mais
    • Visão geral
    • Guias
    • Referência
    • Exemplos
    • Recursos
  • Console
  • Visão geral
  • Principais conceitos
  • Serviço Gerenciado para Apache Spark sem servidor
    • Visão geral
    • Níveis sem servidor do Serviço Gerenciado para Apache Spark
  • Serviço Gerenciado para Apache Spark em clusters
  • Comparar implantações sem servidor e de cluster
  • Serviço Gerenciado para Apache Spark no GKE
  • Começar
  • Sem servidor
    • Criar uma carga de trabalho em lote do Spark sem servidor
  • Clusters
    • Criar um cluster
    • Enviar um job do Spark para um cluster
    • Tutoriais do Spark
      • Usar o Gemini para desenvolver aplicativos Spark
      • Analisar conjuntos de dados públicos com o Spark
      • Análise de sentimento com o Spark MLlib
  • GKE
    • Executar um job do Spark no Kubernetes
  • Desenvolver
  • Sem servidor
    • Configurar sem servidor
      • Usar contêineres personalizados
      • Usar GPUs
      • Usar o Dynamic Workload Scheduler
      • Configuração de rede
      • Versões do ambiente de execução do Spark
        • Visão geral
        • Versão 3.0 do ambiente de execução do Spark
        • Versão 2.3 do ambiente de execução do Spark
        • Versão 2.2 do ambiente de execução do Spark
        • Versão 1.2 do ambiente de execução do Spark
      • Contas de serviço
      • Propriedades do Spark
      • Bucket de preparo
    • Criar cargas de trabalho e sessões em lote
      • Criar uma carga de trabalho em lote do Spark sem servidor
      • Criar sessões interativas e modelos de sessão sem servidor
      • Usar o cliente do Spark Connect sem servidor
      • Usar o JupyterLab para sessões de notebook interativas e em lote sem servidor
      • Usar modelos sem servidor
        • Visão geral
        • Cloud Spanner para Cloud Storage
        • Cloud Storage para BigQuery
        • Cloud Storage para Cloud Spanner
        • Cloud Storage para Cloud Storage
        • Cloud Storage para JDBC
        • Hive para BigQuery
        • Hive para Cloud Storage
        • JDBC para o BigQuery
        • JDBC para Cloud Spanner
        • JDBC para Cloud Storage
        • JDBC para JDBC
        • Pub/Sub para Cloud Storage
    • Criar uma tabela do Apache Iceberg com metadados no catálogo de tempo de execução do Lakehouse
    • Transformar dados e gravar no Apache Iceberg
    • Use o conector do BigQuery com o Spark
      • Visão geral
      • Consultar tabelas do BigQuery
    • Executar código PySpark em notebooks do BigQuery Studio
    • Otimizar
      • Escalonar automaticamente os recursos de carga de trabalho
      • Ajustar automaticamente as cargas de trabalho do Spark
      • Usar o Lightning Engine
        • Acelere cargas de trabalho e sessões em lote com o Lightning Engine
        • Executar a ferramenta de qualificação de execução de consultas nativas
      • Aceleradores de solução Spark sem servidor
  • Clusters
    • Tratamento de dados
      • Configurar o Spark
        • Gerenciar dependências do Spark
        • Personalizar o ambiente do Spark
        • Ativar gravações simultâneas
        • Melhorar a performance do Spark
        • Tune Spark
        • Usar o Lightning Engine
      • Executar jobs do Spark
        • Usar o console
        • Usar a linha de comando
        • Usar o REST APIs Explorer
          • Criar um cluster
          • executar um job do Spark
          • Atualizar um cluster
          • Excluir um cluster
        • Usar as bibliotecas de cliente
      • Executar jobs do Hadoop
      • Gravar e executar jobs do Spark Scala
      • Executar o Trino
      • Executar o Flink
      • Executar o Hive
      • Executar Pig
      • Executar o HBase
      • Executar Python
        • Configurar o ambiente Python
        • Usar as bibliotecas de cliente do Cloud para Python
      • Usar conectores de dados
        • Usar o conector do BigQuery para Spark
          • Visão geral
          • Exemplos de código do conector do BigQuery
        • Usar o conector do Cloud Storage
        • Usar o conector do Spark Spanner
    • Data lakes e lake houses
      • Analisar e extrair dados
      • Transformar dados
      • Carregar dados no BigQuery
      • Criar um lakehouse com o Spark
      • Configurar metastores
      • Criar uma tabela do Apache Iceberg com metadados no metastore do BigLake
      • Usar o Iceberg
      • Usar Delta
      • Usar o Hudi
    • Notebooks e interfaces de ciência de dados
      • Usar notebooks
        • Visão geral
        • Executar um notebook Jupyter em um cluster
        • Executar uma análise genômica em um notebook
        • Usar a extensão do JupyterLab para desenvolver cargas de trabalho do Spark sem servidor
      • Usar o Gateway de componentes
    • Origens e armazenamento de dados
      • Conectar-se às fontes de dados
      • Conectar-se ao Cloud Storage
      • Conectar-se ao BigQuery
      • Conectar o Hive ao BigQuery
      • Conectar ao Bigtable
      • Conectar ao Pub/Sub Lite
    • Administração e governança de dados
      • Gerenciamento de frotas
      • Linhagem
        • Ativar a linhagem de dados do Spark
        • Ativar a linhagem de dados do Hive
    • Configurar clusters
      • Componentes
        • Visão geral
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • Hive WebHCat
        • Hudi
        • Iceberg
        • Jupyter
        • Pig
        • Presto
        • Ranger
          • Instalar o Ranger
          • Usar o Ranger
            • Usar o Ranger com Kerberos
            • Usar o Ranger com armazenamento em cache e redução de escopo
            • Fazer backup e restaurar um esquema do Ranger
        • Solr
        • Trino
        • Zeppelin
        • Zookeeper
      • Agrupar imagens
        • Visão geral
        • Serviços
        • Versões de imagens do cluster
          • Visão geral
          • Versões de imagem de lançamento 3.0.x
          • Versões de imagem de lançamento 2.3.x
          • Versões de imagem de lançamento 2.2.x
          • Versões de imagem de lançamento 2.1.x
      • Opções de computação
        • Tipos de máquina
        • GPUs
        • Plataforma mínima de CPU
        • VMs flexíveis
        • Workers secundários
        • Unidades de estado sólido locais
        • Discos de inicialização
        • Hyperdisks anexados
    • Crie clusters
      • Visão geral
      • Configurar uma rede
        • Visão geral
        • Usar tags seguras
        • Configure o Private Service Connect
      • Selecionar uma região do cluster
      • Ativar a colocação em zona automática
      • Programar a exclusão do cluster
      • Usar ações de inicialização
      • Definir metadados do cluster
      • Definir propriedades do cluster
      • Ativar interfaces da Web do cluster
      • Criar um cluster de alta disponibilidade
      • Criar um cluster de grupo de nós
      • Criar um cluster parcial
      • Criar um cluster de escala zero
      • Criar um cluster de nó único
      • Criar cluster de locatário individual
      • Criar uma imagem personalizada
    • Gerenciar clusters
      • Definir rótulos para filtragem
      • Escalonamento de clusters
      • Iniciar e interromper clusters
      • Escalonar clusters automaticamente
        • Visão geral
        • Iniciar e parar um cluster
        • Programar a interrupção do cluster
      • Recriar um cluster
      • Rotação de clusters
      • Atualizar e excluir um cluster
      • Usar SSH para se conectar a um cluster
      • Siga as práticas recomendadas
        • Visão geral
        • Maximizar a flexibilidade e a eficiência de clusters e jobs
      • Gerenciar dados de cluster
        • Armazenamento de dados Hadoop
        • Selecione o tipo de armazenamento
        • Dados do cluster de cache
        • Descarregar dados de embaralhamento
        • Acessar registros do cluster
    • Gerenciar e orquestrar jobs
      • Vida útil de um job
      • Reiniciar jobs
      • Usar modelos de fluxo de trabalho
        • Visão geral
        • Parametrização
        • Usar arquivos YAML
        • Usar seletores de cluster
        • Usar fluxos de trabalho in-line
      • Orquestrar fluxos de trabalho
        • Modelos do GitHub
        • Soluções de programação de fluxo de trabalho
        • Usar modelos de fluxo de trabalho
        • Usar o Cloud Composer
        • Usar o Cloud Functions
        • Usar o Cloud Scheduler
  • GKE
    • Criar pools de nós
    • Recriar um cluster virtual do GKE
    • Criar uma imagem de contêiner personalizada do GKE
    • Escalonar clusters do GKE
    • Excluir um cluster virtual do GKE
    • Versões
  • Administrar e governar
  • Sem servidor
    • Permissões e papéis
    • Personas e papéis do IAM sem servidor
    • Usar a CMEK com o Serverless para Apache Spark
    • Medidas de segurança padrão
    • Usar o Secret Manager
    • Criar restrições personalizadas
  • Clusters
    • Práticas recomendadas de segurança
    • Autenticar usuários
      • Autenticar no Managed Service for Apache Spark
      • Autenticar clusters pessoais
      • Federação de identidade da força de trabalho
    • Atribuir papéis
      • Permissões e papéis
      • Principais do Managed Service for Apache Spark
      • IAM granular
      • Atribuir papéis para o Kubernetes
    • Contas de serviço
    • Clusters seguros
      • Multilocação segura usando Kerberos
      • Multilocação segura usando contas de serviço
      • Criptografar a memória
      • Gerenciar chaves de criptografia de dados
      • Ativar o serviço de autorização do Ranger
      • Usar o provedor de credenciais do Secret Manager