Passer au contenu principal
Documentation
Débuter
Premiers pas avec Google Cloud
Liste des produits
Cloud Customer Care
Sélection de produits
Agent Platform
Apigee API Management
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
Outils multiproduits
Gestion des accès et des ressources
Gestion des coûts et de l'utilisation
Infrastructure as Code
SDK, langages, frameworks et outils
Domaines technologiques
IA et ML
Développement d'applications
Hébergement d'applications
Calcul
Analyses de données et pipelines
Bases de données
Solutions distribuées, hybrides et multicloud
Solutions par secteur d'activité
Migration
Mise en réseau
Observabilité et surveillance
Sécurité
Storage
/
Console
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Managed Service for Apache Spark
Commencer l'essai gratuit
Aperçu
Guides
Référence
Exemples
Ressources
Documentation
Plus
Aperçu
Guides
Référence
Exemples
Ressources
Console
Aperçu
Concepts clés
Managed Service pour Apache Spark sans serveur
Aperçu
Niveaux sans serveur Managed Service pour Apache Spark
Managed Service pour Apache Spark sur les clusters
Comparer les déploiements sans serveur et de cluster
Managed Service pour Apache Spark sur GKE
Premiers pas
Sans serveur
Créer une charge de travail par lot Spark sans serveur
Clusters
Créer un cluster
Envoyer une tâche Spark à un cluster
Tutoriels Spark
Utiliser Gemini pour développer des applications Spark
Analyser des ensembles de données publics avec Spark
Analyse des sentiments avec Spark MLlib
GKE
Exécuter un job Spark sur Kubernetes
Développer
Sans serveur
Configurer sans serveur
Utiliser des conteneurs personnalisés
Utiliser les GPU
Utiliser le planificateur de charges de travail dynamique
Configuration du réseau
Versions d'exécution Spark
Aperçu
Version 3.0 du runtime Spark
Version d'exécution Spark 2.3
Version 2.2 du runtime Spark
Version 1.2 du runtime Spark
Service Accounts
Propriétés Spark
Bucket de préproduction
Créer des charges de travail et des sessions par lot
Créer une charge de travail par lot Spark sans serveur
Créer des sessions interactives et des modèles de session sans serveur
Utiliser le client Spark Connect sans serveur
Utiliser JupyterLab pour les sessions de notebook et par lot sans serveur
Utiliser des modèles sans serveur
Aperçu
Cloud Spanner vers Cloud Storage
Cloud Storage vers BigQuery
Cloud Storage vers Cloud Spanner
Cloud Storage vers Cloud Storage
Cloud Storage vers JDBC
Hive vers BigQuery
Hive vers Cloud Storage
JDBC vers BigQuery
JDBC vers Cloud Spanner
JDBC vers Cloud Storage
JDBC vers JDBC
Pub/Sub vers Cloud Storage
Créer une table Apache Iceberg avec des métadonnées dans le catalogue du runtime Lakehouse
Transformer des données et écrire dans Apache Iceberg
Utiliser le connecteur BigQuery avec Spark
Aperçu
Interroger des tables BigQuery
Exécuter du code PySpark dans les notebooks BigQuery Studio
Optimiser
Autoscaler les ressources de charge de travail
Régler automatiquement les charges de travail Spark
Utiliser Lightning Engine
Accélérer les charges de travail et les sessions par lot avec Lightning Engine
Exécuter l'outil de qualification pour l'exécution de requêtes natives
Accélérateurs de solution Spark sans serveur
Clusters
Traitement des données
Configurer Spark
Gérer les dépendances Spark
Personnaliser l'environnement Spark
Activer les écritures simultanées
Améliorer les performances de Spark
Tune Spark
Utiliser Lightning Engine
Exécuter des jobs Spark
Utiliser la console
Utiliser la ligne de commande
Utiliser l'explorateur d'API REST
Créer un cluster
Exécuter un job Spark
Mettre à jour un cluster
Supprimer un cluster
Utiliser des bibliothèques clientes
Exécuter des tâches Hadoop
Écrire et exécuter des tâches Spark Scala
Exécuter Trino
Exécuter Flink
Exécuter Hive
Exécuter Pig
Exécuter HBase
Exécuter Python
Configurer l'environnement Python
Utiliser les bibliothèques clientes Cloud pour Python
Utiliser des connecteurs de données
Utiliser le connecteur Spark BigQuery
Aperçu
Exemples de code de connecteur BigQuery
Utiliser le connecteur Cloud Storage
Utiliser le connecteur Spark Spanner
Lacs de données et lakehouses
Explorer et extraire des données
Transformer les données
Charger des données dans BigQuery
Créer une lakehouse avec Spark
Configurer les metastores
Créer une table Apache Iceberg avec des métadonnées dans BigLake Metastore
Utiliser Iceberg
Utiliser Delta
Utiliser Hudi
Notebooks et UI de data science
Utiliser des notebooks
Aperçu
Exécuter un notebook Jupyter sur un cluster
Exécuter une analyse génomique dans un notebook
Utiliser l'extension JupyterLab pour développer des charges de travail Spark sans serveur
Utiliser la passerelle des composants
Sources de données et stockage
Se connecter à des sources de données
Se connecter à Cloud Storage
Se connecter à BigQuery
Connecter Hive à BigQuery
Se connecter à Bigtable
Se connecter à Pub/Sub Lite
Administration et gouvernance des données
Gestion de parc
Traçabilité
Activer la traçabilité des données Spark
Activer la traçabilité des données Hive
Configurer les clusters
Composants
Aperçu
Delta Lake
Docker
Flink
HBase
Hive WebHCat
Hudi
Iceberg
Jupyter
Pig
Presto
Ranger
Installer Ranger
Utiliser Ranger
Utiliser Ranger avec Kerberos
Utiliser Ranger avec la mise en cache et la réduction du champ d'application
Sauvegarder et restaurer un schéma Ranger
Solr
Trino
Zeppelin
ZooKeeper
Regrouper des images
Aperçu
Services
Versions des images de cluster
Aperçu
Versions d'image 3.0.x
Versions des images de la version 2.3.x
Versions d'image 2.2.x
Versions 2.1.x des images de version
Options de calcul
Types de machines
GPU
Configuration minimale de la plate-forme du CPU
VM flexibles
Nœuds de calcul secondaires
Disques durs SSD locaux
Disques de démarrage
Hyperdisques associés
Créer des clusters
Aperçu
Configurer un réseau
Aperçu
Utiliser des tags sécurisés
Configurer Private Service Connect
Sélectionner une région de cluster
Activer la sélection automatique de zone
Planifier la suppression d'un cluster
Utiliser les actions d'initialisation
Définir les métadonnées du cluster
Définir les propriétés du cluster
Activer les interfaces Web de cluster
Créer un cluster à haute disponibilité
Créer un cluster de groupes de nœuds
Créer un cluster partiel
Créer un cluster à échelle nulle
Créer un cluster à nœud unique
Créer un cluster à locataire unique
Créer une image personnalisée
Gestion des clusters
Définir des libellés pour le filtrage
Scaling des clusters
Démarrer et arrêter des clusters
Effectuer l'autoscaling des clusters
Aperçu
Démarrer et arrêter un cluster
Planifier l'arrêt d'un cluster
Recréer un cluster
Faire pivoter des clusters
Mettre à jour et supprimer un cluster
Se connecter à un cluster à l'aide de SSH
Appliquer les bonnes pratiques
Aperçu
Maximiser la flexibilité et l'efficacité des clusters et des jobs
Gérer les données de cluster
Stockage de données Hadoop
Sélectionnez le type de stockage
Mettre en cache les données de cluster
Décharger les données de lecture aléatoire