Chargement groupé de données dans Cloud Firestore à l'aide d'outils tels que mongoimport et
mongorestore.
Cloud Firestore est un système hautement distribué qui offre un scaling automatique pour répondre aux besoins de votre entreprise. Cloud Firestore divise et combine dynamiquement vos données en fonction de la charge reçue par le système.
La division basée sur la charge se produit automatiquement, sans préconfiguration requise. Le système de division basé sur la charge Cloud Firestore présente des caractéristiques importantes et uniques par rapport aux autres bases de données de documents. Il est important de les garder à l'esprit lorsque vous modélisez vos données.
La nature distribuée de Cloud Firestore peut nécessiter de modifier certains choix de conception en particulier pour les charges de travail optimisées pour les bases de données où le réplica principal est le goulot d'étranglement pour le débit d'écriture.
Bonnes pratiques
Les charges de travail qui traitent de grandes quantités de données dans un client à thread unique peuvent créer un goulot d'étranglement. Les clients peuvent utiliser un thread unique pour charger des données en bloc, car le débit du client et du serveur sont similaires. Une Cloud Firestore base de données peut gérer beaucoup plus de parallélisme, mais cela vous oblige à configurer les clients pour qu'ils envoient des requêtes en parallèle.
mongoimport
Lorsque vous utilisez l'outil mongoimport, les requêtes sont effectuées de manière séquentielle par défaut. Pour
améliorer le temps de chargement dans Cloud Firestore, définissez le nombre de nœuds de calcul à l'aide
de l'option --numInsertionWorkers Le paramètre approprié peut nécessiter un réglage en fonction de la taille de votre client.
mongorestore
Lorsque vous utilisez l'outil mongorestore, supprimez le paramètre retryWrites=false de votre chaîne de connexion afin d'améliorer la résilience aux échecs temporaires.
Pour améliorer le temps de chargement dans Cloud Firestore, vous pouvez également augmenter le
nombre de nœuds de calcul d'insertion par collection à l'aide de l'option
--numInsertionWorkersPerCollection et le nombre de collections parallèles
à l'aide de l'option --numParallelCollections. Les paramètres appropriés peuvent nécessiter un réglage en fonction de la taille de votre client.
Programmation asynchrone
Lorsque vous développez votre propre logiciel à l'aide d'opérations compatibles avec MongoDB, vous pouvez améliorer le parallélisme de différentes manières :
- Frameworks asynchrones : les frameworks asynchrones vous permettent de traiter les requêtes et d'y répondre en parallèle. Il n'est pas nécessaire de développer de mise en pool ou de mise en file d'attente complexes lorsque vous effectuez des appels à votre base de données. Chaque flux de requêtes peut utiliser des connexions indépendantes et effectuer ses appels de base de données en parallèle.
- Utiliser des offres de calcul parallélisées : en utilisant des services tels que Cloud Run, votre système peut mettre à l'échelle le nombre de nœuds de calcul requis pour traiter les données.
Échecs temporaires
Lorsque vous utilisez un système distribué de grande taille tel que Cloud Firestore, vous pouvez rencontrer des échecs temporaires, tels que des problèmes de réseau ou des conflits sur un document.
Lorsque vous chargez en bloc de grandes quantités d'informations, il est important de maintenir une stratégie de nouvelle tentative pour les écritures ayant échoué sans que l'opération de chargement groupé plus importante échoue.