Aller au contenu
HexaTransfer
Retour au blog
Cloud et stockage

Optimisation de l'espace de stockage : libérez votre cloud

Optimisez votre espace de stockage grâce à la déduplication, la compression et l'archivage intelligent : récupérez de l'espace et réduisez les coûts.

L'optimisation du stockage cloud récupère généralement 30 à 60 % d'une facture grâce à quatre actions : supprimer les données orphelines, dédupliquer les objets identiques, compresser les contenus à forte densité textuelle, et hiérarchiser les données froides vers Glacier, Azure Archive ou B2. Un bucket AWS de 100 To à 2 300 €/mois tombe souvent à 800 €/mois après optimisation sans perdre un seul fichier utile. Le travail est en grande partie fastidieux — inventaire, analyse, application des règles lifecycle — mais les économies s'accumulent chaque mois. Commencez par mesurer, pas par compresser.

Auditer avant de tailler

Exécutez S3 Inventory, Azure Storage Analytics ou les rapports de verrouillage de bucket GCS pour produire un manifeste de chaque objet : clé, taille, date de dernière modification, classe de stockage et tags. Chargez-le dans Athena, BigQuery ou DuckDB et interrogez.

Résultats typiques dans un bucket non optimisé :

  • 20 à 40 % des objets n'ont pas été consultés depuis plus de 90 jours (candidats au niveau froid)
  • 5 à 15 % sont des doublons exacts par hash SHA-256
  • 10 à 20 % sont orphelins — l'application qui les a créés a disparu
  • 30 à 50 % sont du texte/logs/JSON qui se compressent 3:1 avec zstd

On ne peut pas résoudre ce qu'on n'a pas mesuré. Comptez une journée pour l'audit initial et vous saurez où investir le mois d'optimisation suivant.

Supprimer le gaspillage évident en premier

Avant toute sophistication, supprimez ce qui ne devrait pas exister. Les coupables habituels :

  • Envois multipart incomplets (S3 les conserve jusqu'à l'abandon explicite, parfois pendant des années)
  • Objets vides (zéro octet, mais des métadonnées facturées)
  • Fichiers de log plus anciens que la politique de rétention
  • Fichiers temporaires (.tmp, ~$*, *.bak, .DS_Store, Thumbs.db)
  • Données de test d'expériences lancées puis oubliées

Exécutez aws s3api list-multipart-uploads et annulez tout ce qui a plus de 7 jours — une règle lifecycle avec AbortIncompleteMultipartUpload automatise cela définitivement. Pour S3, une seule règle :

Filter: prefix ""
AbortIncompleteMultipartUpload: DaysAfterInitiation: 7

Des envois multipart orphelins sur des buckets de pétaoctets ont coûté à certaines entreprises des milliers d'euros par mois.

Déduplication : niveau fichier vs niveau bloc

La dédup au niveau fichier supprime les objets identiques — même hash, mêmes octets. Des outils comme rdfind, fdupes et jdupes analysent les répertoires et signalent les doublons. Pour les buckets cloud, traitez le CSV d'inventaire, regroupez par SHA-256, conservez une copie canonique par hash. Remplacez les doublons par des pointeurs (un petit fichier JSON référençant la clé canonique) ou supprimez-les simplement s'ils ne sont pas référencés.

La dédup au niveau bloc est ce que font les systèmes de stockage comme ZFS, Btrfs et les produits de sauvegarde dédiés (Veeam, Commvault, Rubrik). Ils découpent les fichiers en blocs de 4 à 128 Ko, hachent chaque bloc et ne stockent chaque hash unique qu'une fois. Un jeu de sauvegardes de VM peut être redondant à 90 % au niveau bloc, donnant un ratio de compression de 10:1. Cela importe pour les buckets de sauvegarde mais rarement pour le stockage de fichiers général.

Stratégie de compression par type de fichier

Tous les fichiers ne se compressent pas. Un JPEG, un MP4 ou un Zip sont déjà compressés ; exécuter gzip dessus gaspille du CPU sans rien gagner. Mais les formats à forte densité textuelle rétrécissent considérablement :

  • Logs JSON : réduction de 80 à 90 % avec gzip, 85 à 92 % avec zstd
  • Exports CSV : 75 à 85 %
  • .docx (déjà un zip) : 5 à 10 % (à ignorer)
  • .xlsx : 10 à 15 % (à ignorer)
  • .pdf : 0 à 5 % (à ignorer — les PDFs ont une compression interne)
  • Dumps SQL : 85 à 90 %

Utilisez zstd pour les pipelines modernes — il décompresse 2 à 3 fois plus vite que gzip avec des ratios similaires. Pour les logs qui rotatent vers S3, une configuration logrotate avec compress_program=zstd économise à la fois la bande passante et le stockage. Ne compressez jamais un format déjà compressé ; le gain de 0,5 % ne vaut pas le temps CPU.

Hiérarchisation par schéma d'accès

Les données chaudes doivent être sur du stockage rapide ; les données froides sur du stockage économique. S3 Intelligent-Tiering automatise cela : après 30 jours sans accès, les objets passent en Infrequent Access (0,0125 $/Go) ; après 90 jours, Archive Instant ; après 180, Deep Archive. Le service facture 0,0025 $ pour 1 000 objets surveillés, donc les petits fichiers (sous 128 Ko) ne valent pas la surcharge.

Pour un contrôle déterministe, écrivez des règles lifecycle explicites :

  • Jour 30 : Standard → Standard-IA
  • Jour 90 : Standard-IA → Glacier Instant Retrieval
  • Jour 365 : Glacier IR → Glacier Deep Archive
  • Jour 2555 : suppression (sauf si tagué legal-hold)

Les règles s'appliquent automatiquement à tous les nouveaux envois. Un bucket avec 100 To répartis uniformément par âge peut économiser 1 500 $/mois par rapport à tout garder en Standard.

Gérer la surcharge des petits fichiers

Chaque cloud facture une taille minimale facturable par objet. S3 Standard-IA facture 128 Ko minimum même si l'objet fait 4 Ko ; Glacier Instant Retrieval fait de même ; Glacier Flexible et Deep Archive ont 40 Ko de métadonnées par objet facturées aux tarifs Standard-IA.

Un bucket de 10 millions de fichiers de 4 Ko en Standard-IA paye pour 1,28 To au lieu de 40 Go. Solution : regrouper les petits fichiers dans des archives TAR ou ZIP mensuelles avant de les hiérarchiser. tar czf 2026-12-logs.tar.gz logs/2026-12/ donne un seul objet au lieu de milliers. Conservez un index parallèle (CSV de nom de fichier → offset) pour la récupération.

Optimisation des images et vidéos

Les médias dominent souvent le stockage. Convertissez les anciens JPEG en WebP (30 % plus petits) ou AVIF (50 % plus petits) avec cwebp ou avifenc. Pour la vidéo, réencodez les anciens H.264 MP4 en H.265 (HEVC) ou AV1 — une vidéo 1080p H.264 de 1 Go devient 400 Mo en H.265 sans perte de qualité visible.

Pour les sites CMS riches en images, lancez une conversion par lots avec imagemagick ou ffmpeg, conservez les originaux dans Deep Archive, et servez les versions optimisées. Des outils comme Cloudflare Images et AWS CloudFront Image Optimizer génèrent des variantes à la volée, de sorte que vous stockez une copie canonique et servez des versions redimensionnées et réencodées à la demande.

Détection de doublons entre silos cloud

Les environnements d'entreprise ont souvent les mêmes fichiers éparpillés entre OneDrive, Google Drive, Dropbox et un SharePoint d'entreprise. Une vraie optimisation signifie trouver les doublons entre silos. Des outils comme Varonis, Egnyte et rclone (avec --track-renames et comparaison par somme de contrôle) peuvent hacher des fichiers entre fournisseurs et signaler les doublons.

Pour la consolidation ponctuelle — rassembler les copies éparses de rapport-annuel-2024.pdf vers un emplacement canonique — un outil de transfert dédié évite le transit par un ordinateur portable. HexaTransfer déplace des fichiers jusqu'à 10 Go avec chiffrement AES-256-GCM directement entre personnes, pour consolider les doublons sans passer par un silo supplémentaire en chemin.

Mesurer le delta

Après optimisation, mesurez à nouveau. Storage Lens (AWS), Cost Management (Azure) ou la décomposition des coûts GCP doivent montrer la réduction. Si la facture n'a pas baissé, quelque chose a évolué dans le mauvais sens — vérifiez si des règles lifecycle ont rebasculé des objets vers Standard (ça arrive), ou si une réplication non intentionnelle a triplé le stockage entre régions.

Posez un rappel mensuel pour examiner la croissance du stockage. Un bucket qui croît de 10 % par mois sans raison commerciale évidente accumule généralement des déchets. L'identifier tôt — le rituel trimestriel de 2 heures — vaut mieux qu'un projet d'optimisation paniqué après une facture surprise de 50 000 €.

Essayez sur hexatransfer.com — gratuit, sans compte, jusqu'à 10 Go.

Envoyez vos fichiers volumineux en toute sécurité avec le chiffrement de bout en bout

Transférez des fichiers jusqu'à 10 Go gratuitement avec le chiffrement de bout en bout. Aucun compte requis. Vos fichiers sont chiffrés dans votre navigateur avant l'envoi — personne d'autre ne peut les lire.

Envoyer un fichier