Ga naar inhoud
HexaTransfer
Terug naar blog
Cloud & opslag

Opslagruimte optimaliseren: maak ruimte vrij in de cloud

Optimaliseer je opslagruimte met deduplicatie, compressie en slimme archivering. Herwin verspilde ruimte en verlaag zo je maandelijkse opslagkosten.

Cloudopslagoptimalisatie herneemt doorgaans 30–60% van de rekening via vier acties: verwijder weesdata, dedupliceer identieke objecten, comprimeer tekstzware inhoud en verdeel koude data naar Glacier, Azure Archive of B2. Een AWS-bucket van 100 TB voor €2.300/maand daalt vaak naar €800/maand na optimalisatie zonder ook maar één nodig bestand te verliezen. Het werk is grotendeels saai — inventariseren, analyseren, levenscyclusregels toepassen — maar de besparingen stapelen maandelijks op. Begin met meten, niet met comprimeren.

Controleer voor je snijdt

Voer S3 Inventory, Azure Storage Analytics of GCS-bucketslotrapportages uit om een manifest te produceren van elk object: sleutel, grootte, datum van laatste wijziging, opslagklasse en tags. Laad het in Athena, BigQuery of DuckDB en query.

Typische bevindingen in een niet-geoptimaliseerde bucket:

  • 20–40% van de objecten zijn meer dan 90 dagen niet geopend (kandidaten voor koude laag)
  • 5–15% zijn exacte duplicaten via SHA-256-hash
  • 10–20% zijn wees — de applicatie die ze aanmaakte, is verdwenen
  • 30–50% zijn tekst/logs/JSON die 3:1 comprimeren met zstd

Je kunt niet repareren wat je niet hebt gemeten. Plan een dag voor de eerste controle en je weet waar je de volgende maand optimalisatie aan besteedt.

Verwijder eerst het voor de hand liggende afval

Verwijder vóór iets geavanceerds wat er niet zou moeten zijn. Veel voorkomende boosdoeners:

  • Onvolledige meerdelige uploads (S3 bewaard deze totdat ze expliciet worden afgebroken, soms jarenlang)
  • Lege objecten (nul bytes, maar gefactureerde metadata)
  • Logbestanden ouder dan het bewaarbeleid
  • Tijdelijke bestanden (.tmp, ~$*, *.bak, .DS_Store, Thumbs.db)
  • Testdata van gelanceerde-maar-vergeten experimenten

Voer aws s3api list-multipart-uploads uit en breek alles af dat ouder is dan 7 dagen — een levenscyclusregel met AbortIncompleteMultipartUpload automatiseert dit permanent. Voor S3, één regel:

Filter: prefix ""
AbortIncompleteMultipartUpload: DaysAfterInitiation: 7

Weesachtige meerdelige uploads op petabyte-buckets hebben bedrijven al duizenden euro's per maand gekost.

Deduplicatie: bestandsniveau versus blokniveau

Deduplicatie op bestandsniveau verwijdert identieke objecten — zelfde hash, zelfde bytes. Tools zoals rdfind, fdupes en jdupes scannen mappen en rapporteren duplicaten. Voor cloudbuckets verwerk je de inventaris-CSV, groepeer je op SHA-256 en bewaar je één canonieke kopie per hash. Vervang duplicaten door aanwijzers (een klein JSON-bestand dat verwijst naar de canonieke sleutel) of verwijder ze eenvoudigweg als ze niet worden gerefereerd.

Deduplicatie op blokniveau is wat opslagsystemen zoals ZFS, Btrfs en speciale backupproducten (Veeam, Commvault, Rubrik) doen. Ze verdelen bestanden in blokken van 4–128 KB, hashen elk blok en slaan elke unieke hash eenmaal op. Een VM-backupset kan op blokniveau 90% redundant zijn, wat een compressie van 10:1 oplevert. Dit is relevant voor backupbuckets maar zelden voor algemene bestandsopslag.

Compressiestrategie per bestandstype

Niet elk bestand comprimeert. Een JPEG, MP4 of ZIP is al gecomprimeerd; gzip ertegen uitvoeren verspilt CPU en levert niets op. Maar tekstzware formaten krimpen aanzienlijk:

  • JSON-logs: 80–90% reductie met gzip, 85–92% met zstd
  • CSV-exports: 75–85%
  • .docx (al een zip): 5–10% (sla over)
  • .xlsx: 10–15% (sla over)
  • .pdf: 0–5% (sla over — PDF's hebben interne compressie)
  • SQL-dumps: 85–90%

Gebruik zstd voor moderne pijplijnen — het decomprimeert 2–3x sneller dan gzip bij vergelijkbare verhoudingen. Voor logs die roteren naar S3, bespaart een logrotate-config met compress_program=zstd zowel bandbreedte als opslag. Comprimeer nooit een al-gecomprimeerd formaat; de winst van 0,5% is de CPU-tijd niet waard.

Tiering op toegangspatroon

Warme data hoort in snelle opslag; koude data hoort in goedkope opslag. S3 Intelligent-Tiering automatiseert dit: na 30 dagen zonder toegang verhuizen objecten naar Infrequent Access (€0,0125/GB); na 90 dagen Archive Instant; na 180 Deep Archive. De service rekent €0,0025 per 1.000 bewaakte objecten, dus kleine bestanden (onder 128 KB) zijn de overhead niet waard.

Voor deterministische controle schrijf je expliciete levenscyclusregels:

  • Dag 30: Standard → Standard-IA
  • Dag 90: Standard-IA → Glacier Instant Retrieval
  • Dag 365: Glacier IR → Glacier Deep Archive
  • Dag 2555: Verwijder (tenzij getagd legal-hold)

Regels gelden automatisch voor alle nieuwe uploads. Een bucket met 100 TB gelijkmatig verdeeld over leeftijden kan €1.500/maand besparen vergeleken met alles in Standard houden.

Overhead van kleine bestanden verwerken

Elke cloud rekent een minimale factureerbare objectgrootte. S3 Standard-IA rekent voor 128 KB minimum, ook als het object 4 KB is; Glacier Instant Retrieval doet hetzelfde; Glacier Flexible en Deep Archive hebben 40 KB per-object metadata gefactureerd tegen Standard-IA-tarieven.

Een bucket van 10 miljoen bestanden van 4 KB in Standard-IA betaalt voor 1,28 TB in plaats van 40 GB. Oplossing: pak kleine bestanden in maandelijkse TAR- of ZIP-archieven voor tiering. tar czf 2026-12-logs.tar.gz logs/2026-12/ geeft je één object in plaats van duizenden. Houd een parallelle index bij (CSV van bestandsnaam → offset) voor ophalen.

Afbeeldings- en video-optimalisatie

Media domineert vaak opslag. Converteer verouderde JPEG's naar WebP (30% kleiner) of AVIF (50% kleiner) met cwebp of avifenc. Voor video, hercodeer oude H.264 MP4's naar H.265 (HEVC) of AV1 — een 1 GB 1080p H.264-video wordt 400 MB in H.265 zonder zichtbaar kwaliteitsverlies.

Voor afbeeldingszware CMS-sites voer je een eenmalige batchconversie uit met imagemagick of ffmpeg, bewaar originelen in Deep Archive en serveer de geoptimaliseerde versies. Tools zoals Cloudflare Images en AWS CloudFront's Image Optimizer genereren varianten on-the-fly, zodat je één canonieke kopie opslaat en vergroot/versleuteld versies serveert zoals gevraagd.

Duplicaatdetectie over cloudsilos

Zakelijke omgevingen hebben vaak dezelfde bestanden verspreid over OneDrive, Google Drive, Dropbox en een bedrijfs-SharePoint. Echte optimalisatie betekent cross-silo duplicaten vinden. Tools zoals Varonis, Egnyte en rclone (met --track-renames en controlesom vergelijking) kunnen bestanden hashen over providers en duplicaten markeren.

Voor ad-hoc consolidatie — de verspreide kopieën van jaarverslag-2024.pdf samenvoegen op één canonieke locatie — bespaart een speciale overdrachtstool de omweg via een laptop. HexaTransfer verplaatst bestanden tot 10 GB met AES-256-GCM-versleuteling direct tussen mensen, zodat je duplicaten kunt consolideren zonder naar nog een silo te uploaden.

Meet het verschil

Meet na optimalisatie opnieuw. Storage Lens (AWS), Cost Management (Azure) of de kostendetails van GCP moeten de verlaging tonen. Als de rekening niet daalde, is er iets de verkeerde kant op gegaan — controleer op levenscyclusregels die objecten terug naar Standard hebben overgebracht (het gebeurt), of onbedoelde replicatie die opslag over regio's heeft verdrievoudigd.

Stel een maandelijkse herinnering in om opslaggroei te beoordelen. Een bucket die 10% per maand groeit zonder duidelijke zakelijke reden hoopt doorgaans afval op. Het vroeg opvangen — het kwartaalse 2-uurs ritueel — verslaat een paniekoptimalisatieproject na een maandelijkse factuurverrassing van €50.000.

Probeer het op hexatransfer.com — gratis, geen account vereist, maximaal 10 GB.

Verstuur grote bestanden veilig met end-to-end-versleuteling

Draag bestanden tot 10 GB gratis over met end-to-end-versleuteling. Geen account nodig. Uw bestanden worden in uw browser versleuteld voordat ze worden geüpload — niemand anders kan ze lezen.

Een bestand verzenden