
Tech • IA • Robotique • Jeu
Amazon S3 s’est étendu au-delà des buckets d’objets standard avec S3 Tables pour les lacs de données Apache Iceberg serverless et S3 Vector Buckets pour le stockage d’embeddings, ce qui reflète la volonté d’AWS de faire migrer les charges analytiques et d’IA vers des formats managés natifs de S3.
Amazon S3, lancé en 2006, reste l’un des services fondamentaux d’AWS et demeure largement utilisé pour stocker des fichiers comme des PDF, des images et des jeux de données CSV. Il est aussi devenu une base courante pour les data lakes d’entreprise, même si des politiques de buckets publics mal configurées ont à plusieurs reprises exposé des données sensibles. Ces dernières années, AWS a élargi S3 au-delà du stockage généraliste avec des types de buckets plus spécialisés.
Les buckets S3 standard fonctionnaient bien comme stockage brut, mais les équipes de data engineering devaient souvent ajouter des outils supplémentaires pour organiser les données et les interroger via des tables de style Hive. Cette approche créait des défis opérationnels et de gouvernance, surtout à mesure que les exigences de conformité et de gestion des métadonnées devenaient plus strictes. L’essor d’Apache Iceberg a répondu à nombre de ces problèmes en proposant un format de table ouvert mieux adapté aux charges modernes de type lakehouse.
AWS a lancé S3 Tables en 2024 comme moyen managé et serverless de stocker les données au format Iceberg. Le service gère automatiquement les métadonnées, la maintenance et la compaction, réduisant le travail manuel généralement nécessaire pour exploiter de grandes tables analytiques sur un stockage objet. Contrairement à un bucket S3 classique, les utilisateurs ne gèrent ni ne parcourent directement les fichiers sous-jacents de la même manière.
S3 Tables est conçu pour s’intégrer à Amazon Athena, permettant aux équipes de créer et d’interroger des tables Iceberg sans avoir à maintenir elles-mêmes l’organisation du stockage. Une configuration typique peut inclure des namespaces distincts pour des projets ou domaines métier, comme les données de commandes. AWS propose aussi des voies de migration pour les organisations ayant déjà construit des data lakes sur des buckets S3 classiques et souhaitant les convertir vers des structures basées sur Iceberg.
La création d’un table bucket demande essentiellement un nom de bucket, le choix d’une classe de stockage comme Intelligent-Tiering, et des paramètres de chiffrement facultatifs. Ensuite, les tables peuvent être créées depuis Athena, les données étant écrites dans la structure Iceberg managée. Le message est simple: les équipes conservent l’échelle et la durabilité de S3 tout en déléguant les opérations sur les tables à AWS.
AWS a ajouté S3 Vector Buckets en 2025 pour stocker des embeddings vectoriels, un composant clé des agents IA, des systèmes de recherche et des applications RAG. Les embeddings sont des représentations numériques utilisées par les systèmes de machine learning pour trouver des informations liées, et ils sont généralement stockés dans des bases de données vectorielles spécialisées. Avec les vector buckets, AWS positionne S3 comme une alternative serverless à une partie de cette infrastructure.
À l’intérieur d’un vector bucket, les utilisateurs créent un ou plusieurs index vectoriels et définissent des paramètres comme la dimension des embeddings et la métrique de distance, y compris la similarité cosinus. Plusieurs index peuvent coexister dans un même bucket pour différents projets, expérimentations ou sous-ensembles de données. Cette structure vise des cas d’usage allant de la recherche de connaissances d’entreprise à la recherche IA spécifique à un produit.
Le message général est que S3 n’est plus seulement un endroit où déposer des fichiers. Pour les équipes qui stockent encore des jeux de données Iceberg ou des embeddings dans des buckets ordinaires en maintenant leurs propres couches au-dessus, S3 Tables et S3 Vector Buckets offrent des alternatives gérées par AWS. Le compromis est une moindre maîtrise directe des fichiers sous-jacents en échange d’une charge opérationnelle réduite.
Amazon S3 est de plus en plus présenté comme une plateforme managée pour l’analytique et l’IA, et non plus seulement comme un stockage objet de base. La principale question pour les organisations est de savoir si ces nouveaux services natifs de S3 peuvent remplacer les architectures manuelles construites sur des buckets traditionnels.
Poser une question