Ce qui se passe
Croiser les transactions récentes d'une base avec un historique archivé en Parquet sur S3 imposait jusqu'ici de recharger cet historique, puis de le tenir à jour. AWS ouvre dans Aurora PostgreSQL la lecture directe de tables Apache Iceberg et de fichiers Parquet, dans la même requête SQL que les tables de la base, par les connexions existantes.
Le travail analytique est confié à un moteur DuckDB embarqué. Selon heise, Duck Labs, la société derrière DuckDB, a récemment été rachetée par Amazon.
Comment ça marche
On crée des tables étrangères qui pointent vers le data lake. Pour du Parquet,
le schéma est lu dans les métadonnées des fichiers, et
IMPORT FOREIGN SCHEMA crée plusieurs tables d'un coup. Sont pris en charge
les tables Iceberg du catalogue AWS Glue, Iceberg et Parquet sur S3 et
S3 Tables, et les catalogues Iceberg REST par fédération avec Glue.
Aurora ne lit que les colonnes et les données utiles à la requête, et garde en cache ce qui revient souvent. Les lectures passent par l'instance d'écriture comme par les réplicas.
Prérequis et coûts
- Aurora PostgreSQL 17.11 ou 18.6 au minimum, Serverless v2 compris ;
- un rôle IAM associé au cluster avec la fonction
AuroraAnalytics, qui ouvre l'accès à S3 et à Glue ; - l'extension
aurora_analyticsactivée.
Disponible dans toutes les régions commerciales et GovCloud (US). Pas de
supplément pour la fonction, mais le calcul ajouté et les requêtes S3 sont
facturés. aurora_analytics_stat_statements() donne les octets lus sur S3 et
les succès du cache. Pour des temps de réponse très courts, mieux vaut toujours
copier les données dans une table ordinaire.
Source (en allemand) : Historische Daten in S3? AWS Aurora holt sie jetzt direkt, heise Developer, 1er octobre 2026. Annonce d'origine : blog AWS.