Le 21 août 2026, AWS a annoncé la disponibilité générale d’AWS Glue 6.0, une version du service géré d’intégration et de traitement des données qui propose un prix inférieur de 30 % à celui des versions précédentes d’AWS Glue. Cette version repose sur un environnement d’exécution entièrement mis à jour comprenant Apache Spark 4.1, Python 3.12 et Scala 2.13, avec des améliorations visant les performances des tâches d’extraction, de transformation et de chargement des données, ainsi que les cas d’utilisation en temps réel.
Prise en charge élargie des données Apache Iceberg
AWS Glue 6.0 offre une prise en charge complète de la spécification Apache Iceberg v3, fondée dans cette version sur Iceberg 1.11.0. Parmi les principales nouveautés figure le type de données VARIANT avec prise en charge du shredding, permettant de stocker et d’interroger des données JSON, des enregistrements et des données d’événements sans devoir aplatir préalablement les schémas.
En pratique, cette approche aide les équipes chargées des données à réduire la duplication des données et l’écriture de code d’analyse personnalisé, tout en limitant les risques d’interruption des pipelines lors de modifications du schéma. Cela revêt une importance accrue dans les environnements qui traitent des données semi-structurées dont la structure évolue au fil du temps.
- Types Geometry et Geography pour traiter localement les données spatiales dans les analyses des systèmes d’information géographique et de l’intelligence géographique.
- Horodatages d’une précision à la nanoseconde, afin de répondre aux exigences des données issues de capteurs de l’Internet des objets, de l’informatique scientifique et de certaines charges de travail financières à haute fréquence.
- Traitement du type inconnu, permettant de gérer des schémas inattendus ou changeants sans faire échouer le pipeline de données.
Mises à jour du moteur Spark 4.1
Cette version inclut de nouvelles capacités fondées sur Spark 4.1 afin de simplifier le développement des tâches ETL et d’en améliorer l’exécution. Spark Declarative Pipelines permet aux ingénieurs des données de décrire la forme souhaitée des transformations plutôt que de gérer manuellement l’ordre d’exécution et l’optimisation ; le moteur détermine l’ordre d’exécution et les optimisations appropriées.
AWS Glue 6.0 ajoute également une exécution native via Apache Arrow pour les fonctions Python définies par l’utilisateur, notamment les UDF et les UDTF. Cela supprime le coût de la sérialisation entre Python et la JVM, ce qui peut améliorer les performances de PySpark dans les transformations complexes.
Pour les cas de streaming sans état, cette version propose un mode de streaming en temps réel avec une latence à un chiffre en millisecondes. Ce mode repose sur le Real-Time Mode de Spark 4.1, avec une exécution optimisée par Glue, et vise le traitement, la transformation et le routage des événements lorsque la réactivité temporelle est essentielle.
Quels changements concrets pour les utilisateurs ?
L’utilisation de Glue 6.0 ne nécessite aucune modification des interfaces de programmation. La version peut être sélectionnée à l’aide du paramètre --glue-version dans les interfaces create-job et update-job via AWS CLI, AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio et les environnements de développement préférés.
Dans AWS Glue Studio, il est possible de créer de nouvelles tâches à l’aide de l’option Glue 6.0, qui prend en charge Spark 4.1, Scala 2 et Python 3, ou de mettre à niveau les tâches existantes. Il est également possible d’utiliser Spark upgrade agent ou la fonctionnalité de mise à niveau automatique, tandis que les notebooks Jupyter et les sessions interactives permettent de définir la version 6.0 au moyen de l’instruction %glue_version.
Disponibilité et coût
AWS Glue 6.0 est désormais généralement disponible dans toutes les régions AWS où le service fonctionne, avec une disponibilité régionale variable selon la région. Les crawlers et les tâches ETL sont facturés à l’heure et à la seconde, tandis qu’AWS Glue Data Catalog applique des frais mensuels simplifiés pour le stockage et l’accès aux métadonnées. Le stockage du premier million d’objets et le premier million d’opérations d’accès restent gratuits, selon les informations fournies dans l’annonce.