21 августа 2026 года AWS объявила о глобальной доступности AWS Glue 6.0 — управляемого сервиса интеграции и обработки данных, который предлагает цену на 30% ниже, чем предыдущие версии AWS Glue. Выпуск основан на полностью обновлённой среде выполнения, включающей Apache Spark 4.1, Python 3.12 и Scala 2.13, с улучшениями, ориентированными на производительность задач извлечения, преобразования и загрузки данных, а также на сценарии работы в реальном времени.
Расширенная поддержка данных Apache Iceberg
AWS Glue 6.0 обеспечивает полную поддержку спецификации Apache Iceberg v3, основанной в этом выпуске на Iceberg 1.11.0. Среди ключевых нововведений — тип данных VARIANT с поддержкой shredding, что позволяет хранить данные JSON, записи и данные событий и выполнять запросы к ним без предварительного упрощения схем.
На практике такой подход помогает командам по работе с данными сократить дублирование данных и написание специализированного аналитического кода, а также уменьшить вероятность сбоев конвейеров обработки при изменении схемы. Это особенно важно в средах, работающих с полуструктурированными данными, структура которых меняется со временем.
- Типы Geometry и Geography для локальной обработки пространственных данных в аналитике географических информационных систем и аналитике местоположения.
- Временные метки с наносекундной точностью для удовлетворения требованиям данных датчиков Интернета вещей, научных вычислений и некоторых высокочастотных финансовых рабочих нагрузок.
- Обработка неизвестного типа, позволяющая работать с неожиданными или изменяющимися схемами без сбоя конвейера данных.
Обновления движка Spark 4.1
Выпуск включает новые возможности на базе Spark 4.1, упрощающие разработку задач ETL и повышающие эффективность их выполнения. Spark Declarative Pipelines позволяют инженерам по работе с данными описывать желаемый результат преобразований вместо ручного управления порядком выполнения и оптимизацией; движок сам определяет порядок выполнения и подходящие оптимизации.
AWS Glue 6.0 также добавляет нативное выполнение через Apache Arrow для пользовательских функций Python, включая UDF и UDTF. Это устраняет затраты на сериализацию между Python и JVM, что может повысить производительность PySpark при выполнении сложных преобразований.
Для потоковых сценариев без состояния выпуск предоставляет режим потоковой обработки в реальном времени с задержкой в единицы миллисекунд. Этот режим основан на Real-Time Mode в Spark 4.1 и использует оптимизированное выполнение Glue, ориентированное на обработку событий, преобразование и маршрутизацию данных, когда временная реакция имеет решающее значение.
Что практически меняется для пользователей?
Для использования Glue 6.0 не требуется изменять API. Версию можно выбрать с помощью параметра --glue-version в командах create-job и update-job через AWS CLI, AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio и предпочитаемые среды разработки.
В AWS Glue Studio можно создавать новые задачи с помощью варианта Glue 6.0, поддерживающего Spark 4.1, Scala 2 и Python 3, либо обновлять существующие задачи. Также можно использовать Spark upgrade agent или функцию автоматического обновления, а в ноутбуках Jupyter и интерактивных сессиях указывать версию 6.0 с помощью директивы %glue_version.
Доступность и стоимость
AWS Glue 6.0 стал общедоступным во всех регионах AWS, где работает сервис, при этом региональная доступность может различаться в зависимости от региона. Плата за crawlers и задачи ETL взимается почасово и посекундно, тогда как за AWS Glue Data Catalog взимается упрощённая ежемесячная плата за хранение и доступ к метаданным. Согласно информации из объявления, хранение первого миллиона объектов и первый миллион операций доступа по-прежнему предоставляются бесплатно.