Облачные вычисления и центры обработки данных

AWS выпускает Glue 6.0 с ценой на 30% ниже и полной поддержкой Apache Iceberg v3

AWS объявила о глобальной доступности AWS Glue 6.0, снижении цен на 30% по сравнению с предыдущими версиями и полной поддержке возможностей Apache Iceberg v3. Выпуск основан на Apache Spark 4.1, Python 3.12 и Scala 2.13 и добавляет улучшения для обработки полуструктурированных данных, разработки функций PySpark и потоковой обработки с задержкой в единицы миллисекунд.

2026-08-21
3 мин. чтения
11 просмотров
فريق تحرير certi.news
AWS выпускает Glue 6.0 с ценой на 30% ниже и полной поддержкой Apache Iceberg v3

21 августа 2026 года AWS объявила о глобальной доступности AWS Glue 6.0 — управляемого сервиса интеграции и обработки данных, который предлагает цену на 30% ниже, чем предыдущие версии AWS Glue. Выпуск основан на полностью обновлённой среде выполнения, включающей Apache Spark 4.1, Python 3.12 и Scala 2.13, с улучшениями, ориентированными на производительность задач извлечения, преобразования и загрузки данных, а также на сценарии работы в реальном времени.

Расширенная поддержка данных Apache Iceberg

AWS Glue 6.0 обеспечивает полную поддержку спецификации Apache Iceberg v3, основанной в этом выпуске на Iceberg 1.11.0. Среди ключевых нововведений — тип данных VARIANT с поддержкой shredding, что позволяет хранить данные JSON, записи и данные событий и выполнять запросы к ним без предварительного упрощения схем.

На практике такой подход помогает командам по работе с данными сократить дублирование данных и написание специализированного аналитического кода, а также уменьшить вероятность сбоев конвейеров обработки при изменении схемы. Это особенно важно в средах, работающих с полуструктурированными данными, структура которых меняется со временем.

  • Типы Geometry и Geography для локальной обработки пространственных данных в аналитике географических информационных систем и аналитике местоположения.
  • Временные метки с наносекундной точностью для удовлетворения требованиям данных датчиков Интернета вещей, научных вычислений и некоторых высокочастотных финансовых рабочих нагрузок.
  • Обработка неизвестного типа, позволяющая работать с неожиданными или изменяющимися схемами без сбоя конвейера данных.

Обновления движка Spark 4.1

Выпуск включает новые возможности на базе Spark 4.1, упрощающие разработку задач ETL и повышающие эффективность их выполнения. Spark Declarative Pipelines позволяют инженерам по работе с данными описывать желаемый результат преобразований вместо ручного управления порядком выполнения и оптимизацией; движок сам определяет порядок выполнения и подходящие оптимизации.

AWS Glue 6.0 также добавляет нативное выполнение через Apache Arrow для пользовательских функций Python, включая UDF и UDTF. Это устраняет затраты на сериализацию между Python и JVM, что может повысить производительность PySpark при выполнении сложных преобразований.

Для потоковых сценариев без состояния выпуск предоставляет режим потоковой обработки в реальном времени с задержкой в единицы миллисекунд. Этот режим основан на Real-Time Mode в Spark 4.1 и использует оптимизированное выполнение Glue, ориентированное на обработку событий, преобразование и маршрутизацию данных, когда временная реакция имеет решающее значение.

Что практически меняется для пользователей?

Для использования Glue 6.0 не требуется изменять API. Версию можно выбрать с помощью параметра --glue-version в командах create-job и update-job через AWS CLI, AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio и предпочитаемые среды разработки.

В AWS Glue Studio можно создавать новые задачи с помощью варианта Glue 6.0, поддерживающего Spark 4.1, Scala 2 и Python 3, либо обновлять существующие задачи. Также можно использовать Spark upgrade agent или функцию автоматического обновления, а в ноутбуках Jupyter и интерактивных сессиях указывать версию 6.0 с помощью директивы %glue_version.

Доступность и стоимость

AWS Glue 6.0 стал общедоступным во всех регионах AWS, где работает сервис, при этом региональная доступность может различаться в зависимости от региона. Плата за crawlers и задачи ETL взимается почасово и посекундно, тогда как за AWS Glue Data Catalog взимается упрощённая ежемесячная плата за хранение и доступ к метаданным. Согласно информации из объявления, хранение первого миллиона объектов и первый миллион операций доступа по-прежнему предоставляются бесплатно.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости