云计算与数据中心

AWS推出Glue 6.0,价格降低30%,全面支持Apache Iceberg v3

AWS宣布正式发布AWS Glue 6.0,与之前版本相比价格降低30%,并全面支持Apache Iceberg v3的各项能力。该版本基于Apache Spark 4.1、Python 3.12和Scala 2.13,新增半结构化数据处理改进、PySpark函数增强,以及个位数毫秒延迟的流处理能力。

2026-08-21
1 分钟阅读
11 浏览量
فريق تحرير certi.news
AWS推出Glue 6.0,价格降低30%,全面支持Apache Iceberg v3

AWS于2026年8月21日宣布正式发布AWS Glue 6.0。这一托管式数据集成与处理服务版本的价格比之前的AWS Glue版本低30%。该版本基于全面更新的运行环境,包括Apache Spark 4.1、Python 3.12和Scala 2.13,并针对数据提取、转换和加载任务的性能进行了改进,同时支持实时使用场景。

更广泛地支持Apache Iceberg数据

AWS Glue 6.0全面支持Apache Iceberg v3规范,该版本基于Iceberg 1.11.0构建。主要新增内容包括支持带有shredding的VARIANT数据类型,使用户能够存储和查询JSON数据、记录和事件数据,而无需预先将架构扁平化。

在实际应用中,这种方式有助于数据团队减少重复数据复制和定制分析代码的编写,同时降低数据管道因架构变化而中断的可能性。这对于处理结构会随时间变化的半结构化数据的环境尤为重要。

  • 支持GeometryGeography类型,可在地理信息系统分析和位置智能场景中本地处理空间数据。
  • 支持纳秒精度的时间戳,以满足物联网传感器数据、科学计算以及部分高频金融工作负载的需求。
  • 支持处理未知类型,从而能够应对意外或变化的架构,而不会导致数据管道失败。

Spark 4.1引擎更新

该版本包含基于Spark 4.1构建的新能力,以简化ETL任务的开发并改进其执行。Spark Declarative Pipelines允许数据工程师描述所需的转换结果,而不是手动管理执行顺序和优化;引擎会确定执行顺序和适当的优化措施。

AWS Glue 6.0还为Python用户定义函数提供了基于Apache Arrow的原生执行能力,包括UDF和UDTF。这消除了Python与JVM之间的序列化开销,有望提升复杂转换中的PySpark性能。

对于无状态流处理场景,该版本提供了个位数毫秒延迟的实时流处理模式。该模式基于Spark 4.1中的Real-Time Mode,并结合Glue优化后的执行能力,面向事件处理、数据转换和数据路由等对时间响应至关重要的场景。

用户实际会发生哪些变化?

使用Glue 6.0不需要修改API。用户可以通过AWS CLI、AWS SDK、AWS Glue Studio、Amazon SageMaker Unified Studio以及首选开发环境中的create-job和update-job接口,使用--glue-version参数选择该版本。

在AWS Glue Studio中,可以使用支持Spark 4.1、Scala 2和Python 3的Glue 6.0选项创建新任务,也可以升级现有任务。用户还可以使用Spark upgrade agent或自动升级功能;而Jupyter笔记本和交互式会话则可以通过%glue_version指令指定6.0版本。

可用性和成本

AWS Glue 6.0现已在该服务运行的所有AWS区域正式提供,但具体区域可用性可能因区域而异。爬网程序和ETL任务按小时并按秒计费,而AWS Glue Data Catalog则按月收取简化费用,用于存储和访问元数据。根据公告信息,前100万个对象的存储和前100万次访问仍然免费。

新闻来源
AWS News Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻