AWS于2026年8月21日宣布正式发布AWS Glue 6.0。这一托管式数据集成与处理服务版本的价格比之前的AWS Glue版本低30%。该版本基于全面更新的运行环境,包括Apache Spark 4.1、Python 3.12和Scala 2.13,并针对数据提取、转换和加载任务的性能进行了改进,同时支持实时使用场景。
更广泛地支持Apache Iceberg数据
AWS Glue 6.0全面支持Apache Iceberg v3规范,该版本基于Iceberg 1.11.0构建。主要新增内容包括支持带有shredding的VARIANT数据类型,使用户能够存储和查询JSON数据、记录和事件数据,而无需预先将架构扁平化。
在实际应用中,这种方式有助于数据团队减少重复数据复制和定制分析代码的编写,同时降低数据管道因架构变化而中断的可能性。这对于处理结构会随时间变化的半结构化数据的环境尤为重要。
- 支持Geometry和Geography类型,可在地理信息系统分析和位置智能场景中本地处理空间数据。
- 支持纳秒精度的时间戳,以满足物联网传感器数据、科学计算以及部分高频金融工作负载的需求。
- 支持处理未知类型,从而能够应对意外或变化的架构,而不会导致数据管道失败。
Spark 4.1引擎更新
该版本包含基于Spark 4.1构建的新能力,以简化ETL任务的开发并改进其执行。Spark Declarative Pipelines允许数据工程师描述所需的转换结果,而不是手动管理执行顺序和优化;引擎会确定执行顺序和适当的优化措施。
AWS Glue 6.0还为Python用户定义函数提供了基于Apache Arrow的原生执行能力,包括UDF和UDTF。这消除了Python与JVM之间的序列化开销,有望提升复杂转换中的PySpark性能。
对于无状态流处理场景,该版本提供了个位数毫秒延迟的实时流处理模式。该模式基于Spark 4.1中的Real-Time Mode,并结合Glue优化后的执行能力,面向事件处理、数据转换和数据路由等对时间响应至关重要的场景。
用户实际会发生哪些变化?
使用Glue 6.0不需要修改API。用户可以通过AWS CLI、AWS SDK、AWS Glue Studio、Amazon SageMaker Unified Studio以及首选开发环境中的create-job和update-job接口,使用--glue-version参数选择该版本。
在AWS Glue Studio中,可以使用支持Spark 4.1、Scala 2和Python 3的Glue 6.0选项创建新任务,也可以升级现有任务。用户还可以使用Spark upgrade agent或自动升级功能;而Jupyter笔记本和交互式会话则可以通过%glue_version指令指定6.0版本。
可用性和成本
AWS Glue 6.0现已在该服务运行的所有AWS区域正式提供,但具体区域可用性可能因区域而异。爬网程序和ETL任务按小时并按秒计费,而AWS Glue Data Catalog则按月收取简化费用,用于存储和访问元数据。根据公告信息,前100万个对象的存储和前100万次访问仍然免费。