AWS는 2026년 8월 21일 AWS Glue 6.0의 정식 출시를 발표했다. AWS Glue 6.0은 AWS Glue 이전 버전보다 30% 저렴한 가격을 제공하는 관리형 데이터 통합 및 처리 서비스 버전이다. 이번 버전은 Apache Spark 4.1, Python 3.12, Scala 2.13을 포함한 완전히 업데이트된 실행 환경을 기반으로 하며, 데이터 추출·변환·로드 작업의 성능과 실시간 사용 사례를 개선했다.
Apache Iceberg 데이터 지원 확대
AWS Glue 6.0은 이번 버전에서 Iceberg 1.11.0을 기반으로 하는 Apache Iceberg v3 사양을 완전히 지원한다. 주요 추가 기능으로는 VARIANT 데이터 유형과 shredding 지원이 있으며, 이를 통해 스키마를 사전에 평탄화하지 않고도 JSON 데이터, 레코드, 이벤트 데이터를 저장하고 쿼리할 수 있다.
실제로 이 방식은 데이터 팀이 중복 데이터 복사와 맞춤형 분석 코드 작성을 줄이는 데 도움이 되며, 스키마가 변경될 때 데이터 파이프라인이 중단될 가능성도 낮춘다. 시간이 지나면서 구조가 변하는 반정형 데이터를 다루는 환경에서는 이러한 기능의 중요성이 더욱 커진다.
- 지리정보 시스템 분석 및 위치 인텔리전스에서 공간 데이터를 로컬로 처리할 수 있는 Geometry 및 Geography 유형.
- 사물인터넷 센서 데이터, 과학 컴퓨팅, 일부 고빈도 금융 워크로드의 요구 사항을 충족하는 나노초 정밀도의 타임스탬프.
- 예상하지 못했거나 변경되는 스키마를 처리할 수 있도록 해 데이터 파이프라인이 실패하지 않게 하는 알 수 없는 유형 처리.
Spark 4.1 엔진 업데이트
이번 버전에는 ETL 작업의 개발을 간소화하고 실행을 개선하기 위한 Spark 4.1 기반의 새로운 기능이 포함됐다. Spark Declarative Pipelines를 사용하면 데이터 엔지니어가 실행 순서와 최적화를 직접 관리하는 대신 원하는 변환 결과를 설명할 수 있으며, 엔진이 적절한 실행 순서와 최적화를 결정한다.
또한 AWS Glue 6.0은 UDF와 UDTF를 포함한 사용자 정의 Python 함수에 대해 Apache Arrow를 통한 네이티브 실행을 추가한다. 이를 통해 Python과 JVM 간 직렬화 비용이 제거되어 복잡한 변환에서 PySpark 성능이 향상될 수 있다.
상태 비저장 스트리밍 사용 사례를 위해 이번 버전은 한 자릿수 밀리초의 지연 시간을 제공하는 즉시 스트리밍 모드를 제공한다. 이 모드는 Spark 4.1의 Real-Time Mode와 Glue의 최적화된 실행을 기반으로 하며, 시간 응답성이 핵심 요소인 이벤트 처리, 데이터 변환 및 라우팅을 대상으로 한다.
사용자에게 실질적으로 달라지는 점은 무엇인가?
Glue 6.0을 활용하기 위해 API를 변경할 필요는 없다. AWS CLI, AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio 및 선호하는 개발 환경의 create-job 및 update-job 인터페이스에서 --glue-version 매개변수를 사용해 버전을 선택할 수 있다.
AWS Glue Studio에서는 Spark 4.1, Scala 2, Python 3을 지원하는 Glue 6.0 옵션을 사용해 새 작업을 만들거나 기존 작업을 업그레이드할 수 있다. 또한 Spark upgrade agent 또는 자동 업그레이드 기능을 사용할 수 있으며, Jupyter 노트북과 대화형 세션에서는 %glue_version 지시문을 통해 버전 6.0을 지정할 수 있다.
가용성 및 비용
AWS Glue 6.0은 서비스가 운영되는 모든 AWS 리전에서 정식으로 제공되며, 리전에 따라 지역별 가용성은 다를 수 있다. 크롤러와 ETL 작업에는 시간당 및 초당 요금이 부과되고, AWS Glue Data Catalog에는 메타데이터 저장 및 액세스에 대한 간소화된 월별 요금이 부과된다. 발표에 명시된 정보에 따르면 첫 100만 개의 객체 저장과 첫 100만 건의 액세스는 계속 무료다.