AWS, 21 Ağustos 2026'da, önceki AWS Glue sürümlerine kıyasla %30 daha düşük fiyat sunan, yönetilen veri entegrasyonu ve işleme hizmetinin sürümü AWS Glue 6.0'ın genel kullanıma açıldığını duyurdu. Sürüm, Apache Spark 4.1, Python 3.12 ve Scala 2.13'ü içeren tamamen güncellenmiş bir çalışma ortamına dayanır; veri çıkarma, dönüştürme ve yükleme işlerinin performansına yönelik iyileştirmelerin yanı sıra gerçek zamanlı kullanım senaryoları da sunar.
Apache Iceberg verileri için daha geniş destek
AWS Glue 6.0, bu sürümde Iceberg 1.11.0 üzerine kurulu Apache Iceberg v3 spesifikasyonu için tam destek sunar. Öne çıkan eklemeler arasında, şemaları önceden düzleştirmeye gerek kalmadan JSON verilerinin, kayıtların ve olay verilerinin depolanmasını ve sorgulanmasını sağlayan shredding destekli VARIANT veri türü bulunur.
Pratikte bu yaklaşım, veri ekiplerinin yinelenen veri kopyalarını ve özel analiz kodu yazma ihtiyacını azaltmasına yardımcı olur; ayrıca şema değiştiğinde veri hatlarının bozulma olasılığını sınırlar. Bu durum, yapısı zaman içinde değişen yarı yapılandırılmış verilerle çalışan ortamlarda özellikle önemlidir.
- Coğrafi bilgi sistemi analizlerinde ve konum zekâsında mekânsal verileri yerel olarak işlemek için Geometry ve Geography türleri.
- IoT sensör verilerinin, bilimsel hesaplamanın ve bazı yüksek frekanslı finansal iş yüklerinin gereksinimlerini karşılamak için nanosaniye hassasiyetinde zaman damgaları.
- Beklenmeyen veya değişken şemalarla veri hattının başarısız olmadan çalışılmasını sağlayan bilinmeyen tür işleme.
Spark 4.1 motoru güncellemeleri
Sürüm, ETL işlerinin geliştirilmesini kolaylaştırmak ve yürütülmesini iyileştirmek için Spark 4.1 üzerine kurulu yeni yetenekler içerir. Spark Declarative Pipelines, veri mühendislerinin yürütme sırasını ve optimizasyonu manuel olarak yönetmek yerine dönüşümlerin istenen biçimini tanımlamasını sağlar; motor, yürütme sırasını ve uygun optimizasyonları belirler.
AWS Glue 6.0 ayrıca UDF'ler ve UDTF'ler dahil olmak üzere kullanıcı tanımlı Python işlevleri için Apache Arrow üzerinden yerel yürütme ekler. Bu, Python ile JVM arasındaki serileştirme maliyetini ortadan kaldırarak karmaşık dönüşümlerde PySpark performansını iyileştirebilir.
Durum bilgisi olmayan akış kullanım senaryoları için sürüm, tek haneli milisaniye gecikmeyle gerçek zamanlı akış modu sunar. Bu mod, kritik zaman yanıtının gerekli olduğu durumlarda olayların işlenmesini, verilerin dönüştürülmesini ve yönlendirilmesini hedeflemek üzere Spark 4.1'deki Real-Time Mode'u Glue tarafından optimize edilmiş yürütmeyle birleştirir.
Kullanıcılar için pratikte ne değişiyor?
Glue 6.0'dan yararlanmak API'lerde değişiklik yapılmasını gerektirmez. Sürüm, AWS CLI, AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio ve tercih edilen geliştirme ortamlarında create-job ve update-job arayüzleri üzerinden --glue-version parametresi kullanılarak seçilebilir.
AWS Glue Studio'da Spark 4.1, Scala 2 ve Python 3'ü destekleyen Glue 6.0 seçeneğiyle yeni işler oluşturulabilir veya mevcut işler yükseltilebilir. Ayrıca Spark upgrade agent ya da otomatik yükseltme özelliği kullanılabilir; Jupyter not defterleri ve etkileşimli oturumlar ise %glue_version yönergesi aracılığıyla 6.0 sürümünün belirtilmesine olanak tanır.
Kullanılabilirlik ve maliyet
AWS Glue 6.0, hizmetin çalıştığı tüm AWS Bölgelerinde genel kullanıma sunulmuştur; bölgesel kullanılabilirlik bölgeye göre değişir. Crawler'lar ve ETL işleri saatlik ve saniyelik olarak ücretlendirilirken AWS Glue Data Catalog için meta verilerin depolanması ve bunlara erişim amacıyla basitleştirilmiş aylık ücretler uygulanır. Duyuruda verilen bilgilere göre ilk bir milyon nesnenin depolanması ve ilk bir milyon erişim işlemi ücretsiz olmaya devam eder.