A AWS anunciou em 21 de agosto de 2026 a disponibilidade geral do AWS Glue 6.0, uma versão do serviço gerenciado de integração e processamento de dados que oferece um preço 30% menor que o das versões anteriores do AWS Glue. A versão baseia-se em um ambiente de execução totalmente atualizado, que inclui Apache Spark 4.1, Python 3.12 e Scala 2.13, com melhorias voltadas ao desempenho de tarefas de extração, transformação e carregamento de dados, além de casos de uso em tempo real.
Suporte mais amplo a dados do Apache Iceberg
O AWS Glue 6.0 oferece suporte completo à especificação Apache Iceberg v3, baseada nesta versão no Iceberg 1.11.0. Entre as principais adições está o tipo de dados VARIANT, com suporte a shredding, permitindo armazenar e consultar dados JSON, registros e dados de eventos sem a necessidade de nivelar previamente os esquemas.
Na prática, essa abordagem ajuda as equipes de dados a reduzir cópias duplicadas de dados e a escrita de códigos de análise personalizados, além de limitar a possibilidade de falhas nos pipelines quando o esquema muda. Isso é especialmente importante em ambientes que lidam com dados semiestruturados cuja estrutura muda ao longo do tempo.
- Tipos Geometry e Geography para processar dados espaciais localmente em análises de sistemas de informação geográfica e inteligência de localização.
- Marcas de tempo com precisão de nanossegundos, para atender aos requisitos de dados de sensores de Internet das Coisas, computação científica e algumas cargas de trabalho financeiras de alta frequência.
- Processamento de tipos desconhecidos, permitindo lidar com esquemas inesperados ou variáveis sem causar falhas no pipeline de dados.
Atualizações do mecanismo Spark 4.1
A versão inclui novos recursos baseados no Spark 4.1 para simplificar o desenvolvimento de tarefas ETL e melhorar sua execução. Os Spark Declarative Pipelines permitem que engenheiros de dados descrevam a forma desejada das transformações em vez de gerenciar manualmente a ordem de execução e a otimização; o mecanismo determina a ordem de execução e as otimizações adequadas.
O AWS Glue 6.0 também adiciona uma implementação nativa por meio do Apache Arrow para funções Python definidas pelo usuário, incluindo UDFs e UDTFs. Isso elimina o custo de serialização entre Python e JVM, o que pode melhorar o desempenho do PySpark em transformações complexas.
Para casos de streaming sem estado, a versão oferece um modo de streaming em tempo real com latência de um dígito em milissegundos. Esse modo baseia-se no Real-Time Mode do Spark 4.1, com execução otimizada pelo Glue, e tem como alvo o processamento, a transformação e o roteamento de eventos quando o tempo de resposta é um fator crítico.
O que muda na prática para os usuários?
O uso do Glue 6.0 não exige alterações nas interfaces de programação. A versão pode ser selecionada usando o parâmetro --glue-version nas interfaces create-job e update-job por meio da AWS CLI, do AWS SDK, do AWS Glue Studio, do Amazon SageMaker Unified Studio e dos ambientes de desenvolvimento preferidos.
No AWS Glue Studio, é possível criar novas tarefas usando a opção Glue 6.0, que oferece suporte ao Spark 4.1, Scala 2 e Python 3, ou atualizar tarefas existentes. Também é possível usar o Spark upgrade agent ou o recurso de atualização automática, enquanto os notebooks Jupyter e as sessões interativas permitem especificar a versão 6.0 por meio da instrução %glue_version.
Disponibilidade e custo
O AWS Glue 6.0 está disponível geralmente em todas as regiões da AWS nas quais o serviço opera, com variação da disponibilidade regional conforme a região. Os crawlers e as tarefas ETL são cobrados por hora e por segundo, enquanto o AWS Glue Data Catalog aplica cobranças mensais simplificadas pelo armazenamento e acesso aos metadados. O armazenamento do primeiro milhão de objetos e o primeiro milhão de operações de acesso continuam gratuitos, de acordo com as informações do anúncio.