Computação em nuvem e centros de dados

Amazon S3 Tables agora oferece suporte a todos os tipos de dados do Apache Iceberg V3

A AWS anunciou o suporte completo à especificação Apache Iceberg V3 no Amazon S3 Tables, incluindo vetores de exclusão, linhagem de linhas e novos tipos para dados semiestruturados e geográficos. É possível criar novas tabelas V3 ou atualizar tabelas V2 existentes, mas a atualização é unidirecional e exige compatibilidade dos mecanismos de acesso.

2026-09-30
4 min de leitura
20 visualizações
certi.news Editorial Team
Amazon S3 Tables agora oferece suporte a todos os tipos de dados do Apache Iceberg V3

A AWS anunciou que o serviço Amazon S3 Tables passou a oferecer suporte a todos os tipos de dados da especificação Apache Iceberg V3, permitindo criar novas tabelas na versão V3 ou atualizar tabelas existentes baseadas na V2. A atualização inclui vetores de exclusão (Deletion Vectors), linhagem de linhas (Row Lineage) e os tipos de dados variant, timestamp de nanossegundos, geometry, geography e unknown.

Esses recursos destinam-se a equipes de análise que gerenciam tabelas grandes em data lakes. Em vez de representar dados semiestruturados, coordenadas geográficas ou registros de data e hora de altíssima precisão como strings ou números inteiros, é possível armazená-los usando tipos nativos dentro de tabelas Iceberg, mantendo o uso de arquivos Parquet no Amazon S3.

O que muda na prática?

Os vetores de exclusão substituem os arquivos de exclusão posicionais usados no Iceberg V2 por uma representação binária compactada. Segundo o exemplo apresentado pela AWS, excluir 50 mil registros de uma tabela com dois bilhões de linhas pode gerar um único arquivo de vetor de exclusão em vez de milhares de arquivos pequenos, reduzindo a sobrecarga de arquivos e o tempo de compactação posterior.

Já a linhagem de linhas adiciona automaticamente os campos _row_id e _last_updated_sequence_number. Os pipelines de processamento posteriores podem usar o número de sequência para extrair as linhas alteradas desde um ponto de verificação anterior, em vez de examinar a tabela inteira a cada execução.

O tipo variant armazena dados semiestruturados em formato colunar, permitindo que o mecanismo de consulta leia diretamente os campos necessários e use estatísticas para reduzir as operações de entrada e saída, em vez de analisar textos JSON a cada consulta. O Iceberg V3 também oferece tipos nativos para dados geográficos e registros de data e hora com precisão de nanossegundos.

Atualização a partir do Iceberg V2

Uma tabela existente pode ser atualizada atomicamente alterando a propriedade format-version para 3, sem reescrever os dados. Os leitores V2 continuam funcionando nas tabelas atualizadas até que a adoção do V3 seja concluída no ambiente, enquanto o S3 Tables remove os arquivos de exclusão antigos durante o ciclo de compactação seguinte e começa a inicializar os dados de linhagem de linhas na primeira modificação posterior dos dados.

Entretanto, essa atualização é unidirecional; a especificação Apache Iceberg não oferece suporte à reversão do V3 para o V2. Portanto, é necessário verificar previamente se todos os mecanismos que acessam a tabela são compatíveis com a nova versão.

Compatibilidade e limitações

Os novos tipos de dados exigem um mecanismo baseado no Apache Spark 4.0 ou posterior, como o AWS Glue 6.0 ou posterior, ou o Amazon EMR versão 8.1 ou posterior. Esses tipos também estão limitados a tabelas que usam Parquet e não estão disponíveis com ORC ou Avro.

Não é possível usar colunas variant, geometry, geography ou registros de data e hora com precisão de nanossegundos na ordenação da tabela usada para compactação, embora as tabelas que as contenham continuem podendo ser compactadas quando sua ordenação se basear em colunas de outros tipos. O S3 Tables continua gerenciando automaticamente a compactação e a manutenção, com suporte à criação de tabelas pelo console do Amazon S3, pela AWS CLI ou por qualquer mecanismo compatível com a interface Iceberg REST Catalog.

Por que essa atualização é importante?

A atualização oferece às equipes de dados um caminho menos dependente de transformações personalizadas ao lidar com exclusões em grande escala, dados irregulares e atualizações incrementais. No entanto, o benefício prático depende da preparação dos mecanismos de consulta e gravação da organização; a atualização não implica compatibilidade imediata com todas as ferramentas, e o uso dos novos tipos restringe o formato de armazenamento e exige versões específicas do Spark e dos serviços relacionados.

O suporte ao Apache Iceberg V3 está disponível em todas as regiões da AWS que oferecem suporte ao S3 Tables, sem taxas adicionais específicas para a atualização, com a continuidade da aplicação dos preços usuais do S3 Tables.

Fonte da notícia
AWS News Blog
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Na mesma categoria

Você também pode gostar

Ver todas as notícias