Computación en la nube y centros de datos

Amazon S3 Tables ahora admite todos los tipos de datos de Apache Iceberg V3

AWS anunció la disponibilidad de compatibilidad completa con la especificación Apache Iceberg V3 en Amazon S3 Tables, incluidos los vectores de eliminación, el linaje de filas y nuevos tipos de datos semiestructurados y geoespaciales. Se pueden crear nuevas tablas V3 o actualizar las tablas V2 existentes, pero la actualización es unidireccional y requiere compatibilidad de los motores de acceso.

2026-09-30
4 min de lectura
20 visitas
certi.news Editorial Team
Amazon S3 Tables ahora admite todos los tipos de datos de Apache Iceberg V3

AWS anunció que el servicio Amazon S3 Tables ahora admite todos los tipos de datos incluidos en la especificación Apache Iceberg V3, lo que permite crear nuevas tablas con la versión V3 o actualizar las tablas existentes basadas en V2. La actualización incluye vectores de eliminación (Deletion Vectors), linaje de filas (Row Lineage) y los tipos de datos variant, nanosecond timestamp, geometry, geography y unknown.

Estas capacidades están dirigidas a equipos de analítica que gestionan tablas grandes en lagos de datos. En lugar de representar los datos semiestructurados, las coordenadas geográficas o las marcas de tiempo de precisión ultraalta como cadenas de texto o números enteros, se pueden almacenar con tipos nativos dentro de tablas Iceberg, manteniendo el uso de archivos Parquet en Amazon S3.

¿Qué cambia en la práctica?

Los vectores de eliminación sustituyen a los archivos de eliminación posicionales utilizados en Iceberg V2 por una representación binaria comprimida. Según el ejemplo presentado por AWS, eliminar 50.000 registros de una tabla con 2.000 millones de filas puede generar un único archivo de vector de eliminación en lugar de miles de archivos pequeños, lo que reduce la carga de archivos y el tiempo de compactación posterior.

Por su parte, el linaje de filas añade automáticamente los campos _row_id y _last_updated_sequence_number. Las canalizaciones posteriores pueden utilizar el número de secuencia para extraer las filas que cambiaron desde un punto de control anterior, en lugar de examinar toda la tabla en cada ejecución.

El tipo variant almacena datos semiestructurados en formato columnar, lo que permite al motor de consultas leer directamente los campos necesarios y aprovechar las estadísticas para reducir las operaciones de entrada y salida, en lugar de analizar textos JSON en cada consulta. Iceberg V3 también proporciona tipos nativos para datos geoespaciales y marcas de tiempo con precisión de nanosegundos.

Actualización desde Iceberg V2

Una tabla existente puede actualizarse atómicamente cambiando la propiedad format-version a 3, sin reescribir los datos. Los lectores V2 siguen funcionando con las tablas actualizadas hasta que se complete la adopción de V3 en el entorno, mientras que S3 Tables elimina los archivos de eliminación antiguos durante el siguiente ciclo de compactación e inicia la generación de los datos de linaje de filas con la primera modificación posterior de los datos.

Sin embargo, esta actualización es unidireccional; la especificación Apache Iceberg no admite volver de V3 a V2. Por ello, se debe verificar previamente que todos los motores que acceden a la tabla admitan la nueva versión.

Compatibilidad y limitaciones

Los nuevos tipos de datos requieren un motor basado en Apache Spark 4.0 o posterior, como AWS Glue 6.0 o posterior, o Amazon EMR versión 8.1 o posterior. Además, estos tipos están limitados a las tablas que utilizan Parquet y no están disponibles con ORC o Avro.

Las columnas variant, geometry o geography, así como las marcas de tiempo con precisión de nanosegundos, no se pueden utilizar en la ordenación de tablas destinada a la compactación, aunque las tablas que las contienen siguen pudiendo compactarse cuando su ordenación se basa en columnas de otros tipos. S3 Tables continúa gestionando automáticamente la compactación y el mantenimiento, con compatibilidad para crear tablas desde la consola de Amazon S3, AWS CLI o cualquier motor que admita la interfaz Iceberg REST Catalog.

¿Por qué importa esta actualización?

La actualización proporciona a los equipos de datos una vía menos dependiente de transformaciones personalizadas al trabajar con eliminaciones a gran escala, datos irregulares y actualizaciones incrementales. Sin embargo, el beneficio práctico depende de la preparación de los motores de consulta y escritura de la organización; la actualización no implica compatibilidad inmediata con todas las herramientas, y el uso de los nuevos tipos limita el formato de almacenamiento y requiere versiones específicas de Spark y de los servicios relacionados.

La compatibilidad con Apache Iceberg V3 ya está disponible en todas las regiones de AWS que admiten S3 Tables, sin cargos adicionales específicos por la actualización, y se siguen aplicando las tarifas habituales de S3 Tables.

Fuente de la noticia
c
Autor

certi.news Editorial Team

De la misma categoría

También te puede interesar

Ver todas las noticias