Cloud Computing und Rechenzentren

Amazon S3 Tables unterstützt jetzt alle Datentypen von Apache Iceberg V3

AWS hat die vollständige Unterstützung der Spezifikation Apache Iceberg V3 in Amazon S3 Tables angekündigt, einschließlich Löschvektoren, Zeilenherkunft sowie neuer Datentypen für semi-strukturierte und geografische Daten. Es können neue V3-Tabellen erstellt oder bestehende V2-Tabellen aktualisiert werden; das Upgrade ist jedoch einseitig und setzt die Kompatibilität der Zugriffsmotoren voraus.

2026-09-30
4 Min. Lesezeit
20 Aufrufe
certi.news Editorial Team
Amazon S3 Tables unterstützt jetzt alle Datentypen von Apache Iceberg V3

AWS hat angekündigt, dass der Dienst Amazon S3 Tables nun alle Datentypen der Spezifikation Apache Iceberg V3 unterstützt. Dadurch können neue Tabellen mit Version V3 erstellt oder bestehende, auf V2 basierende Tabellen aktualisiert werden. Die Aktualisierung umfasst Löschvektoren (Deletion Vectors), Zeilenherkunft (Row Lineage) sowie die Datentypen variant, nanosecond timestamp, geometry, geography und unknown.

Diese Funktionen richten sich an Analyseteams, die große Tabellen in Data Lakes verwalten. Statt semi-strukturierte Daten, geografische Koordinaten oder Zeitstempel mit extrem hoher Genauigkeit als Zeichenfolgen oder Ganzzahlen darzustellen, können sie in Iceberg-Tabellen in nativen Datentypen gespeichert werden, während weiterhin Parquet-Dateien auf Amazon S3 verwendet werden.

Was ändert sich in der Praxis?

Löschvektoren ersetzen die Positionslöschdateien, die in Iceberg V2 verwendet werden, durch eine komprimierte binäre Darstellung. Laut dem von AWS präsentierten Beispiel kann das Löschen von 50.000 Datensätzen aus einer Tabelle mit zwei Milliarden Zeilen eine einzige Löschvektordatei statt Tausender kleiner Dateien erzeugen, wodurch der Dateiaufwand und die anschließende Komprimierungszeit reduziert werden.

Die Zeilenherkunft fügt automatisch die beiden Felder _row_id und _last_updated_sequence_number hinzu. Nachgelagerte Verarbeitungspipelines können die Sequenznummer verwenden, um die Zeilen zu extrahieren, die sich seit einem früheren Prüfpunkt geändert haben, statt die gesamte Tabelle bei jeder Ausführung zu überprüfen.

Der Typ variant speichert semi-strukturierte Daten in einem spaltenbasierten Format. Dadurch kann die Abfrage-Engine die benötigten Felder direkt lesen und Statistiken nutzen, um Ein-/Ausgabevorgänge zu reduzieren, statt bei jeder Abfrage JSON-Texte zu analysieren. Iceberg V3 bietet außerdem native Datentypen für geografische Daten und Zeitstempel mit Nanosekundengenauigkeit.

Upgrade von Iceberg V2

Eine bestehende Tabelle kann atomar aktualisiert werden, indem die Eigenschaft format-version auf 3 geändert wird, ohne die Daten neu zu schreiben. V2-Lesegeräte funktionieren weiterhin mit Tabellen, die auf V3 aktualisiert wurden, bis die V3-Unterstützung in der Umgebung vollständig eingeführt ist. S3 Tables entfernt die alten Löschdateien während des nächsten Komprimierungszyklus und beginnt mit der Initialisierung der Daten zur Zeilenherkunft bei der ersten anschließenden Datenänderung.

Dieses Upgrade ist jedoch einseitig; die Apache-Iceberg-Spezifikation unterstützt keine Rückkehr von V3 zu V2. Daher muss vorab überprüft werden, dass alle Engines, die auf die Tabelle zugreifen, die neue Version unterstützen.

Kompatibilität und Einschränkungen

Die neuen Datentypen erfordern eine Engine auf Basis von Apache Spark 4.0 oder höher, etwa AWS Glue 6.0 oder höher oder Amazon EMR Version 8.1 oder höher. Außerdem sind diese Datentypen auf Tabellen beschränkt, die Parquet verwenden, und stehen mit ORC oder Avro nicht zur Verfügung.

Spalten vom Typ variant, geometry oder geography sowie Zeitstempel mit Nanosekundengenauigkeit können nicht für die tabellenspezifische Sortierung der Komprimierung verwendet werden. Tabellen, die diese Datentypen enthalten, bleiben jedoch komprimierbar, wenn ihre Sortierung auf Spalten anderer Typen basiert. S3 Tables verwaltet die Komprimierung und Wartung weiterhin automatisch und unterstützt die Erstellung von Tabellen über die Amazon-S3-Konsole, die AWS CLI oder jede Engine, die die Iceberg-REST-Catalog-Schnittstelle unterstützt.

Warum ist diese Aktualisierung wichtig?

Die Aktualisierung bietet Datenteams einen Weg, der beim Umgang mit umfangreichen Löschvorgängen, unregelmäßigen Daten und inkrementellen Aktualisierungen weniger auf benutzerdefinierte Transformationen angewiesen ist. Der praktische Nutzen hängt jedoch von der Bereitschaft der Abfrage- und Schreib-Engines des Unternehmens ab; das Upgrade bedeutet nicht, dass alle Tools sofort kompatibel sind. Zudem schränkt die Verwendung der neuen Datentypen das Speicherformat ein und erfordert bestimmte Versionen von Spark und den damit verbundenen Diensten.

Die Unterstützung für Apache Iceberg V3 ist in allen AWS-Regionen verfügbar, die S3 Tables unterstützen, ohne zusätzliche, speziell für die Aktualisierung anfallende Gebühren. Die üblichen Preise für S3 Tables gelten weiterhin.

Nachrichtenquelle
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen