Kioxia erklärte während der Veranstaltung FMS: the Future of Memory and Storage, die vom 4. bis 6. August 2026 in Santa Clara stattfand, dass Rechenzentren für künstliche Intelligenz Alternativen benötigen, die die Speicher- und Speicherebene neben DRAM und HBM erweitern. Das Unternehmen präsentierte Flash-Technologien und Speichermodule auf Basis der Schnittstelle Compute Express Link (CXL), um diese Herausforderung zu bewältigen. Dabei betonte es, dass herkömmlicher Flash DRAM aufgrund der Latenz und der begrenzten Anzahl von Schreibvorgängen nicht einfach ersetzen kann.
Warum suchen Rechenzentren für künstliche Intelligenz nach Alternativen zu DRAM?
Kioxia erläuterte, dass der Ausbau von Rechenzentren für künstliche Intelligenz die Nachfrage nach HBM und DRAM erhöht, während Versorgungsengpässe die Kosten dieser Komponenten steigern. Zudem verursacht der Ausbau der Infrastruktur der Rechenzentren eine zusätzliche Kostenbelastung. Die Idee, Flash in der Speicherebene einzusetzen, stützt sich auf den großen Kapazitätsunterschied: Ein DRAM-Chip mit einer Kapazität von 32 Gigabit entspricht einem Flash-Chip mit einer Kapazität von 2 Terabit, also einer etwa 64-mal höheren Kapazität.
Dieser Unterschied hebt die technischen Einschränkungen jedoch nicht auf. Flash ist beim Lesen und Schreiben langsamer, und seine Schreibfestigkeit ist im Vergleich zu DRAM begrenzt. Kioxia ist der Ansicht, dass das Datenzugriffsmuster in Rechenzentren für künstliche Intelligenz Spielraum für eine Aufteilung der Aufgaben bietet. Nach Angaben des Unternehmens könnten etwa 20 % der Daten für 80 % der Zugriffsvorgänge verantwortlich sein. Die am häufigsten genutzten Daten können in DRAM verbleiben, während der weniger häufig genutzte Teil in Flash mit niedriger Latenz verschoben wird.
XL-FLASH und CXL-Speicher
Kioxia präsentierte die Technologie XL-FLASH als Flash mit niedriger Latenz. Das Unternehmen gibt an, dass die Leselatenz weniger als 5 Mikrosekunden beträgt, also etwa zehnmal niedriger ist als bei herkömmlichem Flash. Das Design zielt auf 150.000 bis 250.000 erneute Schreibvorgänge während einer Nutzungsdauer von fünf Jahren ab. Die alleinige Verwendung von XL-FLASH erreicht jedoch keine mit DRAM vergleichbare Latenz. Daher zeigte das Unternehmen eine Kombination mit einem speziellen Controller und einem Speichermodul über CXL.
Der Präsentation zufolge beträgt die Leselatenz eines CXL-Moduls, das XL-FLASH und den speziellen Controller kombiniert, weniger als 10 Mikrosekunden. In einem Beispiel für ein System mit Prozessor, DRAM-Modul, CXL-Modul und Speicher wurde ein DRAM-Speicher mit einer Kapazität von 225 Gigabyte durch eine Kombination aus 148 Gigabyte DRAM und 77 Gigabyte CXL-Speicher ersetzt. Laut Kioxia ging die Leistung dabei um höchstens 5 % zurück. Das Unternehmen erklärte außerdem, dass dieselbe Kombination die Kapazität verdoppeln und eine etwa 1,3-mal höhere Leistung erzielen könne, wenn sie mit einem reinen DRAM-System mit vergleichbaren Kosten verglichen wird.
Energieeffizienz bleibt ein entscheidender Faktor bei SSDs
Das Problem von Rechenzentren für künstliche Intelligenz beschränkt sich nicht auf Kapazität und Latenz. Auch die Betriebsleistung von SSDs beeinflusst das Systemdesign. Kioxia wies auf den Übergang der SSD-Schnittstellen von PCIe 5.0 zu PCIe 6.0 und anschließend zu PCIe 7.0 hin, wobei die Lese- und Schreibgeschwindigkeiten weiterhin durch die verfügbaren Leistungsgrenzen bestimmt werden.
Das Unternehmen präsentierte die zehnte Generation von BiCS FLASH TLC, die die Bitdichte gegenüber der achten Generation um etwa 59 % erhöht und laut den Präsentationsdaten den Stromverbrauch beim Lesen um 40 % sowie beim Schreiben um 30 % senkt. Außerdem erklärte Kioxia, dass ein Paket aus Flash-Chips und einem Schnittstellenchip eine Kapazität von bis zu 4 Terabyte erreichen könne. Kioxia arbeitet ebenfalls an der dritten Generation von XL-FLASH und der zehnten Generation von BiCS FLASH QLC.
Was ändert sich in der Praxis?
Die vorgestellten Technologien deuten nicht auf einen vollständigen Ersatz von DRAM hin, sondern auf den Aufbau einer Zwischenschicht zwischen Hauptspeicher und Speicher, die für weniger aktive Daten eingesetzt wird, wenn eine höhere Kapazität wichtiger ist als die niedrigstmögliche Latenz. Die tatsächlichen Ergebnisse hängen weiterhin von der Unterstützung der Plattform für CXL-Module, vom Controller und von der Software sowie vom Datenzugriffsmuster ab. Außerdem behandelt das verfügbare Material nur den ersten Teil des MONOist-Berichts und enthält daher keine Einzelheiten zu den vier Abschnitten, die Kioxia nach eigenen Angaben den SSD-Anwendungen in Rechenzentren für künstliche Intelligenz gewidmet hat.