Искусственный интеллект

Z.ai enthüllt die Identität des Modells Ox Alpha und stellt es unter dem Namen GLM-5.3-Flash mit offenen Gewichten bereit

Z.ai bestätigte, dass das mysteriöse Modell Ox Alpha von dem Unternehmen stammt, und veröffentlichte es unter dem Namen GLM-5.3-Flash mit Gewichten über Hugging Face. Das Modell richtet sich an Programmier- und langfristige Agentenaufgaben und basiert auf 320 Milliarden Parametern, von denen pro Anfrage etwa 18 Milliarden aktiviert werden; der Kontext umfasst bis zu eine Million Token.

2026-08-27
4 мин. чтения
10 просмотров
certi.news
Z.ai enthüllt die Identität des Modells Ox Alpha und stellt es unter dem Namen GLM-5.3-Flash mit offenen Gewichten bereit

Das chinesische KI-Unternehmen Z.ai gab bekannt, dass das Modell, das vergangene Woche auf der Plattform OpenRouter unter dem Namen Ox Alpha erschienen war, zu seinen Modellen gehört, und veröffentlichte es erneut unter dem Namen GLM-5.3-Flash. Das Unternehmen stellte die Gewichte des Modells über Hugging Face bereit. Dadurch können Entwickler darauf zugreifen und es entsprechend der von Z.ai bereitgestellten Variante ausführen, anstatt dass es als Dienst unbekannter Herkunft auf einer Plattform eines Drittanbieters verbleibt.

Ox Alpha war auf OpenRouter kostenlos erschienen, ohne dass die Entwicklerseite offengelegt wurde. Es erregte jedoch schnell Aufmerksamkeit, nachdem es in mehreren Tests und Ranglisten starke Ergebnisse erzielt hatte. Die unbekannte Identität des Entwicklers führte zu Diskussionen darüber, welches Labor dahintersteht. Z.ai war einer der prominentesten Namen, die vor der Bestätigung des Unternehmens seiner Verbindung zu dem Modell genannt wurden.

Ein Modell für Programmierung und Agentenaufgaben

Z.ai präsentiert das Modell als Inferenzmodell für Programmierung, langfristige Agentenaufgaben und Arbeitslasten in Produktionsumgebungen. Den veröffentlichten Informationen zufolge wurde GLM-5.3-Flash für umfangreiche Softwareentwicklungsaufgaben, komplexe Inferenzprobleme und Arbeitsabläufe entwickelt, die Text- und visuellen Kontext miteinander verbinden.

Das Modell verwendet eine Mixture of Experts (MoE)-Architektur mit insgesamt 320 Milliarden Parametern. Bei der Verarbeitung jeder Anfrage sind jedoch nur etwa 18 Milliarden Parameter aktiv. Das Kontextfenster umfasst bis zu eine Million Token und unterstützt Texte, Bilder und Videoclips, während die Länge der generierten Antwort 131.072 Token erreichen kann.

Eine Aufmerksamkeitsarchitektur für lange Kontexte

Z.ai zufolge unterscheidet sich das Modell von früheren GLM-Generationen durch die verwendete Aufmerksamkeitsarchitektur. Sparse attention konzentriert sich auf die relevantesten Teile der Eingaben, anstatt alle Token gleichzeitig zu bewerten. Dadurch soll der Rechenaufwand bei der Verarbeitung langer Eingaben verringert werden.

Der Ansatz der Linear attention zielt darauf ab, das Wachstum des Speicherbedarfs bei zunehmender Kontextlänge zu kontrollieren. Das Unternehmen gibt an, dass das Training des Modells auf einem Datensatz mit 30 Billionen Token basierte und außerdem eine Methode namens mHC zur Verbesserung des Trainingsprozesses eingesetzt wurde.

Was bedeutet das für Entwickler?

Z.ai zufolge sind die Betriebskosten von GLM-5.3-Flash zehnmal niedriger als die Kosten für den Betrieb des vorherigen Modells. Sollte sich dieser Unterschied in der tatsächlichen Nutzung widerspiegeln, könnte er für Teams von Bedeutung sein, die langfristige Agentenaufgaben ausführen oder große Kontextmengen verarbeiten müssen. Der Artikel enthält jedoch keine Einzelheiten zu den Messbedingungen, Preisen oder Hardwareanforderungen, sodass der finanzielle Vergleich unabhängig überprüft werden muss.

In den von dem Unternehmen präsentierten Tests wurde das Modell mit Claude Opus 4.8, GPT-5.6 Terra und Gemini 3.7 Flash verglichen. Den Ergebnissen von Z.ai zufolge erzielte GLM-5.3-Flash im Test GDPval-AA v2 zur Messung der Leistung bei wissensintensiven Aufgaben das höchste Ergebnis und belegte in AutomationBench, das die Fähigkeit zum Abschluss von Aufgaben innerhalb von Cloud-Anwendungen misst, den zweiten Platz.

Die Bedeutung der Ankündigung liegt in der Kombination aus drei Elementen: über Hugging Face verfügbaren Gewichten, einem sehr langen Kontext und einer klaren Ausrichtung auf Agenten und Programmierung. Für sich genommen beweist dies jedoch keine Überlegenheit gegenüber konkurrierenden Modellen, da die genannten Ergebnisse vom Unternehmen selbst stammen und der Artikel keine Einzelheiten zur Methodik oder zur Reproduzierbarkeit der Tests enthält. Die Veröffentlichung ist Teil eines umfassenderen Bestrebens chinesischer KI-Unternehmen, Modelle mit offenen Gewichten und geringeren Betriebskosten als Alternativen zu den geschlossenen Modellen von Unternehmen wie OpenAI und Anthropic anzubieten.

Источник новости
c
Автор

certi.news

В той же категории

Вам также может понравиться

Все новости