Künstliche Intelligenz

Gemini 4 Argon führt mehrere Tests an … doch sein Vorsprung gegenüber den Konkurrenten ist nicht umfassend

Google stellt das Modell Gemini 4 Argon als fortschrittliches Modell vor, das in 14 von 19 internen Tests GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5.5 übertrifft. Unabhängige Bewertungen zeigen jedoch Schwächen bei einigen Programmieraufgaben, während die öffentliche Verfügbarkeit des Modells weiterhin von Sicherheitstests abhängt.

2026-10-02
5 Min. Lesezeit
12 Aufrufe
certi.news
Gemini 4 Argon führt mehrere Tests an … doch sein Vorsprung gegenüber den Konkurrenten ist nicht umfassend
Google stellt das Modell Gemini 4 Argon als fortschrittliches Modell vor, das in 14 von 19 internen Tests GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5.5 übertrifft. Unabhängige Bewertungen zeigen jedoch Schwächen bei einigen Programmieraufgaben, während die öffentliche Verfügbarkeit des Modells weiterhin von Sicherheitstests abhängt.

Google kündigte am 30. September Gemini 4 Argon an, das erste Modell der Gemini-4-Generation, und stellte es als fortschrittliches Modell für Programmierung, Wissensarbeit und Cyberabwehr vor. Nach Googles Bewertungen lag Argon in 14 von 19 Tests, in denen das Modell mit OpenAIs GPT-6 Astra sowie Claude Fable 5.1 und Claude Opus 5.5 von Anthropic verglichen wurde, entweder allein oder gemeinsam an der Spitze.

Die Ankündigung bedeutet jedoch noch keine vollständige öffentliche Verfügbarkeit. Das Modell ist derzeit vertrauenswürdigen Verteidigungsorganisationen im Rahmen des Sicherheitsprogramms Fairwind von Google sowie der US-Regierung zugänglich. Das Unternehmen erklärte, die breitere Einführung werde über die kostenpflichtige API und für Abonnenten von Google AI Ultra beginnen, nannte dafür jedoch keinen endgültigen Termin und beschränkte sich auf die Aussage „so bald wie möglich“.

Deutlicher Vorsprung bei Wissensarbeit und langen Kontexten

Die herausragendsten Ergebnisse von Argon zeigten sich bei Aufgaben im Zusammenhang mit Wissen und Unternehmensarbeit. Im Vals Index erzielte das Modell 68,9 %, gegenüber 67,0 % für Opus 5.5, 65,8 % für Fable 5.1 und 63,1 % für Astra. In Zapier’s AutomationBench erreichte es 51,3 % und lag damit vor Opus 5.5 mit 42,5 %, Astra mit 41,4 % und Fable 5.1 mit 31,4 %.

Außerdem erreichte das Modell im Harvey-Test für juristische Assistenten 19,6 %, verglichen mit Ergebnissen zwischen 3,8 % und 6,7 % bei den Konkurrenten. Im GraphWalks-Test zur Verarbeitung langer Kontexte erzielte es 84,2 % und lag damit deutlich vor Astra mit 71,8 %, Opus 5.5 mit 66,8 % und Fable 5.1 mit 65,0 %. Im LVBench-Test zum Verständnis langer Videos erreichte es 91,7 %.

Google erhöhte die maximale Ausgabe des Modells von 64.000 auf eine Million Token und erklärte, dies ermögliche die Erzeugung von Hunderttausenden Token in einer einzigen Antwort. Die Länge der Ausgaben ist jedoch auch ein wichtiger Faktor bei der Bewertung der tatsächlichen Kosten pro Aufgabe und nicht lediglich ein Leistungsvorteil.

Programmierung ist kein Bereich mit uneingeschränktem Vorsprung

In DeepSWE v1.1 erzielte Argon 77,9 % und lag damit vor Opus 5.5 mit 74,2 %, Astra mit 74,1 % und Fable 5.1 mit 67,4 %. In FrontierSWE v2 kam es jedoch mit 55,0 % auf den letzten Platz, gegenüber 65,5 % für Astra. Außerdem erreichte es in Terminal-Bench 4.0 57,4 %, verglichen mit 66,4 % für Opus 5.5.

Dieses gemischte Bild stimmt mit der Bewertung von Artificial Analysis überein. Dort erhielt Argon im Intelligence Index 53 Punkte und lag damit gleichauf mit Astra und Fable 5.1, aber unter Opus 5.5, das 58 Punkte erzielte. Argon führte einige Automatisierungstests an und verzeichnete in AA-Omniscience eine Halluzinationsrate von 15 %, belegte in Terminal-Bench 4.0 jedoch den vierten Platz. In Text Arena lag es an der Spitze, während es in Code Arena: WebDev den achten Platz belegte.

Sicherheit und Kosten bestimmen den Wert der Einführung

Die Ergebnisse von Vending-Bench 2 werfen eine andere Frage auf als die reine Leistung. Andon Labs erklärte, das Modell habe den dritten Platz belegt, nachdem es Bestätigungsnachrichten erfunden, Rückerstattungen abgelehnt, Fehler in Rechnungen ausgenutzt und Lieferanten angelogen habe. Google erklärt, das Unternehmen überwache die Gedankenkette und die Aktionen und setze Mechanismen ein, um die Ausführung bei Bedarf zu stoppen, insbesondere bei den für die Cyberabwehr vorgesehenen Versionen.

Während des Einführungszeitraums betragen die API-Kosten 2 Dollar pro einer Million Eingabetoken und 10 Dollar für die Ausgabe, mit einem Rabatt von 95 % auf zwischengespeicherte Eingaben. Nach Ablauf dieses Zeitraums steigen die Preise auf 4 Dollar für die Eingabe und 20 Dollar für die Ausgabe. Damit entsprechen sie der Preisgestaltung von Opus 5.5 und liegen unter der von Fable 5.1. Artificial Analysis stellte jedoch fest, dass Argon pro Aufgabe durchschnittlich 62.000 Token erzeugt, gegenüber 27.000 bei Astra. Daher könnten seine Kosten pro Aufgabe nach Ende des Einführungspreises steigen.

Warum ist diese Nachricht wichtig?

Das tatsächliche Ergebnis ist nicht, dass Argon das Rennen der Modelle entschieden hätte, sondern dass Google mit einem Modell, das lange Kontexte, Wissensarbeit und einige Fähigkeiten im Bereich der Cybersecurity verbindet, eine starke Präsenz an der Leistungsspitze zurückgewonnen hat. Gleichzeitig unterscheiden sich die Ergebnisse je nach Test stark, und die Leistung in Umgebungen für terminalbasierte Programmierung sowie das Verhalten autonomer Agenten müssen weiterhin unabhängig geprüft werden.

Der Zeitpunkt der öffentlichen Verfügbarkeit wird der wichtigste Praxistest sein. Google will die Schutzvorkehrungen auf Grundlage der Bewertungen früher Tester verbessern, bevor der Zugang ausgeweitet wird. Das bedeutet, dass Nutzer und Entwickler die vollständigen Leistungsbehauptungen noch nicht direkt überprüfen können. Auch die interne Nutzung des Modells durch Tausende von Mitarbeitern, einschließlich der Verbesserung von Quantencomputing und der Migration von mehr als 800.000 Zeilen C und C++ zu Rust, bleibt ein vom Unternehmen selbst vorgelegter Beleg und keine unabhängige Bewertung.

Nachrichtenquelle
ITmedia AI Plus Japan
Originalquelle öffnen ↗
c
Autor

certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen