Künstliche Intelligenz

SpaceXAI enthüllt Grok 4.7 für Programmierung und Wissensarbeit zum Preis des Vorgängermodells

SpaceXAI hat Grok 4.7 als sein leistungsstärkstes Modell für Programmierung und Wissensarbeit vorgestellt und dabei den Preis und die Geschwindigkeit von Grok 4.6 beibehalten. Das Modell übertrifft die Konkurrenz in einigen Programmier-, Ingenieur- und Rechtstests, fällt jedoch bei Terminalaufgaben und klinischem Schlussfolgern hinter konkurrierende Modelle zurück.

2026-09-22
4 Min. Lesezeit
77 Aufrufe
certi.news
SpaceXAI enthüllt Grok 4.7 für Programmierung und Wissensarbeit zum Preis des Vorgängermodells

SpaceXAI hat am 21. September Ortszeit das KI-Modell Grok 4.7 angekündigt, das Unternehmen und Entwicklern als leistungsstärkstes Modell für Programmierung und Wissensarbeit angeboten wird. Das Modell ist zum selben Preis und mit derselben Geschwindigkeit wie Grok 4.6 verfügbar, während das Unternehmen angibt, es sei doppelt so schnell und halb so teuer wie Modelle derselben Kategorie.

Was hat sich bei Grok 4.7 verändert?

Das Modell basiert auf einem größeren Basismodell und wurde länger mit verstärkendem Lernen sowie mit komplexen Aufgaben trainiert, die für die Bearbeitung von Problemen entwickelt wurden, deren Abschluss Stunden dauern kann. Laut SpaceXAI hat dies die Fähigkeit des Modells verbessert, seine Arbeit zu überprüfen und mit langen Kontexten umzugehen. Außerdem wurde es auf ein grundlegendes Verständnis der Funktionsweise des Programmieragenten des Unternehmens, Grok Bot, trainiert, um seine Leistung bei dialogorientierten Aufgaben und allgemeiner Wissensarbeit zu steigern.

Zu den Verbesserungen gehören die Erstellung von Dokumenten und Präsentationen sowie die Bearbeitung spezialisierter Aufgaben, die die Arbeit von Anwälten, Pflegekräften und Finanzanalysten nachahmen. Im GDPval-Test erzielte Grok 4.7 eine Elo-Wertung von 1695 und lag damit vor Grok 4.6 mit 1605 und GPT-6 Astra mit 1542, blieb jedoch hinter Fable 5.1 mit 1735 zurück.

Fortgeschrittene Ergebnisse in einigen, aber nicht in allen Tests

Im CursorBench 4.0 für langwierige Programmieraufgaben erzielte Grok 4.7 46,3 %, gegenüber 40,4 % für Grok 4.6 und 41,7 % für GPT-5.6 Sol, während Fable 5.1 mit 51,8 % den Spitzenwert erreichte. Außerdem erzielte das Modell im Vergleich der Modelle die höchste Punktzahl im EEBench für Elektrotechnik mit 64,0 % sowie im Harvey Legal Agent Benchmark für juristische Aufgaben mit 19,6 %.

Der Vorsprung war jedoch nicht umfassend: Im Terminal-Bench 4.0 für langwierige Terminalaufgaben erreichte das Modell 38,0 %, gegenüber 57,9 % für Fable 5.1. Im HealthBench Professional für klinisches Schlussfolgern lag es bei 56,7 % und damit hinter GPT-5.6 Sol mit 60,5 % und Fable 5.1 mit 62,1 %. Diese Ergebnisse bedeuten, dass die Wahl des Modells weiterhin von der Art der Aufgabe abhängen wird und nicht allein von der allgemeinen Rangfolge oder dem Preis.

Preis und Verfügbarkeit

Der Preis der Grok-API beginnt bei zwei Dollar pro eine Million Eingabetoken und sechs Dollar pro eine Million Ausgabetoken. Zum Vergleich: GPT-5.6 Sol kostet vier Dollar für Eingaben und 20 Dollar für Ausgaben, während Fable 5.1 zehn Dollar für Eingaben und 50 Dollar für Ausgaben kostet. SpaceXAI bietet eine schnellere Version an, deren Geschwindigkeit doppelt so hoch ist wie bei der Basisversion, wobei sich auch der Preis verdoppelt.

Grok 4.7 wurde am selben Tag über Cursor und das Programmierwerkzeug Grok Build verfügbar, zusätzlich über die Grok-API und Programmierwerkzeuge von Drittanbietern, Modellrouter und Cloud-Computing-Plattformen.

Sicherheit und Zugang zu Testwerkzeugen

SpaceXAI erklärte, die Schutzmechanismen vollständig neu gestaltet und den Widerstand gegen Versuche, Beschränkungen zu umgehen, sowie die Ablehnung gefährlicher Anfragen verbessert zu haben. Das Modell erzielte im LatchBio-Sicherheitstest im Bereich Biologie 62,4 % und damit das höchste Ergebnis unter den von dem Unternehmen verglichenen Modellen. In HackerBench v0.3 bestand das Modell lediglich 3,3 % der Anfragen mit dualem Verwendungszweck und Cyberrisiken, wobei das Unternehmen angibt, es blockiere die Mehrheit der legitimen Sicherheitsaufgaben nicht.

SpaceXAI hat außerdem damit begonnen, einigen Cybersicherheitspartnern zu Forschungszwecken im Bereich der defensiven Sicherheit auf Einladung Zugang zu Red-Team-Funktionen zu gewähren. Diese Behauptungen bleiben mit den von dem Unternehmen ausgewählten Tests und seinen Methoden verbunden. Zudem zwingt die unterschiedliche Leistung in den einzelnen Bereichen Entwicklungs- und Geschäftsteams dazu, das Modell anhand der tatsächlichen Anwendungsfälle zu bewerten.

Nachrichtenquelle
ITmedia NEWS Japan
Originalquelle öffnen ↗
c
Autor

certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen