Elon Musk kündigte an, dass Grok Bot für jede Aufgabe das geeignetste Modell für künstliche Intelligenz auswählen werde, statt sich dauerhaft auf Grok zu verlassen. Musk schrieb, dass SpaceX das „beste Backend-Modell“ verwenden werde, um das bestmögliche Ergebnis zu erzielen, und nannte Claude Opus 5.5, MidJourney, Suno und weitere Schnittstellen als mögliche Optionen.
Grok Bot ist ein gemeinsames Produkt von SpaceXAI, dem zu Musk gehörenden KI-Labor, das in SpaceX integriert wurde, und Cursor. SpaceX hatte im Juni zugestimmt, Cursor für 60 Milliarden US-Dollar in Aktien zu kaufen; der Abschluss der Transaktion erfolgte im August. Grok Bot wurde im selben Monat als Beta-Version eingeführt.
Modell-Routing wird zu einem Mittel zur Kostensenkung
Der Artikel beschreibt diesen Ansatz als „Modell-Routing“: Jede Anfrage wird an das Modell weitergeleitet, das für die Art der Arbeit und deren Kosten geeignet ist, während teurere Modelle für komplexere Aufgaben vorbehalten bleiben. Laut Interviews, die der Autor mit Führungskräften von 22 Unternehmen im Rahmen der Veranstaltung ScaleUp:AI von Insight Partners führte, erklärten mindestens zehn von ihnen, dass sie diesem Ansatz folgen.
In einem Beispiel verwendet ein Sicherheitsunternehmen zunächst eine regelbasierte Engine zur Prüfung der Daten und leitet anschließend den verbleibenden Teil an kleinere Modelle weiter. Einer seiner Verantwortlichen sagte, die Weiterleitung eines Petabytes an Daten durch ein beliebiges Modell könne selbst dann, wenn es klein sei, Millionen von Dollar kosten. In einem anderen Beispiel wird ein kostengünstiges Modell eingesetzt, um die Anfrage des Nutzers zu verstehen, bevor sie zur Ausführung der Aufgabe an ein teureres Modell weitergeleitet wird.
Der Hauptgrund ist die Kontrolle der Ausgaben für Tokens. Einige Unternehmen begannen mit offenen Budgets für künstliche Intelligenz und kehrten dann zu einer präziseren Frage zurück: Was haben sie tatsächlich für all diese Tokens gekauft? Andere Unternehmen versuchen außerdem, ihre Beschäftigten darin zu schulen, das passende Modell auszuwählen, statt automatisch das leistungsfähigste Modell zu verwenden.
Günstigere Modelle übernehmen den Großteil des Volumens
Die Daten von OpenRouter, einem Dienst, der über eine einzige Verbindung den Zugriff auf Hunderte von Modellen ermöglicht, spiegeln diesen Trend wider. In der Woche bis zum 7. Oktober 2026 gehörten vier schnelle und kostengünstige Flash-Modelle gemessen an der Token-Anzahl zu den zehn meistgenutzten Modellen. DeepSeek V4.1 Flash führte die Liste mit 33,6 Billionen Tokens an, gefolgt von GLM 5.3 Flash mit 10,5 Billionen und MiMo-V2.6-Flash mit 10,1 Billionen.
Im Gegensatz dazu stieg die Nutzung von Claude Opus 5.5 innerhalb einer Woche um 74 Prozent auf 3,37 Billionen Tokens, blieb gemessen am Volumen jedoch auf Rang neun. Der Artikel erklärt dies damit, dass das fortschrittliche Modell einen wachsenden Anteil der Aufgaben erhält, aber nicht den Großteil des Nutzungsverkehrs übernimmt.
Die in Tests von The New Stack genannten Ergebnisse deuten darauf hin, dass günstigere Modelle in vielen Fällen ausreichen könnten: Claude Sonnet 5.5 bestand alle 15 Programmier-Tests und kostete dabei 42 Prozent weniger als Opus 5.5, während GPT-6.1 Sol die Genauigkeit von GPT-6 Astra zu Kosten von 18 Prozent derselben erreichte.
Was ändert sich praktisch?
Der Wandel bedeutet nicht, dass das leistungsfähigste Modell überflüssig geworden ist, sondern dass seine Auswahl zu einer betrieblichen Entscheidung geworden ist, die Steuerung und Tests erfordert. Der Artikel warnt vor den Risiken eines schnellen Wechsels: Ein Engineering-Team scheiterte, nachdem es vor einer wichtigen Präsentation ein Modell durch ein anderes ersetzt hatte, und musste die Änderung anschließend zurücknehmen. Die Schlussfolgerung lautete, dass vor einem Modellwechsel Evaluierungstests durchgeführt werden müssen.
Die Daten von OpenRouter bleiben ein Indikator und keine vollständige Messung des Marktes, da sie die Nutzer eines Dienstes widerspiegeln, die sich ursprünglich für die Verwendung eines Modell-Routers entschieden haben. Außerdem messen Token-Zahlen weder die Zahl der Nutzer noch die Ausgaben, und Verträge mit Unternehmen könnten stabiler sein. Das Zusammenspiel dieses Indikators mit den Praktiken der interviewten Unternehmen und der Ankündigung von Grok Bot macht jedoch deutlich, dass die Bindung an ein einzelnes Modell zugunsten einer Struktur abnimmt, die das Modell anhand der Aufgabe und der Kosten auswählt.