Künstliche Intelligenz

GitHub testet HydraFusion zur Orchestrierung mehrerer KI-Modelle in Copilot

GitHub hat eine Forschungsvorschau des Projekts HydraFusion gestartet, das während der Laufzeit zwischen mehreren Modellen und Workflows zur Erstellung und Überprüfung von Programmlösungen auswählt oder an ein leistungsfähigeres Modell eskaliert. In Offline-Tests erzielte das System in einigen Vergleichen eine ähnliche oder bessere Qualität als Claude Opus 5 und senkte dabei die geschätzten Kosten.

2026-09-04
4 Min. Lesezeit
10 Aufrufe
فريق تحرير certi.news
GitHub testet HydraFusion zur Orchestrierung mehrerer KI-Modelle in Copilot

GitHub hat am 4. September 2026 Project HydraFusion angekündigt, ein als Forschungsvorschau verfügbares Projekt innerhalb von GitHub Copilot zur Orchestrierung von KI-Modellen mehrerer Anbieter während der Ausführung von Programmieraufgaben. Statt im Voraus ein einzelnes Modell auszuwählen, erstellt HydraFusion einen Ausführungsplan und bestimmt, ob die Aufgabe eine direkte Lösung, eine unabhängige Überprüfung oder eine Eskalation an ein leistungsfähigeres Modell erfordert.

Der Schritt folgt auf die Anfang des Jahres von GitHub eingeführte Funktion Auto model selection zur Auswahl des geeignetsten Modells für jede Aufgabe. HydraFusion erweitert diese Idee jedoch von der Modellauswahl auf den Aufbau eines vollständigen Workflows, der Ergebnisqualität, Kosten und Antwortzeit ausbalanciert, während die betriebliche Komplexität vor dem Entwickler verborgen bleibt, der HydraFusion in Copilot wie jedes andere Modell auswählt.

Drei Pfade zur Ausführung der Aufgabe

Das System bewertet Signale im Zusammenhang mit Schlussfolgerungen, Codegenerierung, Fehlerbehebung und Tool-Nutzung und wählt anschließend einen von drei Ausführungsmodi:

  • Single: Ein einzelnes Modell übernimmt die direkte Lösung der Aufgabe, wenn seine Fähigkeiten ausreichen.
  • Cascade: Ein effizienteres Modell erstellt zunächst die Lösung. Anschließend entscheidet ein Qualitäts-Gateway, ob sie übernommen oder die Aufgabe an ein leistungsfähigeres Modell weitergeleitet wird.
  • Critique: Ein Modell erstellt eine erste Lösung. Danach überprüft ein unabhängiges Modell aus einer anderen Familie diese Lösung in einem schreibgeschützten Kontext, bevor das erste Modell eine einmalige Überarbeitung der Lösung vornimmt.

GitHub zufolge besteht das Ziel der Selektivität darin, zusätzliche Aufrufe nur dann zu verwenden, wenn zu erwarten ist, dass sie das Ergebnis verbessern. Dadurch bewahrt der direkte Pfad Geschwindigkeit und Effizienz, während die beiden anderen Pfade für Aufgaben, die davon profitieren, eine Überprüfung oder Eskalation hinzufügen.

Was die Tests gezeigt haben

GitHub bewertete feste HydraFusion-Richtlinien anhand von drei Tests für Programmieragenten: TerminalBench 2.1, DeepSWE und dem internen CheckpointBench, der auf realen Sitzungen in GitHub Copilot basiert. Die Ergebnisse wurden mit zwei Ausgangswerten verglichen: Claude Opus 5 und GPT-5.6 Sol. Dabei wurden identische Eingaben, Tools, Ausführungsgrenzen, Preisannahmen und Bewertungsbedingungen verwendet.

In TerminalBench 2.1 erzielte HydraFusion eine Verbesserung von 4,9 Prozentpunkten bei der Qualität der verifizierten Aufgaben und senkte die geschätzten Workflow-Kosten im Vergleich zu Claude Opus 5 um 67 %. In DeepSWE, das sich auf Repository-weite Softwareentwicklungsaufgaben und das Verständnis von Abhängigkeiten zwischen Dateien konzentriert, lag das System 1,5 Prozentpunkte hinter Opus 5, bei 36 % niedrigeren Kosten. Bei CheckpointBench betrug der Qualitätsunterschied lediglich 0,1 Prozentpunkte, während die Kosten um 65 % sanken.

Die Kostenabrechnung umfasst alle Ausführungsphasen, einschließlich Erstellung, Überprüfung, Änderung, Eskalation, erneuter Versuche und Rückfallplänen. GitHub beschreibt diese Ergebnisse jedoch als Offline-Tests, die durch die verwendeten Testversionen, Workflow-Einstellungen, die Modellgruppe und die Preisannahmen begrenzt sind.

Betriebskontrollen und Grenzen der Vorschau

GitHub hat HydraFusion mit Kontrollen konzipiert, die die Erfassung von Kosten und Nutzung für jede Phase, die Festlegung von Abbruch- und Ausführungszeitüberschreitungen sowie die Isolierung von Überprüfungsschritten in Kontexten ohne Tools und ohne Änderungsmöglichkeit am Repository umfassen. Das System prüft außerdem im Voraus Workflow-Definitionen, die Modellzuordnung, das Verhalten von Ersatzoptionen und die Verfügbarkeit von Modellen. Es nimmt keine Korrektur vor, wenn der Vorgang abgebrochen wird oder eine Verifizierung fehlschlägt.

GitHub empfiehlt derzeit, die Erprobung mit großen, klar definierten Programmieraufgaben zu beginnen, die in einer einzigen Eingabe im automatischen Betriebsmodus an Copilot gesendet werden. Das Unternehmen will sich später auf die Verbesserung der Leistung längerer Sitzungen mit mehreren Rollen konzentrieren. Zudem weist es darauf hin, dass sich Modelle, Workflows, Namen, Verfügbarkeit und Produktverhalten während der Vorschauphase ändern können.

Redaktionelle Einordnung: Vom Modell auswählen zum Workflow entwerfen

Die wichtigste Veränderung besteht hier nicht in der Hinzufügung eines neuen Modells, sondern darin, die Ausführungsentscheidung vom Entwickler auf eine Orchestrierungsebene zu verlagern, die bestimmt, wann ein einziger Versuch ausreicht und wann die Aufgabe die Kosten einer Überprüfung oder Eskalation rechtfertigt. Wenn sich die Testergebnisse auf die tatsächliche Nutzung übertragen lassen, könnte dies Entwicklern bei bestimmten Aufgaben eine Qualität nahe der leistungsfähigsten Modelle ermöglichen, ohne deren Kosten bei jeder Anfrage zu verursachen.

Die Zahlen belegen jedoch noch keinen allgemeinen Vorsprung bei allen Programmiermustern; sie beziehen sich auf bestimmte Tests, festgelegte Richtlinien und Offline-Ergebnisse. Fragen zur Antwortzeit, Zuverlässigkeit, zum Systemverhalten in langen Sitzungen, zur Effizienz des Caching und zur Sicherheit bleiben offen. GitHub zufolge sollen diese Aspekte während der Vorschau gemessen werden.

Nachrichtenquelle
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen