Künstliche Intelligenz

OpenAI öffnet die Decisions API und ergänzt Bildanalyse für schnelle Entscheidungen

OpenAI hat die Decisions API in die öffentliche Testphase überführt und unterstützt nun Bilder sowie strukturierte Entscheidungsausgaben in Form von Wahrscheinlichkeiten, Auswahlmöglichkeiten oder Bewertungen. Der Schritt erfolgt im Wettbewerb mit Perplexity, Cloudflare und Amazon, wobei sich mehrere Alternativen grundlegend dadurch unterscheiden, dass sie die lokale Ausführung von Modellen ermöglichen.

2026-10-07
4 Min. Lesezeit
2 Aufrufe
certi.news Editorial Team
OpenAI öffnet die Decisions API und ergänzt Bildanalyse für schnelle Entscheidungen

OpenAI hat die Decisions API für Entwickler in der öffentlichen Testphase freigegeben und um die Möglichkeit erweitert, Bilder zu verarbeiten, um schnelle Entscheidungen aus visuellen Inhalten zu treffen. Die öffentliche Version läuft auf dem Modell GPT-6 Luna und ermöglicht die Umwandlung von Texten oder Bildern in drei Arten strukturierter Ausgaben: Wahrscheinlichkeiten zur Richtigkeit einer bestimmten Aussage, eine Auswahl aus einer festgelegten Liste und eine numerische Bewertung, die die Position der Eingabe innerhalb eines Bereichs bestimmt.

OpenAI berechnet für die API 0,10 US-Dollar pro einer Million Eingabetoken; für Ausgabetoken sowie Lese- und Schreibvorgänge des Zwischenspeichers fallen keine Gebühren an. Damit nimmt der Dienst eine andere Position ein als allgemeine Schlussfolgerungsmodelle: Die API konzentriert sich darauf, schnell eine bestimmte Entscheidung auszugeben, anstatt eine ausführliche Antwort zu erzeugen.

Von Spielen bis zu Robotern

In einer von OpenAI präsentierten Demonstration analysiert die API Bilder aus einem Videospiel, in dem sich ein Auto im Verkehr bewegt, und entscheidet anschließend, ob das Auto die Spur wechseln oder weiterfahren soll. Das Unternehmen erklärt, dass diese Entscheidungen nur einen Bruchteil der Zeit benötigen, die ein Schlussfolgerungsmodell für dieselbe Aufgabe benötigen könnte.

Das Unternehmen zeigt außerdem die Nutzung der API mit Kameraaufnahmen eines programmierbaren zweibeinigen Roboters von Hugging Face namens Microduck. Durch die Kombination der Decisions API mit dem Echtzeit-Sprachmodell GPT-Live kann das System die Position einer Frucht im Bild bestimmen und den Roboter als Reaktion auf einen Befehl wie „Folge dem Apfel“ zu ihr führen. Es kann auch mit einem unklareren Befehl wie „Folge der Frucht“ umgehen. Weitere Beispiele umfassen die Auswahl von Gesichtsausdrücken für eine animierte Figur während eines Sprachgesprächs.

Wettbewerb zwischen gehosteten und offenen Modellen

Der Schritt von OpenAI erfolgt nicht im luftleeren Raum. Perplexity hat das Modell pplx-decider-v1-27b mit einer Apache-2.0-Lizenz auf Hugging Face veröffentlicht. Es wurde auf Grundlage von Qwen3.8-27B feinabgestimmt. Laut Modellkarte erreichte es über 11 Benchmarks hinweg 85,71 Prozent, gegenüber 84,51 Prozent für das Modell Jev von TypeSafe. Jev war jedoch bei sechs von 11 Benchmarks überlegen, darunter WinoGrande, BBH und TruthfulQA binary.

Amazon stellte das herunterladbare Modell Strands Decider 2B vor, das auf Qwen3.5-2B basiert, und erklärte, es belege unter den öffentlichen Modellen mit etwa zwei Milliarden Parametern auf dem öffentlichen JevBench-Datensatz den zweiten Platz. Cloudflare veröffentlichte seinerseits die beiden Modelle Clef und Clef-flash mit offenen Gewichten und einer Apache-2.0-Lizenz; Clef ist außerdem über den Dienst Workers AI verfügbar. Clef und die OpenAI-API unterstützen Bilder, während Jev und Strands Decider auf Text beschränkt bleiben.

Was ist für Entwickler wichtig?

Die wichtigste Veränderung betrifft nicht nur die Hinzufügung von Bildern, sondern auch die Art der Bereitstellung des Modells. Die OpenAI-API ist als gehosteter Dienst verfügbar, während Perplexity, Amazon und Cloudflare das Herunterladen der Gewichte und die Ausführung der Modelle auf der eigenen Infrastruktur des Entwicklers ermöglichen. Daher werden neben Genauigkeit und Geschwindigkeit auch der Ausführungsort, die Datenkontrolle und die Betriebskosten in die Auswahl eines Entscheidungsmodells einfließen.

Die präsentierten Ergebnisse bleiben mit den Benchmarks verknüpft, die von den jeweiligen Anbietern getestet wurden. Außerdem bietet der Artikel keinen umfassenden unabhängigen Vergleich der Antwortzeiten, Betriebskosten oder der visuellen Leistung. Auf Grundlage der verfügbaren Angaben erweitert die Decisions API den Einsatz von Entscheidungsmodellen auf visuelle und interaktive Anwendungen. Sie klärt jedoch noch nicht, ob die Einfachheit eines gehosteten Dienstes die Flexibilität des lokalen Betriebs übertreffen wird.

Nachrichtenquelle
The New Stack - Software Development
Originalquelle öffnen ↗
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen