Medizintechnik

FDA finanziert Test zum Einsatz von Sprachmodellen zur Bewertung KI-generierter Radiologieberichte

Die US-amerikanische Food and Drug Administration hat Cognita Imaging einen Forschungsauftrag im Wert von 1,29 Millionen US-Dollar erteilt, um die Fähigkeit einer Gruppe großer Sprachmodelle zur Bewertung radiologischer Berichte zu testen, die von KI-Systemen erstellt wurden. Das Projekt soll Halluzinationen und Auslassungen messen und Fälle bestimmen, in denen die Überprüfung durch einen Radiologen erforderlich ist.

2026-09-18
4 Min. Lesezeit
14 Aufrufe
فريق تحرير certi.news
FDA finanziert Test zum Einsatz von Sprachmodellen zur Bewertung KI-generierter Radiologieberichte

Die US-amerikanische Food and Drug Administration hat Cognita Imaging einen Forschungsauftrag im Wert von 1,29 Millionen US-Dollar erteilt, um eine neue Methode zur Bewertung medizinischer Berichte zu testen, die von KI-Systemen in der Radiologie erstellt werden. Der Auftrag begann am 22. Juni 2026 und läuft über 18 Monate. Untersucht wird, ob ein „Komitee“ aus großen Sprachmodellen eingesetzt werden kann, um die Ausgaben eines anderen Modells zu überprüfen und Fälle zu bestimmen, die den Eingriff eines Radiologen erfordern.

Das Projekt arbeitet mit dem Team für Regulierungswissenschaften des Center for Devices and Radiological Health der FDA zusammen. Cognita wird den Bewertungsrahmen entwickeln und ihn an einer Million Untersuchungen von Patienten aus einer großen US-amerikanischen Kohorte testen. Dabei soll die Leistung über verschiedene Patientengruppen, Versorgungsumgebungen, Bildgebungsgeräte und Erkrankungen hinweg verglichen werden, darunter auch seltene Fälle.

Das Problem der offenen Bewertung

Die meisten von der FDA zugelassenen KI-Tools in der Radiologie werden für eine bestimmte Aufgabe bewertet, etwa für die Erkennung eines Blutgerinnsels in einer Kopf-CT oder eines Pneumothorax auf einer Röntgenaufnahme des Brustkorbs. Neuere Modelle streben dagegen an, einen vollständigen radiologischen Bericht zu erstellen. Dadurch wird der Bewertungsumfang erheblich größer, da ein Bericht Hunderte potenzieller Befunde enthalten kann statt nur eines oder zweier Ergebnisse.

Akshay Chaudhari, Mitgründer von Cognita und außerordentlicher Professor für Radiologie und biomedizinische Datenwissenschaft an der Stanford University, erklärte, dass die fortlaufende Bewertung solcher Ausgaben durch Gremien aus Radiologen schwieriger und zeitaufwendiger werde.

Wie werden die Ergebnisse überprüft?

Cognita wird mehrere Sprachmodelle einsetzen, um die Berichte der radiologischen Modelle zu überprüfen. Wenn klinisch bedeutsame Abweichungen auftreten, greifen Radiologen ein, um die Ursache des Problems zu bestimmen: den KI-generierten Bericht, das „Komitee“ der Sprachmodelle oder den ursprünglichen Bericht, den der Radiologe verfasst hat.

Das Projekt konzentriert sich auf zwei bekannte Risiken generativer KI: Halluzinationen, also das Einfügen von Informationen, die plausibel erscheinen, aber falsch sind, und Auslassungen, also das Nichterwähnen eines Befunds, der hätte aufgenommen werden müssen. Die Methodik soll die Rate beider Fehlerarten messen und bestimmen, ob ihre Auswirkungen klinisch relevant sind.

Warum ist diese Nachricht wichtig?

Der regulatorische Wert des Projekts liegt nicht in der Zulassung eines neuen Tools, da das untersuchte System keine Zulassung der FDA erhalten hat. Wichtiger ist die Prüfung, ob sich Methoden zur Bewertung generativer KI ausweiten lassen, ohne bei sensiblen Fällen auf die menschliche Überprüfung zu verzichten. Sollte sich die Methodik als valide erweisen, könnte sie der Aufsichtsbehörde einen besser anwendbaren Rahmen für die Bewertung von Tools liefern, die offene Texte erzeugen.

Cognita wird der FDA einen Bericht mit den Ergebnissen und Einschränkungen, den Quellcode, Leitlinien zur Entwicklung von Sprachmodellkomitees, Vergleiche zwischen großen und kleinen Validierungsgruppen sowie von Radiologen überprüfte Differenzanalysen vorlegen. Der Auftrag legt jedoch nicht im Voraus fest, dass die Urteile der Sprachmodelle eine Alternative zu Experten sein werden. Klinisch relevante Abweichungen werden weiterhin eine menschliche Überprüfung erfordern. Zudem gehört die Gültigkeit der Methode über verschiedene Geräte, Patienten und Erkrankungen hinweg zu den Fragen, die der Test beantworten soll.

Ein separater Weg für ein Bild-Text-Modell

Cognita arbeitet außerdem mit der FDA an einem Bild-Sprach-Modell, das Röntgenaufnahmen des Brustkorbs interpretiert und Berichte erstellt, die von einem Radiologen überprüft werden. Dieses Gerät erhielt Anfang 2026 von der FDA die Einstufung als „Breakthrough Device“, wurde jedoch noch nicht zugelassen. Chaudhari betonte, dass dieser Weg vom Forschungsauftrag getrennt sei und das Unternehmen sowie die Aufsichtsbehörde weiterhin festlegten, welche klinische Studie erforderlich sei, um Genauigkeit, Nutzen und Risiken zu messen.

Cognita wurde 2024 gegründet und 2025 von Radiology Partners übernommen. Die Arbeit findet vor dem Hintergrund eines Mangels an Radiologen in den Vereinigten Staaten statt, der mit längeren Arbeitszeiten und einem Rückstau von Fällen verbunden ist. Das Projekt bietet noch keine zugelassene Lösung für diesen Mangel, befasst sich jedoch mit einem praktischen Hindernis bei der Bewertung von Tools, die zur Unterstützung bei der Erstellung von Berichten eingesetzt werden könnten.

Nachrichtenquelle
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen