Anthropic gab am 25. August 2026 den Start eines Förderprogramms im Umfang von 5 Millionen US-Dollar bekannt, um unabhängige Forschung zu den Auswirkungen von KI auf das Wohlbefinden der Nutzer zu finanzieren. Das Programm wird Forschern, die quelloffene Bewertungsinstrumente entwickeln, die jeder Entwickler nutzen kann, direkte Finanzierung, Zugang zu den Modellen des Unternehmens und technische Unterstützung bieten.
Das Unternehmen erklärt, dass intelligente Systeme Teil von Arbeit, Lernen und Problemlösung geworden sind und dass manche Menschen sie als Gesprächspartner oder als Quelle emotionaler Unterstützung in schwierigen Zeiten nutzen. Dennoch fehlen der Branche weiterhin klare Standards dafür, wie Modelle reagieren sollten, wenn ein Nutzer Gesellschaft sucht oder versucht, eine Krise der psychischen Gesundheit zu bewältigen.
Warum ist es schwierig, das Wohlbefinden der Nutzer zu messen?
Anthropic ist der Ansicht, dass sich dieser Aspekt nicht auf die Prüfung einer einzelnen Antwort reduzieren lässt. Ein Nutzer offenbart möglicherweise zu Beginn eines Gesprächs keine Gedanken an Selbstverletzung, während sich der Bedarf an einer vorsichtigeren Reaktion erst nach mehreren Nachrichten zeigen kann. Ebenso kann ein in einem Kontext angemessener Rat in einem anderen Kontext schädlich sein.
Das Unternehmen nennt als Beispiel einen Rat zu ausgewogener Ernährung oder Bewegung für einen Nutzer, der nach Gewichtsabnahme fragt. Dieser Rat kann ungeeignet oder tatsächlich schädlich werden, wenn der Nutzer eine Vorgeschichte mit Essstörungen offenlegt. Anthropic erklärt, dass es daran arbeitet, Schutzmaßnahmen zur Erkennung dieser Muster zu entwickeln, und Forschung über die Arten von Gesprächen veröffentlicht, die Nutzer mit Claude führen, um diese Schutzmaßnahmen und ihre Bewertungsmethoden zu verbessern.
Wonach werden die Förderungen suchen?
Die Safeguards-Abteilung von Anthropic hat Leitlinien für Bewertungen und Referenzstandards veröffentlicht, auf denen ihrer Ansicht nach aufgebaut werden kann. Zu den grundlegenden Kriterien gehören:
- Klar festzulegen, was gemessen wird, was Erfolg oder Misserfolg darstellt und warum dies wichtig ist.
- Klinische Experten und Fachleute in die Gestaltung der Bewertung und die Überprüfung ihrer Gültigkeit einzubeziehen.
- Vorsichtsmaßnahmen und Schäden gemeinsam zu testen, einschließlich der Risiken übermäßiger Zustimmung und übermäßiger Ablehnung.
- Die Art und Weise zu simulieren, wie Menschen KI nutzen, insbesondere durch mehrstufige Gespräche, in denen sich der Kontext verändert und das Risiko zunehmen kann.
- Die Genauigkeit automatisierter Bewertungsinstrumente durch den Vergleich mit den Einschätzungen tatsächlicher Experten zu überprüfen.
Was ändert sich in der Praxis?
Anthropic kündigt keinen fertigen einheitlichen Standard an, sondern finanziert die Entwicklung unabhängiger und offener Bewertungen, die der Branche dabei helfen können, eine solche Grundlage zu entwickeln. Die Bedeutung dieses Schritts liegt darin, die Diskussion von der Prüfung der Sicherheit einzelner Antworten auf die Untersuchung des Modellverhaltens in einem vollständigen Gespräch zu verlagern und dabei den unterschiedlichen Kontext sowie die Möglichkeit indirekter Schäden zu berücksichtigen.
Die Förderempfänger werden vollständig unabhängig arbeiten und ihre Arbeiten als Open-Source-Projekte veröffentlichen. Der Aufruf richtet sich unter anderem an Ärzte, Psychiater, Methodikexperten und weitere Fachleute. Bewerbungsschluss ist der 21. September; die zur Einreichung vollständiger Vorschläge eingeladenen Stellen werden bis zum 5. Oktober benachrichtigt.
Die Wirksamkeit des Programms bleibt davon abhängig, ob es den Forschern gelingt, komplexe Konzepte wie Wohlbefinden und psychischen Schaden in messbare und überprüfbare Kriterien zu übertragen. Auch die Finanzierung von Bewertungen allein entscheidet nicht darüber, wie ihre Ergebnisse bei der Entwicklung von Schutzbarrieren oder im Umgang mit sensiblen Fällen eingesetzt werden.