Sprachmodelle, Quellen

Sprachmodelle: 54% der Quellen illegitim oder nicht existent

Veröffentlicht am: 14.08.2026 um 15:30 Uhr | Redaktion boerse-global.de

Untersuchung von Just Facts zeigt: Chatbots nutzen hÀufig illegitime Quellen und weisen je nach Modell unterschiedliche politische Verzerrungen auf.

KI-Studie deckt politische Einseitigkeit und QuellenmÀngel bei Chatbots auf
Ein beleuchteter Serverraum mit modernen Computer-Racks in einer professionellen, technologischen Umgebung. Illustration mit AI erstellt.

Eine Mitte August veröffentlichte Untersuchung der Organisation Just Facts kommt zu dem Ergebnis, dass große Sprachmodelle bei der Beantwortung politischer Fragen eine messbare Einseitigkeit sowie erhebliche MĂ€ngel bei der Quellenarbeit aufweisen.

Die Studie bewertete insgesamt 100 politische Fragestellungen und stellte fest, dass die untersuchten Chatbots hĂ€ufig auf illegitime Quellen zurĂŒckgreifen oder Referenzen angeben, die faktisch nicht existieren.

Mangelhafte QuellengĂŒte und nicht existierende Referenzen

Im Rahmen der Studie wurden die Modelle ChatGPT, Gemini, Grok und Claude anhand von 419 zitierten Quellen ĂŒberprĂŒft. Dabei stellte sich heraus, dass lediglich 46 % dieser Quellen als gĂŒltig eingestuft werden konnten. Rund die HĂ€lfte der genutzten Referenzen erwies sich als illegitim.

Im Detail identifizierten die PrĂŒfer 104 Webseiten, die ĂŒberhaupt nicht existierten. In weiteren 77 FĂ€llen stĂŒtzten die verlinkten oder genannten Seiten die von der KĂŒnstlichen Intelligenz (KI) aufgestellten Behauptungen nicht.

Die Analyse der QuellenvaliditĂ€t nach einzelnen Modellen zeigt deutliche Unterschiede in der ZuverlĂ€ssigkeit. ChatGPT wies mit 57 % den höchsten Anteil an gĂŒltigen Quellen auf. Dahinter folgten Gemini mit 49 % und Claude mit 44 %.

Das Modell Grok schnitt in diesem Bereich am schwĂ€chsten ab; hier wurden lediglich 32 % der Quellen als gĂŒltig bewertet. Jim Agresti, der PrĂ€sident von Just Facts, betonte in diesem Zusammenhang, dass die Chatbots politische Fehlinformationen verbreiten und dabei auf ein fehlerhaftes Fundament aus Quellen angewiesen seien.

Anzeige

Wer sich professionell mit der ZuverlĂ€ssigkeit von KI befasst, muss auch die rechtlichen Rahmenbedingungen und Kennzeichnungspflichten kennen. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick ĂŒber alle Anforderungen und Fristen des EU AI Acts. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklĂ€rt

Unterschiedliche Genauigkeit bei politischen Positionen

Ein zentraler Aspekt der Untersuchung war die Genauigkeit der KI-Antworten in Bezug auf die politische Ausrichtung von Aussagen. Die Ergebnisse deuten auf ein Muster hin, bei dem die meisten Modelle bei der Einordnung rechter Aussagen eine höhere PrÀzision zeigten als bei linken Aussagen.

ChatGPT erreichte eine Genauigkeit von 94 % bei rechten Aussagen, wĂ€hrend der Wert bei linken Aussagen auf 75 % sank. Ein Ă€hnliches Bild zeigte sich bei Gemini mit 91 % Genauigkeit gegenĂŒber 76 % und bei Claude mit 91 % gegenĂŒber 81 %. In diesen FĂ€llen zeigten die Systeme laut der Studie eine geringere Genauigkeit bei der Identifizierung oder Bewertung linker Falschbehauptungen im Vergleich zu rechten.

Das Modell Grok wies hingegen ein gegenteiliges Muster auf. Hier lag die Genauigkeit bei linken Aussagen mit 84 % höher als bei rechten Aussagen, die mit 73 % bewertet wurden. Die Studienautoren sehen darin einen Beleg fĂŒr eine politische Voreingenommenheit, die sich je nach Modell in unterschiedliche Richtungen auswirkt.

Anzeige

Die Risiken beim Einsatz von KI-Systemen sind vielfĂ€ltig und reichen von fehlerhaften Ausgaben bis hin zu rechtlichen Fallstricken. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und wie Sie die Einhaltung der neuen EU-Verordnung sicherstellen. Welche KI-Systeme gelten als Hochrisiko – und was mĂŒssen Unternehmen jetzt konkret tun?

Reaktionen der Technologieunternehmen

Die von der Studie betroffenen Unternehmen reagierten unterschiedlich auf die Ergebnisse. Anthropic Ă€ußerte Zweifel an der Methodik der Untersuchung und stellte insbesondere das Multiple-Choice-Verfahren in Frage, das fĂŒr die Bewertung der Modelle genutzt wurde.

Die Unternehmen Google und OpenAI gingen nicht direkt auf die spezifischen Prozentwerte der Studie ein. Beide Konzerne betonten jedoch ihre kontinuierlichen BemĂŒhungen um Transparenz innerhalb ihrer Systeme. Sie verwiesen darauf, dass die Verbesserung der ZuverlĂ€ssigkeit und die Minimierung von Fehlern in den Modellen ein zentrales Ziel ihrer Entwicklungsarbeit bleibe.

Disclaimer...

de | wissenschaft | 69949576 |