Buzzmatic

KI-Halluzinationen: warum KI Fakten erfindet

KI-Modelle erfinden Quellen, Zahlen und Zitate, überzeugend formuliert und ohne Warnsignal. Dieser Deep-Dive erklärt die Ursachen und zeigt, wie du das Risiko systematisch senkst.

Fortgeschritten13 Min. LesezeitZuletzt aktualisiert: 21. September 2026

Das lernst du hier

  • Welche technischen Ursachen hinter erfundenen Fakten stecken
  • Woran du besonders halluzinationsanfällige Aufgabentypen erkennst
  • Welche Gegenmaßnahmen wirklich wirken und welche nur beruhigen
  • Wie ein praxistauglicher Qualitätssicherungsprozess fürs Team aussieht
  • Wie du mit dem verbleibenden Restrisiko verantwortlich umgehst

KI-Halluzinationen in einem Satz

Eine KI-Halluzination ist eine sachlich falsche Aussage, die ein Sprachmodell mit absoluter Selbstsicherheit formuliert. Typische Beispiele sind erfundene Quellen, falsche Zahlen, nicht existierende Urteile und Zitate, die nie gesagt wurden.

Das Tückische ist nicht der Fehler selbst, sondern das fehlende Warnsignal. Ein Mensch, der etwas nicht weiß, zögert oder sagt es. Ein Sprachmodell formuliert in beiden Fällen gleich flüssig. Deshalb ist die Halluzination das größte Qualitätsrisiko im professionellen KI-Einsatz, und keines, das sich einfach wegkonfigurieren lässt.

Faithfulness und factualness: zwei Arten von falsch

Stell dir einen Übersetzer vor, der ein Rezept perfekt übersetzt, in dem aber Salz statt Zucker steht. Die Übersetzung ist treu zur Vorlage, aber sachlich falsch. Genau diese Unterscheidung ist bei KI wichtig.

Fraunhofer trennt zwei Fehlerarten. Faithfulness meint die Treue zur mitgegebenen Quelle. Factualness beschreibt die faktische Richtigkeit in der echten Welt. Eine Antwort kann der angehängten Quelle exakt folgen und trotzdem falsch sein. Sie kann auch richtig sein, ohne in der Quelle zu stehen. Wer nur eine Ebene prüft, findet nur die Hälfte der Fehler.

Vier Erscheinungsformen

TÜVIT unterscheidet vier Arten von KI-Halluzinationen.

  • Satzwiderspruch: Ein Satz widerspricht einem anderen innerhalb derselben Antwort.
  • Widerspruch zum Prompt: Die Antwort weicht von deiner Anweisung ab, etwa beim gewünschten Format.
  • Faktischer Widerspruch: Die Aussage widerspricht dem gesicherten Wissen über die Welt.
  • Zufällige Halluzination: Ein Detail taucht auf, das überhaupt nicht zur Frage gehört.

Warum der Begriff umstritten ist

Der Begriff Halluzination beschreibt eigentlich eine Sinnestäuschung. Er schreibt dem Rechner ein menschliches Erleben zu, das er nicht hat. Als präzisere Alternative kursiert das Wort Konfabulation. Das bedeutet, dass eine Erinnerungslücke mit erfundenem Material aufgefüllt wird.

Diese Fehler gibt es auch außerhalb von Texten. Bildmodelle zeichnen Hände mit sechs Fingern, die Objekterkennung ordnet Muster falsch zu, und Transkriptionen erfinden Wortfetzen. Dieser Artikel behandelt Sprachmodelle, weil dort das größte Risiko im Arbeitsalltag entsteht. Den Bildteil behandelt KI-Bilder generieren.

Die Ursachen: fünf Ebenen

KI halluziniert nicht wegen eines Softwarefehlers. Erfundene Fakten entstehen durch fünf gleichzeitig wirkende Eigenschaften der Technologie.

Die fünf Ebenen, auf denen Halluzinationen entstehen: vom Formulieren bis zum fehlerhaften Kontext URSACHEN FORMULIEREN Wahrscheinlichkeit statt Nachschlagen KOMPRESSION seltene Details verschwimmen LÜCKENFÜLLEN Antworten wird belohnt, Schweigen nicht ZUFALL kreative Auswahl beim Ausgeben 1 KONTEXT falsche Quelle, korrekte Fußnote

Erfundene Fakten entstehen nicht durch einen Fehler im System, sondern durch fünf gleichzeitig wirkende Eigenschaften seiner Funktionsweise.

1. Das Modell weiß nichts, es formuliert

Ein Sprachmodell speichert keine Fakten in einer abfragbaren Datenbank. Es hat lediglich gelernt, welche Wortfolgen wahrscheinlich aufeinander passen. Auf die Frage nach einer Studie erzeugt es deshalb etwas, das wie eine Studienangabe aussieht. Es kombiniert einen plausiblen Autor, ein Jahr und einen Zeitschriftentitel. Ob diese Kombination wirklich existiert, ist für den Erzeugungsvorgang unwichtig. Die technische Grundlage dazu erklärt Wie funktioniert KI?

2. Wissen wird komprimiert, nicht abgelegt

Trainingsdaten werden in Modellparameter verdichtet, und diese Kompression ist verlustbehaftet. Häufige Fakten überleben diesen Prozess sehr gut. Seltene Details verschwimmen jedoch. Das betrifft Randfiguren, kleine Unternehmen, Nischenprodukte und präzise Zahlen. Modelle sind bei Allgemeinwissen deshalb verlässlich und bei Spezialdetails unzuverlässig. Das ist genau umgekehrt zu dem, was Nutzende meist erwarten.

3. Lücken werden gefüllt statt markiert

Sprachmodelle sind darauf optimiert, eine hilfreiche Antwort zu liefern. Aus dem Training mit menschlichem Feedback haben sie gelernt, dass vollständige Antworten besser bewertet werden als das Eingeständnis von Unwissen. Diese Belohnungsstruktur erzeugt einen systematischen Anreiz zum Raten. OpenAI beschreibt diesen Mechanismus in der Veröffentlichung „Why Language Models Hallucinate" von 2025. Solange Bestenlisten so messen, bleibt dieser Anreiz bestehen.

4. Der Zufall in der Formulierung

Bei der Textausgabe wählt das Modell nicht immer den wahrscheinlichsten nächsten Baustein. Es zieht zufällig aus den besten Kandidaten. Das sorgt für sprachliche Vielfalt, aber auch für Abweichungen. Je kreativer die Einstellung ist, desto höher wird das Erfindungsrisiko. Zwei identische Prompts liefern deshalb selten zwei identische Antworten.

5. Der Kontext selbst ist fehlerhaft

Auch eine Quellenanbindung löst das Problem nicht komplett. Wenn die abgerufenen Dokumente widersprüchlich oder veraltet sind, entsteht eine falsche Antwort mit korrekt aussehender Quellenangabe. Das ist gefährlich, weil die Fußnote ein Vertrauen erzeugt, das der Inhalt nicht verdient. Eine Analyse von Imperial College London, Stanford und Internet Archive stufte bis Mitte 2025 rund 35 Prozent der neuen Websites als KI-generiert ein. Wer das offene Web nutzt, stützt sich also oft auf Modellausgaben. Wie du Antworten stattdessen an eigene Quellen bindest, zeigt der Artikel zu RAG.

Wo Halluzinationen besonders häufig auftreten

Halluzinationen folgen klaren Mustern. Bestimmte Aufgabentypen sind echte Risikozonen.

Risikozone

Warum

Typischer Fehler

Quellen und Zitate

Formate sind leicht nachzubilden, Inhalte nicht

Existierende Autoren, erfundene Titel und DOIs

Zahlen und Statistiken

Zahlen sind seltene, schwach verankerte Details

Plausible Prozentwerte ohne Grundlage

Recht und Normen

Paragraphenstruktur ist hochgradig musterhaft

Falsch zugeordnete Absätze, erfundene Urteile

Aktuelles

Liegt jenseits des Trainingsstands

Veralteter Stand, souverän als aktuell präsentiert

Nischen und Eigennamen

Zu wenig Trainingsmaterial

Verwechselte Personen, erfundene Produktdetails

Rechnen in Fließtext

Sprachmuster statt Arithmetik

Rechenwege stimmen, Ergebnisse nicht

Woran du eine Halluzination erkennst

Eine Halluzination zu erkennen, bedeutet nicht zu raten. Es gibt klare Signale im Text und drei verlässliche Prüfgriffe.

Vier Warnsignale im Text

  • Die Quellenangabe ist ungewöhnlich glatt. Autor, Jahr, Titel und Zeitschrift passen perfekt zusammen, als kämen sie aus einem Formularfeld.
  • Eine Zahl ist auffällig rund. 30 Prozent, jeder Dritte, eine Verdopplung. Echte Messwerte sind in der Realität meistens unrund.
  • Ein Eigenname steht ohne Kontext. Eine Person, ein Institut oder ein Produkt taucht plötzlich auf, ohne dass die Herkunft erklärt wird.
  • Die Detailtiefe passt nicht zur Frage. Du fragst ganz allgemein und bekommst sofort ein Aktenzeichen oder ein exaktes Datum geliefert.

Drei Prüfgriffe, die funktionieren

  1. Quelle öffnen und die Stelle suchen. Prüfe nicht nur, ob der Link existiert. Du musst die Aussage im Dokument finden. Fehlt die Stelle, ist die Angabe falsch belegt.
  2. Eigennamen und Zahlen unabhängig gegenprüfen. Nutze einen zweiten Kanal mit Zugriff auf die Originaldaten. Schau in ein Register, ein Amtsblatt oder eine Fachdatenbank.
  3. Dieselbe Frage kalt neu stellen. Öffne einen neuen Chat ohne Vorlauf. Wenn die Details jetzt abweichen, hat das Modell vorher geraten.

Der verbreitete Irrtum: das Modell fragen

Das Modell zu fragen, ob es sich sicher ist, ist keine echte Prüfung. Die Selbsteinschätzungen von Sprachmodellen haben wenig mit der tatsächlichen Korrektheit zu tun. Ein Modell bestätigt auf Nachfrage sehr bereitwillig eine erfundene Quelle. Der bekannteste Gerichtsfall zu diesem Thema ist genau daran gescheitert.

Belegte Fälle und was sie lehren

Echte Fälle zeigen, wie schnell erfundene Fakten in die professionelle Arbeit rutschen. Sie zeigen auch, wo die menschliche Kontrolle versagt hat.

2023 bis 2024: Gerichtsakten und Chatbot-Auskünfte

Der erfundene Rechtsprechungskatalog. Im Verfahren gegen Avianca vor dem Southern District of New York reichten Anwälte 2023 einen Schriftsatz ein. Dieser berief sich auf mehrere Gerichtsentscheidungen, von denen keine existierte. Ein Chatbot hatte sie inklusive Aktenzeichen erzeugt und auf Nachfrage bestätigt. Das Gericht sanktionierte die Anwälte. Lehre: Ein Modell nach der Korrektheit seiner eigenen Ausgabe zu fragen, funktioniert nicht.

Der teure Chatbot-Rat. Ein Chatbot von Air Canada beschrieb einem Kunden eine Tarifregel, die es gar nicht gab. Das Civil Resolution Tribunal in British Columbia entschied im Februar 2024, dass das Unternehmen für diese Auskunft einstehen muss. Lehre: Was dein KI-System nach außen sagt, sagst du.

Der Fehler in der Produktdemo. In der öffentlichen Bard-Demo im Februar 2023 ordnete die KI eine astronomische Erstaufnahme falsch dem James-Webb-Teleskop zu. Fachleute korrigierten das innerhalb von Stunden. Lehre: Halluzinationen erwischen auch die Hersteller selbst in bestens vorbereiteten Situationen.

Seit 2025: Halluzinationen in Berichten und Studien

Die aktuellen Fälle betreffen oft Beratungshäuser. Deloitte Australien lieferte 2025 einen Prüfbericht mit erfundenen Quellenangaben und einem falsch wiedergegebenen Gerichtsurteil. KPMG nahm 2026 einen Bericht zu agentischer KI vom Netz, weil die Financial Times darin erfundene Fallstudien gefunden hatte. EY zog im selben Jahr eine Studie zu Cyberrisiken zurück, weil viele Fußnoten auf nicht existierende Quellen zeigten.

Diese drei Fälle treffen den Kern der täglichen Arbeit. Die Fehler entstanden nicht primär im Modell, sondern weil der Prüfschritt davor fehlte. Sie passierten in genau den Dokumenten, die B2B-Teams jeden Tag produzieren.

Laufend aktuell: die Falldatenbank

Gerichtsentscheidungen mit halluzinierten Fundstellen werden in einer öffentlichen Datenbank gesammelt. Sie erscheint unter damiencharlotin.com und erfasst diese Fälle weltweit. Diese Liste ist verlässlicher als jeder Artikel, weil sie nicht altert.

Wie hoch die Fehlerquote in deiner eigenen Arbeit liegt, sagt dir keine Fremdstudie. Das beantwortet nur eine eigene Stichprobe. Nimm zehn typische Fachfragen aus deinem Gebiet. Stelle sie mit und ohne Webrecherche, öffne jede genannte Quelle und zähle aus, wie oft die Aussage tatsächlich darin steht.

Gegenmaßnahmen: was wirklich hilft

Halluzinationen lassen sich nicht mit einem einzigen Trick vermeiden. Du brauchst eine Kombination von Maßnahmen, sortiert nach ihrer Wirkung.

  1. Quellen mitliefern statt abfragen. Gib dem Modell die relevanten Dokumente mit. Weise es an, ausschließlich daraus zu antworten. Aus „Was steht im Vertragsrecht zu X?" wird „Beantworte anhand des angehängten Vertrags. Steht die Antwort nicht darin, sage das." Lesen können Modelle viel besser als Erinnern.
  2. Webrecherche mit Quellenzwang erzwingen. Aktiviere für aktuelle Themen den Recherchemodus. Bestehe auf Belegen und öffne diese Belege dann auch. Wo die Grenzen liegen, zeigt Deep Research.
  3. Unsicherheit ausdrücklich erlauben. Ein Satz im Prompt verändert das Verhalten spürbar. „Wenn du dir bei einer Angabe nicht sicher bist, kennzeichne sie als unsicher statt zu raten." Weitere Muster liefert Bessere Prompts schreiben.
  4. Aufgaben zerlegen. Lange Aufträge erhöhen das Risiko, weil das Modell Lücken überbrücken muss. Kleine Schritte mit einer Zwischenprüfung sind deutlich zuverlässiger.
  5. Rechnen auslagern. Zahlen gehören in die Code-Ausführung oder in eine Tabelle. Sie haben im Fließtext nichts zu suchen.
  6. Kreuzprüfung durch ein zweites Modell. Das findet einen Teil der Fehler, aber nur, wenn die Quelle im Kontext liegt. Ohne Quelle bewerten sich zwei Modelle gegenseitig einfach als plausibel.

Ein QS-Prozess fürs Team

Einzelne Tricks reichen nicht, wenn mehrere Menschen mit KI arbeiten. Was wirklich funktioniert, ist ein abgestufter Prozess mit klaren Stufen und Verantwortlichkeiten. Schritt 1: Inhalte nach Risiko klassifizieren. Nicht jeder Text braucht dieselbe Prüftiefe.

Stufe

Beispiele

Prüfung

Niedrig

Interne Notizen, Brainstormings, Formulierungsvarianten

Plausibilitätsblick durch die schreibende Person

Mittel

Blogartikel, Social Posts, interne Präsentationen

Faktencheck aller Zahlen, Namen und Quellen

Hoch

Kundenkommunikation, Angebote, Rechts- und Gesundheitsthemen, Pressetexte

Vier-Augen-Prinzip plus dokumentierter Quellencheck durch eine fachkundige Person

Schritt 2: Prüfregeln festlegen. Drei Regeln decken den Großteil ab. Jede Zahl braucht eine Quelle. Jede Quelle wird geöffnet. Jeder Eigenname wird gegengeprüft. Wie du das formalisierst, zeigt die KI-Richtlinie fürs Team.

Schritt 3: Verantwortung benennen. Für jeden veröffentlichten Inhalt gibt es genau eine namentlich verantwortliche Person. Wer freigibt, haftet. Der Fall Air Canada zeigt, dass eine Falschauskunft des eigenen Systems bindet. Die Schulungspflicht nach Artikel 4 EU AI Act verlangt, dass die Menschen, die KI-Ausgaben verantworten, deren Grenzen genau kennen.

Schritt 4: Fehler sammeln. Führt eine kurze Liste aufgetretener Halluzinationen. Das macht die Risikozonen im eigenen Fachgebiet sichtbar und liefert gutes Material für Schulungen. Die Tabelle aus Schritt 1 lässt sich direkt als Vorlage übernehmen. Ergänze einfach eine Spalte für die verantwortliche Person und das Datum.

Der abgestufte QS-Prozess: KI-Ausgabe, Risikoeinstufung in drei Prüftiefen und namentliche Freigabe KI-AUSGABE NIEDRIG Plausibilitätsblick MITTEL Zahlen, Namen, Quellen prüfen HOCH Vier Augen + Quellencheck FREIGABE eine verantwortliche Person

Nicht jeder Text braucht dieselbe Prüftiefe. Aber jeder veröffentlichte Inhalt braucht einen Menschen, der ihn verantwortet.

Restrisiko: ehrlich einplanen

Halluzinationen verschwinden nicht. Sie sind eine Eigenschaft der Technologie und kein vorübergehender Zustand. Auch quellengestützte Systeme liegen messbar daneben. Eine Untersuchung der Europäischen Rundfunkunion mit der BBC fand im Oktober 2025 bei 45 Prozent der geprüften Chatbot-Antworten mindestens einen deutlichen Mangel. Grounding senkt die Fehlerquote, aber es beseitigt sie nicht.

Ein Beispiel aus der Wirkstoffforschung zeigt, dass Erfindungen nicht immer ein Problem sind. Dort lässt man Modelle absichtlich neue Moleküle vorschlagen, die anschließend im Labor geprüft werden. Die Prüfinstanz ist fest eingebaut, während sie im Büroalltag oft fehlt.

Daraus folgt eine einfache Entscheidungsregel. Setze KI dort ein, wo ein Fehler auffällt und korrigierbar ist. Entwürfe, Strukturen und Zusammenfassungen von vorliegenden Quellen sind ideal. Alles, wo ein unbemerkter Fehler direkt beim Kunden oder in der Öffentlichkeit landet, braucht einen Menschen dazwischen. Diese Grenze zu ziehen, ist eine Führungsentscheidung. Wenn du dabei Hilfe brauchst, unterstützen wir dich gern dabei, KI-Prozesse mit Prüfschritt aufzusetzen.

Nicht zu verwechseln ist dieses Thema mit der Frage, ob ein Text von einer KI stammt. Dazu gibt es den Artikel KI-Inhalte erkennen und unsere Analyse von KI-Text-Detektoren.

Fazit

KI-Halluzinationen entstehen, weil Sprachmodelle formulieren statt nachzuschlagen. Sie verlieren seltenes Wissen bei der Komprimierung und antworten lieber, als zu schweigen. Eine Halluzination ist keine Störung, sondern ein normaler Nebeneffekt der Funktionsweise.

Wirksam dagegen ist nicht das bessere Modell, sondern das bessere Vorgehen. Gib Quellen mit, erlaube Unsicherheit, zerlege Aufgaben und lagere Zahlen aus. Kenne die Warnsignale und etabliere einen abgestuften Prüfprozess, in dem für jeden Inhalt ein Mensch geradesteht. Die technischen Grundlagen dazu findest du unter Large Language Models: Grundlagen.

FAQ

Häufige Fragen

Eine sachlich falsche Aussage, die ein KI-Modell mit voller sprachlicher Überzeugungskraft ausgibt. Dazu gehören erfundene Quellen, falsche Zahlen oder nicht existierende Urteile. Der Begriff beschreibt kein Versagen des Systems, sondern eine Folge davon, wie Sprachmodelle Antworten erzeugen. Fachlich genauer wäre der Begriff Konfabulation.

Weil sie das Format einer Quellenangabe gelernt hat, nicht deren Inhalt. Autorenname, Jahr und Titel folgen einem musterhaften Aufbau, den ein Modell mühelos nachbildet. Ob die konkrete Kombination existiert, prüft das Modell bei der Erzeugung nicht. Deshalb fallen erfundene Quellen erst beim Öffnen auf.

Achte auf vier Signale. Die Angabe ist auffällig glatt, die Zahl ungewöhnlich rund, ein Eigenname steht ohne Kontext, oder die Detailtiefe passt nicht zur Frage. Öffne danach die Quelle und suche die Aussage im Dokument. Existiert der Link, aber nicht die Stelle, ist die Angabe falsch belegt.

Ja, aber sie gelten immer nur für ein bestimmtes Setup und einen Zeitpunkt. Eine Untersuchung der Europäischen Rundfunkunion mit der BBC fand 2025 bei 45 Prozent der geprüften Antworten einen deutlichen Mangel. Für deinen Alltag ist eine eigene Stichprobe aussagekräftiger, weil dein Fachgebiet und dein Prompt die Quote stark verschieben.

Nicht verlässlich. Eine Websuche und eine Quellenanbindung senken die Fehlerquote gegenüber einem Modell ohne Belege. Eine neuere Generation allein tut das nicht automatisch. OpenAI wies in der Systemkarte zu o3 und o4-mini aus, dass beide Modelle bei Personenwissen häufiger halluzinierten als der Vorgänger o1. Verlass dich auf deinen Prüfschritt, nicht auf die Modellgeneration.

Das ist die verbreitetste unwirksame Maßnahme. Selbsteinschätzungen von Sprachmodellen sagen wenig über die tatsächliche Korrektheit aus. Ein Modell bestätigt auf Nachfrage bereitwillig eine erfundene Quelle. Prüfen heißt, die Quelle selbst zu öffnen oder eine unabhängige Instanz zu befragen.

Ein abgestuftes Vorgehen ist am besten. Interne Notizen brauchen einen Plausibilitätsblick. Veröffentlichte Inhalte erfordern einen Faktencheck aller Zahlen, Namen und Quellen. Kundenkommunikation und Rechtsthemen brauchen ein Vier-Augen-Prinzip mit dokumentiertem Quellencheck. Entscheidend ist, dass jeder veröffentlichte Inhalt eine namentlich verantwortliche Person hat.

Quiz

Teste dein Wissen

Fünf Fragen zu Ursachen, Risikozonen und Gegenmaßnahmen bei KI-Halluzinationen.

Frage 1 von 5

Warum erfindet ein Sprachmodell Quellenangaben?

War dieser Artikel hilfreich?