Warum ein Prozentwert nicht genügt

Eine hohe Prozentzahl auf einer Produktseite nimmt diese Entscheidung nicht ab.

Es gibt keinen Genauigkeitswert, der für jeden Deepfake-Detektor, jeden Dateityp und jeden Einsatz gilt. Entscheidend ist eine konkretere Frage: Wie oft übersieht das System die gesuchten Manipulationen, und wie oft schickt es unauffällige Dateien unnötig in die Prüfung?

Das gilt für ein einzelnes verdächtiges Video ebenso wie für eine KI-Bilderkennungs-API, die täglich viele Uploads verarbeitet.

Was die neue Untersuchung zeigt

Der am 20. September 2026 eingereichte Preprint DFD-Lab nennt für drei Implementierungen im externen Test auf einer Deepfake-Eval-2024-Teilmenge AUROC-Werte von 0,504, 0,538 und 0,458. Training mit JPEG-komprimierten Beispielen verbesserte AUROC, senkte aber Accuracy. Untersucht wurden weder DeepfakePolicy noch sämtliche kommerziellen Detektoren.

Für die Auswahl eines Dienstes heißt das zunächst: klären, was eine Kennzahl aussagt. Auch die britische Marktstudie zu Deepfake-Erkennung nennt unterschiedliche Datensätze und Kennzahlen als Hindernis für belastbare Vergleiche.

Vier Kennzahlen, vier verschiedene Fragen

Zuerst muss feststehen, was erkannt werden soll: vollständig erzeugte Fotos und Face-Swaps sind unterschiedliche Aufgaben. Die Definitionen setzen eine binäre Entscheidung voraus; unklare Ergebnisse gehören gesondert ausgewiesen.

AUROC beschreibt dagegen die Trennfähigkeit der Scores über verschiedene Schwellenwerte. Ein Wert von 0,5 entspricht einer zufälligen Rangfolge, nicht automatisch „50 Prozent richtig“. Auch ein hoher AUROC-Wert nennt noch keine Fehlalarmquote für die gewählte Entscheidungsschwelle.

Steht in einem Bericht ein Score von 85 Prozent, fragen Sie nach seiner Bedeutung. Daraus wird nicht ohne Weiteres eine Betrugswahrscheinlichkeit von 85 Prozent. Score, gemessene Testleistung und die Wahrheit eines konkreten Sachverhalts sind getrennte Fragen.

  • Accuracy — Anteil aller richtigen Klassifikationen.
  • Recall — Anteil der erkannten KI-generierten oder manipulierten Zieldateien.
  • Falsch-Positiv-Rate — Anteil der Nicht-Zieldateien, die fälschlich auffallen.
  • Precision — Anteil tatsächlicher Zieldateien unter allen markierten Dateien.

Hohe Genauigkeit kann trotzdem viele Fehlalarme bedeuten

Ein bewusst erfundenes Rechenbeispiel macht den Unterschied greifbar. Es ist kein DeepfakePolicy-Benchmark und keine Schätzung des tatsächlichen Betrugsaufkommens.

Von 10.000 Dateien gehören 100 zur gesuchten Klasse KI-generierter Inhalte, 9.900 nicht. Angenommen, ein Detektor erkennt 90 der 100 Zieldateien und markiert irrtümlich zwei Prozent der übrigen Dateien. Jede Datei erhält eine Entscheidung.

Die Gesamtgenauigkeit beträgt 97,92 Prozent: 9.792 von 10.000 Entscheidungen sind richtig. Unter den 288 Meldungen befinden sich aber nur 31,25 Prozent tatsächliche Zieldateien. Das Team muss zusätzlich 198 Fehlalarme bearbeiten.

Beide Werte stimmen. Nur beschreiben sie unterschiedliche Teile der Arbeit.

Der Detektor ist deshalb nicht automatisch ungeeignet. Es muss aber klar sein, was nach einer Meldung passiert und wer die Prüfung übernimmt. Auffällige Dateien vorzuselektieren ist eine andere Aufgabe, als einen Kunden automatisch abzuweisen.

  • Zieldateien richtig markiert — 90
  • Zieldateien übersehen — 10
  • Nicht-Zieldateien falsch markiert — 198
  • Nicht-Zieldateien richtig eingeordnet — 9.702

Prüfen Sie die Datei, die bei Ihnen ankommt

Ein Kameraoriginal und dessen Screenshot sind keine austauschbaren Testeingaben. NIST untersucht bei der forensischen Bewertung ausdrücklich die Übertragbarkeit auf neue Inhalte und die Widerstandsfähigkeit gegenüber Nachbearbeitung, etwa Kompression.

Unsere Empfehlung: Bewahren Sie zusammengehörige Versionen gemeinsam auf und vergleichen Sie die Ergebnisse. Verwenden Sie das Original, die von Ihrem Upload-Formular ausgegebene Fassung und eine Version aus dem tatsächlichen Übertragungsweg Ihrer Kunden. Notieren Sie jeweils die Änderung.

Klären Sie bei Videos, was der Dienst untersucht. Ein Einzelbild beantwortet nicht jede Frage zum gesamten Clip. Fragen Sie getrennt nach erzeugten Bildinhalten, Gesichtsmanipulation und Ton. Ein fehlendes Signal ist kein Echtheitsnachweis. Auf den Seiten zum KI-Video-Detektor und zum KI-Bild-Detektor finden Sie den jeweiligen Prüfungsumfang.

Was neben einem Genauigkeitswert stehen sollte

Wir empfehlen einen kurzen Testnachweis: Prüfaufgabe, beschrifteter Datensatz, Testdatum, verfügbare Systemversion, Entscheidungsregel und die absoluten Zahlen hinter den Prozentwerten.

Auch nicht ausgewertete Dateien gehören hinein. „Nicht unterstützt“, „fehlgeschlagen“ und „unklar“ bedeuten nicht „echt“. Ein kleiner Test ohne beobachtete Fehlalarme ist erfreulich, beweist aber keine Fehlerquote von null.

Diese Unterscheidung gilt auch für uns. Die von DeepfakePolicy veröffentlichten 98,8 Prozent Bildgenauigkeit sind eine eigene Produktangabe: keine unabhängige Zertifizierung, kein Wert für Videos und keine Wahrscheinlichkeit für eine einzelne Datei. Einzelheiten stehen in unserer Methodik und ihren Grenzen, Englisch.

Den vollständigen Ablauf eines Anbietervergleichs beschreibt unsere Checkliste zur Auswahl eines Deepfake-Erkennungsdienstes, Englisch. Dieser Artikel erklärt die Kennzahlen; die Checkliste führt durch den Vergleich.

Ein Ergebnis muss nachvollziehbar bleiben

Wer den Vorgang übernimmt, sollte erkennen können, welche Datei geprüft wurde, was das System festgestellt hat und welche Fragen offen sind. Ein sauber gestaltetes PDF ersetzt keine fehlenden Belege.

Beginnen Sie mit bekannten Beispielen, die Sie verwenden dürfen. Für die Einbindung in Ihr Produkt gibt es die Bild- und Video-API. Sehen Sie sich auch die JSON- und PDF-Berichte an. Eine Sandbox eignet sich für Integrationstests, nicht zur Messung der Erkennungsleistung an Ihren Dateien.

DeepfakePolicy bietet Medienprüfungen an und hat ein wirtschaftliches Interesse an diesem Thema. Der Maßstab sollte für uns und andere Anbieter derselbe sein: relevante Dateien prüfen, Fehler mitzählen und die geschäftliche Entscheidung vom Detektor-Score trennen.

FAQ

Häufige Fragen

Können Deepfake-Detektoren echte Dateien fälschlich markieren?

Ja. Auch ein echtes Foto oder Video kann auffallen. Fordern Sie gegebenenfalls das Original an und prüfen Sie die Belege, bevor Sie eine folgenreiche Entscheidung treffen.

Ist ein guter KI-Bild-Detektor auch bei Videos zuverlässig?

Das folgt nicht aus einem Fototest. Video, Gesichtsmanipulation und Ton brauchen eigene Prüfungen. Entscheidend ist die tatsächlich benötigte Aufgabe.

Beweist ein niedriger Score, dass ein Video echt ist?

Nein. Die Prüfung hat unter ihren Bedingungen kein starkes Zielsignal geliefert. Sie bestätigt damit weder die Bildunterschrift noch die Identität oder das gezeigte Ereignis.

Prüfen Sie zusätzlich die Quelle und den Zusammenhang.

Die passende Prüfung starten.

Bild prüfen
Quellen

Primärquellen und weiterführende Informationen

Die verlinkten Quellen wurden zuletzt am 23. September 2026 geprüft. Einige Primärquellen sind nur auf Englisch verfügbar.