Festgelegte Testdateien
Für jede ausgewertete Datei müssen die tatsächliche Klasse, der Lizenz- oder Einwilligungsstatus, eine dauerhafte Kennung und ein kryptografischer Hash dokumentiert sein.
Loading…
Ein versioniertes Protokoll zur Messung der Erkennungsleistung bei Bildern, Videos und Audio unter realistischen Qualitätsveränderungen. Ranglisten bleiben unveröffentlicht, bis der gekennzeichnete Datensatz, das Ausführungsprotokoll und sämtliche Veröffentlichungskriterien vollständig vorliegen.
Funktionstests nach einer Bereitstellung bestätigen, dass ein Endpunkt eine Datei annimmt und einen Bericht zurückgibt. Aussagen zur Genauigkeit erfordern dokumentierte Referenzwerte, repräsentative Stichproben, festgelegte Detektorversionen und Kennzahlen, die Fehler berücksichtigen. Diese Seite trennt die beiden Arten von Aussagen.
Für jede ausgewertete Datei müssen die tatsächliche Klasse, der Lizenz- oder Einwilligungsstatus, eine dauerhafte Kennung und ein kryptografischer Hash dokumentiert sein.
Detektorname, Modellversion, Schwellenwert, Einstellungen, Zeitstempel, Fehler und Kosten werden vor dem Vergleich dokumentiert.
Fehlalarme, übersehene Manipulationen, ausbleibende Bewertungen und Ergebnisse einzelner Teilgruppen werden separat ausgewiesen und nicht auf einen einzigen Prozentwert reduziert.
Protokoll v1 verlangt mindestens 200 geeignete Dateien je Hauptklasse und Medientyp, bevor ein Ergebnis veröffentlicht wird. Die Erkennung von KI-Texten ist ausgeschlossen, da sie einen eigenen Datensatz und gesondert definierte Referenzwerte erfordert.
| Medientyp | Echte Aufnahme | Vollständig synthetisch | Teilweise manipuliert |
|---|---|---|---|
| Bild | Kameraaufnahmen und bearbeitete Fotos | Vollständig generierte Bilder | Ausgetauschte Gesichter und örtlich begrenzte Bearbeitungen |
| Video | Originalclips und konventionell bearbeitete Videos | Vollständig generierte Videos | Manipulation von Gesicht, Lippenbewegungen und Identität |
| Audio | Aufgenommene und konventionell bearbeitete Sprache | Sprachsynthese und Stimmerzeugung | Stimmumwandlung und teilweise ersetzte Aufnahmen |
Verhindert, dass ungleich große Klassen eine schwache Erkennung in einer Klasse verdecken.
Zeigt, wie häufig echte Inhalte fälschlich als auffällig eingestuft werden.
Zeigt, wie häufig synthetische oder manipulierte Inhalte übersehen werden.
Gewichtet jede Hauptklasse gleich.
Prüft, ob die angegebene Modellsicherheit mit den beobachteten Häufigkeiten übereinstimmt.
Zeigt, wie häufig ein Detektor keine Bewertung abgibt oder eine Datei nicht verarbeiten kann.
Misst neben der Genauigkeit auch die Leistung im praktischen Betrieb.
Schwierige Dateien werden nach Bekanntwerden der Ergebnisse nicht ausgetauscht.
Quelle, Lizenz und erlaubte Nutzung für die Auswertung sind dokumentiert.
Aufnahme- und Generatorfamilien werden getrennt, soweit der Versuchsaufbau dies erfordert.
Kleine, bequem ausgewählte Teilmengen ersetzen nicht den vollständigen Testaufbau.
Zeitüberschreitungen, nicht unterstützte Dateien und ausbleibende Bewertungen werden nicht ausgeblendet.
Tabellen und Konfidenzintervalle lassen sich aus den veröffentlichten Eingabedaten und dem Ausführungsprotokoll erneut berechnen.
Das ist beabsichtigt. Ein Platzhalterwert oder ein Vergleich weniger handverlesener Dateien würde eine Aussage nahelegen, die durch die Daten nicht gedeckt ist. Die erste Ergebnistabelle erscheint hier, sobald alle Kriterien von v1 erfüllt sind.
Jede künftige Veröffentlichung bewahrt die Protokollversion, das Dateiverzeichnis mit Hashwerten, Detektorversionen, Schwellenwerte, Zeitstempel, fehlgeschlagene Anfragen und den Korrekturverlauf. Wesentliche Korrekturen werden im Versionsverlauf dokumentiert, statt frühere Ergebnisse stillschweigend zu ersetzen.
Änderungen am Protokoll, Datensatz und Testlauf erhalten jeweils eigene Versionskennungen.
Standardwerte und angepasste Entscheidungsschwellen werden getrennt angegeben.
Ein Vergleichsergebnis beschreibt die Leistung im Test. Es bietet keine Gewissheit für jede künftig geprüfte Datei.
Haben Sie einen Fehler im Protokoll oder einen reproduzierbaren Fehler gefunden? Nennen Sie die Protokollversion und den betroffenen Abschnitt und fügen Sie entsprechende Belege bei.
Korrektur melden