Vastgelegde invoer
Voor elk beoordeeld bestand moeten de referentiegegevens, licentie of toestemming, een vaste identificatiecode en een cryptografische hash zijn vastgelegd.
Loading…
Een protocol met versiebeheer om de prestaties van beeld-, video- en audiodetectoren te meten bij realistische kwaliteitsveranderingen. Ranglijsten worden pas gepubliceerd wanneer de gelabelde dataset, het uitvoeringslogboek en alle publicatievoorwaarden compleet zijn.
Een werkingstest bevestigt dat een systeem een bestand accepteert en een rapport teruggeeft. Om nauwkeurigheid te onderbouwen, zijn gedocumenteerde referentiegegevens, representatieve voorbeelden, vastgelegde detectorversies en meetwaarden nodig die rekening houden met fouten. Op deze pagina maken we dat onderscheid duidelijk.
Voor elk beoordeeld bestand moeten de referentiegegevens, licentie of toestemming, een vaste identificatiecode en een cryptografische hash zijn vastgelegd.
De detectornaam, modelversie, drempelwaarde, instellingen, tijdstempel, fouten en kosten worden vóór de vergelijking vastgelegd.
Foutpositieven, foutnegatieven, ontbrekende oordelen en resultaten per subgroep blijven apart zichtbaar. Ze worden niet samengevat in één overkoepelend percentage.
Protocol v1 vereist minimaal 200 geschikte bestanden per hoofdklasse en mediatype voordat een score wordt gepubliceerd. Detectie van AI-geschreven tekst valt hierbuiten, omdat daarvoor een aparte dataset en opzet voor de referentiegegevens nodig zijn.
| Mediatype | Echte opname | Volledig synthetisch | Gedeeltelijk gemanipuleerd |
|---|---|---|---|
| Afbeelding | Camerafoto’s en bewerkte foto’s | Volledig gegenereerde afbeeldingen | Verwisselde gezichten en plaatselijke bewerkingen |
| Video | Originele en op gebruikelijke wijze bewerkte clips | Volledig gegenereerde video | Manipulatie van gezichten, lipbewegingen en identiteit |
| Audio | Opgenomen en op gebruikelijke wijze bewerkte spraak | Tekst-naar-spraak en stemgeneratie | Stemconversie en gedeeltelijke vervanging |
Voorkomt dat een zwak resultaat voor één klasse verborgen blijft doordat klassen ongelijk groot zijn.
Laat zien hoe vaak echt materiaal ten onrechte wordt gemarkeerd.
Laat zien hoe vaak synthetisch of gemanipuleerd materiaal wordt gemist.
Geeft elke hoofdklasse hetzelfde gewicht.
Toetst of de gemelde zekerheid overeenkomt met de waargenomen frequentie.
Laat zien hoe vaak een detector geen oordeel geeft of een bestand niet kan verwerken.
Meet naast nauwkeurigheid ook de prestaties in het gebruik.
Moeilijke bestanden worden niet achteraf vervangen op basis van de resultaten.
Bron, licentie en toegestaan gebruik voor de evaluatie zijn vastgelegd.
Opnamebronnen en generatorfamilies zijn gescheiden waar de evaluatieopzet dat vereist.
Een kleine, gunstig gekozen selectie kan het volledige protocol niet vervangen.
Time-outs, niet-ondersteunde bestanden en ontbrekende oordelen worden niet weggelaten.
Tabellen en betrouwbaarheidsintervallen kunnen opnieuw worden gemaakt met de gepubliceerde invoer en het uitvoeringslogboek.
Dat is een bewuste keuze. Een voorlopige score of een vergelijking van enkele geselecteerde bestanden zou meer suggereren dan de gegevens onderbouwen. De eerste resultatentabel verschijnt hier zodra aan alle voorwaarden van v1 is voldaan.
Bij elke toekomstige publicatie bewaren we de protocolversie, het manifest met datasethashes, detectorversies, drempelwaarden, tijdstempels, mislukte aanvragen en correctiegeschiedenis. Belangrijke correcties worden in het versielogboek opgenomen; eerdere resultaten worden niet ongemerkt vervangen.
Wijzigingen aan het protocol, de dataset en de testuitvoering krijgen elk een eigen versienummer.
Standaarddrempels en aangepaste beslisdrempels worden afzonderlijk vermeld.
Een benchmarkresultaat beschrijft de prestaties op de benchmark. Het biedt geen zekerheid over elk toekomstig bestand.
Heeft u een fout in het protocol of een reproduceerbaar probleem gevonden? Vermeld de protocolversie, het betreffende onderdeel en de onderbouwing.
Correctie doorgeven