Hoe betrouwbaar zijn deepfake-detectors bij foto's en video's?
Een klant stuurt een foto. Die is bijgesneden, opnieuw opgeslagen en via een berichtenapp doorgestuurd. De detector geeft een waarschuwing. Iemand moet nu beslissen: het origineel opvragen, verder onderzoek doen of de zaak gewoon afhandelen?
Wat een nauwkeurigheidspercentage niet vertelt
Een hoog nauwkeurigheidspercentage op een productpagina neemt die beslissing niet over.
Er is geen percentage dat voor elke deepfake-detector, elk bestand en elke toepassing geldt. Een bruikbaardere vraag is: hoe vaak mist het systeem het materiaal dat wij willen vinden, en hoe vaak laat het ons onnodig naar een gewoon bestand kijken?
Dat is relevant voor één verdachte video, maar ook voor een API die dagelijks grote aantallen afbeeldingen moet controleren.
Wat het nieuwe onderzoek toevoegt
DFD-Lab, ingediend als preprint op 20 september 2026, rapporteert externe AUROC-testscores van 0,504, 0,538 en 0,458 voor drie implementaties op een Deepfake-Eval-2024-deelverzameling. Training met JPEG-gecomprimeerde voorbeelden verbeterde AUROC, maar verlaagde accuracy. Deze beperkte tests beoordelen niet DeepfakePolicy of alle commerciële detectors.
Vraag bij een vergelijking dus eerst wat een getal meet. Ook de Britse marktstudie naar deepfake-detectie noemt verschillende meetmethoden en datasets als belemmering voor zinvolle vergelijkingen.
Vier meetwaarden met een andere betekenis
Bepaal eerst die categorie: volledig gegenereerde foto's en video's met een verwisseld gezicht zijn verschillende taken. Deze definities veronderstellen een binaire beslissing; onbesliste resultaten moeten apart worden geteld.
AUROC beschrijft hoe goed scores de twee categorieën scheiden bij verschillende drempels. Een waarde van 0,5 betekent een rangschikking op kansniveau, niet automatisch „50 procent goed”. Een hoge AUROC vertelt op zichzelf niet hoeveel valse meldingen ontstaan bij de gekozen drempel.
Staat er 85 procent in een rapport? Vraag wat die score inhoudt. Het is niet vanzelf een kans van 85 procent op fraude. De score, de gemeten testprestatie en de feiten in een zaak zijn drie verschillende dingen.
- Accuracy — Het aandeel juiste classificaties van alle bestanden.
- Recall — Het aandeel gevonden bestanden uit de gezochte categorie.
- Foutpositief percentage — Het aandeel overige bestanden dat onterecht wordt gemarkeerd.
- Precision — Het aandeel meldingen dat werkelijk de gezochte categorie betreft.
Een hoge nauwkeurigheid kan toch veel onterechte meldingen opleveren
Neem dit bewust verzonnen rekenvoorbeeld. Het is geen DeepfakePolicy-benchmark en geen schatting van hoe vaak fraude voorkomt.
U ontvangt 10.000 bestanden. Daarvan behoren er 100 tot de gezochte AI-categorie en 9.900 niet. Stel dat de detector 90 van de 100 doelbestanden vindt en twee procent van de overige bestanden onterecht markeert. Elk bestand krijgt een beslissing.
De totale accuracy is 97,92 procent: 9.792 juiste beslissingen op 10.000 bestanden. Toch betreft maar 31,25 procent van de 288 meldingen werkelijk de gezochte categorie. Het team moet daarnaast 198 onterechte meldingen afhandelen.
Beide cijfers kloppen. Ze beschrijven een ander deel van het werk.
Dat maakt de detector niet vanzelf onbruikbaar. U moet wel afspreken wie de meldingen controleert en wat er daarna gebeurt. Verdacht materiaal voor een medewerker selecteren is iets anders dan een klant automatisch afwijzen.
- Doelbestanden terecht gemarkeerd — 90
- Doelbestanden gemist — 10
- Overige bestanden onterecht gemarkeerd — 198
- Overige bestanden juist ingedeeld — 9.702
Test het bestand zoals het bij uw team binnenkomt
Een cameraorigineel en een screenshot daarvan zijn geen onderling uitwisselbare testbestanden. NIST onderzoekt bij forensische evaluatie onder meer generalisatie en bestendigheid tegen nabewerking, waaronder compressie.
Ons advies: bewaar versies van hetzelfde bestand bij elkaar en vergelijk de uitkomsten. Probeer het origineel, de versie die uw uploadformulier oplevert en een bestand dat via het gebruikelijke kanaal van uw klanten is verzonden. Leg vast welke bewerking bij welke versie hoort.
Vraag bij video wat de dienst precies analyseert. Eén stilstaand beeld beantwoordt niet iedere vraag over een clip. Houd gegenereerde beelden, gezichtsmanipulatie en geluid uit elkaar. Een ontbrekend signaal is geen bewijs van echtheid. De pagina's over de AI-videodetector en de AI-afbeeldingsdetector beschrijven wat de controles omvatten.
Wat er naast een nauwkeurigheidspercentage hoort te staan
Wij adviseren een beknopt testverslag: de taak, de gelabelde steekproef, de testdatum, de systeemversie indien beschikbaar, de beslisregel en de aantallen achter de percentages.
Laat ook niet-geanalyseerde bestanden in dat verslag staan. „Niet ondersteund”, „mislukt” en „onbeslist” betekenen niet „echt”. Geen foutpositieven vinden in een kleine test is positief, maar bewijst niet dat de foutkans nul is.
Dat onderscheid geldt ook voor ons. De 98,8 procent beeldnauwkeurigheid die DeepfakePolicy publiceert, is een eigen productopgave. Het is geen onafhankelijke certificering, geen videoprestatie en geen kans voor één afzonderlijk bestand. Zie onze methodologie en beperkingen, Engels.
Voor een complete leveranciersvergelijking is er onze checklist voor het kiezen van een deepfake-detectiedienst, Engels. Dit artikel legt de cijfers uit; de checklist beschrijft hoe u de vergelijking uitvoert.
Zorg dat een collega met het rapport verder kan
Wie het dossier overneemt, moet kunnen zien welk bestand is gecontroleerd, wat het systeem heeft teruggegeven en welke vragen nog openstaan. Een mooi opgemaakt PDF-bestand vult ontbrekend bewijs niet aan.
Begin met gelabelde voorbeelden die u mag gebruiken. Voor controles in uw eigen product kunt u de foto- en video-API bekijken, samen met de JSON- en PDF-rapporten. De sandbox is bedoeld voor integratietests, niet om detectieprestaties op eigen bestanden te meten.
DeepfakePolicy verkoopt mediacontroles en heeft een commercieel belang bij dit onderwerp. De maatstaf moet voor ons en andere aanbieders gelijk zijn: relevante bestanden testen, fouten meetellen en een zakelijke beslissing niet verwarren met een detectorscore.
Veelgestelde vragen
Kan een deepfake-detector een echte foto onterecht markeren?
Ja. Ook een echte foto of video kan een waarschuwing opleveren. Vraag zo nodig het origineel op en controleer het beschikbare bewijs voordat u een ingrijpende beslissing neemt.
Werkt een goede AI-fotodetector ook goed bij video?
Dat volgt niet uit een fototest. Video, gezichtsmanipulatie en geluid vragen om eigen beoordelingen. Test de taak die u daadwerkelijk nodig hebt.
Bewijst een lage score dat een video echt is?
Nee. De controle gaf onder haar testomstandigheden geen sterk doelsignaal. Daarmee zijn het bijschrift, de identiteit en de afgebeelde gebeurtenis nog niet geverifieerd.
Controleer het ontvangen bestand en laat belangrijke meldingen beoordelen.
Afbeelding controlerenPrimaire bronnen
Oorspronkelijke onderzoeken en richtlijnen gecontroleerd op 23 september 2026. Het genoemde onderzoek test DeepfakePolicy niet.