Ce qu'un pourcentage ne vous dit pas

Un pourcentage flatteur sur une page commerciale ne tranche pas la question.

Il n'existe pas de taux de fiabilité valable pour tous les détecteurs, tous les fichiers et tous les usages. La bonne question est plus concrète : combien de contenus recherchés l'outil laisse-t-il passer, et combien de fichiers ordinaires envoie-t-il inutilement en vérification?

Cela vaut aussi bien pour une vidéo douteuse que pour une API chargée d'analyser les images reçues par une entreprise.

Ce qu'apporte la nouvelle étude

DFD-Lab, prépublication du 20 septembre 2026, rapporte trois AUROC en test externe sur un sous-ensemble de Deepfake-Eval-2024 : 0,504, 0,538 et 0,458. L'entraînement avec compression JPEG améliore l'AUROC mais réduit l'accuracy. Ces expériences limitées ne testent ni DeepfakePolicy ni l'ensemble des détecteurs commerciaux.

Avant de comparer deux pourcentages, il faut donc savoir ce qu'ils mesurent. L'étude britannique sur le marché de la détection relève également que la diversité des métriques et des jeux de données complique les comparaisons.

Quatre indicateurs à ne pas confondre

Définissez d'abord cette catégorie : image entièrement générée et visage remplacé ne sont pas équivalents. Ces indicateurs supposent une décision binaire; les résultats indéterminés doivent être comptés séparément.

L'AUROC mesure la séparation des deux catégories par les scores, sur plusieurs seuils. Une valeur de 0,5 correspond à un classement aléatoire, pas nécessairement à « 50 % de réponses justes ». Elle ne donne pas, à elle seule, le taux de fausses alertes au seuil retenu.

Si un rapport affiche 85 %, demandez ce que ce score représente. Il ne devient pas automatiquement une probabilité de fraude de 85 %. Le score, la performance mesurée sur un test et la réalité d'un dossier sont trois choses différentes.

  • Accuracy — Part de toutes les classifications correctes.
  • Rappel — Part des fichiers ciblés effectivement détectés.
  • Taux de faux positifs — Part des fichiers non ciblés signalés à tort.
  • Précision — Part des signalements correspondant réellement à la catégorie ciblée.

Un bon taux global peut cacher beaucoup de fausses alertes

Prenons un exemple entièrement fictif. Ce n'est ni un test de DeepfakePolicy ni une estimation de la fréquence des fraudes.

Vous recevez 10 000 fichiers. Parmi eux, 100 appartiennent à la catégorie IA recherchée et 9 900 n'y appartiennent pas. Supposons que le détecteur trouve 90 des 100 fichiers ciblés et signale à tort 2 % des autres. Il rend une décision pour chaque fichier.

L'accuracy atteint 97,92 % : 9 792 décisions correctes sur 10 000. Pourtant, seuls 31,25 % des 288 signalements concernent réellement la catégorie recherchée. Il reste 198 fausses alertes à traiter.

Les deux chiffres sont exacts. Ils ne racontent simplement pas la même partie de l'histoire.

L'outil n'est pas forcément inutile. Il faut en revanche prévoir qui examinera les alertes et ce qui se passera ensuite. Aider un analyste à repérer des fichiers suspects n'est pas la même fonction que refuser automatiquement un dossier client.

  • Fichiers ciblés correctement signalés — 90
  • Fichiers ciblés non détectés — 10
  • Autres fichiers signalés à tort — 198
  • Autres fichiers correctement classés — 9 702

Testez la version du fichier que vous recevez vraiment

Un original et sa capture d'écran ne constituent pas des entrées de test interchangeables. Les travaux d'évaluation du NIST portent notamment sur la généralisation et la résistance aux traitements ultérieurs, dont la compression.

Notre recommandation : conservez ensemble les versions d'un même fichier et comparez les résultats. Essayez l'original, la version produite par votre formulaire d'envoi et celle qui passe par le canal utilisé par vos clients. Notez la transformation effectuée à chaque étape.

Pour la vidéo, vérifiez le périmètre de l'analyse. Une image extraite ne répond pas à toutes les questions sur un clip. Distinguez les visuels générés, la modification du visage et le son; l'absence d'un signal n'est pas un résultat d'authentification. Consultez les pages du détecteur vidéo IA et du détecteur d'images IA pour comprendre la portée des vérifications.

Ce qu'il faut demander avec un chiffre de fiabilité

Nous recommandons une fiche de test courte : objectif, échantillon étiqueté, date, version du système si elle est disponible, règle de décision et nombres bruts derrière les pourcentages.

Gardez les fichiers non analysés dans le bilan. « Non pris en charge », « échec » et « indéterminé » ne veulent pas dire « authentique ». Ne constater aucun faux positif dans un petit échantillon est encourageant; cela ne démontre pas un taux d'erreur nul.

La même exigence s'applique à nous. Les 98,8 % d'accuracy sur les images annoncés par DeepfakePolicy sont une mesure déclarée par le fournisseur. Ce n'est ni une certification indépendante, ni un résultat pour la vidéo, ni une probabilité associée à un fichier particulier. Voir notre méthodologie et ses limites, en anglais.

Pour organiser une comparaison complète, utilisez notre guide de sélection d'un service de détection, en anglais. Cet article explique les chiffres; le guide détaille la démarche d'évaluation.

Un rapport doit permettre de reprendre le dossier

La personne qui reçoit le rapport doit pouvoir identifier le fichier analysé, le résultat fourni et les questions encore ouvertes. Une belle mise en page ne remplace pas les pièces manquantes.

Commencez par des exemples dont l'origine est connue et que vous êtes autorisé à utiliser. Pour intégrer les vérifications à votre produit, consultez l'API photo et vidéo ainsi que les rapports JSON et PDF. Le bac à sable sert à tester l'intégration, pas à mesurer la détection sur vos propres fichiers.

DeepfakePolicy commercialise des analyses de médias et a un intérêt économique dans ce sujet. Le critère reste le même pour notre service et pour les autres : tester des fichiers pertinents, compter les erreurs et distinguer le score du détecteur de la décision métier.

FAQ

Questions fréquentes

Un détecteur de deepfake peut-il se tromper sur une vraie photo ?

Oui. Une photo ou une vidéo réelle peut être signalée à tort. Demandez l'original si nécessaire et examinez les éléments disponibles avant de prendre une décision importante.

Un détecteur d'images IA fiable l'est-il aussi pour les vidéos ?

Pas nécessairement. Un test sur des photos ne démontre pas les performances sur les vidéos, les visages ou le son. Évaluez la tâche dont vous avez besoin.

Un score faible prouve-t-il qu'une vidéo est réelle ?

Non. L'analyse n'a pas renvoyé de signal fort dans ses conditions de fonctionnement. Elle ne confirme ni la légende, ni l'identité, ni l'événement représenté.

Un score est un signal probabiliste, pas une preuve de fraude ni une certification d'authenticité.

Vérifiez le fichier reçu, puis faites examiner les alertes importantes.

Vérifier une image
Sources principales

Sources principales

Études et documents originaux consultés le 23 septembre 2026. La recherche citée ne teste pas DeepfakePolicy.