Données d’entrée figées
Chaque fichier évalué doit disposer d’une vérité de référence documentée, d’un statut de licence ou de consentement, d’un identifiant stable et d’une empreinte cryptographique.
Loading…
Un protocole versionné pour mesurer les performances des détecteurs d’images, de vidéos et d’audio face à des variations de qualité réalistes. Aucun classement ne sera publié avant la finalisation du jeu de données annoté, du journal d’exécution et de toutes les étapes de validation.
Les tests de fonctionnement vérifient qu’un parcours accepte un fichier et renvoie un rapport. Pour mesurer la précision, il faut des données de référence documentées, des échantillons représentatifs, des versions fixes des détecteurs et des indicateurs qui tiennent compte des erreurs. Cette page distingue ces deux types de tests.
Chaque fichier évalué doit disposer d’une vérité de référence documentée, d’un statut de licence ou de consentement, d’un identifiant stable et d’une empreinte cryptographique.
Le nom du détecteur, la version du modèle, le seuil, les paramètres, la date, les échecs et le coût sont enregistrés avant toute comparaison.
Les faux positifs, les faux négatifs, les abstentions et les résultats par sous-groupe restent visibles, au lieu d’être résumés par un seul pourcentage.
Le protocole v1 exige au moins 200 fichiers admissibles par classe principale et par type de média avant la publication d’un score. La détection de l’auteur d’un texte est exclue, car elle nécessite un jeu de données et une définition de la vérité de référence distincts.
| Type de média | Captation authentique | Entièrement synthétique | Manipulation partielle |
|---|---|---|---|
| Image | Photographies originales et retouchées | Images entièrement générées | Remplacement de visage et retouches localisées |
| Vidéo | Vidéos originales et montées de façon classique | Vidéos entièrement générées | Manipulation du visage, des lèvres et de l’identité |
| Audio | Parole enregistrée et traitée de façon classique | Synthèse vocale et génération de voix | Conversion de voix et remplacement partiel |
Évite qu’une différence de taille entre les classes masque de mauvaises performances sur l’une d’elles.
Indique la fréquence à laquelle des contenus authentiques sont signalés à tort.
Indique la fréquence à laquelle des contenus synthétiques ou manipulés ne sont pas détectés.
Accorde le même poids à chaque classe principale.
Vérifie si le niveau de confiance annoncé correspond à la fréquence observée.
Indique la fréquence à laquelle le détecteur refuse un fichier ou ne peut pas le traiter.
Mesure les performances opérationnelles en complément de l’exactitude.
Les fichiers difficiles ne sont pas remplacés après l’obtention des résultats.
La source, la licence et les usages autorisés pour l’évaluation sont documentés.
Les familles de captation et de génération sont séparées lorsque le protocole d’évaluation l’exige.
Un petit sous-ensemble choisi par commodité ne remplace pas le protocole complet.
Les délais dépassés, les fichiers non pris en charge et les abstentions restent comptabilisés.
Les tableaux et les intervalles de confiance peuvent être régénérés à partir des données et du journal d’exécution publiés.
Ce choix est volontaire. Publier un score provisoire ou comparer quelques fichiers sélectionnés ne suffirait pas à étayer les conclusions suggérées. Le premier tableau de résultats apparaîtra ici lorsque toutes les conditions du protocole v1 seront remplies.
Chaque version publiée conservera la version du protocole, le manifeste des empreintes du jeu de données, les versions des détecteurs, les seuils, les dates, les requêtes échouées et l’historique des corrections. Les corrections importantes seront inscrites dans le journal des versions, sans remplacer discrètement un résultat antérieur.
Les modifications du protocole, du jeu de données et des exécutions reçoivent des identifiants de version distincts.
Les seuils de décision par défaut et les seuils ajustés sont indiqués séparément.
Un résultat décrit les performances sur le jeu d’évaluation. Il ne garantit pas un résultat certain pour chaque futur fichier.
Vous avez repéré une faille du protocole ou une erreur reproductible ? Indiquez la version, la section concernée et les éléments qui étayent votre signalement.
Signaler une correction