Un corpus tridimensionnel ne se constitue pas en accumulant des scènes. Ce qui détermine sa valeur est le nombre de configurations distinctes qu’il couvre, et cette quantité dépend davantage de la géométrie d’acquisition que du volume de données produit.
Cet article expose la méthode. Il prolonge l’article consacré à la densité, l’occlusion et la sparsité.
Pourquoi le nombre de scènes trompe
Quatre propriétés distinguent un corpus d’annotation 3D d’un corpus d’images. La redondance entre scènes proches est forte, deux acquisitions voisines décrivant le même espace. Le volume de stockage croît sans rapport avec la diversité apportée. La couverture dépend de la géométrie d’acquisition autant que du nombre de stations. Et une scène peut contenir des centaines d’objets ou quelques-uns selon le contexte. Une conséquence pratique importante en découle. Ces quatre propriétés font qu’un corpus comptant de nombreuses scènes peut couvrir moins de configurations qu’un corpus réduit et bien conçu, ce qui déplace l’enjeu d’un projet d’annotation 3D de la collecte vers la sélection.Les dimensions à couvrir
Six axes définissent la couverture d’un corpus d’annotation 3D. Ils se multiplient entre eux. Les configurations d’objets, densité, agencement et proximité. Les distances, un même objet devant apparaître proche et lointain. Les conditions d’acquisition, matériel, densité et nombre de stations. Les matériaux présents, notamment ceux qui trompent le capteur. Les types de scène, intérieur, extérieur, ouvert ou encombré. Et les classes rares, dont l’absence n’apparaît qu’à l’usage. Une observation importante en découle. Le deuxième axe est spécifique à ce domaine, un objet observé uniquement à courte distance ne préparant pas un système à le reconnaître épars, ce qui impose une couverture par tranche de distance plutôt que par simple présence de la classe.Sélectionner plutôt que collecter
Quatre stratégies de sélection s’appliquent à un corpus d’annotation 3D. Le tirage aléatoire, qui reflète la distribution réelle et sur-représente le banal. La sélection par configuration, qui retient les scènes contenant les agencements difficiles. La sélection par incertitude, qui retient ce qu’un modèle existant ne maîtrise pas. Et la sélection par couverture, qui complète les combinaisons manquantes du plan. Une conséquence pratique s’ensuit. Ces quatre stratégies se combinent plutôt qu’elles ne se remplacent, la première fournissant une base représentative et les trois autres l’enrichissant sur ce qui compte.Le découpage en scènes
Cette décision structure le corpus. Elle est rarement examinée en annotation 3D. Un relevé continu doit être découpé en unités annotables. Quatre critères orientent ce découpage en annotation 3D. Le nombre d’objets par scène, qui détermine la durée d’une tâche et sa parallélisation. Les frontières naturelles, changement de local ou de station fournissant des points de coupe sans conséquence. L’homogénéité de densité, une scène mêlant zones proches et lointaines produisant une charge inégale. Et l’autonomie de compréhension, une scène devant contenir assez de contexte pour être annotable seule. Une observation importante en découle pour un projet d’annotation 3D. Le deuxième critère supprime par construction le problème des objets coupés par une frontière de tâche, difficulté qui produit sinon des annotations partielles de part et d’autre.La séparation entraînement et évaluation
Une règle gouverne cette séparation. Son non-respect produit des chiffres flatteurs et faux. Deux scènes du même relevé partagent trop de contexte pour se répartir de part et d’autre. Quatre niveaux de séparation existent et leur exigence croît. Par scène, insuffisant lorsque plusieurs scènes proviennent du même relevé. Par relevé, minimum acceptable pour la plupart des usages. Par site, correct dès que le système doit fonctionner ailleurs. Et par campagne ou par capteur, le plus exigeant, qui mesure ce que le système fera sur des données nouvelles. Une conséquence pratique importante en découle. Le premier niveau est encore pratiqué et il produit une performance sans signification, deux scènes du même relevé partageant les mêmes objets vus sous des angles voisins.Les métadonnées à enregistrer
Sept informations conditionnent l’exploitation d’un corpus d’annotation 3D. Elles coûtent quelques champs à la saisie. Le site et la station, indispensables à une séparation correcte. La date et l’heure, qui permettent de reconstituer les conditions. Le capteur employé et ses paramètres. La position du capteur pour chaque scène. La calibration en configuration multi-capteurs, avec son identifiant. Le traitement subi, sous-échantillonnage et filtrage notamment. Et le masque de couverture, qui distingue les zones observées des zones non observées. Une observation en découle pour un projet d’annotation 3D. La quatrième métadonnée est spécifique à ce domaine et rarement enregistrée, sans elle il devient impossible de savoir quelle face d’un objet a été mesurée et laquelle a été extrapolée.Le dimensionnement
Quatre facteurs déterminent le volume nécessaire en annotation 3D. Ils ne se réduisent pas à un nombre de scènes. Le nombre de configurations à couvrir, produit des six axes retenus. Le nombre d’objets par classe et par tranche de distance. La variabilité interne de chaque classe. Et la difficulté de la tâche, une distinction fine exigeant plus d’exemples. Une conséquence pratique s’ensuit. Le volume se raisonne en objets par classe et par tranche de distance plutôt qu’en scènes, un objet proche et un objet lointain de même classe constituant deux exemples différents pour un système.Les classes rares
Cette difficulté domine la constitution d’un corpus d’annotation 3D. Elle se traite en amont. Un objet rare ne se rencontre pas par acquisition aléatoire. Trois méthodes permettent de les récupérer. L’acquisition ciblée, praticable lorsque les emplacements sont connus. La mise en scène délibérée, possible en environnement maîtrisé et impossible ailleurs. Et la sollicitation d’un modèle existant, dont les détections incertaines localisent des candidats. Une observation importante en découle. La deuxième méthode distingue les verticaux maîtrisés des verticaux ouverts, un entrepôt permettant de produire les configurations difficiles à volonté là qu’une route impose de les attendre.Le corpus d’évaluation en 3D
Une distinction mérite d’être posée car ce corpus n’obéit pas aux mêmes règles. Quatre différences caractérisent ce corpus en annotation 3D. L’exhaustivité devient impérative, un objet omis comptant comme fausse détection du système évalué. Le seuil de sparsité ne s’applique pas, ce qui oblige à annoter des objets que le corpus d’entraînement écartait. La stratification par distance doit être délibérée, un jeu dominé par les objets proches mesurant une performance sans signification. Et la stabilité dans le temps conditionne la comparaison entre deux versions. Une conséquence pratique importante en découle pour un projet d’annotation 3D. Les deux premières différences rendent ce corpus disproportionnément coûteux par scène, ce qui justifie de le dimensionner en scènes et non en proportion du corpus d’entraînement.La constitution progressive
Une organisation en lots vaut mieux qu’une acquisition massive. Un corpus construit d’un bloc fige des conventions avant qu’elles soient éprouvées. Quatre avantages accompagnent une approche progressive en annotation 3D. Les conventions se corrigent entre deux lots plutôt qu’après l’ensemble. La cadence et le coût se mesurent tôt et se projettent. Un premier modèle permet de pré-annoter les lots suivants. Et les lacunes révélées par ce modèle orientent le contenu du lot suivant. Une conséquence pratique en découle. Le quatrième avantage est le plus important, il transforme la constitution en boucle plutôt qu’en ligne droite et concentre l’effort sur ce qui manque réellement.Ce qu’il ne faut pas faire
Quatre pratiques dégradent un corpus d’annotation 3D. Elles paraissent pourtant raisonnables. Écarter les scènes dégradées, qui seront présentes en exploitation. Multiplier les stations sur un même site plutôt que d’en chercher de nouveaux. Découper à volume constant sans tenir compte des frontières naturelles. Et conserver uniquement les annotations en supprimant les nuages sources. Une observation en découle. La deuxième pratique est la plus fréquente, un site accessible produisant facilement de nombreuses stations dont l’apport marginal décroît rapidement.Ce que la documentation doit contenir
Six éléments accompagnent une livraison d’annotation 3D. Leur absence limite la réutilisation. Le plan d’échantillonnage effectivement réalisé. Le tableau des effectifs par classe et par tranche de distance. Les conventions d’annotation, seuils et règle d’extrapolation incluses. Le critère de séparation retenu entre entraînement et évaluation. Le rapport de qualité, avec les valeurs par tranche de distance. Et la liste des configurations non couvertes, qui borne explicitement le domaine d’emploi. Une conséquence pratique importante en découle. Le dernier élément est le plus rare et le plus utile, déclarer ce que le corpus ne couvre pas transformant une limite invisible en limite connue.Aborder la constitution d’un corpus 3D
Cinq questions cadrent cette phase d’un projet d’annotation 3D. Elles se posent avant toute acquisition. Combien de configurations distinctes le périmètre comporte-t-il. Ce produit détermine la couverture nécessaire. La couverture par tranche de distance est-elle prévue. Son absence produit un corpus déséquilibré. Quel critère de séparation sera retenu. Cette réponse conditionne la validité de toute mesure. La position du capteur sera-t-elle enregistrée. Son absence prive l’annotation d’une information déterminante. Et les classes rares sont-elles accessibles. Leur absence rend le projet infaisable en l’état. Ces cinq réponses déterminent le volume et la validité du résultat. Les poser avant de collecter évite un corpus volumineux et pauvre en diversité.Ce que ce chapitre enseigne
Une observation transversale mérite de clore cet examen. La valeur d’un corpus 3D tient à sa diversité de configurations et non à son volume. Trois constats la composent. La distance constitue un axe de couverture à part entière, un objet proche et le même objet lointain étant deux exemples distincts pour un système. La géométrie d’acquisition détermine ce qui est observable autant que le capteur, ce qui fait du nombre de stations une variable de couverture et non de volume. Et la position du capteur est une métadonnée sans équivalent en annotation d’images, sans laquelle la distinction entre mesure et extrapolation se perd. Ce constat rejoint celui que le cluster vidéo a établi : ce qui détermine la valeur d’un corpus est ce qu’il couvre délibérément, et cette couverture se conçoit avant l’acquisition plutôt qu’elle ne se constate après.Les erreurs les plus fréquentes
- Dimensionner un corpus en scènes plutôt qu’en objets par tranche de distance.
- Multiplier les stations sur un site accessible au lieu d’en chercher de nouveaux.
- Séparer entraînement et évaluation par scène plutôt que par relevé ou par site.
- Omettre la position du capteur dans les métadonnées.
- Découper à volume constant sans tenir compte des frontières naturelles.
- Écarter les scènes dégradées qui seront présentes en exploitation.
- Supprimer les nuages sources après extraction des annotations.
- Couvrir une classe sans couvrir ses différentes distances d’observation.
- Acquérir massivement avant d’avoir éprouvé les conventions.
- Livrer sans la liste des configurations non couvertes.