Constituer un dataset 3D – volume, diversité et qualité

Un corpus tridimensionnel ne se constitue pas en accumulant des scènes. Ce qui détermine sa valeur est le nombre de configurations distinctes qu’il couvre, et cette quantité dépend davantage de la géométrie d’acquisition que du volume de données produit. Cet article expose la méthode. Il prolonge l’article consacré à la densité, l’occlusion et la sparsité.

Pourquoi le nombre de scènes trompe

Quatre propriétés distinguent un corpus d’annotation 3D d’un corpus d’images. La redondance entre scènes proches est forte, deux acquisitions voisines décrivant le même espace. Le volume de stockage croît sans rapport avec la diversité apportée. La couverture dépend de la géométrie d’acquisition autant que du nombre de stations. Et une scène peut contenir des centaines d’objets ou quelques-uns selon le contexte. Une conséquence pratique importante en découle. Ces quatre propriétés font qu’un corpus comptant de nombreuses scènes peut couvrir moins de configurations qu’un corpus réduit et bien conçu, ce qui déplace l’enjeu d’un projet d’annotation 3D de la collecte vers la sélection.

Les dimensions à couvrir

Six axes définissent la couverture d’un corpus d’annotation 3D. Ils se multiplient entre eux. Les configurations d’objets, densité, agencement et proximité. Les distances, un même objet devant apparaître proche et lointain. Les conditions d’acquisition, matériel, densité et nombre de stations. Les matériaux présents, notamment ceux qui trompent le capteur. Les types de scène, intérieur, extérieur, ouvert ou encombré. Et les classes rares, dont l’absence n’apparaît qu’à l’usage. Une observation importante en découle. Le deuxième axe est spécifique à ce domaine, un objet observé uniquement à courte distance ne préparant pas un système à le reconnaître épars, ce qui impose une couverture par tranche de distance plutôt que par simple présence de la classe.

Sélectionner plutôt que collecter

Quatre stratégies de sélection s’appliquent à un corpus d’annotation 3D. Le tirage aléatoire, qui reflète la distribution réelle et sur-représente le banal. La sélection par configuration, qui retient les scènes contenant les agencements difficiles. La sélection par incertitude, qui retient ce qu’un modèle existant ne maîtrise pas. Et la sélection par couverture, qui complète les combinaisons manquantes du plan. Une conséquence pratique s’ensuit. Ces quatre stratégies se combinent plutôt qu’elles ne se remplacent, la première fournissant une base représentative et les trois autres l’enrichissant sur ce qui compte.

Le découpage en scènes

Cette décision structure le corpus. Elle est rarement examinée en annotation 3D. Un relevé continu doit être découpé en unités annotables. Quatre critères orientent ce découpage en annotation 3D. Le nombre d’objets par scène, qui détermine la durée d’une tâche et sa parallélisation. Les frontières naturelles, changement de local ou de station fournissant des points de coupe sans conséquence. L’homogénéité de densité, une scène mêlant zones proches et lointaines produisant une charge inégale. Et l’autonomie de compréhension, une scène devant contenir assez de contexte pour être annotable seule. Une observation importante en découle pour un projet d’annotation 3D. Le deuxième critère supprime par construction le problème des objets coupés par une frontière de tâche, difficulté qui produit sinon des annotations partielles de part et d’autre.

La séparation entraînement et évaluation

Une règle gouverne cette séparation. Son non-respect produit des chiffres flatteurs et faux. Deux scènes du même relevé partagent trop de contexte pour se répartir de part et d’autre. Quatre niveaux de séparation existent et leur exigence croît. Par scène, insuffisant lorsque plusieurs scènes proviennent du même relevé. Par relevé, minimum acceptable pour la plupart des usages. Par site, correct dès que le système doit fonctionner ailleurs. Et par campagne ou par capteur, le plus exigeant, qui mesure ce que le système fera sur des données nouvelles. Une conséquence pratique importante en découle. Le premier niveau est encore pratiqué et il produit une performance sans signification, deux scènes du même relevé partageant les mêmes objets vus sous des angles voisins.

Les métadonnées à enregistrer

Sept informations conditionnent l’exploitation d’un corpus d’annotation 3D. Elles coûtent quelques champs à la saisie. Le site et la station, indispensables à une séparation correcte. La date et l’heure, qui permettent de reconstituer les conditions. Le capteur employé et ses paramètres. La position du capteur pour chaque scène. La calibration en configuration multi-capteurs, avec son identifiant. Le traitement subi, sous-échantillonnage et filtrage notamment. Et le masque de couverture, qui distingue les zones observées des zones non observées. Une observation en découle pour un projet d’annotation 3D. La quatrième métadonnée est spécifique à ce domaine et rarement enregistrée, sans elle il devient impossible de savoir quelle face d’un objet a été mesurée et laquelle a été extrapolée.

Le dimensionnement

Quatre facteurs déterminent le volume nécessaire en annotation 3D. Ils ne se réduisent pas à un nombre de scènes. Le nombre de configurations à couvrir, produit des six axes retenus. Le nombre d’objets par classe et par tranche de distance. La variabilité interne de chaque classe. Et la difficulté de la tâche, une distinction fine exigeant plus d’exemples. Une conséquence pratique s’ensuit. Le volume se raisonne en objets par classe et par tranche de distance plutôt qu’en scènes, un objet proche et un objet lointain de même classe constituant deux exemples différents pour un système.

Les classes rares

Cette difficulté domine la constitution d’un corpus d’annotation 3D. Elle se traite en amont. Un objet rare ne se rencontre pas par acquisition aléatoire. Trois méthodes permettent de les récupérer. L’acquisition ciblée, praticable lorsque les emplacements sont connus. La mise en scène délibérée, possible en environnement maîtrisé et impossible ailleurs. Et la sollicitation d’un modèle existant, dont les détections incertaines localisent des candidats. Une observation importante en découle. La deuxième méthode distingue les verticaux maîtrisés des verticaux ouverts, un entrepôt permettant de produire les configurations difficiles à volonté là qu’une route impose de les attendre.

Le corpus d’évaluation en 3D

Une distinction mérite d’être posée car ce corpus n’obéit pas aux mêmes règles. Quatre différences caractérisent ce corpus en annotation 3D. L’exhaustivité devient impérative, un objet omis comptant comme fausse détection du système évalué. Le seuil de sparsité ne s’applique pas, ce qui oblige à annoter des objets que le corpus d’entraînement écartait. La stratification par distance doit être délibérée, un jeu dominé par les objets proches mesurant une performance sans signification. Et la stabilité dans le temps conditionne la comparaison entre deux versions. Une conséquence pratique importante en découle pour un projet d’annotation 3D. Les deux premières différences rendent ce corpus disproportionnément coûteux par scène, ce qui justifie de le dimensionner en scènes et non en proportion du corpus d’entraînement.

La constitution progressive

Une organisation en lots vaut mieux qu’une acquisition massive. Un corpus construit d’un bloc fige des conventions avant qu’elles soient éprouvées. Quatre avantages accompagnent une approche progressive en annotation 3D. Les conventions se corrigent entre deux lots plutôt qu’après l’ensemble. La cadence et le coût se mesurent tôt et se projettent. Un premier modèle permet de pré-annoter les lots suivants. Et les lacunes révélées par ce modèle orientent le contenu du lot suivant. Une conséquence pratique en découle. Le quatrième avantage est le plus important, il transforme la constitution en boucle plutôt qu’en ligne droite et concentre l’effort sur ce qui manque réellement.

Ce qu’il ne faut pas faire

Quatre pratiques dégradent un corpus d’annotation 3D. Elles paraissent pourtant raisonnables. Écarter les scènes dégradées, qui seront présentes en exploitation. Multiplier les stations sur un même site plutôt que d’en chercher de nouveaux. Découper à volume constant sans tenir compte des frontières naturelles. Et conserver uniquement les annotations en supprimant les nuages sources. Une observation en découle. La deuxième pratique est la plus fréquente, un site accessible produisant facilement de nombreuses stations dont l’apport marginal décroît rapidement.

Ce que la documentation doit contenir

Six éléments accompagnent une livraison d’annotation 3D. Leur absence limite la réutilisation. Le plan d’échantillonnage effectivement réalisé. Le tableau des effectifs par classe et par tranche de distance. Les conventions d’annotation, seuils et règle d’extrapolation incluses. Le critère de séparation retenu entre entraînement et évaluation. Le rapport de qualité, avec les valeurs par tranche de distance. Et la liste des configurations non couvertes, qui borne explicitement le domaine d’emploi. Une conséquence pratique importante en découle. Le dernier élément est le plus rare et le plus utile, déclarer ce que le corpus ne couvre pas transformant une limite invisible en limite connue.

Aborder la constitution d’un corpus 3D

Cinq questions cadrent cette phase d’un projet d’annotation 3D. Elles se posent avant toute acquisition. Combien de configurations distinctes le périmètre comporte-t-il. Ce produit détermine la couverture nécessaire. La couverture par tranche de distance est-elle prévue. Son absence produit un corpus déséquilibré. Quel critère de séparation sera retenu. Cette réponse conditionne la validité de toute mesure. La position du capteur sera-t-elle enregistrée. Son absence prive l’annotation d’une information déterminante. Et les classes rares sont-elles accessibles. Leur absence rend le projet infaisable en l’état. Ces cinq réponses déterminent le volume et la validité du résultat. Les poser avant de collecter évite un corpus volumineux et pauvre en diversité.

Ce que ce chapitre enseigne

Une observation transversale mérite de clore cet examen. La valeur d’un corpus 3D tient à sa diversité de configurations et non à son volume. Trois constats la composent. La distance constitue un axe de couverture à part entière, un objet proche et le même objet lointain étant deux exemples distincts pour un système. La géométrie d’acquisition détermine ce qui est observable autant que le capteur, ce qui fait du nombre de stations une variable de couverture et non de volume. Et la position du capteur est une métadonnée sans équivalent en annotation d’images, sans laquelle la distinction entre mesure et extrapolation se perd. Ce constat rejoint celui que le cluster vidéo a établi : ce qui détermine la valeur d’un corpus est ce qu’il couvre délibérément, et cette couverture se conçoit avant l’acquisition plutôt qu’elle ne se constate après.

Les erreurs les plus fréquentes

  • Dimensionner un corpus en scènes plutôt qu’en objets par tranche de distance.
  • Multiplier les stations sur un site accessible au lieu d’en chercher de nouveaux.
  • Séparer entraînement et évaluation par scène plutôt que par relevé ou par site.
  • Omettre la position du capteur dans les métadonnées.
  • Découper à volume constant sans tenir compte des frontières naturelles.
  • Écarter les scènes dégradées qui seront présentes en exploitation.
  • Supprimer les nuages sources après extraction des annotations.
  • Couvrir une classe sans couvrir ses différentes distances d’observation.
  • Acquérir massivement avant d’avoir éprouvé les conventions.
  • Livrer sans la liste des configurations non couvertes.

Exploiter un fonds existant

Une situation fréquente mérite d’être traitée, un client disposant souvent de relevés accumulés avant tout projet. Quatre vérifications établissent ce que ces relevés permettent en annotation 3D. La couverture des configurations, exercice qui révèle presque toujours une concentration sur quelques sites. La présence des métadonnées de capteur et de station, dont l’absence limite fortement l’exploitation. L’homogénéité de matériel, un fonds constitué sur plusieurs années mélangeant des capteurs de caractéristiques différentes. Et la représentativité, un fonds constitué pour des démonstrations présentant systématiquement des conditions favorables. Une conséquence pratique en découle pour un projet d’annotation 3D. La troisième vérification produit le constat le plus problématique, un mélange de capteurs rendant le corpus hétérogène en densité et en artefacts, ce qui impose de conserver le capteur comme métadonnée plutôt que de traiter l’ensemble comme un corpus unique.

L’organisation d’une campagne d’acquisition

Cinq décisions logistiques conditionnent la réussite d’une campagne d’annotation 3D. Le repérage des sites, en vérifiant qu’ils couvrent les configurations visées et que l’accès est autorisé. Le plan de stations par site, qui détermine l’occlusion résiduelle davantage que le choix du capteur. Le protocole d’acquisition, hauteur, densité et durée par station, consigné pour être reproductible. Le relevé des métadonnées, organisé pour être renseigné sur place et non reconstitué ensuite. Et le contrôle des nuages le jour même, une station manquée ou mal recalée se corrigeant tant qu’on est sur site. Une conséquence pratique importante en découle. Le deuxième point est celui qui distingue une campagne bien conçue, une station supplémentaire coûtant quelques minutes sur place et supprimant des heures d’extrapolation en annotation.

Le tableau de couverture

Un document simple pilote cette dimension et il tient sur une page. Il croise les configurations visées avec ce qui a été effectivement acquis. Cinq colonnes composent ce tableau en annotation 3D. La configuration, exprimée en catégories observables plutôt qu’en valeurs continues. La tranche de distance, dimension supplémentaire propre à ce domaine. Le nombre de scènes acquises pour cette combinaison. Le nombre d’objets annotés qui en proviennent. Et la performance mesurée, renseignée après la première évaluation. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. La deuxième colonne double le nombre de lignes du tableau et elle révèle presque toujours un déséquilibre, les objets lointains étant sous-représentés alors qu’ils constituent la part la plus difficile.

Ce que le stockage impose

Quatre contraintes spécifiques pèsent sur l’organisation d’un corpus d’annotation 3D. Le volume des nuages sources, plusieurs ordres de grandeur au dessus d’un corpus d’images à couverture équivalente. Le choix entre nuage complet et nuage sous-échantillonné, le second allégeant le travail et interdisant certaines réexploitations. Le transfert, dont la durée devient une contrainte de planning plutôt qu’un détail technique. Et la conservation des nuages après livraison, sans laquelle aucune réexploitation n’est possible. Une observation en découle. La deuxième contrainte mérite un arbitrage explicite, un sous-échantillonnage adapté à une tâche de cuboïdes rendant impossible une segmentation ultérieure sur le même corpus, ce qui plaide pour conserver le nuage complet et livrer la version allégée.

Le lot pilote comme test du plan

Quatre vérifications s’appliquent au premier lot et elles portent sur le plan plutôt que sur le corpus. La densité d’objets par scène et par tranche de distance, qui remplace l’estimation de volume par une mesure. La faisabilité du découpage retenu, une scène trop chargée ou trop pauvre se corrigeant à ce stade. La couverture réelle d’une journée d’acquisition, souvent inférieure à celle qui était prévue. Et la complétude des métadonnées, un champ oublié à l’acquisition ne se rattrapant pas. Une observation en découle pour un projet d’annotation 3D. La troisième vérification produit le constat le plus utile, un plan de campagne supposant régulièrement plus de sites par jour que la logistique n’en permet, ce qui se corrige avant d’avoir consommé le calendrier.

Ce que le corpus vaudra ensuite

Quatre propriétés déterminent si un corpus 3D se comporte comme un actif. La conservation des nuages sources, une annotation séparée de sa donnée perdant toute valeur. La déclaration des conventions de repère, de seuil et d’extrapolation, sans lesquelles il n’est combinable avec aucun autre. La complétude des métadonnées, capteur et station incluses, qui permet de sélectionner un sous-ensemble par condition. Et le masque de couverture, qui distingue les zones observées et vides des zones non observées. Une observation en découle pour un projet d’annotation 3D. La troisième propriété prend ici une importance particulière, un corpus dont on peut extraire les seules scènes issues d’un capteur donné restant exploitable quand le matériel change, là qu’un corpus indifférencié devient inutilisable dans son entier.

La question qui cadre la collecte

Une question remplace le débat sur le volume et elle se pose en une phrase. Dans combien de configurations distinctes le système opérera-t-il en production. Une réponse limitée à quelques sites stables conduit à un corpus modeste et à un effort porté sur la couverture des distances plutôt que des lieux. Une réponse en dizaines de configurations conduit à une campagne planifiée sur de nombreux sites, le nombre de scènes par site important peu. Cette question porte sur le déploiement et non sur la collecte, elle se pose à l’utilisateur final plutôt qu’au donneur d’ordre technique, et elle produit un plan là où une discussion sur le nombre de scènes produit un chiffre sans fondement.

Trois décisions avant la première acquisition

Trois décisions déterminent la validité d’un corpus d’annotation 3D. Établir la liste des configurations à couvrir en croisant les types de scène avec les tranches de distance, ce qui remplace un objectif en scènes par un objectif en diversité. Fixer le critère de séparation entre entraînement et évaluation, relevé ou site plutôt que scène. Et arrêter les métadonnées à enregistrer, position du capteur en premier lieu. Ces trois décisions coûtent une réunion, elles précèdent la première station, et leur absence produit un corpus dont la performance annoncée ne pourra pas être vérifiée.

Ce que la seconde campagne apporte

Une observation concerne ce qu’un premier corpus ne peut structurellement pas contenir. Une campagne menée sur une période courte capture une configuration matérielle et une organisation des lieux. Trois dimensions lui échappent. Le changement de matériel, un capteur remplacé produisant une densité et des artefacts différents. L’évolution des lieux, aménagement et occupation se modifiant sur des mois. Et la variation des pratiques d’acquisition, un opérateur différent ne plaçant pas ses stations de la même façon. Une conséquence pratique en découle pour un projet d’annotation 3D. Une seconde campagne espacée ajoute une dimension qu’aucune augmentation du volume de la première ne fournit, ce qui en fait une contribution qualitativement différente plutôt qu’un supplément.

Ce qu’il faut retenir

Le nombre de scènes ne détermine pas la valeur d’un corpus 3D, le nombre de configurations couvertes la déterminant et dépendant de la géométrie d’acquisition. Trois lectures se dégagent. La distance constitue un axe de couverture à part entière, un objet observé uniquement de près ne préparant pas un système à le reconnaître épars, ce qui impose un comptage par tranche de distance plutôt que par classe. Le découpage aux frontières naturelles supprime par construction le problème des objets coupés par une limite de tâche. Et la position du capteur est une métadonnée sans équivalent en annotation d’images, sans laquelle il devient impossible de savoir quelle face d’un objet a été mesurée et laquelle a été extrapolée. Pour la méthode qui exploite ce corpus à moindre coût, l’article consacré à la pré-annotation automatique en 3D détaille les options. Pour le cadre général, le guide de l’annotation 3D pose le panorama. Pour approfondir les modalités d’exécution, les formats pris en charge et les dispositifs de contrôle applicables, vous pouvez consulter notre page dédiée à l’annotation 2D et 3D. Et si vous devez concevoir un corpus tridimensionnel, échangeons sur votre projet.
Tags

Découvrez nos articles