L’assistance en 3D ne fonctionne pas comme en annotation d’images. Certaines opérations s’automatisent presque entièrement, d’autres résistent complètement, et l’écart entre les deux se prédit à partir de la nature de la tâche plutôt que de la maturité des modèles.
Cet article expose ce qu’elle apporte. Il prolonge l’article consacré à la constitution d’un dataset 3D.
Les quatre niveaux d’assistance
Quatre mécanismes se distinguent en annotation 3D et leur confusion produit des attentes inexactes. Le prétraitement géométrique, détourage du sol et filtrage, qui n’emploie aucun modèle appris. L’ajustement automatique, une boîte s’adaptant à un amas de points désigné. La détection par modèle, qui propose objets et classes sans intervention. Et le recalage de modèle connu, qui aligne une géométrie de référence sur les points effectivement observés. Une conséquence pratique importante en découle. Le premier mécanisme est disponible immédiatement et le troisième suppose un corpus, ce qui les rend accessibles à des moments très différents d’un projet.Le détourage du sol
Cette opération se distingue de toutes les autres en annotation 3D. Son rapport entre coût et gain est sans équivalent. Séparer le sol du reste s’obtient par des méthodes géométriques sans apprentissage. Quatre bénéfices en découlent. La majorité des points d’une scène extérieure sont traités en une opération. Les objets deviennent visuellement séparés, ce qui facilite leur désignation. Le calcul de hauteur devient possible pour tous les objets. Et la charge visuelle diminue fortement, ce qui accélère la navigation dans la scène. Une observation importante en découle. Cette opération ne demande aucun corpus préalable et elle libère l’essentiel du volume, ce qui en fait le seul gain disponible dès la première scène d’un projet d’annotation 3D.Ce que l’ajustement automatique apporte
Ce second mécanisme fonctionne bien en annotation 3D. Il est souvent négligé. Une boîte s’ajuste automatiquement à un amas de points que l’annotateur désigne. Trois apports en découlent pour un projet d’annotation 3D. La délimitation devient une désignation, geste bien plus rapide qu’un ajustement manuel. Le résultat est reproductible, deux annotateurs désignant le même amas obtenant la même boîte. Et les dimensions s’ajustent aux points réellement mesurés plutôt qu’à une estimation visuelle. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. Ce mécanisme n’emploie pas de modèle appris et il est donc disponible immédiatement, ce qui le place avec le détourage du sol dans la catégorie des gains sans condition.Ce que l’ajustement automatique ne fait pas
Trois limites bornent ce second mécanisme. Il ajuste aux points observés et non à l’objet réel, ce qui produit une boîte sous-dimensionnée sur une face masquée. Il ne détermine pas l’orientation lorsque la forme est symétrique ou partiellement observée. Et il inclut les points parasites contenus dans la sélection, sans les distinguer de l’objet. Une observation importante en découle. La première limite est systématique plutôt qu’occasionnelle, ce qui impose de faire suivre l’ajustement d’une extrapolation conforme à la convention plutôt que d’accepter le résultat brut.Ce que la détection par modèle apporte
Ce troisième mécanisme suppose un corpus. Son rendement varie fortement. Quatre observations caractérisent ce mécanisme en annotation 3D. La détection des classes courantes fonctionne bien à courte distance. Elle se dégrade fortement avec la sparsité, précisément là où l’humain est le plus lent. L’orientation proposée reproduit les ambiguïtés plutôt qu’elle ne les résout. Et les dimensions proposées reflètent la convention du corpus d’entraînement, quelle qu’elle soit. Une conséquence pratique importante en découle. La deuxième observation est la plus décevante, l’assistance étant faible exactement sur les objets qui coûtent le plus cher à traiter manuellement.Le recalage de modèle connu
Ce quatrième mécanisme se distingue par sa fiabilité. Il ne vaut que dans les contextes qui le permettent. Une géométrie de référence s’aligne sur les points observés d’un objet identifié. Trois conditions rendent ce recalage possible. Un catalogue fermé d’objets, ce qui restreint son emploi aux environnements maîtrisés. Des modèles numériques disponibles, que le client doit fournir. Et une observation suffisante de l’objet pour lever l’ambiguïté de pose. Une observation en découle pour un projet d’annotation 3D. Ce mécanisme produit une forme exacte y compris sur les faces non observées, ce qui en fait le seul niveau d’assistance supprimant l’extrapolation plutôt que la déplaçant.La segmentation assistée
Une tâche appelle des mécanismes différents et elle mérite un traitement séparé. Quatre formes d’assistance s’appliquent à la classification par point en annotation 3D. Le filtrage par hauteur, qui isole le sol et les objets bas sans aucun apprentissage. La propagation par continuité de surface, qui étend une sélection selon un critère purement géométrique. La segmentation en régions homogènes, qui prédécoupe la scène sans lui attribuer de classe. Et la classification par modèle appris, qui propose une classe pour chaque région ou chaque point. Une conséquence pratique importante en découle pour un projet d’annotation 3D. La troisième forme est la plus rentable et la moins employée, un prédécoupage géométrique transformant une classification par point en une classification par région, ce qui divise le nombre de décisions sans dépendre d’un corpus.Le biais de validation
Ce mécanisme dégrade silencieusement la qualité. Il joue différemment en annotation 3D qu’ailleurs. Accepter une proposition demande moins d’effort que produire une annotation. Trois manifestations en découlent en annotation 3D. Une boîte sous-dimensionnée est validée, l’écart n’étant pas visible sans vue orthogonale. Une orientation plausible est acceptée sans que l’alternative soit examinée. Et une classe proposée est confirmée sur un objet bien trop épars pour la déterminer. Une observation importante en découle. La première manifestation est spécifique à ce domaine et elle est heureusement détectable, le contrôle de plausibilité dimensionnelle signalant automatiquement ce que l’œil laisse passer en annotation 3D.La boucle d’amélioration
Cette organisation transforme l’assistance en levier croissant. Quatre étapes composent cette boucle. La pré-annotation du lot par le modèle courant. La correction par les annotateurs, avec relevé des désaccords par tranche de distance. Le réentraînement sur le corpus enrichi. Et l’analyse des désaccords relevés, qui oriente le contenu du lot suivant. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. Le relevé par tranche de distance est propre à ce domaine, il révèle que le gain se concentre sur les objets proches et permet de décider si un effort d’enrichissement sur les objets lointains est rentable.Mesurer ce que l’assistance apporte
Quatre indicateurs quantifient le gain d’annotation 3D. Ils se relèvent sans effort particulier. Le temps par objet avec et sans assistance, mesuré par tranche de distance. Le taux de propositions acceptées sans modification. Le taux de propositions corrigées, qui distingue une aide d’une gêne. Et le taux d’alertes dimensionnelles sur les objets pré-annotés, révélateur direct d’un sous-dimensionnement systématique. Une observation importante en découle. Le quatrième indicateur n’a pas d’équivalent en annotation d’images, il mesure directement le défaut caractéristique de l’assistance en 3D et il se relève automatiquement.Ce qui reste humain
Cinq décisions d’annotation 3D ne se délèguent pas. L’extrapolation des faces non observées, que l’ajustement automatique ne fait pas. La détermination de l’orientation sur les objets partiellement observés. Le jugement sur un objet trop épars pour être classé avec certitude. La séparation d’objets en contact que la géométrie ne distingue pas. Et le signalement d’un cas que la convention ne couvre pas encore. Une conséquence pratique s’ensuit. Ces cinq décisions correspondent exactement aux configurations que le chapitre sur les difficultés a identifiées, ce qui confirme que l’assistance traite le facile et laisse intact le difficile.Ce que l’assistance change au contrôle
Quatre adaptations du dispositif de contrôle s’imposent. La recherche de sous-dimensionnement systématique, défaut propre à l’ajustement automatique. La conservation d’une part de lots non assistés pour mesurer la dérive. Le contrôle des orientations sur les objets pré-annotés, point faible connu des modèles. Et le suivi du taux de correction par tranche de distance, qui révèle où l’assistance cesse d’aider. Une observation en découle pour un projet d’annotation 3D. La première adaptation est la plus efficace, un décalage systématique des dimensions se détectant sur une distribution alors qu’il reste invisible objet par objet.Aborder un projet assisté
Cinq questions cadrent un dispositif d’annotation 3D assistée. Le détourage du sol est-il en place. Son absence prive le projet du gain le plus immédiat. Un catalogue de modèles numériques existe-t-il. Sa présence ouvre le recalage. Un modèle de détection existe-t-il ou faut-il l’amorcer. Cette réponse détermine le calendrier du gain. Une part non assistée est-elle prévue. Son absence rend la dérive indétectable. Et le contrôle dimensionnel est-il branché sur les propositions avant validation. Son absence laisse passer le défaut caractéristique de ce dispositif. Ces cinq réponses déterminent le gain réel. Les poser avant de commencer évite une promesse d’économie que le dispositif ne tiendra pas.Ce que ce chapitre enseigne
Une observation transversale mérite de clore cet examen. L’assistance en 3D se répartit entre deux catégories très inégales. Trois constats la composent. Les mécanismes géométriques, détourage et ajustement, sont disponibles immédiatement et produisent un gain immédiat sans corpus préalable. Les mécanismes appris se dégradent avec la sparsité, donc exactement là où le travail manuel coûte le plus. Et le défaut caractéristique de l’assistance, le sous-dimensionnement, est détectable automatiquement par une contrainte physique. Ce constat distingue ce domaine du cluster vidéo, où l’assistance introduisait un défaut que seul un contrôle humain révélait, alors qu’ici la physique fournit le garde-fou.Les erreurs les plus fréquentes
- Confondre prétraitement géométrique et détection par modèle.
- Ne pas mettre en place le détourage du sol dès le premier lot.
- Accepter une boîte ajustée automatiquement sans extrapolation.
- Attendre d’un modèle qu’il résolve l’ambiguïté d’orientation.
- Espérer un gain d’assistance sur les objets lointains.
- Employer un modèle dont la convention dimensionnelle diffère du projet.
- Ne pas brancher le contrôle dimensionnel sur les propositions.
- Omettre la part de lots non assistés.
- Mesurer le gain globalement plutôt que par tranche de distance.
- Négliger le recalage de modèle connu lorsque le catalogue le permet.