Pré-annotation automatique en 3D – gains et limites

L’assistance en 3D ne fonctionne pas comme en annotation d’images. Certaines opérations s’automatisent presque entièrement, d’autres résistent complètement, et l’écart entre les deux se prédit à partir de la nature de la tâche plutôt que de la maturité des modèles. Cet article expose ce qu’elle apporte. Il prolonge l’article consacré à la constitution d’un dataset 3D.

Les quatre niveaux d’assistance

Quatre mécanismes se distinguent en annotation 3D et leur confusion produit des attentes inexactes. Le prétraitement géométrique, détourage du sol et filtrage, qui n’emploie aucun modèle appris. L’ajustement automatique, une boîte s’adaptant à un amas de points désigné. La détection par modèle, qui propose objets et classes sans intervention. Et le recalage de modèle connu, qui aligne une géométrie de référence sur les points effectivement observés. Une conséquence pratique importante en découle. Le premier mécanisme est disponible immédiatement et le troisième suppose un corpus, ce qui les rend accessibles à des moments très différents d’un projet.

Le détourage du sol

Cette opération se distingue de toutes les autres en annotation 3D. Son rapport entre coût et gain est sans équivalent. Séparer le sol du reste s’obtient par des méthodes géométriques sans apprentissage. Quatre bénéfices en découlent. La majorité des points d’une scène extérieure sont traités en une opération. Les objets deviennent visuellement séparés, ce qui facilite leur désignation. Le calcul de hauteur devient possible pour tous les objets. Et la charge visuelle diminue fortement, ce qui accélère la navigation dans la scène. Une observation importante en découle. Cette opération ne demande aucun corpus préalable et elle libère l’essentiel du volume, ce qui en fait le seul gain disponible dès la première scène d’un projet d’annotation 3D.

Ce que l’ajustement automatique apporte

Ce second mécanisme fonctionne bien en annotation 3D. Il est souvent négligé. Une boîte s’ajuste automatiquement à un amas de points que l’annotateur désigne. Trois apports en découlent pour un projet d’annotation 3D. La délimitation devient une désignation, geste bien plus rapide qu’un ajustement manuel. Le résultat est reproductible, deux annotateurs désignant le même amas obtenant la même boîte. Et les dimensions s’ajustent aux points réellement mesurés plutôt qu’à une estimation visuelle. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. Ce mécanisme n’emploie pas de modèle appris et il est donc disponible immédiatement, ce qui le place avec le détourage du sol dans la catégorie des gains sans condition.

Ce que l’ajustement automatique ne fait pas

Trois limites bornent ce second mécanisme. Il ajuste aux points observés et non à l’objet réel, ce qui produit une boîte sous-dimensionnée sur une face masquée. Il ne détermine pas l’orientation lorsque la forme est symétrique ou partiellement observée. Et il inclut les points parasites contenus dans la sélection, sans les distinguer de l’objet. Une observation importante en découle. La première limite est systématique plutôt qu’occasionnelle, ce qui impose de faire suivre l’ajustement d’une extrapolation conforme à la convention plutôt que d’accepter le résultat brut.

Ce que la détection par modèle apporte

Ce troisième mécanisme suppose un corpus. Son rendement varie fortement. Quatre observations caractérisent ce mécanisme en annotation 3D. La détection des classes courantes fonctionne bien à courte distance. Elle se dégrade fortement avec la sparsité, précisément là où l’humain est le plus lent. L’orientation proposée reproduit les ambiguïtés plutôt qu’elle ne les résout. Et les dimensions proposées reflètent la convention du corpus d’entraînement, quelle qu’elle soit. Une conséquence pratique importante en découle. La deuxième observation est la plus décevante, l’assistance étant faible exactement sur les objets qui coûtent le plus cher à traiter manuellement.

Le recalage de modèle connu

Ce quatrième mécanisme se distingue par sa fiabilité. Il ne vaut que dans les contextes qui le permettent. Une géométrie de référence s’aligne sur les points observés d’un objet identifié. Trois conditions rendent ce recalage possible. Un catalogue fermé d’objets, ce qui restreint son emploi aux environnements maîtrisés. Des modèles numériques disponibles, que le client doit fournir. Et une observation suffisante de l’objet pour lever l’ambiguïté de pose. Une observation en découle pour un projet d’annotation 3D. Ce mécanisme produit une forme exacte y compris sur les faces non observées, ce qui en fait le seul niveau d’assistance supprimant l’extrapolation plutôt que la déplaçant.

La segmentation assistée

Une tâche appelle des mécanismes différents et elle mérite un traitement séparé. Quatre formes d’assistance s’appliquent à la classification par point en annotation 3D. Le filtrage par hauteur, qui isole le sol et les objets bas sans aucun apprentissage. La propagation par continuité de surface, qui étend une sélection selon un critère purement géométrique. La segmentation en régions homogènes, qui prédécoupe la scène sans lui attribuer de classe. Et la classification par modèle appris, qui propose une classe pour chaque région ou chaque point. Une conséquence pratique importante en découle pour un projet d’annotation 3D. La troisième forme est la plus rentable et la moins employée, un prédécoupage géométrique transformant une classification par point en une classification par région, ce qui divise le nombre de décisions sans dépendre d’un corpus.

Le biais de validation

Ce mécanisme dégrade silencieusement la qualité. Il joue différemment en annotation 3D qu’ailleurs. Accepter une proposition demande moins d’effort que produire une annotation. Trois manifestations en découlent en annotation 3D. Une boîte sous-dimensionnée est validée, l’écart n’étant pas visible sans vue orthogonale. Une orientation plausible est acceptée sans que l’alternative soit examinée. Et une classe proposée est confirmée sur un objet bien trop épars pour la déterminer. Une observation importante en découle. La première manifestation est spécifique à ce domaine et elle est heureusement détectable, le contrôle de plausibilité dimensionnelle signalant automatiquement ce que l’œil laisse passer en annotation 3D.

La boucle d’amélioration

Cette organisation transforme l’assistance en levier croissant. Quatre étapes composent cette boucle. La pré-annotation du lot par le modèle courant. La correction par les annotateurs, avec relevé des désaccords par tranche de distance. Le réentraînement sur le corpus enrichi. Et l’analyse des désaccords relevés, qui oriente le contenu du lot suivant. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. Le relevé par tranche de distance est propre à ce domaine, il révèle que le gain se concentre sur les objets proches et permet de décider si un effort d’enrichissement sur les objets lointains est rentable.

Mesurer ce que l’assistance apporte

Quatre indicateurs quantifient le gain d’annotation 3D. Ils se relèvent sans effort particulier. Le temps par objet avec et sans assistance, mesuré par tranche de distance. Le taux de propositions acceptées sans modification. Le taux de propositions corrigées, qui distingue une aide d’une gêne. Et le taux d’alertes dimensionnelles sur les objets pré-annotés, révélateur direct d’un sous-dimensionnement systématique. Une observation importante en découle. Le quatrième indicateur n’a pas d’équivalent en annotation d’images, il mesure directement le défaut caractéristique de l’assistance en 3D et il se relève automatiquement.

Ce qui reste humain

Cinq décisions d’annotation 3D ne se délèguent pas. L’extrapolation des faces non observées, que l’ajustement automatique ne fait pas. La détermination de l’orientation sur les objets partiellement observés. Le jugement sur un objet trop épars pour être classé avec certitude. La séparation d’objets en contact que la géométrie ne distingue pas. Et le signalement d’un cas que la convention ne couvre pas encore. Une conséquence pratique s’ensuit. Ces cinq décisions correspondent exactement aux configurations que le chapitre sur les difficultés a identifiées, ce qui confirme que l’assistance traite le facile et laisse intact le difficile.

Ce que l’assistance change au contrôle

Quatre adaptations du dispositif de contrôle s’imposent. La recherche de sous-dimensionnement systématique, défaut propre à l’ajustement automatique. La conservation d’une part de lots non assistés pour mesurer la dérive. Le contrôle des orientations sur les objets pré-annotés, point faible connu des modèles. Et le suivi du taux de correction par tranche de distance, qui révèle où l’assistance cesse d’aider. Une observation en découle pour un projet d’annotation 3D. La première adaptation est la plus efficace, un décalage systématique des dimensions se détectant sur une distribution alors qu’il reste invisible objet par objet.

Aborder un projet assisté

Cinq questions cadrent un dispositif d’annotation 3D assistée. Le détourage du sol est-il en place. Son absence prive le projet du gain le plus immédiat. Un catalogue de modèles numériques existe-t-il. Sa présence ouvre le recalage. Un modèle de détection existe-t-il ou faut-il l’amorcer. Cette réponse détermine le calendrier du gain. Une part non assistée est-elle prévue. Son absence rend la dérive indétectable. Et le contrôle dimensionnel est-il branché sur les propositions avant validation. Son absence laisse passer le défaut caractéristique de ce dispositif. Ces cinq réponses déterminent le gain réel. Les poser avant de commencer évite une promesse d’économie que le dispositif ne tiendra pas.

Ce que ce chapitre enseigne

Une observation transversale mérite de clore cet examen. L’assistance en 3D se répartit entre deux catégories très inégales. Trois constats la composent. Les mécanismes géométriques, détourage et ajustement, sont disponibles immédiatement et produisent un gain immédiat sans corpus préalable. Les mécanismes appris se dégradent avec la sparsité, donc exactement là où le travail manuel coûte le plus. Et le défaut caractéristique de l’assistance, le sous-dimensionnement, est détectable automatiquement par une contrainte physique. Ce constat distingue ce domaine du cluster vidéo, où l’assistance introduisait un défaut que seul un contrôle humain révélait, alors qu’ici la physique fournit le garde-fou.

Les erreurs les plus fréquentes

  • Confondre prétraitement géométrique et détection par modèle.
  • Ne pas mettre en place le détourage du sol dès le premier lot.
  • Accepter une boîte ajustée automatiquement sans extrapolation.
  • Attendre d’un modèle qu’il résolve l’ambiguïté d’orientation.
  • Espérer un gain d’assistance sur les objets lointains.
  • Employer un modèle dont la convention dimensionnelle diffère du projet.
  • Ne pas brancher le contrôle dimensionnel sur les propositions.
  • Omettre la part de lots non assistés.
  • Mesurer le gain globalement plutôt que par tranche de distance.
  • Négliger le recalage de modèle connu lorsque le catalogue le permet.

Quand l’assistance devient rentable

Une contrainte de calendrier structure ce dispositif en annotation 3D. Trois phases se succèdent et elles n’offrent pas les mêmes gains d’annotation 3D. Le démarrage, où seuls les mécanismes géométriques sont disponibles, détourage, ajustement et prédécoupage. La montée, où un premier modèle propose des détections imparfaites sur les classes courantes et à courte distance. Et le régime établi, où le modèle traite la majorité des objets proches pendant que l’humain se concentre sur les objets épars et sur les cas limites. Une observation importante en découle. Cette progression diffère de celle des autres domaines par sa première phase, les mécanismes géométriques fournissant un gain substantiel avant tout corpus, ce qui rend l’assistance rentable même sur un projet court là qu’en vidéo elle ne l’était pas.

Ce que l’assistance change au chiffrage

Quatre effets modifient une estimation de coût en annotation 3D. Le coût par objet décroît fortement sur les objets proches et bien observés. Il ne décroît presque pas sur les objets épars, qui restent traités manuellement. Le contrôle devient plus coûteux, la recherche de sous-dimensionnement systématique s’ajoutant au dispositif ordinaire. Et la mise en place des mécanismes géométriques constitue un coût unique modeste. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. Le deuxième effet impose de chiffrer par tranche de distance plutôt que globalement, un gain annoncé sur l’ensemble étant systématiquement supérieur au gain réalisé dès que le corpus comporte une part importante d’objets lointains.

Former les annotateurs au travail assisté

Cinq réflexes distinguent un annotateur 3D formé à ce mode de travail. Vérifier systématiquement une boîte ajustée en vue orthogonale, seule vue où le sous-dimensionnement se voit. Compléter l’extrapolation après un ajustement automatique plutôt qu’accepter le résultat brut. Examiner l’orientation proposée plutôt que la valider par défaut. Écarter une proposition entière sur un objet trop épars plutôt que de la corriger. Et signaler une erreur récurrente du modèle plutôt que de la corriger silencieusement. Une conséquence pratique s’ensuit pour un projet d’annotation 3D. Le premier réflexe est le plus déterminant et le moins naturel, une boîte ajustée paraissant correcte en vue perspective alors qu’elle est systématiquement trop courte du côté non observé.

Ce que le modèle apprend du corpus

Une propriété de la boucle mérite d’être signalée car elle produit un effet cumulatif. Un modèle réentraîné sur un corpus corrigé reproduit les conventions de ce corpus. Trois conséquences en découlent en annotation 3D. La convention d’extrapolation se propage dans les propositions, ce qui rend l’assistance progressivement conforme au projet. Un sous-dimensionnement non corrigé se renforce, le modèle apprenant à produire des boîtes trop courtes avec cohérence. Et le seuil de sparsité employé détermine ce que le modèle apprend à ignorer définitivement. Une conséquence pratique importante en découle. La deuxième conséquence justifie de brancher le contrôle dimensionnel avant le réentraînement plutôt qu’après, un corpus validé avec un biais systématique produisant un modèle qui l’amplifie à chaque itération.

Le corpus d’amorçage

Une question pratique se pose au démarrage et elle admet trois réponses. Un modèle de détection a besoin d’un premier corpus pour être utile. Trois sources permettent d’obtenir ce corpus d’amorçage en annotation 3D. L’annotation manuelle d’un premier lot, assistée par les mécanismes géométriques disponibles immédiatement. Un corpus public du même domaine, qui donne un point de départ et impose de vérifier la convention dimensionnelle. Et un modèle généraliste pré-entraîné, dont les classes courantes couvrent une part du besoin et ignorent entièrement les catégories métier. Une observation importante en découle. La deuxième source produit un effet secondaire propre à ce domaine, un corpus public employant une autre convention d’extrapolation transmettant au modèle des dimensions systématiquement décalées, ce qui impose de vérifier cette convention avant de l’employer.

Quand renoncer à l’assistance apprise

Quatre situations rendent la détection par modèle contre-productive en annotation 3D. Un corpus majoritairement composé d’objets épars, où le modèle échoue précisément là où le besoin se situe. Une nomenclature métier sans équivalent public, qui interdit tout amorçage externe. Une nomenclature en cours de stabilisation, une pré-annotation figeant des conventions en révision. Et un corpus hétérogène en capteurs, où le modèle rencontre des densités et des artefacts qu’il n’a jamais appris à traiter. Une observation en découle. Ces quatre situations n’écartent que la détection par modèle, les mécanismes géométriques restant applicables et rentables, ce qui distingue une renonciation partielle d’un abandon de l’assistance.

Le dispositif minimal

Cinq mesures encadrent une chaîne d’annotation 3D assistée et leur coût reste modeste. Le contrôle de plausibilité dimensionnelle branché sur les propositions avant validation. Une part de lots non assistés, fixée au départ et maintenue tout au long du projet. Le suivi du taux de correction par tranche de distance. La vérification systématique des orientations sur les objets pré-annotés. Et la consigne explicite de signalement des erreurs récurrentes plutôt que de leur correction silencieuse. Une observation en découle. La première mesure est celle qui distingue ce domaine, elle intercepte automatiquement le défaut caractéristique de l’assistance et elle ne demande qu’une table de plages dimensionnelles déjà nécessaire par ailleurs.

Ce qu’il faut dire au client

Quatre formulations rendent cette conversation honnête et elles évitent une promesse intenable. Annoncer un gain par tranche de distance plutôt qu’un gain global, la distinction étant vérifiable. Distinguer les mécanismes géométriques, disponibles immédiatement, de la détection apprise, qui suppose un corpus. Exposer que le contrôle change de nature et non qu’il disparaît, la recherche de sous-dimensionnement étant une dépense nouvelle. Et rappeler que les objets épars restent entièrement à la charge humaine, ce qui borne l’économie sur les corpus à longue portée. Une observation en découle pour un prestataire d’annotation 3D. La deuxième formulation est celle qui distingue le plus, un client entendant généralement que l’assistance suppose un corpus et découvrant avec intérêt qu’une part du gain est disponible dès la première scène.

La question qui décide de l’assistance

Une question tranche l’opportunité de la détection apprise et elle porte sur la distribution du corpus. Quelle part des objets se situe à courte distance et bien observée. Une réponse élevée rend la détection apprise décisive, le modèle traitant la majorité du volume et l’humain se concentrant sur le reste. Une réponse faible la rend marginale, le gain portant sur une fraction du travail alors que la mise en place et le contrôle s’appliquent à l’ensemble. Cette question se répond en comptant les objets par tranche de distance sur un lot pilote, et elle ne concerne que la détection apprise, les mécanismes géométriques restant rentables dans tous les cas.

Trois précautions avant de lancer

Trois précautions distinguent une chaîne d’annotation 3D assistée saine d’une chaîne qui dérive. Brancher le contrôle de plausibilité dimensionnelle sur les propositions avant la première validation, et non après le premier lot. Fixer la part de lots non assistés avant de commencer, valeur qui ne se renégocie pas sous la pression du délai. Et vérifier que la convention dimensionnelle du modèle employé correspond à celle du projet, une divergence produisant un décalage systématique invisible objet par objet. Ces trois précautions coûtent peu, elles se prennent au cadrage, et leur absence produit une chaîne rapide dont les dimensions dérivent lentement sans que personne ne s’en aperçoive avant la livraison.

Ce qu’il faut retenir

L’assistance en 3D sépare nettement les mécanismes géométriques, disponibles sans corpus, des mécanismes appris, dont le rendement dépend du contexte. Trois lectures se dégagent. Le détourage du sol ne demande aucun corpus préalable et libère l’essentiel du volume d’une scène extérieure, ce qui en fait le seul gain disponible dès la première scène. La détection par modèle se dégrade avec la sparsité, donc exactement sur les objets qui coûtent le plus cher à traiter manuellement, ce qui borne l’économie réelle. Et le sous-dimensionnement produit par l’ajustement automatique est détectable par le contrôle de plausibilité dimensionnelle, ce qui fournit un garde-fou que l’annotation d’images ne possède pas. Pour la vue prospective de ce domaine, l’article consacré aux tendances de la perception 3D examine les évolutions. Pour le cadre général, le guide de l’annotation 3D pose le panorama. Pour approfondir les modalités d’exécution, les formats pris en charge et les dispositifs de contrôle applicables, vous pouvez consulter notre page dédiée à l’annotation 2D et 3D. Et si vous souhaitez mettre en place une chaîne d’annotation 3D assistée, échangeons sur votre projet.
Tags

Découvrez nos articles