Un fonds d’images n’est pas un dataset. Entre les deux se placent une série de décisions techniques qui, prises à la légère, produisent un corpus annoté avec soin et inutilisable pour l’usage auquel il était destiné.
Cet article expose ces décisions. Il prolonge l’article consacré au LiDAR aéroporté.
Ce que la résolution commande
Cinq conséquences découlent de la taille du pixel au sol en imagerie satellite.
Elle fixe la taille minimale d’un objet réellement identifiable.
Elle décide des géométries d’annotation qui restent employables.
Elle conditionne enfin la séparation de deux objets voisins.
Elle influe directement sur le nombre d’objets par tuile.
Et elle détermine directement le coût d’acquisition de la donnée.
Une conséquence pratique importante en découle. Une règle simple guide le cadrage, un objet devant couvrir plusieurs pixels dans sa plus petite dimension pour pouvoir être délimité, ce qui permet de vérifier la faisabilité d’un projet avant toute acquisition.
Ce que le rééchantillonnage change
Quatre effets accompagnent un changement de résolution.
Une image volontairement dégradée perd définitivement le détail retiré.
Une image suréchantillonnée ne gagne strictement aucune information.
Le mélange de plusieurs résolutions produit un corpus hétérogène.
Et la méthode d’interpolation retenue modifie l’apparence des contours.
Une observation importante en découle pour un projet d’imagerie satellite. Le deuxième effet trompe régulièrement, une image simplement agrandie paraissant plus fine sans rien contenir de davantage, ce qui conduit parfois à annoter des objets que le capteur n’avait jamais résolus.
Ce que le géoréférencement exige
Cinq vérifications précèdent toute production en imagerie satellite.
Le système de coordonnées employé ainsi que sa projection.
La correction du relief, opérée par une orthorectification préalable.
La superposition effective de deux acquisitions successives.
La cohérence entre l’image et les couches vectorielles déjà existantes.
Et l’exactitude de position rapportée à des points de calage connus.
Une conséquence pratique s’ensuit. La quatrième vérification se néglige souvent, un décalage entre l’image et le référentiel propre du client rendant les annotations livrées inexploitables sans un recalage que personne n’avait songé à budgéter.
Ce que le tuilage impose
Cinq décisions structurent le découpage d’une scène d’imagerie satellite.
La taille des tuiles, qui arbitre entre contexte visible et maniabilité.
Le recouvrement finalement retenu entre deux tuiles adjacentes.
Le traitement réservé aux objets coupés par une limite.
La règle de comptage appliquée à ces objets partagés.
Et la reconstitution du résultat à l’échelle de la scène entière.
Une observation en découle. La première décision se juge à l’objet plutôt qu’au confort, une tuile trop petite privant l’annotateur du contexte qui lui est nécessaire pour reconnaître ce qu’il regarde.
Ce que le recouvrement apporte
Quatre bénéfices d’imagerie satellite découlent d’une marge entre tuiles.
Un objet coupé apparaît en entier sur la tuile voisine.
Le réassemblage se fait sans discontinuité visible.
Les erreurs de bord se détectent alors par simple comparaison.
Et le contexte demeure disponible jusqu’aux limites.
Une conséquence pratique importante en découle. Ces quatre bénéfices se paient en volume annoté, un recouvrement trop important multipliant le nombre d’objets vus deux fois, ce qui impose un arbitrage explicite entre qualité de raccord et coût de production.
Ce que l’hétérogénéité du fonds impose
Cinq écarts se rencontrent dans un fonds d’imagerie satellite constitué.
Des résolutions différentes selon chacune des sources.
Des capteurs aux restitutions colorimétriques nettement distinctes.
Des dates d’acquisition réparties sur plusieurs années.
Des angles de prise de vue très variables d’une image à l’autre.
Et des états de correction très inégaux d’une image à l’autre.
Une observation importante en découle pour un projet d’imagerie satellite. Le dernier écart est le plus insidieux, un fonds mêlant des images corrigées et des images brutes produisant des variations d’apparence que l’annotateur attribuera au terrain plutôt qu’au traitement.
Ce que le format des données impose
Cinq caractéristiques techniques conditionnent le travail en imagerie satellite.
La profondeur radiométrique, bien souvent supérieure à celle d’une photographie.
Le nombre de bandes ainsi que leur ordre dans le fichier.
La compression employée ainsi que ses éventuelles pertes.
Les métadonnées de géoréférencement effectivement attachées au fichier.
Et la structure interne du fichier, qui autorise ou non un accès partiel.
Une conséquence pratique importante en découle. La première caractéristique surprend les équipes venues de l’annotation d’images, un fichier satellite codant chaque bande sur bien plus de niveaux qu’un écran ordinaire n’en affiche, ce qui impose un choix de visualisation qui n’a rien d’automatique.
Ce que la séparation des jeux exige
Quatre règles gouvernent la répartition d’un corpus d’imagerie satellite.
La séparation doit toujours être géographique plutôt qu’aléatoire.
Les tuiles voisines appartiennent nécessairement au même jeu.
Le recouvrement ne doit jamais traverser deux jeux distincts.
Et les mêmes zones prises à des dates différentes restent ensemble.
Une conséquence pratique importante en découle. Ces quatre règles visent un seul défaut, une tuile d’entraînement voisine d’une tuile d’évaluation produisant une performance mesurée qui surestime largement la capacité réelle du système.
Aborder la préparation d’un dataset
Cinq questions cadrent une telle préparation en imagerie satellite.
La résolution suffit-elle aux objets visés. Vérifiez avant d’acquérir.
Les images se superposent-elles au référentiel client. Sinon le livrable est inutilisable.
Quelle taille de tuile donne le contexte nécessaire. L’objet en décide.
Le fonds est-il homogène en correction. Sinon l’annotateur sera trompé.
Et la séparation des jeux est-elle spatiale. Sinon la mesure trompe.
Ces cinq réponses déterminent la validité même du corpus. Les poser avant la production évite un travail impeccable et pourtant inexploitable.
Ce que ce chapitre enseigne
Une observation transversale mérite de clore cet examen.
La préparation décide de ce que l’annotation pourra produire.
Trois constats la composent.
Une image agrandie paraît plus fine sans contenir davantage.
Un décalage avec le référentiel client rend les annotations inexploitables.
Et une tuile d’entraînement voisine d’une tuile d’évaluation fausse toute mesure.
Ce constat éclaire rétrospectivement les chapitres précédents, plusieurs difficultés y trouvant leur origine dans une décision technique prise avant la première annotation.
Les erreurs les plus fréquentes
- Annoter des objets que la résolution ne permettait pas de résoudre.
- Suréchantillonner une image en croyant gagner du détail.
- Découvrir un décalage avec le référentiel client à la livraison.
- Choisir une taille de tuile pour le confort plutôt que pour l’objet.
- Mélanger des images corrigées et non corrigées dans un même fonds.
- Répartir les jeux aléatoirement plutôt que par zone géographique.
- Laisser un recouvrement traverser deux jeux distincts.
- Omettre la règle de traitement des objets coupés par une tuile.
- Négliger la vérification de position sur des points connus.
- Constituer un fonds sans documenter la provenance de chaque image.
Ce que la sélection des zones décide
Cinq critères guident le choix des zones d’imagerie satellite à annoter.
La représentativité des territoires effectivement visés par l’usage.
La présence des classes rares que le projet cherche à obtenir.
La variété des conditions d’acquisition réellement rencontrées.
La disponibilité d’une vérité de terrain sur chacune de ces zones.
Et la contiguïté nécessaire au contrôle des raccords entre tuiles.
Une observation importante en découle pour un projet d’imagerie satellite. Le premier critère entre souvent en conflit avec le quatrième, les zones les mieux documentées étant bien rarement les plus représentatives, ce qui impose de choisir explicitement entre facilité de vérification et validité du corpus.
Ce que la documentation du fonds doit consigner
Six informations accompagnent chaque image d’un corpus d’imagerie satellite.
La source ainsi que le capteur d’origine.
La date ainsi que l’heure exacte d’acquisition.
La résolution native constatée avant tout traitement.
L’état de correction atmosphérique ainsi que géométrique.
Le système de coordonnées finalement employé.
Et l’ensemble des traitements appliqués depuis l’acquisition.
Une conséquence pratique importante en découle pour un projet d’imagerie satellite. La dernière information manque presque toujours et se reconstitue mal, un corpus dont on ignore la chaîne de traitement devenant impossible à étendre de façon cohérente, ce qui limite sa durée de vie bien plus sûrement que ne le fait son volume.
Trois décisions avant de produire
Trois décisions engagent la préparation d’un dataset d’imagerie satellite.
Vérifier que la résolution native permet de résoudre les objets visés.
Contrôler la superposition des images avec le référentiel du client.
Et fixer une séparation géographique des jeux avant tout découpage.
Ces trois décisions ne coûtent que quelques heures, elles précèdent la toute première tuile, et leur absence produit un travail d’annotation impeccable et pourtant inexploitable.
Ce que l’annotateur reçoit réellement
Cinq éléments composent un poste d’annotation d’imagerie satellite correctement préparé.
Des tuiles dont la taille fournit le contexte nécessaire.
Une visualisation fixée une fois pour toutes et identique pour tous les opérateurs.
Un accès aux tuiles voisines pour traiter les objets de bord.
Les couches de référence superposables, lorsqu’elles existent déjà.
Et une consigne écrite portant sur le traitement des limites.
Une observation importante en découle pour un projet d’imagerie satellite. Le troisième élément se néglige souvent et coûte peu, un opérateur privé de la tuile voisine ne pouvant décider si un objet coupé se poursuit ou bien s’arrête, ce qui transforme une question de préparation en une source permanente de désaccord.
La question qui cadre la préparation
Une question détermine toute la chaîne technique en imagerie satellite.
Le corpus servira-t-il un seul projet ou plusieurs.
Un seul projet autorise un tuilage taillé pour l’objet visé, une visualisation choisie pour lui et une documentation sommaire, le corpus disparaissant avec le modèle qu’il a servi.
Plusieurs projets exigent une résolution native conservée, une chaîne de traitement documentée et un découpage que d’autres usages pourront reprendre.
Cette question relève de l’ambition du client et non de la technique, elle se pose avant l’acquisition, et elle sépare un corpus jetable d’un actif qui se réemploie pendant des années.
Trois vérifications avant la première tuile
Trois contrôles qualifient un fonds d’imagerie satellite préparé.
La résolution native, rapportée à la taille réelle des objets visés.
La superposition effective obtenue avec les couches de référence du client.
Et la règle de séparation des jeux retenue, spatiale plutôt qu’aléatoire.
Ces trois contrôles se posent en une seule question chacun, ils ne demandent aucun outil particulier, et leur absence indique un corpus dont le défaut se révélera après la production plutôt qu’avant elle.
Ce que le prestataire apporte ici
Quatre apports distinguent une préparation menée sérieusement en imagerie satellite.
Un contrôle de superposition conduit avant la production plutôt qu’au moment de la recette.
Un tuilage dimensionné pour l’objet visé plutôt que pour le confort de l’outil.
Une séparation spatiale des jeux appliquée dès le premier découpage.
Et une documentation complète de la chaîne de traitement remise avec le corpus.
Une conséquence pratique importante en découle. Le premier apport se remarque peu et évite le litige le plus fréquent de ce domaine, un client découvrant au moment de la livraison que les annotations ne se superposent pas à ses données rejetant l’ensemble du travail pour une cause qui n’a rien à voir avec sa qualité.
Ce que ce chapitre laisse au suivant
Un corpus bien préparé n’empêche pas un annotateur de manquer ce qu’il regarde.
Trois questions restent ouvertes en imagerie satellite.
Comment traiter des objets qui approchent la limite du détectable.
Ce que des heures de balayage font à l’attention d’un opérateur.
Et comment contrôler un travail dont les erreurs sont des absences.
Ces trois questions relèvent de la qualité d’annotation, qui constitue l’objet du chapitre suivant.
Ce que le coût de cette étape recouvre
Quatre postes composent la préparation d’un fonds d’imagerie satellite.
L’acquisition ou bien la collecte des images sources.
Les traitements de correction ainsi que d’harmonisation.
Le découpage, le recouvrement ainsi que la répartition des jeux.
Et la documentation de l’ensemble de la chaîne de traitement.
Une conséquence pratique importante en découle. Ces quatre postes précèdent tous la première annotation et s’oublient très régulièrement au chiffrage, un projet budgété sur le seul volume à annoter découvrant en cours de route une phase préparatoire qui pèse parfois autant que la production elle-même.
Ce que cette étape a de particulier
Quatre traits distinguent la préparation des autres phases d’un projet.
Elle précède tout le reste et ne se juge que bien après.
Ses défauts ne se voient jamais sur une seule tuile isolée.
Elle relève de la technique bien plus que du domaine traité.
Et son coût s’omet très régulièrement des chiffrages initiaux.
Une observation importante en découle pour un projet d’imagerie satellite. Le deuxième trait explique pourquoi ces décisions se prennent mal, un contrôle mené par échantillon de tuiles ne pouvant révéler ni un décalage de référentiel ni une séparation de jeux défaillante, ce qui laisse ces défauts traverser toute la production sans être détectés.
Ce que le premier lot doit établir
Quatre résultats justifient un lot d’essai avant la production complète.
La superposition effective des annotations avec les couches du client.
La taille de tuile que les annotateurs jugent réellement suffisante en contexte.
Le nombre d’objets rencontrés par tuile sur les zones réellement traitées.
Et la proportion d’objets effectivement coupés par une limite de tuile.
Une conséquence pratique importante en découle pour un projet d’imagerie satellite. Le premier résultat se vérifie en une heure et évite le litige le plus coûteux, un simple report de quelques annotations dans le système propre du client montrant immédiatement si les deux se rejoignent, contrôle que presque personne ne conduit avant d’avoir tout produit.
Ce que cette étape rend possible ensuite
Quatre libertés découlent d’une préparation bien conduite.
Le corpus peut s’étendre ensuite sans rien perdre de sa cohérence.
Un nouvel usage peut réemployer directement les mêmes tuiles.
Une performance mesurée reflète enfin la capacité réelle du système.
Et les annotations se reportent sans reprise dans les outils du client.
Une conséquence pratique importante en découle. La deuxième liberté a la plus grande valeur économique, un corpus réellement réutilisable amortissant son coût sur plusieurs projets successifs, ce qui justifie l’effort de préparation supplémentaire bien mieux qu’aucun argument de qualité.
Trois erreurs propres à cette étape
Trois défauts d’imagerie satellite naissent avant la première annotation.
Une résolution insuffisante que le suréchantillonnage est venu rendre trompeuse.
Un décalage de référentiel découvert seulement au moment de la livraison.
Et une séparation aléatoire des jeux qui vient flatter la performance mesurée.
Ces trois défauts ne se corrigent pas en reprenant les annotations, ils imposent de refaire la préparation puis la production, et leur point commun est de coûter presque rien à éviter et un projet entier à réparer.
Ce que le client doit fournir ici
Quatre éléments viennent du client plutôt que du prestataire.
Le système de coordonnées employé au sein de ses propres outils.
Les couches de référence sur lesquelles les annotations devront se superposer.
La provenance ainsi que l’état de correction des images qu’il fournit.
Et les usages ultérieurs qu’il envisage éventuellement pour le corpus.
Une observation importante en découle pour un projet d’imagerie satellite. Le troisième élément se demande rarement et manque souvent, un client ayant lui-même reçu ses images d’un tiers ignorant parfois quels traitements elles ont subis, ce qui oblige à documenter ce qui peut l’être et à signaler explicitement ce qui reste inconnu.
Ce que la reprise d’un corpus existant impose
Cinq vérifications précèdent l’extension d’un corpus déjà constitué.
La résolution des nouvelles images, comparée à celle des images anciennes.
Le système de coordonnées, resté identique ou converti sans aucune perte.
La convention de tuilage ainsi que le recouvrement employés à l’origine.
Le référentiel de classes ainsi que ses éventuelles évolutions.
Et la répartition des jeux existante, à respecter plutôt qu’à refaire.
Une conséquence pratique importante en découle pour un projet d’imagerie satellite. La dernière vérification protège la valeur du corpus initial, un ajout réparti sans tenir compte de la séparation déjà existante mêlant des zones d’entraînement et des zones d’évaluation, ce qui invalide toute comparaison avec les performances mesurées auparavant.
Ce que cette étape doit au reste du parcours
Quatre décisions techniques reviennent dans les chapitres précédents.
La résolution, qui bornait déjà la détection des installations solaires.
Le tuilage, dont les raccords menaçaient déjà la continuité d’un réseau.
La séparation des jeux, qui faussait la mesure dès le guide pilier.
Et l’harmonisation des sources, sans laquelle deux dates ne se comparent pas.
Une observation importante en découle pour un projet d’imagerie satellite. Ces quatre décisions apparaissaient jusqu’ici comme des difficultés propres à chaque domaine, alors qu’elles relèvent toutes de la même étape préparatoire, ce qui suggère de la traiter une fois pour toutes plutôt que de la redécouvrir projet après projet.
Ce que le volume à traiter change ici
Quatre effets accompagnent un fonds d’imagerie satellite de grande taille.
Le découpage devient une opération entièrement automatisée plutôt que manuelle.
Le contrôle du géoréférencement porte sur un échantillon plutôt que sur l’ensemble.
Le stockage ainsi que le transfert deviennent des postes à part entière.
Et la reprise consécutive à un défaut de préparation coûte plusieurs jours.
Une conséquence pratique importante en découle. Le dernier effet justifie de contrôler tôt plutôt que largement, une vérification conduite sur quelques tuiles avant le découpage complet évitant une reprise dont le coût ne cesse de croître avec le volume déjà produit.
Ce qu’il faut retenir
La préparation technique décide de ce que l’annotation pourra produire.
Trois lectures se dégagent. Une image suréchantillonnée paraît plus fine sans contenir davantage d’information, ce qui conduit parfois à annoter des objets que le capteur n’avait jamais résolus et à produire un corpus dont une part décrit du bruit. Un décalage entre l’image et le référentiel du client rend les annotations livrées inexploitables sans un recalage que personne n’avait budgété, ce qui fait de cette vérification une étape préalable plutôt qu’un contrôle de recette. Et une tuile d’entraînement voisine d’une tuile d’évaluation produit une performance mesurée qui surestime largement la capacité réelle du système, ce qui impose une séparation géographique des jeux que seul le géoréférencement rend possible.
Pour la qualité du travail, l’article consacré aux petits objets et à la fatigue visuelle détaille la démarche. Pour l’économie du projet, l’article sur le coût de l’annotation satellite l’expose.
Pour approfondir les modalités d’exécution, les formats pris en charge et les dispositifs de contrôle applicables, vous pouvez consulter notre page dédiée à l’annotation pour le géospatial. Et si vous préparez un dataset satellite, échangeons sur votre besoin.
