segmentation d'image d'objet

Sep 03 2020

J'ai 2 jeux de données différents avec des objets similaires, l'un où chaque objet mesure 50 pixels de large et l'autre où ils font 150 pixels. Chaque photo est de 512x512 pour les deux ensembles de données. Ces deux jeux de données ont le même nombre de photos. Pris avec le même appareil photo, donc même focale, résolution etc ...

Jusqu'à présent, nous convenons que seule la taille des objets diffère.


Je segmente avec U-net, pour chaque jeu de données. Tout va bien, j'ai de bonnes prédictions.

Pour le plaisir, je m'entraîne avec un jeu de données de 150 pixels et je teste sur un jeu de données de 50 pixels, et vice versa.

Encore une fois, tout va bien, les résultats sont mauvais donc nous en déduisons que les résultats sont meilleurs lorsque la taille des objets est similaire. Logique.


Maintenant, j'entraîne un modèle sur un ensemble de données composé à la fois des objets de 50 et 150 pixels (moitié 50 et moitié 150), et au total le même nombre d'images qu'auparavant.

Lorsque je teste mon modèle sur un ensemble d'images composé exclusivement d'objets de 50 pixels (respectivement 150), j'obtiens de meilleurs résultats que lorsque j'entraîne mon réseau en utilisant seulement 50 pixels d'objet à entraîner (resp 150)

Est-ce dû à des problèmes de fonctionnalités d'échelle (dans) les variantes? Avez-vous traité un cas similaire?

Merci beaucoup

Réponses

2 D.W. Sep 04 2020 at 00:20

C'est difficile. Je ne sais pas ce qui pourrait causer ça.

Il peut être difficile de savoir pourquoi nous voyons les résultats que nous obtenons lorsque nous travaillons avec des réseaux neuronaux. Souvent, le mieux que nous puissions faire est de formuler plusieurs hypothèses, puis de concevoir des expériences pour essayer de tester ces hypothèses.

Quelques explications possibles que vous pourriez essayer de tester:

  • C'est peut-être du bruit / du hasard

  • Peut-être que les images de 50 pixels sont assez homogènes et les images de 150 pixels sont assez homogènes, et prendre une combinaison de ces deux donne plus de diversité, ce qui aide le réseau à apprendre (par exemple, il ne suradapte ni l'un ni l'autre)

  • Peut-être que les objets de 50 pixels ne proviennent pas de la même distribution que les objets de 150 pixels (par exemple, les images de 50 pixels sont des enfants et les images de 150 pixels sont des adultes; ils diffèrent de plusieurs manières que la taille; ou l'arrière-plan est corrélé à la taille de l'objet), et vous obtenez plus de régularisation en exposant le réseau aux deux, ou à quelque chose (c'est vague et peut-être pas très différent de la deuxième explication)

Peut-être que vous pouvez penser à d'autres possibilités.