segmentação de imagem de objeto

Sep 03 2020

Eu tenho 2 conjuntos de dados diferentes com objetos semelhantes, um onde cada objeto tem 50 pixels de largura e outro onde eles têm 150 pixels. Cada foto tem 512x512 para ambos os conjuntos de dados. Esses dois conjuntos de dados têm o mesmo número de fotos. Tirada com a mesma câmera, com a mesma distância focal, resolução etc ...

Até agora, concordamos que apenas o tamanho dos objetos difere.


Eu segmento com U-net, para cada conjunto de dados. Tudo bem, tenho boas previsões.

Por diversão, treino com conjunto de dados de 150 pixels e teste em conjunto de dados de 50 pixels e vice-versa.

Novamente, está tudo bem, os resultados são ruins então deduzimos que os resultados são melhores quando o tamanho dos objetos é semelhante. Lógico.


Agora eu treino um modelo em um conjunto de dados composto de objetos de 50 e 150 pixels (metade 50 e metade 150), e no total o mesmo número de imagens de antes.

Quando eu testo meu modelo em um conjunto de imagens composto exclusivamente por objetos de 50 pixels (respectivamente 150), obtenho resultados melhores do que quando treinei minha rede usando apenas objetos de 50 pixels para treinar (resp 150)

Isso se deve a problemas de dimensionamento (in) variantes de recursos? Você lidou com um caso semelhante?

Muito obrigado

Respostas

2 D.W. Sep 04 2020 at 00:20

Essa é difícil. Não sei o que pode causar isso.

Pode ser difícil saber por que vemos os resultados que vemos ao trabalhar com redes neurais. Freqüentemente, o melhor que podemos fazer é formar várias hipóteses e, em seguida, planejar experimentos para tentar testar essas hipóteses.

Algumas explicações possíveis que você pode tentar testar:

  • Talvez seja ruído / chance aleatória

  • Talvez as imagens de 50 pixels sejam bastante homogêneas e as imagens de 150 pixels sejam bastante homogêneas, e a combinação dessas duas produz mais diversidade, o que ajuda a rede a aprender (por exemplo, não se ajusta a nenhum deles)

  • Talvez os objetos de 50 pixels não venham da mesma distribuição que os objetos de 150 pixels (por exemplo, as imagens de 50 pixels são de crianças e as imagens de 150 pixels de adultos; elas diferem em mais maneiras do que apenas no tamanho; ou o fundo está correlacionado ao tamanho do objeto), e você obtém mais regularização expondo a rede para ambos, ou algo (isso é vago e pode não ser muito diferente da segunda explicação)

Talvez você possa pensar em outras possibilidades.