segmentación de imágenes de objetos
Tengo 2 conjuntos de datos diferentes con objetos similares, uno en el que cada objeto tiene 50 píxeles de ancho y el otro en 150 píxeles. Cada foto es de 512 x 512 para ambos conjuntos de datos. Estos dos conjuntos de datos tienen la misma cantidad de fotos. Tomada con la misma cámara, con la misma distancia focal, resolución, etc.
Hasta ahora, estamos de acuerdo en que solo difiere el tamaño de los objetos.
Segmento con U-net, para cada conjunto de datos. Está bien, tengo buenas predicciones.
Para divertirme, entreno con un conjunto de datos de 150 píxeles y pruebo en un conjunto de datos de 50 píxeles, y viceversa.
Nuevamente todo está bien, los resultados son malos por lo que deducimos que los resultados son mejores cuando el tamaño de los objetos es similar. Lógico.
Ahora entreno un modelo en un conjunto de datos compuesto por objetos de 50 y 150 píxeles (la mitad de 50 y la mitad de 150), y en total la misma cantidad de imágenes que antes.
Cuando pruebo mi modelo en un conjunto de imágenes compuestas exclusivamente por objetos de 50 píxeles (respectivamente 150), obtengo mejores resultados que cuando entrené mi red usando solo objetos de 50 píxeles para entrenar (resp 150)
¿Esto se debe a problemas de características de variante de escala (in)? ¿Hay algún caso similar que haya tratado?
Muchas gracias
Respuestas
Esa es una dificil. No sé qué podría causar eso.
Puede ser difícil saber por qué vemos los resultados que vemos cuando trabajamos con redes neuronales. A menudo, lo mejor que podemos hacer es formular varias hipótesis y luego idear experimentos para intentar probar esas hipótesis.
Algunas posibles explicaciones que podrías intentar probar:
Quizás sea ruido / azar
Quizás las imágenes de 50 píxeles son bastante homogéneas y las imágenes de 150 píxeles son bastante homogéneas, y tomar una combinación de estos dos produce más diversidad, lo que ayuda a la red a aprender (por ejemplo, no se adapta demasiado a ninguno de los dos).
Quizás los objetos de 50 píxeles no provienen de la misma distribución que los objetos de 150 píxeles (p. Ej., Las imágenes de 50 píxeles son de niños y las imágenes de 150 píxeles son de adultos; estas difieren en más formas que solo el tamaño; o el fondo está correlacionado con el tamaño del objeto), y obtiene una mayor regularización al exponer la red a ambos, o algo (esto es vago y podría no ser muy diferente de la segunda explicación)
Quizás puedas pensar en otras posibilidades.