сегментация изображения объекта

Sep 03 2020

У меня есть 2 разных набора данных с похожими объектами: в одном каждый объект имеет ширину 50 пикселей, а в другом - 150 пикселей. Каждая фотография имеет размер 512x512 для обоих наборов данных. Эти два набора данных содержат одинаковое количество фотографий. Снято той же камерой, с таким же фокусным расстоянием, разрешением и т. Д.

Пока согласны с тем, что различаются только размеры объектов.


Я сегментирую с помощью U-net для каждого набора данных. Все в порядке, у меня хорошие прогнозы.

Для удовольствия я тренируюсь с набором данных 150 пикселей и тестирую на наборе данных 50 пикселей, и наоборот.

Опять же, все в порядке, результаты плохие, поэтому мы пришли к выводу, что результаты лучше, когда размеры объектов аналогичны. Логично.


Теперь я обучаю модель на наборе данных, состоящем из объектов размером 50 и 150 пикселей (половина 50 и половина 150), и в целом такое же количество изображений, как и раньше.

Когда я тестирую свою модель на наборе изображений, состоящих исключительно из объектов размером 50 пикселей (соответственно 150), я получаю лучшие результаты, чем когда я обучал свою сеть, используя для обучения только объект 50 пикселей (или 150).

Это связано с проблемами масштабных (не) вариантов? Вы имели дело с подобным случаем?

большое спасибо

Ответы

2 D.W. Sep 04 2020 at 00:20

Это сложный вопрос. Я не знаю, что могло быть причиной этого.

Может быть трудно понять, почему мы видим такие результаты при работе с нейронными сетями. Часто лучшее, что мы можем сделать, - это сформулировать несколько гипотез, а затем разработать эксперименты, чтобы попытаться проверить эти гипотезы.

Некоторые возможные объяснения, которые вы можете попробовать проверить:

  • Возможно это шум / случайность

  • Возможно, 50-пиксельные изображения довольно однородны, а 150-пиксельные изображения довольно однородны, и сочетание этих двух дает большее разнообразие, что помогает сети учиться (например, она не подходит ни для одного другого).

  • Возможно, 50-пиксельные объекты не имеют того же распределения, что и 150-пиксельные объекты (например, 50-пиксельные изображения относятся к детям, а 150-пиксельные изображения - к взрослым; они отличаются не только размером; или фон коррелирует с размером объекта), и вы получаете большую регуляризацию, открывая сеть обоим или чему-то еще (это расплывчато и может не сильно отличаться от второго объяснения)

Может быть, вы можете подумать о других возможностях.