сегментация изображения объекта
У меня есть 2 разных набора данных с похожими объектами: в одном каждый объект имеет ширину 50 пикселей, а в другом - 150 пикселей. Каждая фотография имеет размер 512x512 для обоих наборов данных. Эти два набора данных содержат одинаковое количество фотографий. Снято той же камерой, с таким же фокусным расстоянием, разрешением и т. Д.
Пока согласны с тем, что различаются только размеры объектов.
Я сегментирую с помощью U-net для каждого набора данных. Все в порядке, у меня хорошие прогнозы.
Для удовольствия я тренируюсь с набором данных 150 пикселей и тестирую на наборе данных 50 пикселей, и наоборот.
Опять же, все в порядке, результаты плохие, поэтому мы пришли к выводу, что результаты лучше, когда размеры объектов аналогичны. Логично.
Теперь я обучаю модель на наборе данных, состоящем из объектов размером 50 и 150 пикселей (половина 50 и половина 150), и в целом такое же количество изображений, как и раньше.
Когда я тестирую свою модель на наборе изображений, состоящих исключительно из объектов размером 50 пикселей (соответственно 150), я получаю лучшие результаты, чем когда я обучал свою сеть, используя для обучения только объект 50 пикселей (или 150).
Это связано с проблемами масштабных (не) вариантов? Вы имели дело с подобным случаем?
большое спасибо
Ответы
Это сложный вопрос. Я не знаю, что могло быть причиной этого.
Может быть трудно понять, почему мы видим такие результаты при работе с нейронными сетями. Часто лучшее, что мы можем сделать, - это сформулировать несколько гипотез, а затем разработать эксперименты, чтобы попытаться проверить эти гипотезы.
Некоторые возможные объяснения, которые вы можете попробовать проверить:
Возможно это шум / случайность
Возможно, 50-пиксельные изображения довольно однородны, а 150-пиксельные изображения довольно однородны, и сочетание этих двух дает большее разнообразие, что помогает сети учиться (например, она не подходит ни для одного другого).
Возможно, 50-пиксельные объекты не имеют того же распределения, что и 150-пиксельные объекты (например, 50-пиксельные изображения относятся к детям, а 150-пиксельные изображения - к взрослым; они отличаются не только размером; или фон коррелирует с размером объекта), и вы получаете большую регуляризацию, открывая сеть обоим или чему-то еще (это расплывчато и может не сильно отличаться от второго объяснения)
Может быть, вы можете подумать о других возможностях.