nesne görüntü segmentasyonu
Biri 50 piksel genişliğinde ve diğeri 150 piksel genişliğinde benzer nesneler içeren 2 farklı veri setim var. Her fotoğraf, her iki veri kümesi için de 512x512'dir. Bu iki veri kümesinde aynı sayıda fotoğraf var. Aynı kamera ile çekilmiş, dolayısıyla aynı odak uzaklığı, çözünürlük vb.
Şimdiye kadar, yalnızca nesnelerin boyutlarının farklı olduğu konusunda hemfikiriz.
Her veri kümesi için U-net ile segmentlere ayırıyorum. Sorun değil, iyi tahminlerim var.
Eğlence için, 150 piksel veri kümesiyle eğitim yapıyorum ve 50 piksel veri kümesinde test ediyorum ve bunun tersi de geçerli.
Yine, her şey yolunda, sonuçlar kötü, bu yüzden nesnelerin boyutu benzer olduğunda sonuçların daha iyi olduğunu anlıyoruz. Mantıklı.
Şimdi, hem 50 hem de 150 piksel nesnelerden (yarısı 50 ve yarısı 150) ve toplamda eskisi gibi aynı sayıda görüntüden oluşan bir veri kümesi üzerinde bir model eğitiyorum.
Modelimi yalnızca 50 piksel nesneden (sırasıyla 150) oluşan bir dizi görüntü üzerinde test ettiğimde, ağımı eğitmek için yalnızca 50 piksel nesnesini kullanarak eğittiğimden daha iyi sonuçlar alıyorum (resp 150)
Bu, ölçek (in) varyant özellik sorunlarından mı kaynaklanıyor? Karşılaştığınız benzer bir dava var mı?
Çok teşekkürler
Yanıtlar
Bu zor bir soru. Buna neyin sebep olabileceğini bilmiyorum.
Sinir ağlarıyla çalışırken yaptığımız sonuçları neden gördüğümüzü bilmek zor olabilir. Çoğunlukla yapabileceğimiz en iyi şey, birkaç hipotez oluşturmak ve ardından bu hipotezleri test etmeye çalışmak için deneyler yapmaktır.
Test etmeye çalışabileceğiniz bazı olası açıklamalar:
Belki de gürültü / rastgele şans
Belki de 50 piksellik görüntüler oldukça homojendir ve 150 piksellik görüntüler oldukça homojendir ve bu ikisinin bir kombinasyonunu almak, ağın öğrenmesine yardımcı olan daha fazla çeşitlilik sağlar (örneğin, ikisine de fazla uymaz)
Belki de 50 piksellik nesneler, 150 piksellik nesnelerle aynı dağılımdan gelmiyordur (örneğin, 50 piksellik görüntüler çocuklara ve 150 piksellik görüntüler yetişkinlere aittir; bunlar boyuttan çok daha farklıdır; veya arka plan nesnenin boyutuyla ilişkilendirilir) ve ağı her ikisine de veya başka bir şeye maruz bırakarak daha fazla düzenleme elde edersiniz (bu belirsizdir ve ikinci açıklamadan çok farklı olmayabilir)
Belki başka olasılıklar düşünebilirsiniz.