segmentasi gambar objek

Sep 03 2020

Saya memiliki 2 dataset berbeda dengan objek yang serupa, satu di mana setiap objek memiliki lebar 50 piksel dan yang lainnya berukuran 150 piksel. Setiap foto berukuran 512x512 untuk kedua dataset. Kedua dataset ini memiliki jumlah foto yang sama. Diambil dengan kamera yang sama, panjang fokus yang sama, resolusi, dll.

Sejauh ini, kami setuju bahwa hanya ukuran objek yang berbeda.


Saya melakukan segmentasi dengan U-net, untuk setiap dataset. Tidak apa-apa, saya punya prediksi yang bagus.

Untuk bersenang-senang, saya berlatih dengan kumpulan data 150 piksel dan menguji kumpulan data 50 piksel, dan sebaliknya.

Sekali lagi, semuanya baik-baik saja, hasilnya buruk jadi kami menyimpulkan bahwa hasilnya lebih baik bila ukuran objeknya serupa. Logis.


Sekarang saya melatih model pada kumpulan data yang terdiri dari objek 50 dan 150 piksel (setengah 50 dan setengah 150), dan secara total jumlah gambar yang sama seperti sebelumnya.

Saat saya menguji model saya pada sekumpulan gambar yang secara eksklusif terdiri dari objek 50 piksel (masing-masing 150), saya mendapatkan hasil yang lebih baik daripada saat saya melatih jaringan saya dengan hanya menggunakan objek 50 piksel untuk dilatih (resp 150)

Apakah ini karena masalah fitur varian skala (dalam)? Apakah ada kasus serupa yang Anda tangani?

Terima kasih banyak

Jawaban

2 D.W. Sep 04 2020 at 00:20

Itu yang sulit. Saya tidak tahu apa yang bisa menyebabkan itu.

Sulit untuk mengetahui mengapa kami melihat hasil yang kami lakukan, saat bekerja dengan jaringan saraf. Seringkali yang terbaik yang dapat kita lakukan adalah membentuk beberapa hipotesis, dan kemudian merancang eksperimen untuk mencoba menguji hipotesis tersebut.

Beberapa kemungkinan penjelasan yang bisa Anda coba uji:

  • Mungkin itu adalah kebisingan / kebetulan acak

  • Mungkin gambar 50-piksel cukup homogen dan gambar 150 piksel cukup homogen, dan kombinasi dari keduanya menghasilkan lebih banyak keragaman, yang membantu jaringan belajar (misalnya, tidak terlalu cocok untuk keduanya)

  • Mungkin objek 50-piksel tidak berasal dari distribusi yang sama dengan objek 150-piksel (misalnya, gambar 50-piksel adalah gambar anak-anak dan gambar 150-piksel adalah gambar dewasa; ini berbeda dalam lebih dari sekedar ukuran; atau latar belakang berkorelasi dengan ukuran objek), dan Anda mendapatkan lebih banyak regularisasi dengan mengekspos jaringan ke keduanya, atau sesuatu (ini tidak jelas dan mungkin tidak terlalu berbeda dari penjelasan kedua)

Mungkin Anda bisa memikirkan kemungkinan lain.