segmentazione dell'immagine dell'oggetto
Ho 2 diversi set di dati con oggetti simili, uno in cui ogni oggetto è largo 50 pixel e l'altro dove sono 150 pixel. Ogni foto è 512 x 512 per entrambi i set di dati. Questi due set di dati hanno lo stesso numero di foto. Scattata con la stessa fotocamera, quindi stessa lunghezza focale, risoluzione ecc ...
Finora, siamo d'accordo che solo la dimensione degli oggetti differisce.
Segmento con U-net, per ogni dataset. Va tutto bene, ho buone previsioni.
Per divertimento, mi alleno con un set di dati da 150 pixel e provo su un set di dati da 50 pixel e viceversa.
Ancora una volta, va tutto bene, i risultati sono negativi, quindi deduciamo che i risultati sono migliori quando la dimensione degli oggetti è simile. Logico.
Ora alleno un modello su un set di dati composto da oggetti da 50 e 150 pixel (metà 50 e metà 150), e in totale lo stesso numero di immagini di prima.
Quando provo il mio modello su un set di immagini composto esclusivamente da oggetti da 50 pixel (rispettivamente 150), ottengo risultati migliori rispetto a quando ho addestrato la mia rete utilizzando solo oggetti da 50 pixel per addestrare (risp 150)
Ciò è dovuto a problemi di scalabilità (in) varianti? Hai affrontato un caso simile?
molte grazie
Risposte
È difficile. Non so cosa potrebbe causarlo.
Può essere difficile sapere perché vediamo i risultati che otteniamo quando lavoriamo con reti neurali. Spesso il meglio che possiamo fare è formare diverse ipotesi e quindi escogitare esperimenti per provare a testare quelle ipotesi.
Alcune possibili spiegazioni che potresti provare a testare:
Forse è rumore / casualità
Forse le immagini da 50 pixel sono abbastanza omogenee e le immagini da 150 pixel sono abbastanza omogenee, e prendere una combinazione di questi due produce una maggiore diversità, il che aiuta la rete ad apprendere (ad esempio, non si adatta troppo a nessuno dei due)
Forse gli oggetti da 50 pixel non provengono dalla stessa distribuzione degli oggetti da 150 pixel (ad esempio, le immagini da 50 pixel sono di bambini e le immagini da 150 pixel sono di adulti; queste differiscono in più modi oltre alla dimensione; o lo sfondo è correlato alla dimensione dell'oggetto) e si ottiene una maggiore regolarizzazione dall'esporre la rete a entrambi, o qualcosa del genere (questo è vago e potrebbe non essere molto diverso dalla seconda spiegazione)
Forse puoi pensare ad altre possibilità.