การแบ่งส่วนภาพวัตถุ
ฉันมีชุดข้อมูล 2 ชุดที่แตกต่างกันโดยมีวัตถุที่คล้ายกันโดยที่แต่ละวัตถุมีความกว้าง 50 พิกเซลและอีกชุดหนึ่งอยู่ที่ 150 พิกเซล แต่ละภาพมีขนาด 512x512 สำหรับทั้งสองชุดข้อมูล ชุดข้อมูลทั้งสองนี้มีจำนวนรูปภาพเท่ากัน ถ่ายด้วยกล้องตัวเดียวกันทางยาวโฟกัสความละเอียดเท่ากัน ฯลฯ ...
จนถึงตอนนี้เรายอมรับว่ามีเพียงขนาดของวัตถุเท่านั้นที่แตกต่างกัน
ฉันแบ่งกลุ่มด้วย U-net สำหรับแต่ละชุดข้อมูล ไม่เป็นไรฉันมีคำทำนายที่ดี
เพื่อความสนุกฉันฝึกกับชุดข้อมูล 150 พิกเซลและทดสอบกับชุดข้อมูล 50 พิกเซลและในทางกลับกัน
อีกครั้งทุกอย่างเรียบร้อยดีผลลัพธ์ไม่ดีดังนั้นเราจึงสรุปได้ว่าผลลัพธ์จะดีกว่าเมื่อขนาดของวัตถุใกล้เคียงกัน ตรรกะ
ตอนนี้ฉันฝึกโมเดลบนชุดข้อมูลที่ประกอบด้วยวัตถุทั้ง 50 และ 150 พิกเซล (ครึ่ง 50 และ 150 ครึ่ง) และในจำนวนรูปภาพทั้งหมดเท่าเดิม
เมื่อฉันทดสอบโมเดลของฉันกับชุดของภาพที่ประกอบด้วยวัตถุขนาด 50 พิกเซลโดยเฉพาะ (ตามลำดับ 150) ฉันจะได้ผลลัพธ์ที่ดีกว่าเมื่อฉันฝึกเครือข่ายของฉันโดยใช้วัตถุเพียง 50 พิกเซลในการฝึก (การตอบ 150)
นี่เป็นเพราะปัญหาคุณสมบัติของตัวแปรขนาด (ใน) หรือไม่ มีกรณีคล้าย ๆ กันที่คุณจัดการหรือไม่?
ขอบคุณมาก
คำตอบ
นั่นเป็นสิ่งที่ยาก ฉันไม่รู้ว่าอะไรเป็นสาเหตุ
อาจเป็นเรื่องยากที่จะทราบว่าเหตุใดเราจึงเห็นผลลัพธ์ที่เราทำเมื่อทำงานกับโครงข่ายประสาทเทียม บ่อยครั้งสิ่งที่ดีที่สุดที่เราทำได้คือสร้างสมมติฐานหลาย ๆ สมมติฐานจากนั้นจึงทำการทดลองเพื่อพยายามทดสอบสมมติฐานเหล่านั้น
คำอธิบายที่เป็นไปได้ที่คุณสามารถลองทดสอบ:
บางทีอาจเป็นเสียง / โอกาสสุ่ม
บางทีภาพขนาด 50 พิกเซลนั้นค่อนข้างจะเป็นเนื้อเดียวกันและภาพ 150 พิกเซลนั้นค่อนข้างเป็นเนื้อเดียวกันและการผสมผสานทั้งสองอย่างนี้จะทำให้เกิดความหลากหลายมากขึ้นซึ่งจะช่วยให้เครือข่ายเรียนรู้ (เช่นไม่เกินพอดี)
บางทีวัตถุ 50 พิกเซลอาจไม่ได้มาจากการกระจายแบบเดียวกับวัตถุ 150 พิกเซล (เช่นภาพ 50 พิกเซลเป็นของเด็กและภาพ 150 พิกเซลเป็นของผู้ใหญ่สิ่งเหล่านี้แตกต่างกันในหลาย ๆ วิธีมากกว่าขนาด หรือพื้นหลังมีความสัมพันธ์กับขนาดของวัตถุ) และคุณจะได้รับความสม่ำเสมอมากขึ้นจากการเปิดเผยเครือข่ายกับทั้งสองอย่างหรือบางสิ่งบางอย่าง (สิ่งนี้คลุมเครือและอาจไม่แตกต่างจากคำอธิบายที่สองมากนัก)
บางทีคุณอาจคิดถึงความเป็นไปได้อื่น ๆ