phân đoạn hình ảnh đối tượng
Tôi có 2 tập dữ liệu khác nhau với các đối tượng tương tự, một trong đó mỗi đối tượng rộng 50 pixel và một trong đó chúng có kích thước 150 pixel. Mỗi ảnh có kích thước 512x512 cho cả hai tập dữ liệu. Hai tập dữ liệu này có cùng số lượng ảnh. Được chụp bằng cùng một máy ảnh, cùng tiêu cự, độ phân giải, v.v.
Cho đến nay, chúng tôi đồng ý rằng chỉ có kích thước của các đối tượng khác nhau.
Tôi phân đoạn bằng U-net, cho mỗi tập dữ liệu. Không sao đâu, tôi có những dự đoán tốt.
Để giải trí, tôi huấn luyện với tập dữ liệu 150 pixel và thử nghiệm trên tập dữ liệu 50 pixel và ngược lại.
Một lần nữa, mọi thứ đều ổn, kết quả xấu nên chúng ta suy ra rằng kết quả tốt hơn khi kích thước của các đối tượng tương tự nhau. Hợp lý.
Bây giờ tôi đào tạo một mô hình trên một tập dữ liệu bao gồm cả đối tượng 50 và 150 pixel (nửa 50 và nửa 150), và tổng số hình ảnh giống như trước đây.
Khi tôi kiểm tra mô hình của mình trên một tập hợp các hình ảnh bao gồm các đối tượng 50 pixel (tương ứng 150), tôi nhận được kết quả tốt hơn so với khi tôi huấn luyện mạng của mình chỉ sử dụng đối tượng 50 pixel để huấn luyện (tương ứng 150)
Điều này có phải do các vấn đề về tính năng của biến thể scale- (in) không? Có một trường hợp tương tự mà bạn đã xử lý?
Cảm ơn rất nhiều
Trả lời
Đó là một trong những khó khăn. Tôi không biết điều gì có thể gây ra điều đó.
Có thể khó biết tại sao chúng ta lại nhìn thấy kết quả khi làm việc với mạng thần kinh. Thông thường, điều tốt nhất chúng ta có thể làm là hình thành một số giả thuyết, sau đó đưa ra các thí nghiệm để thử kiểm tra các giả thuyết đó.
Một số giải thích khả thi mà bạn có thể thử kiểm tra:
Có lẽ đó là tiếng ồn / cơ hội ngẫu nhiên
Có lẽ hình ảnh 50 pixel khá đồng nhất và hình ảnh 150 pixel tương đối đồng nhất và việc kết hợp cả hai hình ảnh này tạo ra sự đa dạng hơn, giúp mạng học hỏi (ví dụ: nó không quá phù hợp)
Có lẽ các đối tượng 50 pixel không cùng phân bố với các đối tượng 150 pixel (ví dụ: hình ảnh 50 pixel là của trẻ em và hình ảnh 150 pixel là của người lớn; chúng khác nhau về nhiều mặt hơn là chỉ kích thước; hoặc nền có tương quan với kích thước của đối tượng) và bạn nhận được sự chính xác hơn từ việc hiển thị mạng cho cả hai hoặc một cái gì đó (điều này mơ hồ và có thể không khác lắm so với giải thích thứ hai)
Có thể bạn có thể nghĩ đến những khả năng khác.