Apa hasil dari YOLO?

Oct 06 2020

Saya mencoba menggunakan YOLO untuk mendeteksi pelat nomor di aplikasi Android.

Jadi saya melatih model YOLOv3 dan YOLOv4 di Google Colab. Saya mengonversi 2 model ini ke TensorFlow Lite, menggunakan proyek wonderfull dari Hunglc007 dan saya juga memverifikasi bahwa mereka berfungsi dan mendapatkan hasil sebagai berikut:

Tetapi ketika saya mencoba memahami output model untuk menyesuaikannya di aplikasi saya, saya mendapatkannya menggunakan netron :

Mengapa saya memiliki 2 keluaran jika model telah dilatih untuk mendeteksi hanya satu objek?

Dan mengapa format keluarannya seperti itu, apa yang [1,1,4]diwakilinya?

EDIT

Kode untuk bbox dapat ditemukan di sini

boxes, scores, classes, valid_detections = tf.image.combined_non_max_suppression(
            boxes=tf.reshape(boxes, (tf.shape(boxes)[0], -1, 1, 4)),
            scores=tf.reshape(
                pred_conf, (tf.shape(pred_conf)[0], -1, tf.shape(pred_conf)[-1])),
            max_output_size_per_class=50,
            max_total_size=50,
            iou_threshold=FLAGS.iou,
            score_threshold=FLAGS.score
        )
        pred_bbox = [boxes.numpy(), scores.numpy(), classes.numpy(), valid_detections.numpy()]
        image = utils.draw_bbox(original_image, pred_bbox)
        # image = utils.draw_bbox(image_data*255, pred_bbox)
        image = Image.fromarray(image.astype(np.uint8))
        image.show()
        image = cv2.cvtColor(np.array(image), cv2.COLOR_BGR2RGB)
        cv2.imwrite(FLAGS.output + 'detection' + str(count) + '.png', image)

Jawaban

1 AbdelAzizAbdelLatef Oct 06 2020 at 21:21

Saya bukan ahli dalam Netron, tetapi dari memeriksa masalah dan keluaran yang diharapkan, saya melihat bahwa ia harus menghasilkan dua keluaran untuk setiap deteksi; persegi panjang deteksi dan keyakinan deteksi. Oleh karena itu, dua keluaran yang Anda tanyakan kemungkinan adalah, persegi panjang yang ditentukan oleh 4 angka pelampung - dua koordinat sudut kiri atas, lebar dan tinggi - dan kepercayaan yang merupakan satu angka pelampung.

2 dtlam26 Oct 06 2020 at 21:34

Ini sangat jelas. Untuk model deteksi. Secara umum, ini harus memberikan setidaknya 2 keluaran: kotak pembatas dan kelas sehubungan dengan kotak pembatas. Oleh karena itu, (1,1,4) adalah hasil 4 untuk kotak pembatas. Angka pertama 1 sesuai dengan pengambilan gambar Anda ke dalam model. Karena Anda hanya memiliki satu objek maka hasilnya adalah 1 untuk bilangan kedua. Selanjutnya konfigurasi YOLO untuk kotak pembatas adalah (x_center, y_center, lebar, tinggi)

(1,1,1) akan sama, tetapi sekarang 1 untuk label kelas yang Anda pilih.