Scene Text Image Super-Resolution สำหรับ OCR

Nov 12 2020

ฉันกำลังทำงานกับระบบ OCR ความท้าทายที่ฉันหันหน้าไปทางในการตระหนักถึงข้อความภายในผลตอบแทนการลงทุนเป็นเพราะความไม่มั่นคงหรือผลการเคลื่อนไหวยิงหรือข้อความที่ไม่เน้นเนื่องจากตำแหน่งมุม โปรดพิจารณาตัวอย่างการสาธิตต่อไปนี้

หากคุณสังเกตเห็นข้อความ (เช่นเครื่องหมายเป็นสีแดง) ในกรณีเช่นนี้ระบบ OCR จะไม่สามารถจดจำข้อความได้อย่างถูกต้อง อย่างไรก็ตามสถานการณ์นี้อาจเกิดขึ้นได้โดยไม่มีภาพมุมที่ภาพเบลอเกินไปจนระบบ OCR ไม่สามารถจดจำข้อความได้บางส่วน บางครั้งพวกเขาจะเบลอหรือบางครั้งมากความละเอียดต่ำหรือตัวหนังสือ ตัวอย่างเช่น

วิธีการที่เราพยายาม

ประการแรกเราได้ลองใช้วิธีการต่างๆที่มีอยู่ใน SO แต่น่าเสียดายที่ไม่มีโชค

  • วิธีปรับปรุงคุณภาพของภาพเพื่อดึงข้อความจากภาพโดยใช้ Tesseract
  • จะปรับปรุงคุณภาพของภาพได้อย่างไร? [ปิด]
  • การปรับปรุงคุณภาพของภาพใน Opencv

ต่อไปเราได้ลองใช้วิธีที่มีแนวโน้มมากที่สุดสามวิธีดังต่อไปนี้

1. TSRN

งานวิจัยล่าสุด ( TSRN ) มุ่งเน้นไปที่กรณีดังกล่าวเป็นหลัก ใช้งานง่ายหลักคือการแนะนำเทคนิคsuper-resolution (SR) เป็นการประมวลผลล่วงหน้า การใช้งานนี้ดูมีแนวโน้มมากที่สุด อย่างไรก็ตามมันล้มเหลวในการสร้างเวทมนตร์ในชุดข้อมูลที่กำหนดเองของเรา (เช่นภาพที่สองด้านบนข้อความสีน้ำเงิน) นี่คือตัวอย่างบางส่วนจากการสาธิต:

2. การเพิ่มประสิทธิภาพของระบบประสาท

หลังจากดูภาพประกอบในหน้าเราเชื่อว่ามันอาจใช้ได้ แต่น่าเศร้าที่ไม่สามารถแก้ไขปัญหาได้ อย่างไรก็ตามฉันรู้สึกสับสนเล็กน้อยแม้จะมีตัวอย่างที่แสดงให้เห็นเพราะฉันไม่สามารถทำซ้ำได้เช่นกัน ฉันได้ยกปัญหาเกี่ยวกับ githubซึ่งฉันได้แสดงรายละเอียดเพิ่มเติมนี้ นี่คือตัวอย่างบางส่วนจากการสาธิต:

3. ISR

ทางเลือกสุดท้ายด้วยความหวังขั้นต่ำนี้การดำเนินงาน ไม่มีโชคเหมือนกัน

อัปเดต 1

  • [วิธีการ]: นอกเหนือจากข้างต้นเรายังได้ลองใช้วิธีการแบบเดิม ๆ เช่นDeblur Filter นอกโฟกัส ( ตัวกรอง Wiener และตัวกรอง Weiner ที่ไม่ได้รับการดูแล) เราตรวจสอบวิธีRichardson-Lucyด้วย แต่ไม่มีการปรับปรุงด้วยวิธีนี้เช่นกัน

  • [วิธี]: เราได้ตรวจสอบโซลูชัน DeBlur ที่ใช้ GAN แล้ว DeblurGANฉันได้ลองใช้เครือข่ายนี้แล้ว สิ่งที่ดึงดูดฉันคือแนวทางของกลไกBlind Motion Deblurring

สุดท้ายจากการสนทนานี้เราได้พบกับงานวิจัยชิ้นนี้ซึ่งดูเหมือนว่าดีพอจริงๆ ยังไม่ได้ลองทำ

อัปเดต 2

  1. [วิธีการ]: ความละเอียดสูงระดับโลกแห่งความจริงผ่านการประมาณค่าเคอร์เนลและการฉีดเสียงรบกวนลองใช้วิธีนี้ สัญญา อย่างไรก็ตามไม่ได้ผลในกรณีของเรา รหัส .

  2. [วิธีการ]: การคืนค่าภาพถ่ายเมื่อเปรียบเทียบกับวิธีการทั้งหมดข้างต้นมันทำงานได้ดีที่สุดอย่างน่าประหลาดใจในความละเอียด super text สำหรับ OCR ช่วยขจัดจุดรบกวนความเบลอ ฯลฯ ได้อย่างมากและทำให้ภาพมีความชัดเจนมากขึ้นและช่วยเพิ่มลักษณะทั่วไปของโมเดลได้ดีขึ้น รหัส .

แบบสอบถามของฉัน

มีวิธีแก้ปัญหาที่มีประสิทธิภาพในการจัดการกับกรณีดังกล่าวหรือไม่? วิธีการใดที่สามารถปรับปรุงพิกเซลที่พร่ามัวหรือความละเอียดต่ำได้ไม่ว่าข้อความจะอยู่ด้านหน้าหรือห่างไกลเนื่องจากมุมกล้อง

คำตอบ

shirley Nov 17 2020 at 08:12

ปัจจุบันมีเป็นหนึ่งในวิธีการแก้ปัญหาโลกจริง Super-Resolution ผ่าน Kernel การประเมินและการฉีดเสียงรบกวน ผู้เขียนเสนอกรอบการย่อยสลาย RealSR ซึ่งให้ภาพที่เหมือนจริงสำหรับการเรียนรู้ที่มีความละเอียดสูง เป็นวิธีที่มีแนวโน้มสำหรับภาพสั่นไหวหรือเอฟเฟกต์การเคลื่อนไหวที่มีความละเอียดสูง

วิธีการแบ่งออกเป็นสองขั้นตอน ขั้นตอนแรกการย่อยสลายที่สมจริงสำหรับ Super-Resolution

คือการประมาณค่าความเสื่อมโทรมจากข้อมูลจริงและสร้างภาพ LR ที่เหมือนจริง

Super-Resoluion Modelขั้นที่สอง

คือการฝึกโมเดล SR ตามข้อมูลที่สร้างขึ้น

คุณสามารถดูบทความ Github นี้: https://github.com/jixiaozhong/RealSR