ภาษาของการปรับเปลี่ยน
จินตนาการ ถึงการ อธิบายงานให้เพื่อนของคุณทำ ไม่น่าเป็นไปได้ที่พวกเขาจะทำถูกต้องในการลองครั้งแรก บ่อยครั้งที่จำเป็นต้องมีการสื่อสารเพิ่มเติมเพื่อแก้ไขและปรับปรุงสิ่งที่กำลังทำอยู่
ที่ Neurips 2022 ฉันทำการศึกษาเล็กๆ เพื่อทำความเข้าใจสิ่งต่อไปนี้:
Q1 : กระบวนการดัดแปลงมีค่าแค่ไหน?
Q2 : ภาษาในการดัดแปลงและคำอธิบายแตกต่างกันหรือไม่?
พจนานุกรมทางโทรศัพท์
ฉันเลือกงานแสดงภาพทางโทรศัพท์ ให้ภาพเริ่มต้น คนกลุ่มหนึ่งเลือกที่จะอธิบาย (โดยใช้คำพูด) จากนั้นจึงวาดภาพใหม่ตามคำอธิบาย
สิ่งนี้ดำเนินต่อไปสำหรับการทำซ้ำหลายครั้ง อย่างที่คุณเห็น ภาษามีคำอธิบายและมีจุดมุ่งหมายเพื่อให้ลิ้นชักกู้คืนรูปภาพต้นฉบับใน 1 ช็อต
พจนานุกรมทางโทรศัพท์พร้อมการดัดแปลง
จะเกิดอะไรขึ้นหากเราอนุญาตให้มีการแก้ไขขั้นตอนเพิ่มเติมเพื่อแก้ไขข้อผิดพลาดบางส่วน ดูเหมือนว่า:
ตามหลักการแล้ว บุคคลที่ 1 และบุคคลที่ 3 เป็นบุคคลคนเดียวกัน — “โปรแกรมเมอร์” และบุคคลที่ 2 และบุคคลที่ 4 เป็นบุคคลเดียวกัน ซึ่งก็คือ “ล่าม” ฉันแยกคนเหล่านี้ออกจากกันเพื่อหลีกเลี่ยงการจับคู่โปรแกรมเมอร์กับล่ามในการทำซ้ำเดียวกัน
ข้อมูลที่รวบรวมทั้งหมดสามารถดูได้ที่เว็บไซต์นี้ (ภาพบางภาพอาจไม่โหลดทันที เพียงคลิกปุ่มเพื่อบังคับให้โหลดซ้ำ)
Q1 : กระบวนการปรับเปลี่ยนมีความสำคัญอย่างไร ?
ต่อไปนี้คือการเปลี่ยนแปลงของภาพต้นฉบับเมื่อเวลาผ่านไปโดยให้คำอธิบายเท่านั้น
อย่างที่คุณเห็น เรากลายเป็นเพียงสี่เหลี่ยมและวงกลมอย่างรวดเร็ว
นี่คือคำอธิบายและการแก้ไข
อย่างที่เราเห็น ด้วยการดัดแปลง เราสามารถเก็บรายละเอียดได้มากขึ้น และมาถึงตุ๊กตาหมีที่เหมือนภาพวาด
เราสรุปได้ว่ากระบวนการปรับเปลี่ยนมีความสำคัญ
Q2: ภาษาสำหรับคำอธิบายและการแก้ไขแตกต่างกันหรือไม่?
ภาษาของคำอธิบายและการดัดแปลงแตกต่างกันหรือไม่? ก่อนอื่นฉันถอดความภาษาทั้งหมดที่ใช้ใน รูป แบบข้อความ
จากนั้น เราสามารถใช้การเรียนรู้แบบไม่กี่ช็อตของ gpt-3 เพื่อดูว่าสามารถแยกความแตกต่างของภาษาบรรยายกับภาษาดัดแปลงได้อย่างน่าเชื่อถือหรือไม่ ฉันใช้ข้อความของ 2 รุ่นแรกทันที และประเมินใน 9 รุ่นที่เหลือ
สำหรับคำอธิบาย ได้รับการระบุที่ถูกต้อง 9/9 ครั้ง สำหรับการแก้ไข เราได้รับการระบุที่ถูกต้อง 7/9 ครั้ง
เราสรุปได้ว่าภาษาของคำอธิบายและการแก้ไขนั้นแตกต่างกัน
ข้อสังเกตด้านลอจิสติกส์เล็กน้อย
การศึกษานี้ประกอบด้วย 12 รุ่นจาก 2 เงื่อนไข โดยรุ่นหนึ่งไม่มีการปรับเปลี่ยน (ผู้เข้าร่วม 2 คน) และอีกรุ่นหนึ่งที่มีการปรับเปลี่ยน (ผู้เข้าร่วม 4 คน) (2+4)*12 หรือผู้เข้าร่วมทั้งหมดประมาณ 70 คน จุดข้อมูลแต่ละจุดใช้เวลาในการรวบรวมประมาณ 4 นาที (อธิบายงาน 1 นาที และรอ 2-3 นาทีเพื่อหาคำตอบ) รวมเวลาทั้งหมดประมาณ 5 ชั่วโมง บล็อกโพสต์นี้และเว็บไซต์เชิงโต้ตอบที่เกี่ยวข้องและการศึกษา gpt3 ใช้เวลาประมาณ 10 ชั่วโมง รวมเป็น 15 ชั่วโมงในการทำงาน
ฉันดีใจที่ได้เก็บรวบรวมข้อมูลที่ neurips ซึ่งข้อมูลมีคุณภาพสูง ผู้ทำคำอธิบายประกอบเข้าใจงานเป็นอย่างดี และฉันไม่ต้องเปลี่ยนเว็บไซต์และโฮสต์เว็บไซต์บนพื้นที่อุดมสมบูรณ์
บทสรุป
การดัดแปลงนั้นมีค่า - หากปราศจากการดัดแปลง การวาดคนของเราจะกลายเป็นแค่สี่เหลี่ยมผืนผ้าและวงกลม ภาษาของการแก้ไขแตกต่างจากคำอธิบาย — gpt3 สามารถบอกได้อย่างน่าเชื่อถือจากอีกภาษาหนึ่ง
แบบจำลองพื้นฐานในปัจจุบัน เช่น คลิป และการแพร่กระจายแบบเสถียร ได้รับการฝึกโดยใช้ข้อมูลเชิงพรรณนา เช่น คู่ของภาพและคำบรรยาย ดังนั้น แม้ว่าพวกเขาสามารถสร้างผลลัพธ์ที่น่าประทับใจได้ใน 1 ช็อต แต่ก็ยากที่จะโต้ตอบกับพวกเขาเพิ่มเติมเพื่อแก้ไขและปรับแต่งผลลัพธ์ปัจจุบัน
เราควรรวบรวมชุดข้อมูลการแก้ไขเพิ่มเติม โดยที่ผู้พูดใช้ภาษาเพื่อบอกผู้ฟังถึงวิธีการแก้ไขและปรับปรุงผลลัพธ์ที่มีอยู่ มีความพยายามหลายอย่างในทิศทางนี้แล้ว ส่วนใหญ่อยู่ในขอบเขตของการแก้ไขข้อความและโค้ด ซึ่งเป็นการเริ่มต้นที่มีแนวโน้มดี
— อีวาน 2022–12–05
ป.ล. ขอบคุณมากสำหรับทุกคนที่เข้าร่วมในการศึกษานี้ เป็นเรื่องปกติที่บางคนจะเข้าหาคุณในการประชุมและขอภาพวาด แต่คุณใจดีกับฉันมากและอดทนกับมัน บล็อกนี้เขียนขึ้นเพื่อคุณ





































![รายการที่เชื่อมโยงคืออะไร? [ส่วนที่ 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)