4 คะแนน โดย GN⁺ 15 시간 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • โมเดลพื้นฐานที่ช่วยบรรเทาปัญหาการขาดแคลนข้อมูลของโมเดลนโยบายหุ่นยนต์ โดยพรีเทรนด้วย เส้นทาง UMI ขนาด 100,000 ชั่วโมงที่ไม่ขึ้นกับตัวหุ่นยนต์ แล้วจึงฝึกต่อด้วยข้อมูลหุ่นยนต์จริง
  • ใส่คำอธิบายประกอบอัตโนมัติให้กับสถานการณ์มากกว่า 1,700 รายการเพื่อเรียนรู้ความสามารถในการสร้างพฤติกรรมทั่วไป และในการฝึกต่อได้ จัดแนวให้สอดคล้องกับรูปแบบของหุ่นยนต์และคำสั่งภาษาธรรมชาติ
  • เมื่อข้อมูลและโมเดลสำหรับพรีเทรนมีขนาดใหญ่ขึ้น ค่าความคลาดเคลื่อนของพฤติกรรมในการตรวจสอบลดลง และหลังการฝึกต่อ อัตราความสำเร็จของหุ่นยนต์จริง ที่วัดในสภาพแวดล้อมและวัตถุที่ไม่เคยเห็นก็เพิ่มขึ้นอย่างต่อเนื่อง โดยไม่พบสัญญาณอิ่มตัว
  • ด้วยการสาธิตเฉลี่ยน้อยกว่า 10 ชั่วโมงต่อภารกิจ ทำได้ อัตราความสำเร็จรวม 75% ในงานแพ็กโทรศัพท์ เติมเครื่องพิมพ์ ใส่ผ้าลงเครื่องซักผ้า และแพ็กกล่อง และเมื่อใช้เฉลี่ยน้อยกว่า 40 ชั่วโมงก็ถึง 85%
  • ทำผลงานดีที่สุดทั้งหมดบน RoboCasa, RoboCasa365, VLABench และ RoboDojo แสดงให้เห็นว่า ผลการทำให้ทั่วไปได้จากการพรีเทรน UMI ขนาดใหญ่ ส่งต่อไปสู่การปรับตัวกับหุ่นยนต์จริงและการประเมินมาตรฐาน

การเรียนรู้ 2 ขั้นเพื่อข้ามกำแพงข้อมูลหุ่นยนต์

  • โมเดลที่ใช้ภาษาและวิชันมีประสิทธิภาพดีขึ้นเมื่อข้อมูล พารามิเตอร์ และปริมาณการคำนวณเพิ่มขึ้น แต่โมเดลนโยบายหุ่นยนต์ถูกจำกัดการขยายขนาดมาโดยตลอดเพราะ ขาดข้อมูลคุณภาพสูงขนาดใหญ่
  • Xiaomi-Robotics-1 ใช้ วิธีการเรียนรู้ 2 ขั้น โดยพรีเทรนด้วยข้อมูล UMI ขนาดใหญ่ที่ไม่ขึ้นกับตัวหุ่นยนต์ แล้วฝึกต่อด้วยข้อมูลหุ่นยนต์จริงในปริมาณค่อนข้างน้อย
  • วิธีนี้ใช้ประเมินรูปแบบการขยายตัวของโมเดลนโยบายหุ่นยนต์ และตรวจสอบว่าการปรับปรุงจากการพรีเทรนถ่ายโอนไปสู่ประสิทธิภาพของหุ่นยนต์จริงหรือไม่

องค์ประกอบของข้อมูลพรีเทรนและฝึกต่อ

  • ข้อมูลพรีเทรนประกอบด้วย เส้นทาง UMI 100,000 ชั่วโมง
    • ครอบคลุมสถานการณ์มากกว่า 1,700 รายการและงานหลากหลาย ตั้งแต่บ้านเรือน สถานที่เชิงพาณิชย์ พื้นที่อุตสาหกรรม ไปจนถึงพื้นที่กลางแจ้ง
    • พัฒนา pipeline สำหรับใส่คำอธิบายประกอบอัตโนมัติ โดยแบ่งเส้นทางเป็นช่วงความยาวคงที่ แล้วบันทึกการเปลี่ยนแปลงสถานะของฉากในแต่ละช่วงเป็นภาษา
  • การฝึกต่อใช้ชุดข้อมูลที่ครอบคลุมรูปแบบหุ่นยนต์หลายแบบ
    • ข้อมูลหุ่นยนต์จริงที่เก็บรวบรวมเอง
    • ข้อมูลหุ่นยนต์โอเพนซอร์สที่ผ่านการกรอง
    • ข้อมูล UMI คุณภาพสูงที่คัดสรรแล้ว
  • ข้อมูลที่เก็บเองมี งานหุ่นยนต์จริงมากกว่า 7,200 ชั่วโมง ที่รวบรวมจากบ้านจริง
    • ครอบคลุมงานอย่างจัดโซฟา แยกประเภทตู้รองเท้า และเก็บเครื่องครัวเข้าที่
  • ข้อมูล UMI สำหรับฝึกต่อมีมนุษย์ใส่คำอธิบายประกอบช่วงเวลาและพรอมป์คำสั่งด้วยตนเอง
    • เป็นวิธีที่แตกต่างจากคำอธิบายการเปลี่ยนสถานะที่สร้างอัตโนมัติซึ่งใช้ในข้อมูลพรีเทรน

การพรีเทรน UMI และการใส่คำอธิบายประกอบอัตโนมัติ

  • การพรีเทรนเป็นขั้นตอนที่ให้โมเดลพบกับสภาพแวดล้อมจริงและงานที่หลากหลาย เพื่อเรียนรู้ การแทนค่าการสร้างพฤติกรรมทั่วไป
  • เนื่องจากขนาดข้อมูลทำให้การใส่คำอธิบายประกอบด้วยมือทำได้ยาก จึงสร้าง pipeline อัตโนมัติที่ใช้โมเดลวิชัน-ภาษา (VLM) ที่ทรงพลัง
    • แบ่งวิดีโอยาวออกเป็นคลิปความยาวคงที่
    • VLM อธิบายการเปลี่ยนแปลงสถานะของ gripper และวัตถุที่มีปฏิสัมพันธ์ในแต่ละคลิป
    • สร้างคอร์ปัสขนาดใหญ่ที่ผสานเส้นทางการจัดการวัตถุจริงกับคำอธิบายภาษาที่ละเอียด
  • โมเดลเรียนรู้ให้สร้างพฤติกรรมที่เปลี่ยนฉากให้สอดคล้องกับการเปลี่ยนสถานะที่อธิบายด้วยภาษา
  • เมื่อข้อมูลและขนาดโมเดลเพิ่มขึ้น พบรูปแบบการขยายตัวที่ชัดเจน โดย ค่าความคลาดเคลื่อนของพฤติกรรมในการตรวจสอบลดลงอย่างต่อเนื่อง

การจัดแนวกับหุ่นยนต์จริงและคำสั่งภาษาธรรมชาติ

  • การฝึกต่อจัดแนวความสามารถในการสร้างพฤติกรรมที่ได้จากการพรีเทรนในสองแกน
    • การจัดแนวรูปแบบหุ่นยนต์: แมปความสามารถในการสร้างพฤติกรรมทั่วไปเข้ากับหุ่นยนต์ทางกายภาพด้วยข้อมูลหุ่นยนต์จริงคุณภาพสูงหลายรูปแบบ
    • การจัดแนวคำสั่ง: เปลี่ยนโมเดลที่เดิมรับคำอธิบายการเปลี่ยนสถานะของฉากเป็นอินพุต ให้เข้าใจและทำตามคำสั่งภาษาธรรมชาติได้โดยตรง
  • โมเดลที่ผ่านการฝึกต่อแล้วสามารถใช้กับงานเคลื่อนที่และจัดการวัตถุจริงหลากหลายได้โดยไม่ต้องปรับแต่งเพิ่มเติม
  • เพื่อยืนยันว่าผลจากการขยายขนาดในการพรีเทรนถ่ายโอนมาได้หรือไม่ จึงประเมินประสิทธิภาพของหุ่นยนต์จริงใน สภาพแวดล้อมและอินสแตนซ์วัตถุที่ไม่เคยเห็น
  • เมื่อข้อมูลพรีเทรนและขนาดโมเดลใหญ่ขึ้น อัตราความสำเร็จของหุ่นยนต์จริงก็เพิ่มขึ้นอย่างต่อเนื่องและคาดการณ์ได้
    • โมเดลพรีเทรนที่แข็งแกร่งกว่าจะให้ประสิทธิภาพหุ่นยนต์จริงที่สูงกว่าหลังการฝึกต่อด้วย
    • การเพิ่มขึ้นของอัตราความสำเร็จตามขนาดข้อมูลและโมเดล ไม่พบสัญญาณอิ่มตัว

เรียนรู้งานใหม่ด้วยข้อมูลน้อย

  • Xiaomi-Robotics-1 ปรับตัวกับงานใหม่ที่ซับซ้อนได้ด้วยการสาธิตจากหุ่นยนต์จริงเพียงไม่กี่ชั่วโมงต่อภารกิจ
  • ใช้งานแพ็กโทรศัพท์ เติมเครื่องพิมพ์ ใส่ผ้าลงเครื่องซักผ้า และแพ็กกล่องเป็นงานประเมิน
  • ในการสาธิตเฉลี่ย น้อยกว่า 10 ชั่วโมง ต่อภารกิจ ทำได้อัตราความสำเร็จรวม 75% ซึ่งเหนือกว่าโมเดลฐาน Ï0.5 ที่ได้ 40% อย่างมากภายใต้งบข้อมูลเท่ากัน
    • แพ็กโทรศัพท์: XR-1 70%, Ï0.5 30%
    • เติมเครื่องพิมพ์: XR-1 70%, Ï0.5 20%
    • ใส่ผ้าลงเครื่องซักผ้า: XR-1 80%, Ï0.5 40%
    • แพ็กกล่อง: XR-1 80%, Ï0.5 70%
  • เมื่อเพิ่มเป็นเฉลี่ย น้อยกว่า 40 ชั่วโมง ต่อภารกิจ อัตราความสำเร็จรวมเพิ่มเป็น XR-1 85%, Ï0.5 53%
    • แพ็กโทรศัพท์: XR-1 80%, Ï0.5 40%
    • เติมเครื่องพิมพ์: XR-1 60%, Ï0.5 20%
    • ใส่ผ้าลงเครื่องซักผ้า: XR-1 100%, Ï0.5 50%
    • แพ็กกล่อง: ทั้งสองโมเดล 100%

ประสิทธิภาพบนเบนช์มาร์กจำลอง 4 รายการ

  • ทำได้ ประสิทธิภาพสูงสุด ทั้งหมดบนเบนช์มาร์กจำลองหลัก 4 รายการที่เน้นการทำให้ทั่วไปได้
    • RoboCasa: อัตราความสำเร็จเฉลี่ย 74.5%, ดีขึ้น 2.6% เมื่อเทียบกับอันดับ 2 ที่ 72.6%
    • RoboCasa365: 57.4%, ดีขึ้น 23.2% เมื่อเทียบกับอันดับ 2 ที่ 46.6%
    • VLABench: 59.1%, ดีขึ้น 11.1% เมื่อเทียบกับอันดับ 2 ที่ 53.2%
    • RoboDojo: 13.93%, ดีขึ้น 58.3% เมื่อเทียบกับอันดับ 2 ที่ 8.80%
  • ผลด้านการทำให้ทั่วไปได้และการขยายขนาด ที่ได้จากการพรีเทรนยังส่งต่อไปสู่การประเมินแบบจำลองมาตรฐานด้วย

ผลการขยายขนาดและขอบเขตการใช้งาน

  • การพรีเทรน UMI ขนาดใหญ่ช่วยบรรเทาคอขวดด้านข้อมูลหุ่นยนต์ และการจัดแนวกับหุ่นยนต์จริงและคำสั่งช่วยถ่ายโอนความสามารถในการสร้างพฤติกรรมทั่วไปไปยังหุ่นยนต์ทางกายภาพ
  • การปรับปรุงประสิทธิภาพตามขนาดข้อมูลพรีเทรนและโมเดลสะท้อนโดยตรงถึงประสิทธิภาพใช้งานทันทีของหุ่นยนต์จริงหลังการฝึกต่อ
  • โมเดลพื้นฐานที่เสร็จสมบูรณ์ปรับตัวกับงานใหม่ได้ด้วยข้อมูลน้อย พร้อมทั้งทำผลงานสูงสุดบนเบนช์มาร์กจำลอง 4 รายการที่ประเมินการทำให้ทั่วไปได้
  • ในฐานะตัวอย่างการใช้งานจริง ยังเผยแพร่ วิดีโอแพ็กกระเป๋าเดินทางแบบไม่ตัดต่อ ด้วย

1 ความคิดเห็น

 
ความคิดเห็นจาก Hacker News
  • ผมยิ้มกว้างตลอดตอนดูวิดีโอ จนไม่เข้าใจปฏิกิริยาเชิงลบที่นี่เลย นี่หมายความว่าในที่สุดก็มี หุ่นยนต์ซักผ้า ออกมาแล้ว และอย่างน้อยโมเดลก็ถูกปล่อยให้ใช้ฟรีไม่ใช่หรือ นี่คืออนาคตที่เราหวังไว้ และหุ่นยนต์ควรถูกใช้กับเรื่องแบบนี้แหละ

    • ใน HN มี กระแสต่อต้านจีน ทั้งแบบแฝงและแบบโจ่งแจ้งอยู่ไม่น้อย จึงน่าจะมีผลต่อปฏิกิริยาเชิงลบมากพอสมควร
    • ผลงานล่าสุดจากจีนในด้านปัญญาประดิษฐ์และหุ่นยนต์สร้างผลดีสุทธิจำนวนมากให้ทั้งโลก โอเพนซอร์ส เป็นเรื่องดีไม่ว่าจะมาจากที่ใด
    • ปัญญาประดิษฐ์หรือโมเดลภาษาขนาดใหญ่ที่ดีที่สุดจะไม่ได้มาจากแชตบอตถามตอบอีกตัว หรือระบบอัตโนมัติสำหรับอีเมลและเรียงความ แต่มาจาก หุ่นยนต์ ต่างหาก อยากให้มันล้างจาน ซักผ้า และแม้แต่ช่วยหาของที่เราลืมว่าวางไว้ที่ไหน
    • การที่ลิงก์ซึ่งแสดงเทคโนโลยีที่เมื่อไม่กี่ปีก่อนยังเป็นไปไม่ได้ กลับถูกกลบอยู่ใต้ข่าวเบราว์เซอร์คล้าย ๆ ของ Kagi สะท้อนลำดับความสำคัญของผู้อ่าน HN ได้ดี โลกตะวันตกอาจล้าหลังด้านหุ่นยนต์เพราะ ลำดับความสำคัญที่ผิดพลาดของนักลงทุนร่วมทุนและนักพัฒนา
    • นี่เป็นเทคโนโลยีที่น่าทึ่งที่สุดเท่าที่เคยเห็นมาในชีวิต จนรู้สึกว่า เอกฐานทางเทคโนโลยี มาถึงแล้วก็ได้ อีกไม่นานหุ่นยนต์แบบนี้อาจดูแลและเลี้ยงเด็กทารกได้ด้วย
  • วิดีโอนี้มีโจทย์หลายอย่างที่ตามตำราแล้วถือว่ายากมาก ดังนั้นถ้าไม่รู้สึกประทับใจ ก็ควรดีใจที่เมื่อ 10 ปีก่อนไม่ต้องสร้างมันเอง
    มีทั้ง การประสานงานสองมือ, ลำตัวแบบเคลื่อนที่ได้, วัตถุที่เปลี่ยนรูปได้, จุดจับที่บางอย่างซิปกระเป๋า และการหยิบจับวัตถุหลายชิ้นในครั้งเดียว แต่ละอย่างเคยเป็นหัวข้อวิจัยแยกกันในด้านการรับรู้หรือการหยิบจับ และเป็นปัญหาระดับที่ทำวิทยานิพนธ์ปริญญาเอกได้หลายเล่ม

  • พอเห็นหุ่นยนต์สองมือแล้ว รู้สึกว่าถ้ามี มือที่สาม ซึ่งมีความสามารถต่างออกไป เช่น กริปแบบหนวด ก็จะทำให้งานจำนวนมากง่ายขึ้น แม้จำนวนแขนขามากขึ้นจะเพิ่มปัญหา แต่ข้อดีของการมีวิธีเพิ่มในการจับยึดและหมุนวัตถุนั้นใหญ่มาก

    • ถ้าจะฝึกมือที่สาม ต้องมีข้อมูลจำนวนมากจากการที่มนุษย์ควบคุมโดยตรง มือสองข้างมีวิดีโอพฤติกรรมมนุษย์อยู่มาก แต่แขนขาเพิ่มเติมไม่มี ดังนั้นในอนาคตคงต้องให้หุ่นยนต์ปรับปรุงตัวเอง หรือมีวิธีเพิ่มประสิทธิภาพแบบใหม่ออกมา
    • ในนิยายไซไฟ The Mote in God's Eye มีมนุษย์ต่างดาวที่มีสามมือ มือหนึ่งสำหรับยึดวัตถุบริเวณท้อง และอีกสองมือสำหรับงานละเอียด จนเกิดสำนวนทำนองว่า “ในมือหนึ่ง, อีกมือหนึ่ง, และในมือที่ใช้ยึด”
    • ใครที่เคยซ่อมรถจะรู้ว่า ถ้ามีมือเพิ่มอีกข้าง มันมีประโยชน์เสมอ
    • น่าจะต้องมีอะไรทำนอง กฎของ Amdahl สำหรับจำนวนแขนขาด้วย
  • ผมอยากเรียกแนวทางที่เรายอมรับได้แม้หุ่นยนต์จะพับผ้าแบบยับ ๆ และลวก ๆ ไปบ้าง เพราะมันสะดวกกว่าการพับอย่างประณีตและรีดผ้า ว่า Slopfold

    • เครื่องชงกาแฟตอนแรกก็สู้บาริสตาไม่ได้ แต่พัฒนาต่อเนื่องจนตอนนี้ในหลายกรณีทำได้ดีกว่า เทคโนโลยีมักเริ่มจากความสะดวกที่ยังไม่สมบูรณ์แบบแบบนี้แล้วค่อยดีขึ้น
    • เห็นหุ่นยนต์พับผ้าแล้ว มันทำได้ดีกว่าผมแล้ว
    • การพับผ้าเองก็เป็นการประนีประนอมระหว่างการวางแผ่ไว้กับการแขวนบนไม้แขวน
  • ความก้าวหน้าเร็วมาก และ ปัญญาประดิษฐ์จะครองอนาคต ผมคิดว่าเรายังแตะได้แค่ผิวเผินของสิ่งที่เป็นไปได้เท่านั้น แต่ในแง่ร้าย ผมก็คิดว่าคำทำนายของ Bill Joy มีวิสัยทัศน์ล่วงหน้าจริง ๆ
    https://www.wired.com/2000/04/joy-2/

  • สิ่งที่ผมคาดหวังที่สุดจากอนาคตของปัญญาประดิษฐ์คือ การทำงานบ้านอัตโนมัติ ในเอเชีย ผู้ช่วยทำงานบ้านค่อนข้างถูกและหาได้ง่าย แต่ในตะวันตก การจ้างคนทำความสะอาดหรือแม่บ้านแทบเป็นเรื่องฟุ่มเฟือย เราใช้เวลามหาศาลดูแลบ้านทุกสัปดาห์ จึงรอวันที่จะได้เวลานั้นกลับคืนมา

    • ในเอเชียก็ใช่ว่าคนส่วนใหญ่จะเข้าถึงผู้ช่วยทำงานบ้านได้ถูกและง่าย ที่ดูเหมือนเป็นเช่นนั้นเพราะตัดคนจนออกจากคำว่า ‘ส่วนใหญ่’ ต่างหาก
    • สำหรับการทำความสะอาดบ้านจริง ๆ ผมคิดว่าหุ่นยนต์ที่ก้าวหน้ากว่า Roomba คง ยากที่จะถูกกว่าผู้ช่วยทำงานบ้าน
    • สงสัยว่าเวลาว่างที่คุณอยากได้คืนมานั้นจะเอาไปทำอะไร
  • ยิ่งยอดเยี่ยมขึ้นเพราะเป็นวิดีโอที่ไม่ได้ตัดต่อ จะยกตัวอย่างสิ่งที่มันยังทำไม่ได้อย่างบันไดหรือประตูแคบ ๆ ได้มากมายก็จริง แต่แค่งานที่ทำได้แล้วก็น่าทึ่ง และ แผงแชต ยังทำให้การโต้ตอบดีขึ้นด้วย

  • แนวทางที่เหมาะคือออกแบบ หุ่นยนต์ที่ไม่ใช่มนุษย์ทรง ต่อไป เครื่องมือและเครื่องใช้ไฟฟ้าในอนาคตก็คงเปลี่ยนไปเพื่อให้มนุษย์กับหุ่นยนต์ใช้ร่วมกันได้ และสายรูดซิปของกระเป๋าใส่รองเท้าก็ต้องการความแม่นยำสูงเกินไป

    • มีหลักฐานเพียงพอแล้วว่ามุมมองนี้ผิด จนถึงไม่กี่เดือนก่อน นี่แทบจะเป็นความเห็นมาตรฐานของวงการหุ่นยนต์ แต่ก่อนจะเริ่มผลิตจำนวนมากด้วยซ้ำ ราคาหุ่นยนต์ฮิวแมนนอยด์ ก็ร่วงลงอย่างรวดเร็ว
      การใช้ประโยชน์จากการลงทุนมหาศาลในการเรียนรู้งานจริง เพื่อให้หุ่นยนต์ฮิวแมนนอยด์ราคาถูกมีความคล่องแคล่ว อายุแบตเตอรี่ และพละกำลังดีขึ้นเรื่อย ๆ น่าจะเป็นไปได้มากกว่าการออกแบบของใช้ประจำวันนับล้านชิ้นใหม่ให้เข้ากับหุ่นยนต์เฉพาะงานในปัจจุบัน
    • หุ่นยนต์ไม่ใช่มนุษย์ทรงที่จัดการงานน่าเบื่อนั้นถูกใช้แพร่หลายแล้ว เช่น งานบำรุงรักษาใต้น้ำ การทำงานคล้ายมนุษย์ไม่ได้แปลว่าต้องมีรูปร่างแบบมนุษย์
      ผมอยากได้ฝูงหุ่นยนต์ทรงแมลงสำหรับกำจัดยุง หุ่นยนต์ทรงงูสำหรับซ่อมท่อ และหุ่นยนต์ทรงแมงมุมสำหรับทำความสะอาดพื้นผิว
    • ทางที่ดีคือ ผสม สองแนวทางเข้าด้วยกัน มีของบางอย่างอย่างประตูที่ถูกออกแบบมาให้เข้ากับมือและเท้าอยู่แล้ว แต่การใส่กริปรูปแบบอื่นหรือแขนเพิ่มเข้าไปก็อาจช่วยได้
    • หุ่นยนต์ไม่จำเป็นต้องหน้าตาเหมือนมนุษย์ แค่มี แขนสักสองสามข้าง ที่ทำงานได้เรียบร้อยก็พอ
  • อีกไม่กี่ปี Home Assistant กับ LLM น่าจะช่วยประสานงานบ้านระหว่างที่เราออกไปข้างนอกได้ LLM อาจทำรายการสิ่งของในบ้าน แล้วส่งเครื่องดูดฝุ่นกับหุ่นยนต์ไปจัดระเบียบได้
    LLM แบบมัลติโมดัลสามารถวิเคราะห์ภาพ แยกได้ว่าอะไรควรใส่เครื่องล้างจานหรือเครื่องซักผ้า และอะไรต้องขัดเงา รวมถึงจัดตู้เสื้อผ้า ปูเตียง และดูแลต้นไม้ได้ด้วย ให้มันทำงานทั้งวันระหว่างที่แผงโซลาร์จ่ายพลังงานก็พอ

  • ผมทำงานบ้านเต็มเวลา เลยอยากได้หุ่นยนต์ตัวนี้จริง ๆ ผมเกลียด การพับผ้า และผัดผ่อนตลอด ดังนั้นต่อให้ไม่มีฟังก์ชันเอาผ้าใส่เครื่องซักผ้า แค่พับให้ก็พอแล้ว