1 คะแนน โดย GN⁺ 3 시간 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • Black Forest Labs และ mimic robotics พัฒนา FLUX-mimic โดยผสานการทำนายการกระทำของหุ่นยนต์เข้ากับ แบ็กโบน FLUX 3 ที่เรียนรู้ภาพ·วิดีโอ·เสียงร่วมกัน และได้นำไปทดสอบ·ปรับใช้ในสายการผลิตของ Audi
  • เรียนรู้การสัมผัส·การเคลื่อนไหว·น้ำหนัก·ความเป็นเหตุเป็นผลผ่าน การทำนายวิดีโอ ซึ่งคิดเป็น มากกว่า 95% ของการคำนวณในการฝึกทั้งหมด และปฏิบัติต่อการกระทำของหุ่นยนต์แบบมิติต่ำเป็นอีก modality หนึ่งที่แทนความเป็นจริงทางฟิสิกส์เดียวกัน
  • หลังเพิ่มการทำนายการกระทำ คุณภาพการสร้างวิดีโอลดลงชั่วคราวสูงสุด 10% แต่ กลับสู่ระดับเดิมหลัง 3,500 สเต็ป ยืนยันว่าแบ็กโบนเดียวสามารถทำทั้งการสร้างคอนเทนต์และการทำนายการกระทำได้
  • รวมการเรียนรู้เชิงสร้างและการเรียนรู้ representation ด้วย Self-Flow และเชื่อมต่อ action decoder น้ำหนักเบา ทำให้บน NVIDIA RTX 5090 ตัวเดียวทำ การประมวลผลแบ็กโบนได้ต่ำกว่า 80ms และได้เวลาตอบสนองรวมของหุ่นยนต์ 101ms
  • world model ที่เรียนรู้วิดีโอทั่วไปและงานจัดการวัตถุในสเกลใหญ่ สามารถปรับตัวกับงานใหม่ด้วยตัวอย่างสาธิตเพียงเล็กน้อยและลองใหม่หลังล้มเหลว จึงนำไปใช้กับงานผลิตที่ระบบอัตโนมัติแบบเดิมมีต้นทุนสูง เช่น ชิ้นส่วนยืดหยุ่นและการจัดการที่ต้องความแม่นยำ

แบ็กโบนเดียวสำหรับการสร้างคอนเทนต์และการควบคุมหุ่นยนต์

  • หลังจาก FLUX 1·FLUX 2 มุ่งเน้นการสร้างภาพ FLUX 3 เรียนรู้ภาพ·วิดีโอ·เสียงร่วมกันตั้งแต่ต้น เพื่อสร้างคอนเทนต์ภาพและเสียงร่วมกัน
  • Black Forest Labs มอบ FLUX 3 เวอร์ชันเริ่มต้นให้ mimic robotics และผสานความเชี่ยวชาญด้านการเรียนรู้·การปรับใช้หุ่นยนต์ของทั้งสองบริษัทเข้ากับความเชี่ยวชาญด้าน foundation model เพื่อพัฒนา FLUX-mimic
    • mimic รับผิดชอบหุ่นยนต์ของตนเอง การเรียนรู้ของหุ่นยนต์ การจัดการวัตถุอย่างประณีต และการปรับใช้ในสภาพแวดล้อมการผลิต
    • Black Forest Labs ให้ความสามารถด้านโมเดลพื้นฐานการมองเห็น และการเรียนรู้·การสร้างโมเดลแบบ multimodal
  • FLUX-mimic เป็น โมเดลวิดีโอ-แอ็กชัน สำหรับการจัดการวัตถุทั่วไปบนพื้นฐานแบ็กโบน FLUX 3 และถูกรวมเข้ากับระบบปรับใช้แบบฟูลสแต็กของ mimic
  • แบ็กโบนเดียวกันสร้างคอนเทนต์ภาพ·วิดีโอ·เสียง ขณะเดียวกันใน Physical AI ก็ใช้ดำเนินการกระทำ

โลกทางฟิสิกส์ที่เรียนรู้ผ่านการทำนายวิดีโอ

  • มากกว่า 95% ของการคำนวณในการฝึก FLUX 3 ถูกใช้กับการทำนายวิดีโอ
    • เพื่อสร้างวิดีโอที่สมจริง ต้องเรียนรู้การสัมผัส การเคลื่อนไหว น้ำหนัก เหตุและผล หากจัดการสิ่งเหล่านี้ผิด วิดีโอผลลัพธ์ก็จะดูไม่เป็นธรรมชาติ
    • กระบวนการเรนเดอร์โลกอย่างถูกต้องเชื่อมโยงกับกระบวนการเรียนรู้ว่าโลกทำงานอย่างไร
  • เสียงเป็น modality มิติต่ำที่คิดเป็น น้อยกว่า 0.5% ของโทเคนในวิดีโอ 720p พร้อมเสียง
    • โมเดลที่เข้าใจวิดีโอสามารถเรียนรู้ความเป็นเหตุเป็นผลของเสียงพูดที่ซิงก์กับการขยับริมฝีปาก และเอฟเฟกต์เสียงที่สอดคล้องกับเหตุการณ์ทางฟิสิกส์
  • การกระทำของหุ่นยนต์ก็เป็น representation สถานะมิติต่ำที่ผูกกับการสังเกตด้วยภาพอย่างใกล้ชิดเช่นกัน
    • การกระทำ·เสียง·เฟรมวิดีโอ ต่างเป็นการแทนส่วนหนึ่งของความเป็นจริงทางฟิสิกส์เดียวกัน
    • การทำนายการกระทำไม่ได้สร้าง foundation model แยกต่างหาก แต่เป็นการเชื่อมต่อวิธีสังเกตอีกแบบหนึ่งเข้ากับ world model ที่มีอยู่

คุณภาพการสร้างกลับคืนหลังเรียนรู้การกระทำ

  • เมื่อเพิ่มการทำนายการกระทำเข้าไปในการฝึกขนาดใหญ่ คะแนนประเมินโดยมนุษย์ของการสร้าง text-to-video และ image-to-video ลดลงในช่วงแรกสูงสุด 10%
  • คุณภาพฟื้นกลับมาเมื่อโมเดลเรียนรู้โครงสร้างของ action space และจัดแนว representation ภายในของโลก โดยหลัง 3,500 สเต็ป ก็กลับถึงระดับการสร้างวิดีโอเดิม พร้อมกับทำนายการกระทำได้ด้วย
  • แม้จะเกิดความสับสนชั่วคราวระหว่างผสานการกระทำเข้าเป็นอินพุตและเอาต์พุต แต่ไม่ได้แลกมาด้วยการสูญเสียความสามารถเดิมอย่างถาวร
  • ไม่จำเป็นต้องมี foundation model แยกสำหรับการสร้างวิดีโอและการทำนายการกระทำ เพราะ แบ็กโบนเดียว ตัวเดียวกันทำทั้งสองงานได้

สถาปัตยกรรมที่ถอดรหัสการกระทำจาก representation ของโลก

  • FLUX-mimic ถอดรหัสการกระทำของหุ่นยนต์จาก representation ภายในของโลกที่ FLUX 3 เรียนรู้ไว้เพื่อการสร้างวิดีโอ
  • ตามวิธีที่ใช้ครั้งแรกใน mimic-video จะดึงฟีเจอร์ระหว่างทางจากเส้นทางการทำนายวิดีโอของ FLUX และฝึก action decoder น้ำหนักเบา ทับบนฟีเจอร์นั้น
  • ประสิทธิภาพขึ้นอยู่กับสององค์ประกอบที่เชื่อมโยงกัน
    • คุณภาพของ world model: หากไม่เข้าใจว่าโลกเคลื่อนไหวอย่างไร ก็ยากจะจำลองได้อย่างแม่นยำ และเชื่อมโยงโดยตรงกับคุณภาพการสร้าง
    • คุณภาพของ representation: หากความเป็นเหตุเป็นผลระหว่าง modality ต่าง ๆ พัวพันกันแบบไม่เชิงเส้นใน feature space action decoder ก็ต้องตีความสิ่งนั้นยากพอ ๆ กับการตีความอินพุตดิบ
  • โมเดลเชิงสร้างให้การจำลองคุณภาพสูงและ scaling laws ที่คาดการณ์ได้ตามปริมาณการคำนวณที่เพิ่มขึ้น แต่อาจสร้าง representation ที่แยกส่วนชัดเจนน้อยกว่าวิธีเรียนรู้ representation เฉพาะทาง จึงอาจจำกัดการนำไปใช้ในงานต่อยอดที่ต้องอาศัยความเข้าใจโลก

รวมการเรียนรู้เชิงสร้างและ representation ด้วย Self-Flow

  • Self-Flow รวมการเรียนรู้เชิงสร้างและการเรียนรู้ representation ไว้ใน เฟรมเวิร์กเดียว
  • หลังนำมาใช้ คุณภาพของ world model และ representation ดีขึ้นไปพร้อมกัน
    • ประสิทธิภาพของ world model ที่วัดจากคุณภาพการสร้างวิดีโอ·ภาพ·เสียงสูงขึ้น
    • คุณภาพของ representation ที่วัดจากอัตราความสำเร็จของงานควบคุมหุ่นยนต์ในซิมูเลชันก็ดีขึ้นด้วย
  • FLUX 3 ขยาย Self-Flow เพื่อเรียนรู้พลวัตของโลกและความสามารถในการจัดการวัตถุที่กว้างขวางตั้งแต่ต้น
    • คอนเทนต์วิดีโอทั่วไป หลายสิบล้านชั่วโมง
    • คอนเทนต์วิดีโอที่มุ่งเน้นการจัดการวัตถุโดยมนุษย์และหุ่นยนต์ หลายแสนชั่วโมง
  • การฝึกขนาดใหญ่นี้ขยายผลลัพธ์ของ Self-Flow จากห้องแล็บไปสู่สภาพแวดล้อมการผลิต·โลจิสติกส์จริง

งานในโรงงานและประสิทธิภาพบนเบนช์มาร์ก

  • mimic นำ FLUX-mimic ไปปรับใช้กับงานโรงงานจริง
    • การจัดชุดชิ้นส่วนลงในถาดที่มีโครงสร้าง
    • การใส่อุปกรณ์ควบคุมอิเล็กทรอนิกส์ลงในฟิกซ์เจอร์ที่มีระยะเผื่อจำกัด
    • การประกอบชิ้นส่วน
    • การจัดการวัสดุอ่อนและยืดหยุ่น เช่น ด้าย·สายเคเบิล
  • แม้จะตรึงแบ็กโบน FLUX ไว้ทั้งหมด action decoder ก็ให้ประสิทธิภาพสูงกว่า โมเดลวิชัน-ภาษา-แอ็กชัน รุ่นก่อน โดยโมเดลก่อนหน้าไม่สามารถทำงานสำเร็จในการตั้งค่านี้ได้
  • เมื่อ fine-tune แบ็กโบนและ action decoder ร่วมกัน FLUX-mimic ทำอัตราความสำเร็จของงานได้ระดับสูงสุด
  • การฝึกขนาดใหญ่ให้ความรู้เรื่องโลกและการกระทำแก่แบ็กโบน ส่วน Self-Flow ทำให้ถอดรหัสความรู้นั้นจาก feature representation ได้ง่าย

เรียนรู้จากตัวอย่างสาธิตน้อยและกู้คืนจากความล้มเหลว

  • หากกฎฟิสิกส์ถูกบรรจุอยู่ใน representation ที่เข้าถึงได้แล้ว การปรับตัวกับงานใหม่จะกลายเป็นกระบวนการเชื่อมงานเฉพาะเข้ากับความรู้เดิม แทนที่จะต้องเรียนรู้ใหม่ว่าโลกทำงานอย่างไร
  • ในการทดลอง Self-Flow จำนวนสเต็ปฝึกการทำนายการกระทำที่จำเป็นเพื่อให้ได้อัตราความสำเร็จเดียวกันลดลงเหลือ ครึ่งหนึ่ง ของโมเดลวิดีโอที่ไม่ได้ใช้ Self-Flow
  • ในบทความ mimic-video โมเดลวิดีโอ-แอ็กชันมี sample efficiency สูงกว่าถึง 10 เท่า เมื่อเทียบกับโมเดลวิชัน-ภาษา-แอ็กชัน และ FLUX-mimic ผสานสองผลลัพธ์นี้เข้าด้วยกัน
  • หากหุ่นยนต์จับวัตถุไม่สำเร็จ มันสามารถปรับท่าทาง จับใหม่ และทำงานให้เสร็จได้ด้วย การกู้คืนจากความล้มเหลวอย่างเป็นธรรมชาติ
    • เนื่องจากไม่สามารถใส่ความล้มเหลวทุกประเภทไว้ในข้อมูลสาธิตได้ พฤติกรรมกู้คืนที่ไม่ได้ถูกสาธิตจึงมาจากโมเดลที่เรียนรู้วิธีทำงานของโลกไว้แล้ว

ระบบหุ่นยนต์ที่ตอบสนองใน 101ms

  • ในสภาพแวดล้อมจริง โมเดลต้องกระทำให้ทันกับความเร็วการเปลี่ยนแปลงของสภาพแวดล้อม และต้นทุนการคำนวณส่วนใหญ่ของ FLUX-mimic เกิดจากองค์ประกอบที่ใหญ่ที่สุดคือ แบ็กโบน
  • representation ของโลกที่มีโครงสร้างดีช่วยให้ได้ประสิทธิภาพเดียวกันด้วยจำนวนพารามิเตอร์น้อยลง ทำให้ใช้แบ็กโบนที่เล็กและเร็วขึ้นได้
  • แบ็กโบนที่ปรับแต่งแล้วทำงานบน NVIDIA RTX 5090 ตัวเดียว ตั้งแต่อินพุตจนถึงการสร้าง representation ของโลกได้ต่ำกว่า 80ms ซึ่งอยู่ในระดับเดียวกับเวลาตอบสนองทางการมองเห็นของมนุษย์
  • mimic ปรับแต่งองค์ประกอบต่อไปนี้เพื่อลด latency เพิ่มเติมในสแต็กการปรับใช้ทั้งหมด
    • action decoder
    • latency ระหว่างโปรเซสของเซนเซอร์·โมเดล·แอคชูเอเตอร์
    • real-time chunking ที่ซ้อนการทำนายกับการดำเนินการเพื่อป้องกันหุ่นยนต์สะดุด
  • หลังใช้การปรับแต่งทั้งหมด เวลาตอบสนองสุดท้ายคือ 101ms สำหรับระบบหุ่นยนต์แบบสแตนด์อโลน

การประยุกต์ใช้ในสายการผลิตของ Audi

  • แม้ Audi จะมีระดับระบบอัตโนมัติสูง แต่ยังคงทำงานกับชิ้นส่วนยืดหยุ่นและงานจัดการที่ต้องความแม่นยำด้วยมือ
  • การผลิตสินค้าพรีเมียมมีรูปแบบหลากหลาย ทำให้การออกแบบเซลล์หุ่นยนต์ที่โปรแกรมด้วยวิธีเดิมใหม่ในแต่ละกรณีมีต้นทุนสูง
    • ระบบที่อิงการเรียนรู้เปลี่ยนโครงสร้างต้นทุนนี้
  • Audi Production Lab ร่วมมือกับ mimic เพื่อ ทดสอบ·ปรับใช้ FLUX-mimic
    • ดำเนินการจัดการวัตถุอ่อนที่ซับซ้อนซึ่งหุ่นยนต์เดิมทำไม่ได้
    • สามารถใช้สนับสนุนพนักงาน เพิ่มประสิทธิภาพ และขยายระบบอัตโนมัติที่ยืดหยุ่นในงานผลิต·โลจิสติกส์
  • sample efficiency และความทนทานของ FLUX-mimic ไม่ได้มาจากวิศวกรรมเฉพาะงาน แต่มาจากแบ็กโบน FLUX 3 และ representation ที่ถอดรหัสได้ ซึ่งรองรับการถ่ายโอนข้ามงาน·อุตสาหกรรม·ฮาร์ดแวร์
  • foundation model ด้าน visual intelligence เพียงตัวเดียวสร้างภาพ·วิดีโอ·เสียง พร้อมกับขับเคลื่อนหุ่นยนต์ในสายการผลิต

1 ความคิดเห็น

 
GN⁺ 3 시간 전
ความเห็นจาก Hacker News
  • ดูเหมือนว่า ภายใน โมเดลสร้างวิดีโอแบบมัลติโหมดัล ที่ฝึกมาอย่างดี จะเกิดโมเดลแทนภาพของโลกขึ้น และเมื่อนำสิ่งนี้ออกมาใช้กับหุ่นยนต์ก็ทำงานได้ดี
    แนวคิดที่ว่าโมเดลวิดีโอเข้าใจสสาร แสง และโลกไม่ใช่เรื่องใหม่ แต่กรณีที่แล็บวิดีโอเปลี่ยนไปเป็นแล็บหุ่นยนต์นั้นพบได้น้อย นี่อาจเป็นเส้นทางธุรกิจที่ขยายสเกลด้วยการสร้างวิดีโอ แล้วใช้ความสามารถนั้นมาฝึกหุ่นยนต์
    มือของ BFL ที่ดูเหมือนซ่อนอุปกรณ์หลายอย่างไว้ในถุงมือก็น่าสนใจ Robotics-1 ของ Xiami สร้างวิดีโอฝึกด้วยกริปเปอร์ทั่วไปและถุงมือแบบกริปเปอร์ แต่ โมเดล BFL ดูเหมือนไม่ต้องใช้อุปกรณ์แบบนั้น ในเมื่อฮาร์ดแวร์เป็นด้านที่ยาก ก็อยากรู้ว่าพวกเขาจะเดินแนวทางต่อไปอย่างไร

  • ช่วงประมาณนาทีที่ 3:30 ฉากที่แขนหุ่นยนต์พยายามสามครั้งก่อนจะใส่บัวขอบหน้าต่างกลับเข้าไปได้นั้นน่าทึ่งมาก ผมเพิ่งเคยเห็น การแก้ปัญหาหลังล้มเหลว แบบนี้ จึงสงสัยว่านี่เป็นเทคโนโลยีใหม่หรือไม่

    • Google เคยโชว์งานที่อาจน่าประทับใจกว่านั้นเมื่อกว่าหนึ่งปีก่อน โดยหุ่นยนต์ที่ใช้ VLA เปลี่ยน สายพานไทม์มิ่ง ที่มีแรงตึง: https://www.youtube.com/watch?v=2AAFiuEP7iE
    • ถ้าต้องการตามให้ทันระดับล่าสุด น่าลองดู Generalist ซึ่งเป็นระดับแนวหน้าในงานควบคุมจัดการวัตถุที่ละเอียดอ่อน: https://generalistai.com/blog/gen-1
  • ในคำอธิบายที่ว่า “สำหรับงานที่ต้องเข้าใจโลก representation ที่แยกส่วนน้อยกว่าจะมีประโยชน์น้อยกว่า” ประโยคที่เลือกใช้คำว่า representation ที่แยกส่วนน้อยกว่า เพื่อสื่อแนวคิดว่า ‘พันกันมากกว่า’ นั้นดูตลกดี การอธิบายโลกจริงแล้วทำให้ตัวแนวคิดเองยิ่งพันกันไปด้วย ดูเป็นสำนวนแบบ LLM มาก

    • ตอนนี้กลายเป็นขั้นที่หาเบาะแสของ LLM ในทุกประโยคโดยไม่มีหลักฐานแล้ว คงถึงเวลาที่ควรสมมติว่างานเขียนทุกชิ้นได้รับ ความช่วยเหลือจาก LLM ในระดับหนึ่ง แล้วประเมินแค่คุณภาพของผลลัพธ์
    • คนเราก็เขียนประโยคแปลก ๆ บ่อยเหมือนกัน อันที่จริงสำนวนแบบนั้นอาจพบได้น้อยในข้อมูลฝึก จน ความเป็นไปได้ที่ LLM จะสร้าง อาจต่ำกว่ามนุษย์ก็ได้
    • ล้อเล่นน่ะ
    • เครื่องหมาย dash ในต้นฉบับก็เป็นหลักฐานชัดเจนว่า LLM เขียนคอมเมนต์นี้ /s
  • น่าเศร้าที่เทคโนโลยีก้าวหน้าขนาดนี้ แต่หนังกลับดูแย่กว่าที่เคย บางทีต้องไปดูหนังเมื่อหลายสิบปีก่อนเพื่อหางานดี ๆ ทั้งที่ใช้หุ่นเชิดตลก ๆ แต่ โครงสร้างเรื่องราวดีกว่า 1,000 เท่า

    • อาจเป็น อคติจากผู้รอดชีวิต เพราะเราไม่ได้ดูหนังเก่าแย่ ๆ ที่ไม่มีใครจำได้
    • จะปฏิเสธการลงทุนใน BFL เพราะ Robin Rombach ไม่รู้เรื่องการทำหนังหรือไม่? Sora จบแล้ว และคงยากจะหาคนที่กล้าพูดต่อสาธารณะว่า Bill Peebles ไม่รู้เรื่องการทำหนัง
      นี่ไม่ใช่แค่ปัญหาของ VC เท่านั้น แต่เกี่ยวข้องกับสิ่งที่เรียกว่า Hollywood No ในทางกลับกัน Hollywood No เองก็อาจเป็นปัญหา และในวงการเกมเรียกสิ่งนี้ว่า toxic positivity
  • ดีใจที่ได้เห็น ความร่วมมือระหว่างสตาร์ทอัพยุโรป

    • Flux ไม่ได้ถูก Meta ซื้อไปแล้วหรือ?
  • นี่คืออนาคต และก็เป็นปัจจุบันแล้วเช่นกัน หวังว่าจะช่วยแชร์เรื่องนี้ให้คนรู้จักที่อยู่นอกสายพัฒนาซอฟต์แวร์และวิศวกรรมด้วย

  • เรากำลังพุ่งตรงเข้าสู่ วิกฤต ที่คุณค่าของมนุษย์ซึ่งไม่ได้เป็นเจ้าของปัจจัยการผลิตจะยิ่งลดลง ดูเหมือนช่วงเวลาอันมืดมนกำลังใกล้เข้ามา