- เป็น โมเดลพื้นฐานมัลติโมดัล ที่เรียนรู้ภาพ วิดีโอ และเสียงร่วมกันในสถาปัตยกรรมเดียว เพื่อรวมการสร้าง การทำความเข้าใจ และการคาดการณ์การกระทำ โดยเริ่มให้ใช้งานแบบ Early Access จาก FLUX 3 Video
- เรียนรู้โครงสร้างเชิงพื้นที่ของภาพ พลวัตด้านเวลาและฟิสิกส์ของวิดีโอ รวมถึงความสัมพันธ์ระหว่างเหตุการณ์กับเสียงในออดิโอในฐานะข้อจำกัดซึ่งกันและกัน และขยายข้อมูลกับทรัพยากรการประมวลผลบนพื้นฐานของ Self-Flow
- สร้างวิดีโอพร้อมเสียงแบบเนทีฟได้สูงสุดครั้งละ 20 วินาที และในการประเมินระยะแรกได้รับความนิยมในการเปรียบเทียบมากกว่า Grok Imagine Video สูงสุด 69%, มากกว่า Runway Gen-4.5 77% และมากกว่า Luma Ray 3.2 93%
- รองรับการสังเคราะห์และแก้ไขภาพ รวมถึงการเรนเดอร์ข้อความหลายภาษา และสามารถปรับจูนวิดีโอแบ็กโบนที่ผ่านการพรีเทรนแล้วด้วยข้อมูลเฉพาะงานที่จำกัด เพื่อนำไปใช้เป็น โมเดลพฤติกรรมหุ่นยนต์
- จะทยอยเปิดตัว Video, Image, Action และ FLUX 3 Dev แบบ open weights โดยมีเป้าหมายระยะยาวคือรวมการคาดการณ์ด้านการรับรู้ การกระทำ และภาษาไว้ในโมเดลเดียว
โมเดลมัลติโมดัลที่เรียนรู้ความเป็นจริงร่วมกัน
- FLUX 3 มองภาพ วิดีโอ และเสียงไม่ใช่องค์ประกอบที่แยกจากกัน แต่เป็นผลลัพธ์จากการสังเกตความเป็นจริงเดียวกันผ่านเซนเซอร์คนละแบบ
- ภาพจับโครงสร้างเชิงพื้นที่และความสัมพันธ์ ณ ช่วงเวลาหนึ่ง
- วิดีโอคืนมิติเวลาให้เห็นการเคลื่อนไหว พลวัตตามเวลา และกฎฟิสิกส์
- เสียงแสดงปรากฏการณ์เชิงกลและความสัมพันธ์เชิงเหตุผลของเสียงที่ตรวจจับได้ยากด้วยภาพเพียงอย่างเดียว
- ภาษาเชื่อมการรับรู้เหล่านี้เข้ากับเป้าหมาย นามธรรม และคำสั่ง
- เมื่อเรียนรู้หลายโมดาลิตีร่วมกัน จะสามารถใช้ ข้อจำกัดซึ่งกันและกัน เช่น เสียงต้องสอดคล้องกับการชน การเคลื่อนไหวต้องเป็นไปตามมวล และอนาคตต้องต่อเนื่องจากอดีต
- FLUX 3 เป็นโมเดลแรกที่สร้างขึ้นจากหลักการเหล่านี้เพียงอย่างเดียว โดยมุ่งสู่ปัญญาด้านการมองเห็นในโลกจริงที่รับรู้ คาดการณ์ และลงมือทำในสภาพแวดล้อมทางกายภาพและดิจิทัล
- ผลลัพธ์ระยะแรกจากการสร้างคอนเทนต์และ physical AI แสดงให้เห็นศักยภาพของแนวทางนี้
สถาปัตยกรรมรวมบนพื้นฐาน Self-Flow
- Self-Flow เป็นแนวทางที่จัดแนวการสร้างและการทำความเข้าใจแบบมัลติโมดัลอย่างมีประสิทธิภาพในสถาปัตยกรรมพื้นฐานเดียว
- FLUX 3 ใช้ Self-Flow เป็นฐาน และขยายปริมาณการประมวลผลกับทรัพยากรข้อมูลอย่างมากเพื่อ เรียนรู้วิดีโอ ภาพ และเสียงพร้อมกัน
- การเปรียบเทียบที่เผยแพร่ใช้ Fréchet distance ซึ่งทำให้ข้อผิดพลาดการสร้างตามแต่ละโมดาลิตีถูกนอร์มัลไลซ์โดยตั้ง Flow Matching เป็นเกณฑ์ 100 และใช้อัตราความสำเร็จในการจัดการวัตถุของงาน 4 กลุ่มหลังการปรับจูน
การสร้างวิดีโอและเสียงแบบเนทีฟ
- FLUX 3 สามารถสร้างวิดีโอและเสียงที่หลากหลายได้ยาว สูงสุด 20 วินาที ในการสร้างหนึ่งครั้ง
- ขอบเขตที่รองรับมีดังนี้
- การสร้าง text-to-video
- การสร้าง image-to-video โดยต่อจากเฟรมเริ่มต้น หรือใช้ภาพเป็นข้อมูลอ้างอิงด้านภาพ
- การสร้าง video-to-video ที่ย้ายองค์ประกอบหลักอย่างตัวละครต้นฉบับไปยังฉากหรือบริบทใหม่
- การต่อเนื่องวิดีโอและเสียงเชิงสร้างสรรค์จากวิดีโอและเสียงอินพุต
- การสร้าง keyframe-to-video ที่ควบคุมการเปลี่ยนผ่านระหว่างฉากที่กำหนด
- บทสนทนาหลายภาษา
- สไตล์ภาพและอัตราส่วนภาพที่หลากหลายเกินกว่ารูปแบบภาพยนตร์แบบดั้งเดิม
- agentic chaining ที่เชื่อมคลิปแต่ละอันให้เป็นซีเควนซ์หลายช็อตที่ยาวขึ้น
- สไตล์หลากหลายตั้งแต่วิดีโอจากกล้องแคมคอร์เดอร์ไปจนถึงแอนิเมชันและภาพยนตร์
- การสร้างตัวอักษรและการออกแบบแอนิเมชัน
- เอาต์พุตวิดีโอทั้งหมดมี การสร้างเสียงแบบเนทีฟ รวมอยู่ด้วย
การประเมินวิดีโอระยะแรก
- การประเมินเบื้องต้นทำกับ คลิป text-to-video ความละเอียด 720p ยาว 10 วินาทีพร้อมเสียง
- สัดส่วนที่ FLUX 3 ได้รับความนิยมในการประเมินเปรียบเทียบมีดังนี้
- สูงสุด 69% เมื่อเทียบกับ Grok Imagine Video
- 60% เมื่อเทียบกับ Kling v3 Pro
- 59% เมื่อเทียบกับ Happy Horse v1 และ 57% เมื่อเทียบกับ Happy Horse 1.1
- อย่างละ 52% เมื่อเทียบกับ Seedance 2.0 และ Gemini Omni Flash
- 77% เมื่อเทียบกับ Runway Gen-4.5
- 93% เมื่อเทียบกับ Luma Ray 3.2
- เนื่องจากโมเดลและ harness โดยรอบยังอยู่ระหว่างการพัฒนา ผลลัพธ์จึงยังเป็นขั้นเบื้องต้น และจะปรับปรุงเพิ่มเติมในช่วง Early Access
- พื้นที่ที่แข็งแกร่งเป็นพิเศษในตอนนี้คือการจับสีหน้าของมนุษย์ การเชื่อมโยงเหตุการณ์ทางกายภาพกับเสียง และการประมวลผลหลายภาษา
- สามารถรวมหลายคลิปโดยใช้ข้อมูลอ้างอิงด้านภาพเพื่อรักษาความสม่ำเสมอของตัวละครทั่วทั้งฉาก และสร้าง ซีเควนซ์ความยาวหลายนาที ได้
- FLUX 3 Video ให้ใช้งานแบบ Early Access
การสังเคราะห์และแก้ไขภาพ
- FLUX 3 สามารถ สังเคราะห์และแก้ไข ภาพได้ในหลายสไตล์ อัตราส่วนภาพ และความละเอียด
- ในการประเมินเบื้องต้นช่วงกลางของการฝึก ความสามารถในการจัดการพรอมป์ที่ซับซ้อนและสร้างข้อความดีขึ้นอย่างมากเมื่อเทียบกับ FLUX เวอร์ชันก่อนหน้า
- สามารถสร้างสไตล์เอาต์พุตหลากหลายและเรนเดอร์ข้อความหลายภาษาได้ด้วยความแม่นยำสูง
- ผลการประเมินยังอยู่ในขั้นเบื้องต้น และจะปรับปรุงเพิ่มเติมก่อนการเปิดตัวอย่างเป็นทางการ
- มีแผนจะเริ่ม Early Access ของ FLUX 3 Image ภายในไม่กี่สัปดาห์ข้างหน้า
การคาดการณ์การกระทำและการเรียนรู้ของหุ่นยนต์
- ใช้สองแนวทางเพื่อขยายความเข้าใจความเป็นจริงไปสู่ การคาดการณ์การกระทำ
- ขยายงานระยะแรกของ Self-Flow เพื่อรวมการคาดการณ์การกระทำแบบเนทีฟไว้ใน FLUX 3 เอง
- ใช้วิดีโอแบ็กโบนที่ผ่านการพรีเทรนแล้วเป็นฐานสำหรับทำความเข้าใจพลวัต และปรับจูนโมเดลการกระทำเฉพาะทางด้วยข้อมูลเฉพาะงานที่จำกัด
- พัฒนา FLUX-mimic ร่วมกับ mimic robotics ซึ่งเป็นพาร์ตเนอร์ที่เข้าถึงได้ตั้งแต่ช่วงแรก
- เป็นโมเดล video-to-action ที่ผสานแบ็กโบน FLUX 3 เข้ากับความเชี่ยวชาญของ mimic ด้านการเรียนรู้การจัดการวัตถุด้วยหุ่นยนต์อย่างละเอียดและการนำไปใช้ในโปรดักชัน
- มีการเผยแพร่เนื้อหาแยกเกี่ยวกับ การทดสอบรากฐานร่วมกันของ physical AI และการสร้างคอนเทนต์ในงานโปรดักชันจริงของ Audi
การทยอยเปิดตัวตามฟังก์ชัน
- แต่ละฟังก์ชันจะเปิดให้ใช้งานในช่วงหลายสัปดาห์ถึงหลายเดือนข้างหน้า ผ่าน Early Access เพื่อการเปิดตัวที่ราบรื่น การรวบรวมฟีดแบ็ก และ การทดสอบความปลอดภัย อย่างเข้มงวด
- ทั้งหมดแตกแขนงมาจากโมเดลพื้นฐานแบบมัลติโมดัล Flow Matching เดียวกัน
- FLUX 3 Video: การสร้างและแก้ไขวิดีโอ/เสียงผ่าน API และการเข้าถึงน้ำหนักแบบไม่เปิดเผยต่อสาธารณะ
- FLUX-mimic·FLUX 3 Action: ให้การคาดการณ์การกระทำแก่พาร์ตเนอร์วิจัยและเชิงพาณิชย์ที่คัดเลือก โดยเริ่มจาก mimic robotics
- FLUX 3 Image: การสังเคราะห์และแก้ไขภาพผ่าน API และการเข้าถึงน้ำหนักแบบไม่เปิดเผยต่อสาธารณะ
- FLUX 3 Dev: ให้ open weights ของแบ็กโบนมัลติโมดัลสำหรับการสร้างคอนเทนต์วิดีโอ เสียง ภาพ และการคาดการณ์การกระทำ
- จะเผยแพร่รายละเอียดทางเทคนิคเพิ่มเติมของแนวทางพื้นฐานด้วย และสามารถ สมัคร Early Access ได้
การรวมการรับรู้ การกระทำ และภาษา
- เป้าหมายการใช้งานในอนาคต ได้แก่ การแก้ไขภาพและวิดีโอแบบโต้ตอบ การจำลอง การใช้งานคอมพิวเตอร์ และ physical AI
- ขณะทยอยเปิดตัวฟังก์ชันปัจจุบัน ก็ยังเดินหน้าพัฒนาโมเดลรุ่นถัดไปด้วย
- เป้าหมายสุดท้ายคือการรวม การคาดการณ์ด้านการรับรู้ การกระทำ และภาษา ไว้ในโมเดลหนึ่งเดียว
1 ความคิดเห็น
ความคิดเห็นจาก Hacker News
คาดหวังว่าเวอร์ชันที่เปิดเผยน้ำหนักโมเดลจะเป็น ประสิทธิภาพสูงสุด (SOTA)
บอกว่าจะเปิดให้ใช้น้ำหนักโมเดลแบบเปิดของ FLUX 3 Dev ซึ่งเป็นโมเดลพื้นฐานแบบมัลติโหมดสำหรับการสร้างคอนเทนต์และการคาดการณ์พฤติกรรม ภายในช่วงไม่กี่สัปดาห์ถึงไม่กี่เดือนข้างหน้า พร้อมเผยรายละเอียดทางเทคนิคของแนวทางพื้นฐานด้วย
ถ้าโมเดลพื้นฐานออกมาเป็นเวอร์ชัน Dev ก็ยากจะรู้จากโพสต์นี้ว่ามีอะไรถูกตัดออกไปบ้าง
แทบไม่มีตัวอย่างที่แสดงคน ใช้คำว่า world model อย่างหลวม ๆ และอ้างวิดีโอความยาว 20 วินาทีแต่ที่แสดงจริงกลับเป็นแค่ jump cut
สุดท้ายประเด็นสำคัญทั้งหมดก็ยังเป็นแค่ “จะเปิดเผยเร็ว ๆ นี้”
วงการ reinforcement learning เองก็อาจยืมคำนี้มาจาก behavioral science เหมือนกัน ดังนั้นอาจจะยอมรับไปก็ได้ คล้ายกับที่นักปรัชญาและศิลปินทัศนศิลป์ต่างก็นำคำว่า object-oriented ไปใช้ผิดกันคนละแบบ
ปฏิกิริยาที่นี่ดูเป็นลบและประชดประชันอย่างน่าประหลาดใจ แต่ในสายตาฉัน ประสิทธิภาพของโมเดลนี้น่าประทับใจมาก
ก็มีคนบอกว่าพวกที่มองลบมักจะเข้ามาพ่นคำร้ายก่อนเสมอ เลยคิดว่าจะรอดูต่อไป
ช่วงนี้รู้สึกว่า HN มีบรรยากาศด้านลบมากขึ้น หวังว่าฉันจะคิดไปเอง
ถ้ามีสภาพแวดล้อมการรันที่เหมาะสม และเข้าใจโดเมนมากพอจะตัดสินได้ว่าโมเดลกำลังหลงไปกับการให้เหตุผลผิด ๆ หรือให้ผลลัพธ์ที่ผิดแบบละเอียดอ่อน ฉันก็ค่อนข้างมองโลกในแง่ดี ตรงกันข้าม เมื่อเห็นโซเชียลมีเดียเต็มไปด้วยภาพและวิดีโอที่ AI สร้างแบบแย่มาก ๆ ฉันกลับมองโลกในแง่ร้ายกว่ามากต่อโอกาสที่ตัวสร้างภาพและวิดีโอสังเคราะห์เต็มรูปแบบจะถูกนำไปใช้ให้เกิดประโยชน์ในโลกจริง ดูเหมือนว่าเมื่ออยู่ในมือคนนับล้าน มันจะถูกใช้ในทางที่เป็นโทษต่อสังคมมากกว่าที่เป็นประโยชน์
ถ้าโมเดลวิดีโอนี้อยู่ในระดับใกล้เคียงกับ Seedance 2.0 ต้นทุนก็น่าจะสูงเกินไปสำหรับการสร้างคอนเทนต์คุณภาพต่ำ และมีแนวโน้มจะเข้าไปอยู่ในสายงาน VFX ของโปรเจกต์มากกว่า
สงสัยว่ามีที่ไหนฝึกโมเดลด้วย ข้อมูลการสัมผัส บ้างไหม
สิ่งที่อยากให้หุ่นยนต์ทำมากที่สุดคือการสัมผัสวัตถุ แต่กลับให้เพียงเสียง วิดีโอ และภาพนิ่ง ทำให้โมเดลที่ไม่เคยสัมผัสอะไรเลยต้องเรียนรู้วิธีการสัมผัสเอง นี่อาจเป็นเหตุผลที่หุ่นยนต์ดูเหมือนลังเลเวลาจะจับต้องวัตถุ
Flux 2 Dev Klein แทบจะเป็นโมเดลที่ดีที่สุดในบรรดาโมเดลที่ใช้ได้บนฮาร์ดแวร์เชิงพาณิชย์ทั่วไป
หวังว่า Flux 3 จะมีโมเดลเปิดเผยน้ำหนักรุ่นใหม่ที่เทียบชั้นกันรวมมาด้วย ไม่เช่นนั้นคงเป็นการสูญเสียครั้งใหญ่สำหรับผู้ใช้สายงานอดิเรกจำนวนมาก
นี่เป็นโปรเจกต์ AI จากยุโรปตัวแรกที่ทำให้รู้สึก คาดหวังอย่างมาก
เห็นว่ากำลังรับสมัครงานที่ Freiburg im Breisgau เลยสงสัยว่าที่นั่นสรรหาคนเก่งได้ดีไหม
เพื่อนคนหนึ่งที่อยู่ที่นั่นชอบปั่นจักรยานถนนในภูเขารอบ ๆ ส่วนเพื่อนอีกคนก็เล่นสกีครอสคันทรีช่วงพักเที่ยงในฤดูหนาว
ไม่แน่ใจเรื่อง pool ของบุคลากร เท่าไร แต่มีมหาวิทยาลัยอยู่
เป็นเรื่องปกติที่สตาร์ตอัปนอก SF จะรับคนจากเมืองมหาวิทยาลัย
จนกระทั่งถึงฉากเต้นในห้องที่น้ำท่วม ฉันยังคิดว่าเป็น วิดีโอภาพจริง
เวอร์ชัน 2.3 ยอดเยี่ยมมาก และเมื่อดูวิดีโอและรีวิวที่คนซึ่งได้สิทธิ์เข้าถึงล่วงหน้าเผยแพร่ออกมา โมเดลนี้ก็ดูน่าจะเป็นประสิทธิภาพสูงสุดตัวใหม่สำหรับการใช้งานในบ้าน จึงตื่นเต้นมาก
ถ้าโมเดลต้องเรียนรู้วิธีถ่ายทอดเสียงของโลกและเหตุการณ์ต่าง ๆ ก็หวังว่าเพื่อความสนุกจะมีการใส่ Wilhelm scream แบบมากเกินจริงเข้าไปในกระบวนการฝึกด้วย