ไดนามิกภาพเชิงกำเนิด
(generative-dynamics.github.io)- เป็นแนวทางที่ใช้ image-space prior distribution ของการเคลื่อนไหวในฉากกับภาพนิ่งเพียงภาพเดียว เพื่อเปลี่ยนให้เป็นวิดีโอแบบวนซ้ำหรือฉากไดนามิกที่โต้ตอบได้
- การฝึกใช้วิถีการเคลื่อนไหวจากลำดับวิดีโอจริงที่มี การเคลื่อนไหวแบบสั่นไหวตามธรรมชาติ เช่น ต้นไม้ ดอกไม้ เปลวเทียน และเสื้อผ้าที่ไหวตามลม
- โมเดลจัดการการเคลื่อนไหวระยะยาวใน Fourier domain และทำนาย spectral volume ผ่าน frequency-conditioned diffusion sampling จากอินพุตภาพเดี่ยว
- spectral volume ที่ทำนายได้จะถูกแปลงเป็น motion texture ของวิดีโอทั้งชุด และนำไปใช้สร้างวิดีโอแบบวนซ้ำ รวมถึงการโต้ตอบกับวัตถุในภาพถ่ายจริง
- เดโมต้องใช้เบราว์เซอร์ที่รองรับ WebGL2 และเพื่อความเร็ว จึงใช้ mesh warping แทนโมเดลเรนเดอร์คุณภาพสูงในงานวิจัย
สร้างฉากไดนามิกจากภาพนิ่ง
- Generative Image Dynamics เป็นวิธีสำหรับสร้างแบบจำลอง image-space prior distribution ของการเคลื่อนไหวในฉาก
- อินพุตคือภาพนิ่งเพียงภาพเดียว และเอาต์พุตคือวิดีโอที่วนซ้ำอย่างลื่นไหล หรือฉากไดนามิกที่ผู้ใช้สามารถโต้ตอบได้
- สามารถดู งานวิจัย, arXiv, เอกสารเสริม ได้
- ผลงานนี้ได้รับ CVPR 2024 Best Paper Award
Prior distribution ของการเคลื่อนไหวและวิธีเรนเดอร์
- ข้อมูลฝึกเป็นชุดวิถีการเคลื่อนไหวที่สกัดจากลำดับวิดีโอจริง
- ใช้ตัวอย่างการเคลื่อนไหวที่เป็นธรรมชาติและมีลักษณะสั่นไหว เช่น ต้นไม้ ดอกไม้ เปลวเทียน และเสื้อผ้าที่ไหวตามลม
- โมเดลสร้างแบบจำลอง prior distribution ของการเคลื่อนไหวที่หนาแน่นและระยะยาวใน Fourier domain
- เมื่อให้ภาพเดี่ยว โมเดลจะทำนาย spectral volume ด้วย frequency-conditioned diffusion sampling
- spectral volume สามารถแปลงเป็น motion texture ครอบคลุมทั้งวิดีโอได้
- เมื่อนำไปรวมกับโมดูล image-based rendering จะทำให้ใช้งานได้หลายรูปแบบ
- แปลงภาพนิ่งให้เป็นวิดีโอที่วนซ้ำอย่างลื่นไหล
- ตีความ spectral volume เป็น image-space modal bases เพื่อทำให้วัตถุในภาพถ่ายจริงโต้ตอบได้อย่างสมจริง
- การตอบสนองเชิงไดนามิกของวัตถุต่อแรงกระตุ้นจากผู้ใช้จำลองด้วย modal analysis ของ Davis และคณะ
เดโมและการใช้งานเพิ่มเติม
- เดโมแสดงให้เห็นว่าฉากจะเคลื่อนไหวอย่างไร เมื่อคลิกจุดหนึ่งบนภาพ ลาก แล้วปล่อย
- เบราว์เซอร์ต้องรองรับ WebGL2
- เพื่อความเร็ว ใช้ mesh warping แทนโมเดลเรนเดอร์คุณภาพสูงที่ระบุในงานวิจัย
- สามารถปรับแอมพลิจูดของ motion texture เพื่อลดหรือเพิ่มการเคลื่อนไหวของแอนิเมชันได้
- เมื่อทำ interpolation กับ motion texture ที่ทำนายได้ จะสามารถสร้าง วิดีโอสโลว์โมชัน ได้
- งานก่อนหน้าที่เกี่ยวข้อง ได้แก่ Animating Pictures with Stochastic Motion Textures, Image-space Modal Bases for Plausible Manipulation of Objects in Video, Visual Vibration Analysis
1 ความคิดเห็น
ความคิดเห็นบน Hacker News
เคล็ดลับของ cinemagraph ระดับ 10 คะแนนคือ ยิ่งละเอียดอ่อนเท่าไร ยิ่งสร้างอิมแพ็กต์ได้มากเท่านั้น ควรทำให้ผู้ชมตอนแรกคิดว่าเป็นภาพนิ่ง แล้วสมองค่อย ๆ รู้ตัวช้าว่า “เดี๋ยวนะ มีอะไรแปลก ๆ นี่ไม่ใช่รูป แต่เป็นวิดีโอนี่นา”
ปริมาณการเคลื่อนไหวที่ต่างกันระหว่างภาพแรกกับภาพที่สองก็น่าสนใจ และอาจเป็นเพราะพิจารณาความหนาแน่นรอบ ๆ ตัวชี้เมาส์ด้วยก็ได้ ตัวอย่างการเคลื่อนไหวช้า ๆ ดูแล้วผ่อนคลายมากจริง ๆ
ดูเหมือนว่าอาจกลายเป็นฟีเจอร์พื้นฐานของ วอลเปเปอร์เดสก์ท็อปและมือถือ ได้ ถ้าจัดการการเคลื่อนไหวที่นุ่มนวลของน้ำหรือเมฆได้ ก็น่าจะเหมาะกับการนำไปใช้กับภาพถ่ายแบบเลือกจุดในสารคดีประวัติศาสตร์ด้วย