2 คะแนน โดย GN⁺ 2023-09-18 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • เป็นแนวทางที่ใช้ image-space prior distribution ของการเคลื่อนไหวในฉากกับภาพนิ่งเพียงภาพเดียว เพื่อเปลี่ยนให้เป็นวิดีโอแบบวนซ้ำหรือฉากไดนามิกที่โต้ตอบได้
  • การฝึกใช้วิถีการเคลื่อนไหวจากลำดับวิดีโอจริงที่มี การเคลื่อนไหวแบบสั่นไหวตามธรรมชาติ เช่น ต้นไม้ ดอกไม้ เปลวเทียน และเสื้อผ้าที่ไหวตามลม
  • โมเดลจัดการการเคลื่อนไหวระยะยาวใน Fourier domain และทำนาย spectral volume ผ่าน frequency-conditioned diffusion sampling จากอินพุตภาพเดี่ยว
  • spectral volume ที่ทำนายได้จะถูกแปลงเป็น motion texture ของวิดีโอทั้งชุด และนำไปใช้สร้างวิดีโอแบบวนซ้ำ รวมถึงการโต้ตอบกับวัตถุในภาพถ่ายจริง
  • เดโมต้องใช้เบราว์เซอร์ที่รองรับ WebGL2 และเพื่อความเร็ว จึงใช้ mesh warping แทนโมเดลเรนเดอร์คุณภาพสูงในงานวิจัย

สร้างฉากไดนามิกจากภาพนิ่ง

  • Generative Image Dynamics เป็นวิธีสำหรับสร้างแบบจำลอง image-space prior distribution ของการเคลื่อนไหวในฉาก
  • อินพุตคือภาพนิ่งเพียงภาพเดียว และเอาต์พุตคือวิดีโอที่วนซ้ำอย่างลื่นไหล หรือฉากไดนามิกที่ผู้ใช้สามารถโต้ตอบได้
  • สามารถดู งานวิจัย, arXiv, เอกสารเสริม ได้
  • ผลงานนี้ได้รับ CVPR 2024 Best Paper Award

Prior distribution ของการเคลื่อนไหวและวิธีเรนเดอร์

  • ข้อมูลฝึกเป็นชุดวิถีการเคลื่อนไหวที่สกัดจากลำดับวิดีโอจริง
    • ใช้ตัวอย่างการเคลื่อนไหวที่เป็นธรรมชาติและมีลักษณะสั่นไหว เช่น ต้นไม้ ดอกไม้ เปลวเทียน และเสื้อผ้าที่ไหวตามลม
  • โมเดลสร้างแบบจำลอง prior distribution ของการเคลื่อนไหวที่หนาแน่นและระยะยาวใน Fourier domain
    • เมื่อให้ภาพเดี่ยว โมเดลจะทำนาย spectral volume ด้วย frequency-conditioned diffusion sampling
    • spectral volume สามารถแปลงเป็น motion texture ครอบคลุมทั้งวิดีโอได้
  • เมื่อนำไปรวมกับโมดูล image-based rendering จะทำให้ใช้งานได้หลายรูปแบบ
    • แปลงภาพนิ่งให้เป็นวิดีโอที่วนซ้ำอย่างลื่นไหล
    • ตีความ spectral volume เป็น image-space modal bases เพื่อทำให้วัตถุในภาพถ่ายจริงโต้ตอบได้อย่างสมจริง
    • การตอบสนองเชิงไดนามิกของวัตถุต่อแรงกระตุ้นจากผู้ใช้จำลองด้วย modal analysis ของ Davis และคณะ

เดโมและการใช้งานเพิ่มเติม

  • เดโมแสดงให้เห็นว่าฉากจะเคลื่อนไหวอย่างไร เมื่อคลิกจุดหนึ่งบนภาพ ลาก แล้วปล่อย
    • เบราว์เซอร์ต้องรองรับ WebGL2
    • เพื่อความเร็ว ใช้ mesh warping แทนโมเดลเรนเดอร์คุณภาพสูงที่ระบุในงานวิจัย
  • สามารถปรับแอมพลิจูดของ motion texture เพื่อลดหรือเพิ่มการเคลื่อนไหวของแอนิเมชันได้
  • เมื่อทำ interpolation กับ motion texture ที่ทำนายได้ จะสามารถสร้าง วิดีโอสโลว์โมชัน ได้
  • งานก่อนหน้าที่เกี่ยวข้อง ได้แก่ Animating Pictures with Stochastic Motion Textures, Image-space Modal Bases for Plausible Manipulation of Objects in Video, Visual Vibration Analysis

1 ความคิดเห็น

 
GN⁺ 2023-09-18
ความคิดเห็นบน Hacker News
  • เจ๋งมากจริง ๆ ผมชอบ cinemagraph มานานแล้ว และเวลาทำงานไม่ว่าจะเป็นการตลาดหรือการถ่ายทำ ก็พยายามใส่ความรู้สึกเหมือนภาพนิ่งที่มีความเคลื่อนไหวบาง ๆ ลงไป จึงดูเหมือนว่านี่อาจกลายเป็นเครื่องมือที่ใช้บ่อยได้
    เคล็ดลับของ cinemagraph ระดับ 10 คะแนนคือ ยิ่งละเอียดอ่อนเท่าไร ยิ่งสร้างอิมแพ็กต์ได้มากเท่านั้น ควรทำให้ผู้ชมตอนแรกคิดว่าเป็นภาพนิ่ง แล้วสมองค่อย ๆ รู้ตัวช้าว่า “เดี๋ยวนะ มีอะไรแปลก ๆ นี่ไม่ใช่รูป แต่เป็นวิดีโอนี่นา”
  • ต้นไม้ถ้าลากตรงขอบจะเกิด การบิดเบี้ยว ค่อนข้างมาก แต่ก็ยังเป็นไอเดียที่น่าสนใจ
    • น่าจะต้องเอาสิ่งนี้ไปรวมกับ segmentation และ generative fill สำหรับเลเยอร์พื้นหลัง โชคดีที่ด้านนั้นก็ก้าวหน้าไปมากแล้วเช่นกัน
  • ใน ดอกกุหลาบสีแดง ของภาพแรก ดอกไม้ในพื้นหลังก็ขยับด้วย แต่สงสัยว่าทำไมในภาพต้นไม้ภาพที่สามถึงไม่เห็นเอฟเฟกต์แบบเดียวกัน
    ปริมาณการเคลื่อนไหวที่ต่างกันระหว่างภาพแรกกับภาพที่สองก็น่าสนใจ และอาจเป็นเพราะพิจารณาความหนาแน่นรอบ ๆ ตัวชี้เมาส์ด้วยก็ได้ ตัวอย่างการเคลื่อนไหวช้า ๆ ดูแล้วผ่อนคลายมากจริง ๆ
    • ไม่รู้ทำไม แต่ตัวอย่างกุหลาบให้ความรู้สึก น่ากลัว นิด ๆ
  • ดีที่เห็นนักวิจัยของ Google ยังคงเผยแพร่ งานวิจัยแบบเปิด พร้อมเดโมอย่างต่อเนื่อง ส่วนเรื่องที่ Google ล้มเหลวในการนำงานวิจัย AI ไปทำเป็นผลิตภัณฑ์หรือเปิดโอเพนซอร์สนั้น คงไม่ต้องพูดซ้ำอีก
  • เจ๋งจริง ๆ แม้จะไม่ถึงขั้นเปลี่ยนโลกหรือเพิ่มผลิตภาพ แต่ก็ยังเจ๋งมาก
    ดูเหมือนว่าอาจกลายเป็นฟีเจอร์พื้นฐานของ วอลเปเปอร์เดสก์ท็อปและมือถือ ได้ ถ้าจัดการการเคลื่อนไหวที่นุ่มนวลของน้ำหรือเมฆได้ ก็น่าจะเหมาะกับการนำไปใช้กับภาพถ่ายแบบเลือกจุดในสารคดีประวัติศาสตร์ด้วย
  • เดโมใช้ WebGL ด้วย ดีเลย
    • ถ้าเอาไปใส่ในวิดีโอเกมน่าจะสุดยอดมาก เช่น เดินผ่านพุ่มไม้แล้วพืชถูกดึงตามตัวไปได้
  • สิ่งนี้มีข้อจำกัดเหมือน EbSynth คือจำเป็นต้องมี การเคลื่อนไหวเวกเตอร์ต่ำ
    • ความสำเร็จตรงนี้น่าจะอยู่ที่ การสร้างไดนามิกของภาพ เป็นหลัก เช่น ถ้าในภาพมีแมว โมเดลจะเข้าใจว่าแมวควรหายใจ จึงสร้างการเคลื่อนไหวแบบปอดหดตัว และบทความน่าจะพูดถึงวิธีแปลงไดนามิกของภาพนั้นกับภาพต้นฉบับให้กลายเป็นวิดีโอที่ลื่นไหล ผมอาจเข้าใจผิดก็ได้
  • ให้ความรู้สึกว่าเหลืออีกก้าวเดียว ภาพนิ่งก็จะกลายเป็น ภาพในกรอบแบบ Harry Potter แล้ว
  • ว้าว ดูเหนือจริงมาก ถ้ารวมเข้ากับ Photoshop แล้ว อยากรีบลองใช้เลย