นี่คือไปป์ไลน์สำหรับสร้างวิดีโอสั้นแนะนำสุนัขจากฟุตเทจที่ถ่ายด้วยโทรศัพท์เท่านั้น เมื่อใส่วิดีโอดิบจากโทรศัพท์หลายคลิปและคำขอภาษาธรรมชาติหนึ่งย่อหน้า ประมาณ 4 นาทีต่อมาจะได้วิดีโอแนวตั้ง 9:16 พร้อมคำบรรยายและเสียงบรรยาย ตั้งแต่อัลกอริทึมตรวจจับไปจนถึง TTS ทั้งหมดถูกออกแบบให้ทำงานแบบโลคัลบน MacBook เครื่องเดียว

วิดีโอเดโม

การโยนวิดีโอให้ LLM แล้วดึงเดโมที่ดูน่าเชื่อถือออกมาไม่ใช่เรื่องยาก แต่โปรเจกต์นี้ตั้งเป้าตอบคำถามสองข้อแทน คือ พรุ่งนี้จะสร้างผลลัพธ์แบบเดิมซ้ำได้หรือไม่ และสิ่งที่ AI แต่งขึ้นมาจะไม่ปะปนกับสิ่งที่มนุษย์กำหนดไว้หรือไม่

โครงสร้าง

  • LLM ทำหน้าที่ตีความเท่านั้น ส่วนการทำงานจริงเป็นแบบ deterministic Gemma (โลคัล) ทำเฉพาะการตัดสินเชิงความหมาย เช่น ชื่อการกระทำ การแยกย่อยคำขอตัดต่อ และการสังเกตฉาก ส่วนพิกเซล เฟรม และเวลา ทั้งหมดจัดการด้วย Python/OpenCV/ffmpeg อินพุตเดิมจะได้เอาต์พุตเดิม
  • การตรวจจับและติดตามใช้ YOLO11 + ByteTrack, การระบุตัวตนซ้ำในกรณีมีสุนัขหลายตัวใช้ embedding ของ DINOv2 + ภาพเจ้าของเป็น anchor, การตัดสินว่าเคลื่อนไหว/อยู่นิ่งรับผิดชอบโดยการวัด residual ของ ROI ที่ชดเชยการเคลื่อนที่ของกล้องแล้ว แกนที่ LLM มองไม่เห็นโดยโครงสร้าง เช่น motion จากภาพนิ่งหนึ่งภาพ จะไม่ปล่อยให้ LLM รับผิดชอบ
  • TTS สังเคราะห์แบบโลคัลด้วย Qwen3-TTS (mlx-audio) และตรวจสอบด้วยเกต CER แบบไป-กลับผ่าน Whisper
  • คำบรรยายที่ LLM แต่งขึ้นจะถูกแยกข้อกล่าวอ้างเชิงข้อเท็จจริง แล้วเทียบกับบันทึกการสังเกตจากวิดีโอ หากไม่มีหลักฐานจะเขียนใหม่ คำบรรยายที่ผู้ใช้เขียนเองจะไม่ถูกตรวจสอบ

วิธีตัดสินใจ

  • การเปลี่ยนโมเดลและพารามิเตอร์ทั้งหมดตัดสินด้วยการให้คะแนนกับ golden set ที่ติดป้ายกำกับด้วยมือ
  • แนวทางปรับปรุงที่เคยเชื่อว่าน่าจะดีขึ้นอย่างแน่นอน ถูกการให้คะแนนบน golden set ปฏิเสธถึงสองครั้ง

ตัวเลข

  • unit test 148 รายการ, ความแม่นยำการตัดสินกลุ่มการกระทำ M4 เท่ากับ 1.00
  • ลดเวลาสร้างผลลัพธ์แบบ full lifecycle จาก 8 นาทีเหลือ 4 นาที

ข้อจำกัด
Golden set มีวิดีโอ 5–9 คลิป โดเมนเดียว และพัฒนาโดยคนเดียว นี่คือความเข้มงวดของวิธีการ ไม่ใช่การตรวจสอบยืนยันในระดับสเกล

กระบวนการพัฒนาถูกเขียนเป็นซีรีส์ไว้ในบล็อก
ใช้ไลเซนส์ MIT ยินดีรับคำถามเกี่ยวกับการนำวิธีการนี้ไปใช้กับโดเมนอื่น หรือรายละเอียดของแต่ละการตัดสินใจ

ยังไม่มีความคิดเห็น

ยังไม่มีความคิดเห็น