ผมไม่อยากเปิดแท็บ Telegram ค้างไว้ทั้งวันเพื่อคุยกับเอเจนต์โลคัล (Hermes/OpenClaw) เลยสร้างอวตารขึ้นมาแทนที่ตรงนั้น เป็นหน้าต่างแบบวิดีโอคอล 2 หน้าต่าง (อวตาร + แชต) ที่อยู่บนหน้าจอตลอดเวลา ทำให้เอเจนต์ไม่ได้แค่อ่านคำตอบ แต่ “แสดงบทบาท” ออกมา
-
อวตารไม่ใช้ GPU ตอนรันไทม์ แทนที่จะอนุมานแบบเรียลไทม์ จะเลือกเล่นคลิปที่เรนเดอร์ไว้ล่วงหน้าประมาณ 30 คลิปตามแท็กอารมณ์จากเอาต์พุตของ LLM ถ้าเป็น [working] ก็จะใส่แว่นแล้วจดโน้ต ส่วนแท็ก [confirm] จะมีปุ่มอนุมัติ/ยกเลิกขึ้นมาเพื่อถามก่อนทำงานที่ย้อนกลับไม่ได้ และโค้ด/ล็อกจะไม่ถูกอ่านออกเสียง แต่เรนเดอร์เป็นการ์ดแทน GPU จึงถูกปล่อยไว้ให้โมเดลใช้อย่างเต็มที่
-
ไม่ได้แทนที่เอเจนต์ แต่ต่อเพิ่มด้วยคอนเนกเตอร์ โครงสร้างคือเกตเวย์ dial-out ไปยัง WebSocket โลคัลที่แอปเปิดไว้ ดังนั้นจากมุมของเอเจนต์ก็เหมือนมีช่องทางเพิ่มขึ้นมาอีกหนึ่งช่อง เมนู slash command ของเอเจนต์ก็รับมาแสดงได้เหมือนเดิม
-
เสียงสองทาง: Edge TTS (เปลี่ยนเป็นเอนจินโลคัลได้) + Silero VAD·faster-whisper
-
โอเพนคอร์ (MIT) มีอวตารเริ่มต้นฟรีมาให้ในชุด จึงโคลนแล้วรันได้ทันที ตัวอวตารนั้นสร้างด้วยเครื่องมือโลคัลฟรีเท่านั้น (Animagine XL → HunyuanVideo 1.5 i2v) จึงเป็นตัวอย่างที่พิสูจน์ด้วยว่าวิธีสร้างที่เขียนไว้ในเอกสารใช้งานได้จริง
สิ่งที่ได้รู้ระหว่างทำ: การให้โมเดล video diffusion สร้างสีหน้าละเอียด ๆ ด้วยพรอมป์ยากกว่าที่คิด Wan 2.2 5B ทำรอยยิ้มแบบอ้าปากกว้างได้ แต่สำหรับอารมณ์ที่แสดงผ่านคิ้วอย่าง “กังวล” หรือ “โกรธ” กลับออกมาแทบไร้อารมณ์ พอเปลี่ยนเป็น HunyuanVideo 1.5 (8.3B step-distilled) บนการ์ด 12GB เดียวกัน กลับเร็วกว่าและสีหน้าก็ออกมาถูกต้องกว่า
ตอนนี้มีเฉพาะบิลด์ Windows และยังไม่มีลิปซิงก์แบบเรียลไทม์ (เป็น trade-off ของวิธีเรนเดอร์ล่วงหน้า)
ยังไม่มีความคิดเห็น