สวัสดีครับ/ค่ะ
เมื่อเร็ว ๆ นี้ผม/ฉันได้สร้าง Chrome Extension ที่แปลงงานที่ทำบนเบราว์เซอร์ให้เป็นคู่มือผู้ใช้ (SOP) โดยอัตโนมัติ
ต่างจากวิธีบันทึกหน้าจอแบบเดิม เครื่องมือนี้เก็บอีเวนต์การคลิกและการป้อนข้อมูลพร้อมบริบทของ DOM (Context) แล้วนำมาจัดโครงสร้างใหม่เป็นขั้นตอนการทำงานที่มนุษย์เข้าใจได้ง่าย
ปัจจุบัน pipeline เป็นดังนี้
Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown
ส่วนที่ยากที่สุดระหว่างการพัฒนาคือ “จะนับขอบเขตถึงตรงไหนว่าเป็น Step หนึ่งขั้น”
ถ้าบันทึกอีเวนต์ของเบราว์เซอร์ตามจริงทั้งหมด จะละเอียดเกินไป แต่ถ้ารวมมากเกินไป ความตั้งใจสำคัญของผู้ใช้ก็จะหายไป ปัจจุบันเรานำอีเวนต์มารวมกันโดยอิงจากการเปลี่ยนแปลงของ DOM, สถานะการป้อนข้อมูล, การเปลี่ยนหน้า ฯลฯ จากนั้นให้ Solar Pro 3 สร้างคำอธิบายแต่ละขั้นตอนเป็นภาษาธรรมชาติ และให้ AI ตรวจสอบลำดับกับสิ่งที่ตกหล่นอีกครั้ง
ตอนนี้พัฒนาถึงขั้นสร้างเอกสารได้แล้ว และลำดับถัดไปกำลังทดลองใช้คู่มือที่สร้างขึ้นเป็น Task Plan แบบมีโครงสร้าง เป้าหมายคือพัฒนาให้ไม่ใช่แค่เอกสารธรรมดา แต่เป็น workflow ที่นำไปปฏิบัติได้ ซึ่ง AI Agent สามารถเข้าใจงานและให้คำแนะนำ หรือทำซ้ำงานบนเบราว์เซอร์ที่ทำเป็นประจำได้
ขณะนี้ Interaction Segmentation และ Task Planning ยังอยู่ระหว่างการปรับปรุงอย่างต่อเนื่อง หากมีผู้ที่มีประสบการณ์ด้านงานวิจัยหรือการพัฒนาที่เกี่ยวข้อง ยินดีรับฟังฟีดแบ็กครับ/ค่ะ
ยังไม่มีความคิดเห็น