6 คะแนน โดย mssmss 1 일 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp

เมื่อไม่นานมานี้มีหัวข้อหนึ่งที่ถูกพูดถึงอย่างร้อนแรงบน Hacker News
เป็นบทความบล็อกที่บอกว่าการใช้ ML แบบคลาสสิกเพื่อตรวจจับ AI Slop Text นั้นได้ผลดีเกินคาด

https://news.ycombinator.com/item?id=48936880
https://blog.lyc8503.net/en/post/llm-classifier/

แม้จะเป็นแนวทางที่มีการพูดคุยกันมามากแล้ว แต่จุดที่ยังใช้ได้ผลและมีประสิทธิภาพก็ยังน่าสนใจ จึงลองทำเวอร์ชันภาษาเกาหลีขึ้นมาด้วย

  • แบ่งเป็นรายประโยค แล้วให้คะแนนด้วย ensemble ของ char/word n-gram TF-IDF + linear SVM และตัดสินทั้งเอกสารจากสัดส่วนของประโยคที่น่าสงสัย
  • การ inference ทั้งหมดเป็น JavaScript จึงทำงานได้ด้วยหน้าเว็บ static เท่านั้น โดยไม่ต้องมีเซิร์ฟเวอร์, API หรือ GPU โมเดลมีขนาดราว 1.4MB และข้อความที่วางลงไปจะไม่ถูกส่งไปที่ใด

แน่นอนว่าข้อจำกัดก็ชัดเจนเช่นกัน เพราะใช้ ML แบบคลาสสิกอย่าง SVM จึงค่อนข้างตรวจจับข้อความบางแบบที่มีลักษณะเป็น AI อย่างชัดเจนได้แน่นอน แต่กับข้อความที่กำกวมหรือเป็นเชิงวิชาการ อาจให้ผลลัพธ์ที่ไม่ชัดเจนได้

แม้ผลลัพธ์จะบอกว่าเป็น AI ก็ไม่ได้หมายความว่าจะต้องเป็น AI เสมอไป แต่คิดว่าน่าจะเหมาะสำหรับใช้ตรวจสอบข้อความที่สงสัยว่า AI สร้างขึ้น

1 ความคิดเห็น

 
selene 1 일 전

ลองเทียบกับงานเขียนของผมดูแล้ว ข้อความที่ผมเขียนเองได้ 0%, ข้อความที่เขียนด้วย AI แล้วแก้บางส่วนได้ 51%, ส่วนที่เขียนด้วย AI ล้วน ๆ ได้ 100% แยกแยะได้ดีกว่าที่คิดนะครับ ฮึฮึ

แค่ไอเดียนะครับ ถ้าทำเป็นส่วนขยายของเบราว์เซอร์ Chrome ที่ระบุเนื้อหาตามเกณฑ์แบบ https://github.com/mozilla/readability แล้วแสดงผลการ判定เหมือนไฟจราจร น่าจะสะดวกขึ้นครับ
(อาจให้ระบุอัตโนมัติเฉพาะโดเมนของหน้าที่ลงทะเบียนไว้ ส่วนที่เหลือให้ทำงานแบบแมนนวลเหมือนฟีเจอร์แปลภาษาก็น่าจะดีครับ)