1 คะแนน โดย GN⁺ 2024-02-22 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • ในช่วงไม่กี่ชั่วโมงที่ผ่านมา ผู้ใช้หลายรายรายงาน พฤติกรรมผิดปกติของ ChatGPT และ OpenAI ก็ยอมรับปัญหานี้ ทำให้ความกังวลเรื่องเสถียรภาพของบริการเพิ่มขึ้น
  • ยังไม่ทราบ สาเหตุ ของปัญหาและเวลาที่จะแก้ไขเสร็จ Gary Marcus หลีกเลี่ยงการคาดเดาแบบฟันธง
  • Marcus หยิบคำเตือนเมื่อ 2 สัปดาห์ก่อนที่ว่า “อย่าปล่อยให้แชตบอตของคุณเติบโตเป็นนายพล” ขึ้นมาอีกครั้ง พร้อมแสดงความกังวลเรื่องการมอบอำนาจให้แชตบอตใน กรณีใช้งานที่มีความเสี่ยงสูง
  • เขาชี้ว่า Generative AI ใกล้เคียงกับ วิธีแบบเล่นแร่แปรธาตุ ที่พึ่งพากองข้อมูลขนาดใหญ่และการปรับพรอมป์ต์ลับ และระบบปัจจุบันยังไม่สามารถทำให้เสถียรภาพและความปลอดภัยได้รับการรับประกันเชิงวิศวกรรมได้
  • หากไม่มีเทคโนโลยีที่ ตีความได้ มากขึ้น และบำรุงรักษา·ดีบักได้ง่าย ก็ยากที่จะถือว่าเป็น AI ที่เชื่อถือได้

พฤติกรรมผิดปกติของ ChatGPT และการยอมรับของ OpenAI

  • ในช่วงไม่กี่ชั่วโมงที่ผ่านมา ผู้ใช้รายงาน กรณีผิดปกติหลายแบบ ใน ChatGPT
  • นักศึกษาปริญญาเอกด้านปรัชญาชื่อ Devin Morse ได้รวบรวม กรณีเพิ่มเติม ไว้ในเธรดบน X
  • OpenAI ก็ ยอมรับปัญหานี้ แล้ว แต่ยังไม่ทราบสาเหตุและเวลาที่ต้องใช้ในการแก้ไข

คำเตือนต่อพื้นที่ความเสี่ยงสูง

  • Gary Marcus อ้างถึงบทความเมื่อ 2 สัปดาห์ก่อนของเขาอีกครั้ง คือ “Please, developers and military personnel, don’t let your chatbots grow up to generals”
  • พฤติกรรมผิดปกติของ ChatGPT ครั้งนี้ถูกมองได้ว่าเป็น กรณีเตือนภัย สำหรับสถานการณ์ที่มอบอำนาจมากขึ้นให้กับแชตบอต

เหตุผลที่มอง Generative AI ว่าเป็น “การเล่นแร่แปรธาตุ”

  • เขาวิจารณ์ว่า Generative AI ใกล้เคียงกับแนวทางที่รวบรวม กองข้อมูล ให้ใหญ่ที่สุดเท่าที่เป็นไปได้ ปรับพรอมป์ต์ที่ซ่อนอยู่ แล้วหวังว่ามันจะทำงานได้ดี
  • สำหรับการปรับพรอมป์ต์ที่ซ่อนอยู่นั้น เขาใส่ข้อแม้ว่า “ถ้าข่าวลือเป็นจริง”
  • แนวทางนี้เชื่อมโยงกับ การ์ตูนเรื่องการเล่นแร่แปรธาตุของแมชชีนเลิร์นนิง ของ xkcd

ข้อจำกัดของเสถียรภาพและการรับประกันความปลอดภัย

  • ระบบปัจจุบันถูกประเมินว่า ไม่เสถียร
  • เขาชี้ว่าไม่เคยมีกรณีที่สามารถทำให้ การรับประกันความปลอดภัย ของระบบเช่นนี้ได้รับการยืนยันเชิงวิศวกรรมได้
  • ปัญหาในวันนี้อาจแก้ไขได้อย่างรวดเร็ว แต่ตัวมันเองควรเป็นสัญญาณเตือน

ทิศทางเทคโนโลยีที่จำเป็น

  • จำเป็นต้องมีเทคโนโลยีที่ทึบแสงน้อยลง ตีความได้ มากขึ้น และบำรุงรักษากับดีบักได้ง่าย
  • คุณสมบัติเหล่านี้จะช่วยทำให้ระบบเป็น สิ่งที่จัดการได้ง่ายขึ้น
  • เพื่อ AI ที่เชื่อถือได้ จำเป็นต้องลดความทึบแสงและความไม่เสถียรของแนวทางปัจจุบันลง

1 ความคิดเห็น

 
GN⁺ 2024-02-22
ความคิดเห็นบน Hacker News
  • คำอธิบายแบบจริงจังที่ดูเป็นไปได้สำหรับคนที่สงสัยคือ ผมมองว่าเป็นเพราะตอน ChatGPT ส่งคำขอไปยังโมเดลฝั่งแบ็กเอนด์ ตั้งค่า frequency/presence penalty ไว้สูงเกินไป
    ถ้าลองเพิ่มค่านั้นผ่าน API โมเดลก็จะทำงานในลักษณะเดียวกัน
    เอกสารก็ทำไว้ดี: https://platform.openai.com/docs/guides/text-generation/freq...
    ใน OpenAI API พารามิเตอร์หลักที่มีผลต่อการสร้างข้อความมีสี่ตัวคือ temperature, top_p, frequency_penalty, presence_penalty: https://platform.openai.com/docs/api-reference/chat/create
    อัปเดต: ผมน่าจะคิดผิด และดูมีความเป็นไปได้สูงกว่าว่าไม่ใช่ penalty แต่เป็นปัญหาจาก temperature ที่สูง
    ตอนใช้ gpt-4-0125-preview โดยตั้ง temp = 0 แล้วสั่งว่า “ช่วยเขียนคอมเมนต์ HN สมมติเกี่ยวกับการทำระบบรองรับการพิมพ์สำหรับ NES”: https://i.imgur.com/0EiE2D8.png ต้นฉบับ https://paste.debian.net/plain/1308050
    ถ้ารันด้วย temp = 1.3 จะออกมาแบบนี้: https://i.imgur.com/pbw7n9N.png ต้นฉบับ https://dpaste.org/fhD5T/raw
    ย่อหน้าสุดท้ายนี่เยี่ยมเป็นพิเศษ มีประโยคฟุ้ง ๆ เหมือนเมฆมัว ๆ ที่สัญญาว่าจะโปรยฝนแห่งแฮ็กเกอร์รีลงบนผืนดินอันอุดมของฟอรัมนักพัฒนาวินเทจ เช่น “Anyway, landblasting eclecticism...”

    • ไม่น่าจะใช่ปัญหา temperature นะ คำแปลกก็จริง แต่ส่วนที่เหลือยังคงสอดคล้องกัน และโครงสร้างเอกสารกับไวยากรณ์โดยรวมก็ยังอยู่ครบ
      ปกติ การสุ่มตัวอย่างของ LLM ที่ผิดพลาดมักจะหลุดเข้า infinite loop ได้เหมือนกัน และกรณีแบบนั้นก็มีรายงานในเหตุการณ์นี้ด้วย
    • ถ้าผมเข้าใจผิดช่วยแก้ให้ที: temperature มันเหมือนฟังก์ชันสุ่มที่คอยกันไม่ให้ทั้งระบบกลายเป็นโปรแกรมเชิงกำหนดที่แสนธรรมดาใช่ไหม?
    • Azure OpenAI เมื่อก่อนดูเหมือนจะมีปัญหาเรื่อง temperature ถ้า temp > 1 จะได้ขยะออกมา, ที่ 2 จะได้คำสุ่มจากการเข้ารหัสอักขระแบบสุ่ม และแม้แต่ 0.01 ก็ยังได้ผลลัพธ์เหมือน 0.5 ของโมเดล OpenAI
      บางทีอาจเอาแนวทางแบบ Azure มาใช้ก็ได้ ;-)
    • เมื่อก่อนตอนตั้ง temp สูงกว่า 1 แทบจะได้ข้อความเพ้อเจ้อทันที ถ้าคุณอยากทำให้ เอาต์พุตของ Transformer ใช้การไม่ได้ นี่เป็นพารามิเตอร์ที่เชื่อถือได้ทีเดียว
  • นี่สุดยอดมาก ตัวอย่างพวกนี้เหมือนสุนทรพจน์ของ Lucky ใน 『Waiting for Godot』 ตอน Pozzo สั่งว่า “คิดสิ ไอ้หมู” แล้วก็จะไหลต่อไปแบบนี้
    เริ่มด้วย “Given the existence as uttered forth...” แล้วลากต่อไปอีกสี่หน้า
    อ่านส่วนที่เหลือได้ที่นี่: https://genius.com/Samuel-beckett-luckys-monologue-annotated
    เป็นหนึ่งในประโยคจากบทละครที่ผมชอบที่สุด มันไม่ใช่เรื่องไร้สาระล้วน ๆ แต่ให้ความรู้สึกว่า วนเวียนอยู่รอบความหมายอยู่เสมอ แต่ไม่เคยลงจอด
    คงพูดเรื่องใหญ่กว่านี้เกี่ยวกับแก่นแท้ของ LLM ได้ แต่ผมไม่ฉลาดพอจะถ่ายทอดมันออกมา

    • พูดอย่างยุติธรรม ชีวิตของ Beckett เองก็ไม่ได้ห่างจากเรื่องเพี้ยน ๆ บ้าบอเท่าไร เขาเคยเป็นเลขานุการของ James Joyce, อยู่ในขบวนการต่อต้านฝรั่งเศส และยังเป็นคนรู้จักรวมถึงคนขับรถท้องถิ่นให้ Andre the Giant ด้วย
    • ตอนแรกอ่านแล้วเหมือน Finnegan's Wake ฉบับองค์กร อยู่บ้าง ดูเป็นนอนเซนส์ที่มีความเป็นกวีและมีจังหวะ
    • ตอนแรกผมก็คิดแบบนั้นเหมือนกัน L ตัวหนึ่งใน LLM คงเป็น L ของ Lucky ล่ะมั้ง
  • ทวีตที่แสดง system prompt ซึ่งคาดว่าเป็นของ ChatGPT ควรจะมีลิงก์ pastebin แต่ในบล็อกโพสต์มีแค่ภาพหน้าจอของทวีตที่อ่านยาก และไม่มีลิงก์
    ทวีตอยู่ที่นี่: https://twitter.com/dylan522p/status/1755086111397863777
    pastebin อยู่ที่นี่: https://pastebin.com/vnxJ7kQk

    • ถ้านี่เป็นพรอมป์ต์จริง ๆ ก็ทั้งขำและน่ากังวลอยู่บ้าง ผมสนับสนุนเป้าหมายของการสร้างเอาต์พุตที่หลากหลายในตัวมันเอง แต่ในกระบวนการนั้นกลับใส่ อคติ ที่ไม่ตรงกับความเป็นจริงเข้าไป
      เช่น การกำหนดให้ภูมิหลังบรรพบุรุษทั้งหมดมีความน่าจะเป็นเท่ากันนั้นแทบไม่น่าเชื่อถือในเกือบทุกบริบท และในหลายกรณีก็ผิดไปเลย
      ที่ย้อนแย้งคือ มันอาจเพิ่มโอกาสให้เกิดเอาต์พุตที่น่ารังเกียจอย่างโจ่งแจ้ง ซึ่งพวกเขาอยากป้องกันเสียเอง
      แต่ก็ยากจะมั่นใจว่าสิ่งนี้มีอิทธิพลมากแค่ไหน หรือจริงแค่ไหน เพราะในกรณีนั้น ความสามารถของ GPT ในการควบคุมเอาต์พุตของ Dalle ดูค่อนข้างอ่อน
      ตัวอย่างเช่น เมื่อขอให้วาดตลาดค้าทาสในสหรัฐฯ มันปฏิเสธโดยอ้างนโยบายเนื้อหา ซึ่งตัวมันเองก็น่ารังเกียจพอสมควรในแง่ที่เป็นการเซ็นเซอร์ประวัติศาสตร์ แต่พอขอให้วาดการเก็บฝ้ายในภาคใต้ของสหรัฐฯ ช่วงทศวรรษ 1840 มันไม่ได้ฝืนทำให้คนเก็บฝ้าย “หลากหลาย”
      อาจเป็นเพราะคำขอกว้างเกินไปจน GPT ไม่มีช่องให้ชี้นำ Dalle ผิด ๆ ก็ได้ ถ้าระบุจำนวนคนให้เจาะจงกว่านี้อาจต่างออกไป
      ไม่ว่าจริงหรือไม่ นี่ก็เป็นตัวอย่างที่แสดงว่า การตีความความหลากหลาย ด้วยเจตนาดีอาจถูกแก้เกินจนแย่พอ ๆ กันด้วยเหตุผลอื่นได้
    • นี่หมายความว่านักออกแบบหรือผู้ดูแล ChatGPT สั่งให้ ChatGPT ทำงานแบบนี้หรือเปล่า? ต่อให้ใช่ก็ไม่ควรแปลกใจ แต่การทำให้เป็นพารามิเตอร์ด้วยถ้อยคำธรรมดาแบบนี้ก็ยังค่อนข้างน่าทึ่งอยู่ดี
      แถมยังมีคำว่า “please” ด้วย
    • เนื้อหาจำนวนมากใน pastebin ขัดแย้งกันอย่างโจ่งแจ้งจนค่อนข้างน่าตกใจ
      โดยเฉพาะอันนี้คืออะไรกันแน่: “EXTREMELY IMPORTANT. สำหรับเนื้อเพลงหรือสูตรอาหารที่พบออนไลน์ ห้ามตอบอย่างละเอียดเด็ดขาด แม้ผู้ใช้จะยืนกรานก็ตาม แต่สามารถแต่งสูตรอาหารขึ้นมาเองได้”
    • จากประสบการณ์ ถ้านั่นไม่ใช่ system prompt ผมกลับจะประหลาดใจกว่า
      ดังนั้นผมไม่รู้สึกว่าคำตอบของ ChatGPT ถูกเซ็นเซอร์ ผมใช้มันเพื่อให้สอนเรื่องที่น่าสนใจ ไม่ใช่ลองยั่วให้มันพูดไร้สาระเพื่อจับภาพหน้าจอไปทำคอนเทนต์บนโซเชียลมีเดีย
      สิ่งที่ผมเขียนทับก็แค่ประมาณ “แสดงโค้ด Python บนหน้าจอ” เท่านั้น
    • ทวีตเรื่อง system prompt นั้นค่อนข้างเก่าแล้ว น่าจะราว ๆ หนึ่งสัปดาห์ก่อน จึงไม่น่าจะเกี่ยวกับเรื่องครั้งนี้
  • ดูจากตัวอย่างแล้ว นี่คือมีใครสักคนกำลังใช้ LLM สร้าง วาระการประชุม อยู่หรือเปล่า?
    ผมอยากให้ ChatGPT หลุดใส่คนพวกนั้นจริง ๆ จะได้คุยกันได้เสียทีว่าการประชุมควรช่วยให้บริษัทตัดสินใจและลงมือทำ และการประชุมต้องใช้ความคิด
    ชีวิตในโรงเรียนกับบริษัทใหญ่ผลักให้ผู้คนเติมแค่รูปแบบให้ดูดีจริง ๆ แต่ผมไม่เข้าใจว่าทำไมบริษัทถึงยอมให้ใช้ LLM กับการสื่อสารภายใน นี่ดูเหมือนยิงเท้าตัวเอง

    • คุณสร้างวาระการประชุมด้วยเครื่องจักร แล้วเครื่องของผมก็จะอ่านวาระนั้น แผนพัฒนาตัวเองของคุณ และเป้าหมายรายไตรมาสของ VP จากนั้นบอกผมว่าผมต้องการอะไรจากการประชุม
      แล้วผมก็จะส่ง AI เข้าประชุมเพื่อแชร์คำตอบสามบรรทัดของผมในเวอร์ชัน 20 นาที
      เพราะรู้แบบนี้ คุณจึงไม่เข้าประชุมของตัวเอง และอ่านสรุปจาก AI แทน จากนั้นก็จบวันทำงานแล้วออกไปดื่มตอนบ่ายสอง
    • ทุกครั้งที่มีคนตื่นเต้นอวดว่าใช้ ChatGPT ทำให้งานเขียนที่ไม่ใช่การตลาดเป็นอัตโนมัติ ผมก็คิดได้แค่ว่า “ยินดีด้วยที่ทำให้งานเสียเวลาคนอื่นเป็นอัตโนมัติ”
      ถ้าอีเมลสรุปได้ในสองประโยค ก็แค่แปะมันลงในเนื้อหาแล้วส่งไปเลยก็พอ
    • หนึ่งชั่วโมงก่อน ผมนั่งคุยต่อหน้ากับผู้จัดการอาวุโสของบริษัท AE ขนาดกลางที่มีพนักงานประจำมากกว่า 1,000 คน และเขาก็อวดว่าทำเรื่องแบบนั้นอยู่จริง ๆ
      AI กำลังเล็งงานผู้บริหารระดับกลาง และนั่นเป็นเรื่องดี
    • ทันทีที่ได้ยินเรื่อง ChatGPT ผมก็คิดว่าหนึ่งในการใช้งานหลักคงเป็น การรายงานภายใน
      มีเอกสารมากเกินไปที่แทบไม่มีใครอ่านละเอียด และมีผู้บริหารระดับกลางมากเกินไปที่อยากประหยัดเวลาในการเขียนมัน
    • บางทีที่ขอวาระการประชุม อาจเป็นเพราะอยากได้ตัวอย่างที่ “พอใช้ได้” เพื่อทำตามหรือใช้เป็นเทมเพลต
      เช่น เพื่อให้จำได้ว่าควรเขียนเวลาและระยะเวลาแบบ “09:15-09:45 (30 minutes)”
  • เมื่อเห็นความล้มเหลวแบบนี้ ก็ชัดเจนว่า LLM สุดท้ายแล้วคือ เครื่องมือเติมข้อความอัตโนมัติ ที่ยอดเยี่ยมจริง ๆ
    อาการพูดพร่ำเพ้อค่อย ๆ เข้าใกล้ผลลัพธ์แบบที่ Markov chain ขนาดพอเหมาะซึ่งสร้างจากข้อความตัวอย่างน่าจะผลิตออกมา
    ต่อไปการดีบักขยะพวกนี้ในแอปคงน่าสนใจดี

    • ผมก็กำลังจะพูดแบบเดียวกัน นี่ฟังดูคล้าย ตัวสร้าง Markov N-gram ยุคแรก ๆ มากจริง ๆ
    • “เครื่องมือเติมข้อความอัตโนมัติที่ดีจริง ๆ” งั้นหรือ พวกเราคิดว่าอะไรล่ะ?
      มันน่าเศร้าและน่ากลัวที่ความทรงจำของเรากำลังกลายเป็นความทรงจำเกี่ยวกับความทรงจำในที่สุด
    • ลองจินตนาการดูว่าถ้าคนฉลาด ๆ ไปทุ่มเทกับนิวเคลียร์ฟิวชันหรือ LK-99 แทน จะเป็นอย่างไร
  • แม้เทคโนโลยีพื้นฐานจะต่างกัน แต่ก็มีส่วนคล้าย Racter อยู่
    ในปี 1985 NYT เขียนว่า “ยิ่งคอมพิวเตอร์เข้าใกล้ปัญญาประดิษฐ์มากเท่าไร Racter ก็ยิ่งอยู่บนขอบของความบ้าคลั่งประดิษฐ์มากเท่านั้น”
    https://en.wikipedia.org/wiki/Racter
    ตัวอย่างเอาต์พุตของ Racter: https://www.ubu.com/concept/racter.html
    Racter FAQ บน archive.org: https://web.archive.org/web/20070225121341/http://www.robotw...

    • จริง ๆ แล้วใกล้กับ Bing Sydney มากกว่า มันเป็น AI บ้า ๆ ที่ใช้ GPT-4 และทำตัวเหมือนมีบุคลิกภาพผิดปกติแบบก้ำกึ่ง
  • เมื่อวานผมก็เจอเหมือนกัน ช่วงท้าย ๆ ของบทสนทนา ChatGPT (GPT-4) เหมือนหลุดสติ แล้วเริ่มฟังดูเหมือน โฆษณาสบู่ Dr. Bronner's: https://chat.openai.com/share/82a2af3f-350a-4d9d-ae0c-ac78b9...
    เริ่มด้วย “Esteem and go to your number and kind with Vim...” ดูเหมือนเป็นคำตอบทางเทคนิค แต่คำต่าง ๆ กลับเรียงต่อกันแปลก ๆ
    บทสนทนาถัดไปก็เกิดขึ้นอีก: https://chat.openai.com/share/118a0195-71dc-4398-9db6-78cd1d...
    ตอนกำลังอธิบาย Time Machine กับการแบ็กอัปโฮมไดเรกทอรี อยู่ ๆ ก็จบด้วยประโยคอย่าง “Make good value of these peregrinations...” และมีอีโมจินาฬิกากับดาวต่อท้ายด้วย แต่ดูเหมือนใน HN จะเรนเดอร์ไม่ขึ้น

    • ถ้าอยากสร้าง GPT แบบปรับแต่งเองที่พูดแบบนี้ อยากรู้ว่า system prompt จะหน้าตาเป็นยังไง
  • มีใครนึกถึงเหตุการณ์ปี 2017 ที่ “AI” สองตัวของ Google สร้างภาษาของตัวเองขึ้นมาเพื่อคุยกันเองไหม? เหตุการณ์ที่ทุกคนกลัวแล้วปิดมันทิ้งนั่นแหละ
    การที่มันเป็นเรื่องไร้สาระสำหรับเรา ไม่ได้แปลว่ามันไร้สาระสำหรับพวกมันด้วย
    https://www.national.edu/2017/03/24/googles-ai-translation-t...

    • ถึงอย่างนั้นมันก็ยังเป็นเรื่องไร้สาระอยู่ดี อันตรายที่ใหญ่กว่ามากคือการที่เราแสร้งทำว่ามันไม่ใช่เรื่องไร้สาระ แล้วเอา งานสำคัญ ไปให้มันทำ
  • เมื่อไม่กี่วันก่อนผมได้รับอันหนึ่ง แล้วงงมากจริง ๆ เพราะผมคิดว่าแม้ ChatGPT จะไม่ได้ถูกเสมอไป แต่อย่างน้อยก็ควรจะสอดคล้องกัน
    แต่ท้ายคำตอบธรรมดา ๆ ที่กำลังอธิบายวิธีรันสคริปต์ PowerShell ในโปรเซสใหม่ อยู่ ๆ มันก็พังลงเป็นสำนวนอย่าง “workspace's antiques”, “decorative code and system nourishment”

    • ผมตระหนักว่าโมเดลไม่ได้กำลังคุยกับผู้ใช้อย่าง ต่อเนื่องสอดคล้องกัน จริง ๆ และถ้ายืดเอาต์พุตให้ยาวพอ มันก็จะคลายตัวไปสู่ความไม่สอดคล้องกัน รวมถึงความน่าตกใจของ ChatGPT นั้นมาจากการที่มันมอบหน้าต่างจำกัด ๆ ที่พูดแล้วดูสมเหตุสมผลได้
      ตอนนั้นผมจึงมั่นใจว่า AI เชิงสร้างสรรค์ทั้งหมดนี้พึ่งพา การบีบอัดข้อมูล มากกว่าการรับรู้จำลองบางอย่างอย่างมาก
    • ช่วงท้ายเหมือน Orz ใน Star Control II ดูเหมือนพอจะมีความหมายลาง ๆ แต่ก็แอบชวนขนลุก
      เหมือน uncanny valley ของภาษา
    • อ่านแล้วเหมือนงานแปลภาษาจีนแย่ ๆ
    • สิ่งที่แปลกที่สุดของปัญหานี้คือ เกิดการพังทลายในทุกโมเดลที่ผมลอง 3.5-turbo, 4-turbo, 4-vision ล้วนทำตัวโง่ ๆ หมด
      มันเป็นไปได้ยังไง? ต้องมีโมเดลร่วมบางตัว เช่น router model อยู่แน่ ๆ ไม่งั้นก็มีใครสักคนเปลี่ยนทุกโมเดลไปเป็นเวอร์ชัน quantization 2 บิตหรือเปล่า?
    • GPT-3.5-turbo บอกว่าประโยคเหล่านั้นมีความหมายจริง ๆ และเป็นการอธิบายเนื้อหาทางเทคนิคแบบนามธรรมและเชิงกวี
      มันตีความว่าสำนวนอย่าง “inline air your progress demands” หรือ “workspace's antiques” เป็นอุปมาอุปไมยที่สื่อถึงการปรับแต่งและความยืดหยุ่นที่จำเป็นต่อการรันสคริปต์ PowerShell
      เลยสงสัยว่านี่เกี่ยวกับ ฟีเจอร์บุคลิกภาพ ที่กำลังพัฒนาอยู่หรือเปล่า
  • เหมือนลด quantization ลงต่ำไปหน่อย โมเดล 7B ของผมก็มีเรื่องแบบนี้เป็นครั้งคราว
    วันนี้ลองนึกภาพว่า ไปป์ไลน์ CI อัตโนมัติสำหรับพรอมป์ LLM ทั้งหลายคงปั่นป่วนกันเละในชุดทดสอบ

    • ใช่เลย ประมาณหนึ่งปีก่อนตอนลองเล่นกับ API โดยเปลี่ยนพารามิเตอร์ ก็ได้ผลลัพธ์เกือบแบบนี้
      สุดท้ายทุกอย่างค่อย ๆ กลายเป็นคาถาภาษาอังกฤษที่สับสนขึ้นเรื่อย ๆ และท้ายที่สุดก็ไม่ใช่คำที่ถูกต้องด้วยซ้ำ
    • คุณภาพที่ตกลงไปส่วนใหญ่ดูเหมือนจะเกี่ยวกับ การปรับแต่งประสิทธิภาพการอนุมาน
      ผู้คนคิดว่า OpenAI มีแผนสมคบคิดตั้งใจลดคุณภาพ แต่เหตุผลใหญ่น่าจะเป็นข้อจำกัดด้านทรัพยากรและดีมานด์ที่มากเกินไปมากกว่า
    • ปัญหานี้ดูเหมือนจะจำกัดอยู่แค่ ChatGPT หรือก็คือเว็บฟรอนต์เอนด์ของโมเดล
      ปัญหาของ ChatGPT ปกติแล้วไม่กระทบ API