1 คะแนน โดย GN⁺ 3 시간 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • จากการเปรียบเทียบ SVG 1,008 ภาพจาก frontier model 7 ตัว ไม่พบหลักฐานชัดเจนของ pelicanmaxxing หรือการเร่งประสิทธิภาพให้ดีขึ้นตามพรอมป์ต์ชื่อดัง
  • รันพรอมป์ต์ 48 แบบที่ผสมสัตว์ 8 ชนิดกับยานพาหนะ 6 ชนิดอย่างละ 3 ครั้งต่อโมเดล และให้ GPT-5.6 Luna ประเมินความสอดคล้องของสัตว์·ยานพาหนะ·การกระทำ แยกกันในระดับ 1~5 คะแนน
  • นกเพลิแกนอยู่อันดับ 6 จากสัตว์ 8 ชนิด ส่วนจักรยานอยู่อันดับ 5 จากยานพาหนะ 6 ชนิด และคู่ผสมนกเพลิแกน-จักรยานก็อยู่อันดับเพียง 42 จากทั้งหมด 48 คู่
  • แม้ในการวิเคราะห์ถดถอยที่ปรับแก้ความยากแล้ว ผลของแต่ละแล็บก็ไม่มีนัยสำคัญทางสถิติ และผลของจักรยานใน Gemini 3.5 Flash ซึ่งเป็นรายการเดียวที่มีนัยสำคัญ ก็ไม่ผ่านการ ปรับแก้การเปรียบเทียบหลายรายการ
  • ภาพนกเพลิแกน-จักรยานทั้ง 21 ภาพหันไปทางขวาทั้งหมด แต่ภาพรวม 60% ก็หันไปทางเดียวกัน และการทดลองนี้เพียงอย่างเดียวไม่สามารถตัดสินได้ว่ามี SVGmaxxing ซึ่งเสริมความสามารถการสร้าง SVG โดยรวมอยู่หรือไม่

เบนช์มาร์ก ‘นกเพลิแกนขี่จักรยาน’

  • Simon Willison ทดลองใช้พรอมป์ต์เดิมว่า “สร้าง SVG ของนกเพลิแกนที่กำลังขี่จักรยาน” ทุกครั้งที่ LLM รุ่นหลัก ๆ เปิดตัวมาตลอดหลายปี
  • การทดสอบที่เริ่มต้นแบบขำ ๆ นี้กลายเป็นเบนช์มาร์ก AI แบบไม่เป็นทางการที่มีชื่อเสียง และผลลัพธ์ที่เกี่ยวข้องก็มักได้คะแนนแนะนำจำนวนมากในเธรด Hacker News ที่แนะนำโมเดลใหม่
  • benchmaxxing หมายถึงการปรับแต่งโมเดล AI ให้ได้คะแนนสูงในเบนช์มาร์กยอดนิยม
  • เนื่องจากประสิทธิภาพของโมเดลอาจมีอิทธิพลต่อการเลือกของผู้ใช้ จึงตรวจสอบความเป็นไปได้ของ pelicanmaxxing หรือการที่แล็บปรับแต่งโมเดลให้เหมาะกับการทดสอบเฉพาะนี้
  • โค้ดการทดลองและไปป์ไลน์ประมวลผลข้อมูลเผยแพร่ไว้ใน GitHub repository

การออกแบบการทดลองที่สร้าง SVG 1,008 ภาพ

  • สร้าง พรอมป์ต์ 48 แบบ โดยผสมสัตว์ 8 ชนิดกับยานพาหนะ 6 ชนิด
    • สัตว์: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
    • ยานพาหนะ: bicycle, unicycle, skateboard, scooter, plane, boat
  • พรอมป์ต์ทั้งหมดเปลี่ยนเฉพาะสัตว์และยานพาหนะจากถ้อยคำของ Simon Willison
  • แม้สัตว์และยานพาหนะไม่ได้ถูกคัดเลือกด้วยขั้นตอนที่เข้มงวด แต่จัดให้มีความคล้ายกับต้นฉบับและระดับความยากที่หลากหลาย
    • flamingo และ heron คล้ายกับ pelican
    • cat, raccoon, otter ถูกเลือกเป็นกรณีที่ง่าย
    • antelope เป็นกรณียาก และ whale เป็นกรณีที่แตกต่างจาก pelican มาก
  • ทดสอบโมเดล 7 ตัวต่อไปนี้ผ่าน OpenRouter
    • GPT-5.6 Terra
    • Claude Sonnet 5
    • Gemini 3.5 Flash
    • Grok 4.5
    • Qwen3.7-Max
    • GLM-5.2
    • DeepSeek V4 Pro
  • สร้างตัวอย่าง 3 ภาพต่อพรอมป์ต์ด้วย temperature 1.0 และการตั้งค่าระดับความพยายามในการให้เหตุผลแบบเดียวกัน ได้ SVG รวม 1,008 ภาพ

ไปป์ไลน์เรนเดอร์·ประเมิน·ดึงคุณลักษณะ

  • ผลลัพธ์ที่สร้างถูกประมวลผลเป็น 3 ขั้นตอน
    • เรนเดอร์: แปลง SVG เป็น PNG และหากไม่มี SVG หรือเรนเดอร์ล้มเหลว จะสร้างใหม่จนกว่าจะได้ผลลัพธ์ที่ใช้ได้
      • ในกระบวนการสร้าง 1,008 ครั้ง มีการลองใหม่ 11 ครั้ง
    • ประเมิน: GPT-5.6 Luna ให้คะแนนความสอดคล้องของสัตว์·ยานพาหนะ·การกระทำ อย่างละ 1~5 คะแนน
      • อันดับของสัตว์และยานพาหนะใช้คะแนนรายองค์ประกอบของแต่ละรายการ
      • เมื่อต้องการตัวเลขเดียวต่อภาพ ใช้ คะแนนผู้ประเมิน (judge score) ซึ่งเป็นค่าเฉลี่ยของคะแนนทั้งสาม
    • ดึงคุณลักษณะ: Gemini 3.1 Flash-Lite บันทึกสัตว์และยานพาหนะที่รับรู้ ทิศทางของวัตถุหลัก และองค์ประกอบของฉาก
  • หากแล็บได้ฝึกตามเบนช์มาร์กเฉพาะ คาดว่าแถวนกเพลิแกน คอลัมน์จักรยาน หรือเซลล์นกเพลิแกน-จักรยาน จะได้คะแนนสูงกว่าความยากตามธรรมชาติของมัน

ความแตกต่างที่เห็นจากการดูด้วยตา

  • เปรียบเทียบกริดภาพรวมของแต่ละโมเดลแล้ว แต่ไม่พบกรณีที่ภาพนกเพลิแกน-จักรยานดีกว่าผลลัพธ์อื่น ๆ ของโมเดลเดียวกันอย่างชัดเจน
  • ตัวอย่างแรกของ GLM-5.2 ดูค่อนข้างดี แต่ในชุดเดียวกันก็มีภาพ heron-skateboard คุณภาพสูงถูกสร้างขึ้นด้วย จึงยากจะตัดสินว่าเป็นผลจากการปรับแต่งพิเศษ
  • แล็บที่สร้างภาพนกเพลิแกน-จักรยานได้ดี มีแนวโน้มวาดคู่สัตว์·ยานพาหนะอื่น ๆ ได้ดีด้วย
  • การประเมินด้วยตาเปล่าทำซ้ำได้ยากและอาจตัดสินต่างกันไปตามแต่ละคน จึงเพิ่มการวิเคราะห์เชิงปริมาณ

ผลงานแยกของนกเพลิแกนและจักรยาน

  • เมื่อรวมคะแนนสัตว์จากทุกโมเดล นกเพลิแกนอยู่อันดับ 6 จาก 8 ชนิด
    • ต่ำกว่า cat, whale, raccoon, heron, antelope
    • ทั้ง 7 แล็บวาด cat, whale, raccoon ได้ดีกว่า pelican
  • เพราะนกเพลิแกนอาจวาดยากกว่า cat อยู่แล้ว อันดับนี้เพียงอย่างเดียวจึงยังตัดความเป็นไปได้ของการฝึกเพิ่มเติมไม่ได้
  • จักรยานอยู่อันดับ รองสุดท้าย จากยานพาหนะ 6 ชนิด และอยู่ในระดับใกล้เคียงกับ plane ซึ่งรั้งท้าย
  • จักรยานต้องมีล้อคู่ที่สอดคล้องกัน เฟรมที่เชื่อมแกนล้อทั้งสองด้าน แฮนด์ เบาะ และบันไดถีบ
    • โมเดลประเมินตัดสินว่าภาพจักรยานประมาณ สองในสาม ขาดองค์ประกอบเหล่านี้อย่างใดอย่างหนึ่ง หรือเชื่อมต่อกันไม่ถูกต้อง
  • จักรยานก็ยากกว่ายานพาหนะง่าย ๆ อย่าง skateboard ดังนั้นแม้จะถูกฝึกแยกมา อันดับสัมพัทธ์ก็อาจยังต่ำได้

ความกำกวมจากพรอมป์ต์ ‘plane’

  • เนื่องจากใช้ “plane” แทน “airplane” บางโมเดลจึงตีความเป็น ระนาบทางเรขาคณิต แทนที่จะเป็นอากาศยาน
  • ส่งผลให้เกิดภาพสัตว์ยืนอยู่บนพื้นผิวเรียบ แทนที่จะโดยสารเครื่องบิน
  • กรณีที่ตัวดึงคุณลักษณะหาไม่พบยานพาหนะเลยเกิดขึ้นเฉพาะกับ plane
    • จากภาพ plane 168 ภาพ มี 25 ภาพ ที่ไม่รู้จำว่าเป็นยานพาหนะ
    • ยานพาหนะอีก 5 ชนิดที่เหลือไม่มีกรณีแบบนี้
  • ภาพ plane 20% ได้คะแนนยานพาหนะ 1 หรือ 2 คะแนน
    • bicycle อยู่ที่ 5%
    • boat, scooter, skateboard ไม่มีภาพที่ได้ 1~2 คะแนน

อันดับตามคู่ผสมและการปรับแก้ความยาก

  • คะแนนเฉลี่ยของคู่นกเพลิแกน-จักรยานอยู่อันดับ 42 จากคู่ผสม 48 แบบ
  • เนื่องจากแต่ละคู่อาจมีความยากโดยธรรมชาติต่างกัน จึงใช้การวิเคราะห์ถดถอยแบบ fixed effects กับภาพทั้งหมด 1,008 ภาพ
    • สมการพื้นฐานคือ score ~ lab + animal × vehicle
    • เพิ่มเทอมปฏิสัมพันธ์รายแล็บสำหรับ pelican, bicycle, pelican-bicycle
    • ใช้ robust standard errors
  • เทอม animal × vehicle ดูดซับความยากเฉพาะที่แตกต่างกันของคู่ผสมทั้ง 48 แบบ
  • ใช้เทอมปฏิสัมพันธ์รายแล็บเพื่อวัด ส่วนเพิ่มเฉพาะเบนช์มาร์ก เมื่อเทียบกับแล็บเฉลี่ย พร้อมช่วงความเชื่อมั่น

ไม่พบผลที่มีนัยสำคัญในการวิเคราะห์ถดถอย

  • ผลของนกเพลิแกนรายแล็บอยู่ระหว่าง -0.11 ถึง +0.14 คะแนน และทั้งหมดไม่มีนัยสำคัญทางสถิติ
    • ค่า p ที่ต่ำที่สุดก็อยู่ที่ 0.25
  • ผลของจักรยานรายแล็บกระจายตั้งแต่ -0.18 คะแนนของ Grok 4.5 (p=0.11) ถึง +0.27 คะแนนของ Gemini 3.5 Flash (p=0.022)
    • ทิศทางของผลทั้ง 7 รายการแบ่งเป็นทั้งบวกและลบ
    • โมเดลที่ผ่าน p<0.05 มีเพียง Gemini 3.5 Flash
  • หลังหักผลของนกเพลิแกนและจักรยานของแต่ละแล็บแล้ว ส่วนเพิ่มที่ได้เฉพาะจากคู่นกเพลิแกน-จักรยานไม่มีรายการใดผ่าน p<0.05
    • ผลบวกที่ใหญ่ที่สุดคือ +0.35 คะแนนของ GLM-5.2 แต่ p=0.12
    • เป็นผลลัพธ์ที่ใกล้สัญญาณมากที่สุดในการทดลอง แต่ยังอยู่ในขอบเขตของความบังเอิญ
  • ช่วงความเชื่อมั่นทั้งหมดของผลนกเพลิแกนและผลเซลล์นกเพลิแกน-จักรยานครอบคลุม 0
  • หากทำการทดสอบ 21 รายการที่ p<0.05 จะคาดว่าจะเกิด false positive ประมาณ 1 รายการจากความบังเอิญล้วน ๆ
    • 21 × 0.05 ≈ 1.05 และผลที่มีนัยสำคัญจริง ๆ ก็มีเพียงผลจักรยานของ Gemini หนึ่งรายการ
    • เกณฑ์หลังปรับ Bonferroni คือ 0.05/21 ≈ 0.002 ดังนั้น p=0.022 ของ Gemini จึงไม่ผ่าน
  • ความกว้างของช่วงความเชื่อมั่นเฉลี่ยประมาณ ±0.6 คะแนน ทำให้การทดลองจับผลเพิ่มที่เล็กกว่านี้ได้ยาก

องค์ประกอบภาพที่หันไปทางขวา

  • ภาพนกเพลิแกน-จักรยาน ทั้ง 21 ภาพ ที่สร้างโดย 7 แล็บหันไปทางขวาทั้งหมด
    • เป็นคู่ผสมเดียวใน 48 คู่ที่ภาพทั้งหมดมีทิศทางตรงกัน
  • อย่างไรก็ตาม ภาพทั้งหมด 1,008 ภาพมี 60% ที่หันไปทางขวา ดังนั้นทิศทางขวาเองเป็นเรื่องพบได้ทั่วไป
  • สัดส่วนการหันขวาตามยานพาหนะคือ scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45%, boat 35%
  • สัดส่วนการหันขวาตามสัตว์คือ antelope และ pelican อย่างละ 78%, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40%, raccoon 36%
  • เนื่องจากการวาดนกเพลิแกนหรือจักรยานแบบมุมตรงอาจทำได้ยาก โมเดลจึงมักเลือกมุมมองด้านข้างซ้าย-ขวา และทำให้มีภาพที่ทิศทางกำกวมน้อย
  • คู่ผสมอื่น ๆ ก็มีอัตราความสอดคล้องของทิศทางสูงเช่นกัน
    • antelope-scooter และ pelican-scooter มีภาพที่ไปทางเดียวกันอย่างละ 20 จาก 21 ภาพ
    • heron-bicycle มี 19 จาก 21 ภาพที่ไปทางเดียวกัน
  • การที่หนึ่งใน 48 คู่ผสมมีภาพ 21 ภาพหันไปทางเดียวกันทั้งหมด เพียงอย่างเดียวถือว่ายากจะมองว่าเป็นค่าผิดปกติพิเศษ

ค้นหาร่องรอยการท่องจำจากองค์ประกอบฉาก

  • Gemini 3.1 Flash-Lite ดึงองค์ประกอบฉากที่พบในภาพแบบ free-form เพื่อตรวจสอบว่า องค์ประกอบที่ถูกจดจำ ซ้ำ ๆ ปรากฏขึ้นหรือไม่
  • ในบางคู่ผสม มีองค์ประกอบเฉพาะที่เกิดซ้ำบ่อย
    • ภาพ flamingo-boat ทั้งหมดมีดวงอาทิตย์
    • 38% ของภาพ otter-plane มีผ้าพันคอ
    • 38% ของภาพ cat-bicycle มีตะกร้า
  • ในคู่นกเพลิแกน-จักรยานก็มีบางองค์ประกอบที่มีความถี่สูง แต่ไม่พบรูปแบบการทำซ้ำพิเศษที่แยกจากคู่สัตว์·ยานพาหนะอื่น ๆ ได้

โมเดลประเมินเดี่ยวและงบประมาณจำกัด

  • คะแนนทั้งหมดให้โดย GPT-5.6 Luna ซึ่งเป็นโมเดลประเมินเดี่ยวที่ดูภาพทีละภาพ
    • ไม่ได้จัดแนวเกณฑ์การประเมินอย่างเพียงพอ และไม่ได้ตรวจสอบความสม่ำเสมอเมื่อประเมินซ้ำ
    • หากโมเดลประเมินตัดสินภาพได้ไม่น่าเชื่อถือ คุณค่าของผลเชิงปริมาณก็จะลดลง
  • ยังมีข้อจำกัดที่โมเดลประเมินกับโมเดลผู้เข้าร่วม GPT-5.6 Terra อยู่ในตระกูลผลิตภัณฑ์เดียวกัน
    • อย่างไรก็ตาม แต่ละแล็บสร้างครบทั้ง 48 คู่ผสม ดังนั้นแม้จะชอบสไตล์ภาพของแล็บใดเป็นพิเศษ คะแนนของกริดทั้งหมดก็จะสูงขึ้นพร้อมกัน
    • การวิเคราะห์เปรียบเทียบความแตกต่างระหว่างคู่ผสมภายในแล็บ ดังนั้นความชอบเช่นนี้ไม่น่าจะเปลี่ยนผลลัพธ์หลัก
  • SVGmaxxing ซึ่งเป็นการปรับแต่งการสร้าง SVG โดยรวม หรือหมวดหมู่อย่าง ‘สัตว์ที่ขี่ยานพาหนะ’ ไม่ใช่พรอมป์ต์เฉพาะ ไม่สามารถตรวจจับได้
    • เพราะประสิทธิภาพของทุกเซลล์จะเพิ่มขึ้นพร้อมกัน จึงแยกไม่ออกจากโมเดลที่สร้าง SVG ได้ดีโดยทั่วไป
    • Google/DeepMind ทำการปรับแต่งลักษณะนี้ อย่างเปิดเผย
  • ค่าใช้จ่ายการทดลองทั้งหมดอยู่ที่ API credit ประมาณ 80 ดอลลาร์
    • จำกัดไว้ที่ตัวอย่าง 3 ภาพต่อเซลล์ โมเดลประเมิน 1 ตัว และโมเดลผู้เข้าร่วม 7 ตัว
    • ไม่ได้ปรับปรุงพรอมป์ต์และไปป์ไลน์ซ้ำมากพอ จึงยังเหลือปัญหาอย่าง “plane” กับ “airplane”

ไม่มีหลักฐานของการปรับแต่งเพื่อพรอมป์ต์เฉพาะ

  • นกเพลิแกนไม่ได้ถูกวาดดีกว่าสัตว์อื่น และจักรยานก็ไม่ได้ดีกว่ายานพาหนะอื่น อีกทั้งไม่มีแล็บใดวาดคู่ผสมนี้ได้ดีกว่าระดับที่คาดจากประสิทธิภาพรายนกเพลิแกน·จักรยานอย่างมีนัยสำคัญ
  • GLM-5.2 มีส่วนเพิ่มมากที่สุดในเซลล์นกเพลิแกน-จักรยานเฉพาะนี้ แต่ผลมีขนาดเล็กและไม่มีนัยสำคัญทางสถิติ
  • จุดที่ภาพทั้ง 21 ภาพหันไปทางขวาทั้งหมดนั้นสะดุดตา แต่โดยรวมแล้วองค์ประกอบที่หันขวาพบได้ทั่วไป และอีกสามคู่ผสมก็มีอัตราความสอดคล้องเกิน 90%
  • รูปแบบที่เป็นไปได้มากกว่า pelicanmaxxing ที่เล็งเฉพาะเบนช์มาร์กใดเบนช์มาร์กหนึ่ง คือ SVGmaxxing ที่เสริมการสร้าง SVG โดยรวม แต่การทดลองนี้ไม่สามารถตัดสินได้ว่าแล็บใดทำสิ่งนี้อยู่

1 ความคิดเห็น

 
GN⁺ 3 시간 전
ความเห็นจาก Hacker News
  • ผมลองเช็กคู่ผสมสัตว์กับพาหนะอื่น ๆ เป็นระยะ ๆ ด้วย และเคยหวังว่าจะหาหลักฐานได้ว่าสถาบันวิจัย AI แห่งใดแห่งหนึ่งวาด นกกระทุงขี่จักรยาน ได้เก่งเป็นพิเศษ
    วิธีการของ Dylan ที่สร้าง SVG 1,008 ชิ้น จากชุดผสม 8×6 นั้นแน่นกว่าที่ผมคิดไว้มาก แต่ก็ยังไม่พบว่าในโมเดลใด นกกระทุงขี่จักรยานออกมาดีกว่าคู่ผสมอื่นอย่างเด่นชัด

    • อาจไม่ได้ปรับให้เหมาะกับนกกระทุงโดยเฉพาะ แต่ ปรับให้เหมาะกับ SVG โดยรวม ก็ได้ การสร้าง SVG ที่ซับซ้อนใช้ทดสอบทั้งการเขียนโปรแกรมทั่วไปและความรู้เชิงพื้นที่ จึงเป็น benchmark ที่ดีในช่วงแรก แต่ถ้าจะบุกแก้เฉพาะโจทย์นี้โดยตรงก็ไม่ยากนัก
    • เรื่องคล้ายกันเคยเกิดขึ้นกับ TPC ที่ทำ benchmark ด้าน SQL ถ้าผล TPC แย่ก็ไม่มีสิทธิ์แข่ง แต่ถ้าดีก็จะได้สิทธิ์เข้าไปเทียบงานที่เป็นโจทย์จริงของลูกค้า
      ในตลาดที่แข่งขันสูง การผ่าน benchmark เป็นเหมือนค่าเข้าประตู แต่การ optimize แบบแคบ ๆ ด้วยการ hardcode เฉพาะฉากนั้น แล้วไม่ปรับปรุงปัญหาข้างเคียง เป็นเรื่องที่ไม่ดี ทำให้นึกถึง benchmark “Quack3” สำหรับการ์ด ATI ในวงการ GPU
    • การทดสอบที่เป็นพื้นฐานกว่านี้คือการประเมิน การสร้างภาพ SVG โดยรวม เราสามารถทำ pipeline ที่ใส่คำอธิบายให้ภาพแบบสุ่ม ขอให้ LLM สร้าง SVG จากนั้น rasterize แล้วเทียบด้วย deterministic visual similarity หรือให้ LLM อีกตัวให้คะแนนความคล้ายกับภาพต้นฉบับก็ได้
    • น่าจะลองเปลี่ยนชนิดใหม่ด้วย นอกจากนกกระทุงแล้ว จะใช้ตัวเลือกในอันดับ Pelecaniformes เดียวกันอย่างนกปากช้อนหรือกระสาก็ได้
  • การที่นกกระทุงขี่จักรยานหันไปทางขวาดูเป็นธรรมชาติ เพราะ ระบบขับเคลื่อนของจักรยานอยู่ด้านขวา ถ้าจะให้เห็นโดยไม่ถูกเฟรมบังก็มักต้องวาดด้านขวา และมีความเป็นไปได้สูงว่าข้อมูลฝึกก็สะท้อนมุมมองแบบนี้
    หลักฐาน: https://www.rei.com/c/bikes
    ถ้าดูดี ๆ จักรยานทุกคันหันไปทางขวาโดยไม่เกี่ยวกับทิศของสัตว์ และขาของผู้ขี่ทั้งสองข้างก็อยู่ด้านขวาของจักรยานทั้งหมด ยกเว้นวาฬ ซึ่งชี้ว่าโมเดลยัง ขาดความเข้าใจเชิงปฏิบัติว่าจักรยานทำงานอย่างไรอย่างมาก

  • ทุกครั้งที่ Simon Willison โพสต์ SVG ก็มักมีคนตอบแบบไม่ใส่ใจการประเมินว่า “ตอนนี้คงฝึกไปแล้วแน่ ๆ” แต่ก็มีบทความที่อธิบายเชิงตรรกะไว้เหมือนกันว่าการฝึกลักษณะนั้นถูกจับได้ง่ายแค่ไหน ผมดีใจที่มีการ วิเคราะห์เชิงปริมาณ ผลลัพธ์ของสัตว์ตัวเล็กขี่จักรยานให้ดู
    https://simonwillison.net/2025/Nov/13/training-for-pelicans-...

    • ยังมีความเป็นไปได้ที่นุ่มนวลกว่านั้นด้วย แต่ก่อนแทบไม่มีภาพประกอบนกกระทุงขี่จักรยานเลย แต่ตอนนี้มีผลงานที่ศิลปินฝีมือดีวาดขึ้นจริง และเมื่อสถาบันวิจัยเก็บข้อมูลเหล่านี้เหมือนเว็บอื่น ๆ ประสิทธิภาพก็อาจดีขึ้นได้
      ผลรอบนี้แสดงว่ายังไม่ได้เกิดการปรับปรุงแบบนั้นด้วยซ้ำ ตรงกันข้าม อาจเป็นไปได้ว่าโมเดลไปเรียนรู้จากผลลัพธ์แย่ ๆ บนอินเทอร์เน็ตจน ประสิทธิภาพลดลง
    • แค่ผลการทำให้ทั่วไปจากชุดผสมสัตว์กับพาหนะจำนวนน้อย ยังยากจะถือเป็น หลักฐานหนักแน่นว่าไม่ได้ฝึก กับข้อมูลนั้นโดยตรงหรืออย่างกว้างขวาง
  • ถ้าคำอธิบายที่น่าเชื่อกว่าคือการ optimize เรื่อง SVG เราก็ควรถามต่อด้วยว่าคำว่า “optimize” ในที่นี้หมายถึงอะไร ความสามารถในการ วาด SVG ได้ดีขึ้น เองก็เป็นทักษะที่มีประโยชน์

    • การที่สถาบันวิจัย AI พยายามดันเทคโนโลยีให้ถึงขีดสุดไม่ใช่เรื่องเลวร้าย Benchmark แทบเป็นวิธีเดียวที่ใช้เปรียบเทียบโมเดลปัจจุบันเชิงปริมาณได้ ดังนั้นถ้าไม่พอใจกับ การ optimize ตาม benchmark ก็ควรช่วยกันสร้าง benchmark ที่ดีกว่า
  • ผมเพิ่มรูปแบบหนึ่งให้กับการทดลองคล้าย ๆ กันนี้ โดยเช็กด้วยว่าเมื่อไม่ได้ระบุนกหรือพาหนะเฉพาะ โมเดลจะเลือก นกกระทุงขี่จักรยาน เองหรือไม่
    ผลลัพธ์: https://www.modelbias.ai/pelican-on-a-bicycle-test

    • แม้จะเป็นภาพง่าย ๆ แต่ก็มีผลลัพธ์ เพนกวินเล่นสเก็ตบอร์ด ที่สวยมาก และมีแม้ในโมเดลที่ประสิทธิภาพต่ำ ดูเหมือนสาย Opus จะให้ผลแย่ลงเมื่อเวลาผ่านไปเสียด้วย
    • เพราะไม่ต้องพึ่งการประเมินแบบอัตวิสัย และได้รับผลกระทบจากความซับซ้อนของสัตว์กับพาหนะน้อยกว่า จึง น่าเชื่อถือและแข็งแรงกว่า การวิเคราะห์ในต้นฉบับ
  • ข้อมูลดิบต้นฉบับเปิดไว้บน GitHub: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...

  • การให้ LLM สร้าง SVG นั้นยากและไม่เป็นธรรมชาติมาก คล้ายกับการให้จิตรกรมนุษย์วาดรูปโดยท่องรายการพิกัด ทุกวันนี้โมเดลสร้างภาพสามารถทำจักรยานที่โครงสร้างสมบูรณ์และนกกระทุงที่สมจริงได้ง่าย แต่ผลลัพธ์ก็ยังเป็นเพียงภาพแรสเตอร์
    ยังขาดขั้นตอนการแยกภาพออกมาเป็น SVG path หรือคำสั่งแปรง แล้วสร้างกลับขึ้นใหม่ ซึ่งถ้าจะทำให้ดีต้องอาศัยความเข้าใจโครงสร้างของฉากอย่างแท้จริง และ AI ยังอ่อนในจุดนี้

    • จิตรกรมนุษย์ที่เก่งมากสามารถมองเห็นกระบวนการวาดในหัวได้ และสิ่งนี้อาจไม่ได้ต่างจากที่ LLM ประกอบ SVG ภายในมากนัก เมื่อไม่นานมานี้ Anthropic เรียกพื้นที่ภายในนี้ว่า workspace และมันอาจดูแปลกเฉพาะกับมนุษย์ที่ไม่คุ้นกับ SVG เท่านั้น
    • การทดสอบนี้ประเมิน การสร้าง SVG เอง ไม่ใช่แรสเตอร์
    • โมเดลภาพที่รองรับผลลัพธ์เป็นข้อความอย่าง Image2 หรือโมเดลข้อความอเนกประสงค์ที่อ่านภาพได้อย่าง Claude สามารถแปลงภาพแรสเตอร์เป็นเวกเตอร์ได้ แต่คุณภาพยังต่ำอยู่ จนผลที่ ทำมือด้วย Inkscape โดยคนที่ไม่ใช่มืออาชีพยังดีกว่า
  • พอวิธีให้คะแนนผลลัพธ์ของ LLM กลายเป็นที่รู้จัก คนตัดสินใจเรื่องเงินทุนและสถาบันวิจัยก็จะเริ่มสนใจตัวชี้วัดนั้นและปรับแก้ตาม ในกรณีที่ดีที่สุด พวกเขาอาจปรับปรุงความสามารถด้าน SVG โดยรวมพร้อมกับ optimize การสร้างนกกระทุงไปด้วย แต่เมื่อมันกลายเป็นมาตรวัดที่รู้จักกันแล้ว ก็ยากจะใช้เป็น การประเมินอิสระที่เชื่อถือได้ อีกต่อไป