- จากการเปรียบเทียบ SVG 1,008 ภาพจาก frontier model 7 ตัว ไม่พบหลักฐานชัดเจนของ pelicanmaxxing หรือการเร่งประสิทธิภาพให้ดีขึ้นตามพรอมป์ต์ชื่อดัง
- รันพรอมป์ต์ 48 แบบที่ผสมสัตว์ 8 ชนิดกับยานพาหนะ 6 ชนิดอย่างละ 3 ครั้งต่อโมเดล และให้ GPT-5.6 Luna ประเมินความสอดคล้องของสัตว์·ยานพาหนะ·การกระทำ แยกกันในระดับ 1~5 คะแนน
- นกเพลิแกนอยู่อันดับ 6 จากสัตว์ 8 ชนิด ส่วนจักรยานอยู่อันดับ 5 จากยานพาหนะ 6 ชนิด และคู่ผสมนกเพลิแกน-จักรยานก็อยู่อันดับเพียง 42 จากทั้งหมด 48 คู่
- แม้ในการวิเคราะห์ถดถอยที่ปรับแก้ความยากแล้ว ผลของแต่ละแล็บก็ไม่มีนัยสำคัญทางสถิติ และผลของจักรยานใน Gemini 3.5 Flash ซึ่งเป็นรายการเดียวที่มีนัยสำคัญ ก็ไม่ผ่านการ ปรับแก้การเปรียบเทียบหลายรายการ
- ภาพนกเพลิแกน-จักรยานทั้ง 21 ภาพหันไปทางขวาทั้งหมด แต่ภาพรวม 60% ก็หันไปทางเดียวกัน และการทดลองนี้เพียงอย่างเดียวไม่สามารถตัดสินได้ว่ามี SVGmaxxing ซึ่งเสริมความสามารถการสร้าง SVG โดยรวมอยู่หรือไม่
เบนช์มาร์ก ‘นกเพลิแกนขี่จักรยาน’
- Simon Willison ทดลองใช้พรอมป์ต์เดิมว่า “สร้าง SVG ของนกเพลิแกนที่กำลังขี่จักรยาน” ทุกครั้งที่ LLM รุ่นหลัก ๆ เปิดตัวมาตลอดหลายปี
- การทดสอบที่เริ่มต้นแบบขำ ๆ นี้กลายเป็นเบนช์มาร์ก AI แบบไม่เป็นทางการที่มีชื่อเสียง และผลลัพธ์ที่เกี่ยวข้องก็มักได้คะแนนแนะนำจำนวนมากในเธรด Hacker News ที่แนะนำโมเดลใหม่
- benchmaxxing หมายถึงการปรับแต่งโมเดล AI ให้ได้คะแนนสูงในเบนช์มาร์กยอดนิยม
- เนื่องจากประสิทธิภาพของโมเดลอาจมีอิทธิพลต่อการเลือกของผู้ใช้ จึงตรวจสอบความเป็นไปได้ของ pelicanmaxxing หรือการที่แล็บปรับแต่งโมเดลให้เหมาะกับการทดสอบเฉพาะนี้
- โค้ดการทดลองและไปป์ไลน์ประมวลผลข้อมูลเผยแพร่ไว้ใน GitHub repository
การออกแบบการทดลองที่สร้าง SVG 1,008 ภาพ
- สร้าง พรอมป์ต์ 48 แบบ โดยผสมสัตว์ 8 ชนิดกับยานพาหนะ 6 ชนิด
- สัตว์: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
- ยานพาหนะ: bicycle, unicycle, skateboard, scooter, plane, boat
- พรอมป์ต์ทั้งหมดเปลี่ยนเฉพาะสัตว์และยานพาหนะจากถ้อยคำของ Simon Willison
- แม้สัตว์และยานพาหนะไม่ได้ถูกคัดเลือกด้วยขั้นตอนที่เข้มงวด แต่จัดให้มีความคล้ายกับต้นฉบับและระดับความยากที่หลากหลาย
- flamingo และ heron คล้ายกับ pelican
- cat, raccoon, otter ถูกเลือกเป็นกรณีที่ง่าย
- antelope เป็นกรณียาก และ whale เป็นกรณีที่แตกต่างจาก pelican มาก
- ทดสอบโมเดล 7 ตัวต่อไปนี้ผ่าน OpenRouter
- GPT-5.6 Terra
- Claude Sonnet 5
- Gemini 3.5 Flash
- Grok 4.5
- Qwen3.7-Max
- GLM-5.2
- DeepSeek V4 Pro
- สร้างตัวอย่าง 3 ภาพต่อพรอมป์ต์ด้วย temperature 1.0 และการตั้งค่าระดับความพยายามในการให้เหตุผลแบบเดียวกัน ได้ SVG รวม 1,008 ภาพ
ไปป์ไลน์เรนเดอร์·ประเมิน·ดึงคุณลักษณะ
- ผลลัพธ์ที่สร้างถูกประมวลผลเป็น 3 ขั้นตอน
- เรนเดอร์: แปลง SVG เป็น PNG และหากไม่มี SVG หรือเรนเดอร์ล้มเหลว จะสร้างใหม่จนกว่าจะได้ผลลัพธ์ที่ใช้ได้
- ในกระบวนการสร้าง 1,008 ครั้ง มีการลองใหม่ 11 ครั้ง
- ประเมิน: GPT-5.6 Luna ให้คะแนนความสอดคล้องของสัตว์·ยานพาหนะ·การกระทำ อย่างละ 1~5 คะแนน
- อันดับของสัตว์และยานพาหนะใช้คะแนนรายองค์ประกอบของแต่ละรายการ
- เมื่อต้องการตัวเลขเดียวต่อภาพ ใช้ คะแนนผู้ประเมิน (judge score) ซึ่งเป็นค่าเฉลี่ยของคะแนนทั้งสาม
- ดึงคุณลักษณะ: Gemini 3.1 Flash-Lite บันทึกสัตว์และยานพาหนะที่รับรู้ ทิศทางของวัตถุหลัก และองค์ประกอบของฉาก
- เรนเดอร์: แปลง SVG เป็น PNG และหากไม่มี SVG หรือเรนเดอร์ล้มเหลว จะสร้างใหม่จนกว่าจะได้ผลลัพธ์ที่ใช้ได้
- หากแล็บได้ฝึกตามเบนช์มาร์กเฉพาะ คาดว่าแถวนกเพลิแกน คอลัมน์จักรยาน หรือเซลล์นกเพลิแกน-จักรยาน จะได้คะแนนสูงกว่าความยากตามธรรมชาติของมัน
ความแตกต่างที่เห็นจากการดูด้วยตา
- เปรียบเทียบกริดภาพรวมของแต่ละโมเดลแล้ว แต่ไม่พบกรณีที่ภาพนกเพลิแกน-จักรยานดีกว่าผลลัพธ์อื่น ๆ ของโมเดลเดียวกันอย่างชัดเจน
- ตัวอย่างแรกของ GLM-5.2 ดูค่อนข้างดี แต่ในชุดเดียวกันก็มีภาพ heron-skateboard คุณภาพสูงถูกสร้างขึ้นด้วย จึงยากจะตัดสินว่าเป็นผลจากการปรับแต่งพิเศษ
- แล็บที่สร้างภาพนกเพลิแกน-จักรยานได้ดี มีแนวโน้มวาดคู่สัตว์·ยานพาหนะอื่น ๆ ได้ดีด้วย
- การประเมินด้วยตาเปล่าทำซ้ำได้ยากและอาจตัดสินต่างกันไปตามแต่ละคน จึงเพิ่มการวิเคราะห์เชิงปริมาณ
ผลงานแยกของนกเพลิแกนและจักรยาน
- เมื่อรวมคะแนนสัตว์จากทุกโมเดล นกเพลิแกนอยู่อันดับ 6 จาก 8 ชนิด
- ต่ำกว่า cat, whale, raccoon, heron, antelope
- ทั้ง 7 แล็บวาด cat, whale, raccoon ได้ดีกว่า pelican
- เพราะนกเพลิแกนอาจวาดยากกว่า cat อยู่แล้ว อันดับนี้เพียงอย่างเดียวจึงยังตัดความเป็นไปได้ของการฝึกเพิ่มเติมไม่ได้
- จักรยานอยู่อันดับ รองสุดท้าย จากยานพาหนะ 6 ชนิด และอยู่ในระดับใกล้เคียงกับ plane ซึ่งรั้งท้าย
- จักรยานต้องมีล้อคู่ที่สอดคล้องกัน เฟรมที่เชื่อมแกนล้อทั้งสองด้าน แฮนด์ เบาะ และบันไดถีบ
- โมเดลประเมินตัดสินว่าภาพจักรยานประมาณ สองในสาม ขาดองค์ประกอบเหล่านี้อย่างใดอย่างหนึ่ง หรือเชื่อมต่อกันไม่ถูกต้อง
- จักรยานก็ยากกว่ายานพาหนะง่าย ๆ อย่าง skateboard ดังนั้นแม้จะถูกฝึกแยกมา อันดับสัมพัทธ์ก็อาจยังต่ำได้
ความกำกวมจากพรอมป์ต์ ‘plane’
- เนื่องจากใช้ “plane” แทน “airplane” บางโมเดลจึงตีความเป็น ระนาบทางเรขาคณิต แทนที่จะเป็นอากาศยาน
- ส่งผลให้เกิดภาพสัตว์ยืนอยู่บนพื้นผิวเรียบ แทนที่จะโดยสารเครื่องบิน
- กรณีที่ตัวดึงคุณลักษณะหาไม่พบยานพาหนะเลยเกิดขึ้นเฉพาะกับ plane
- จากภาพ plane 168 ภาพ มี 25 ภาพ ที่ไม่รู้จำว่าเป็นยานพาหนะ
- ยานพาหนะอีก 5 ชนิดที่เหลือไม่มีกรณีแบบนี้
- ภาพ plane 20% ได้คะแนนยานพาหนะ 1 หรือ 2 คะแนน
- bicycle อยู่ที่ 5%
- boat, scooter, skateboard ไม่มีภาพที่ได้ 1~2 คะแนน
อันดับตามคู่ผสมและการปรับแก้ความยาก
- คะแนนเฉลี่ยของคู่นกเพลิแกน-จักรยานอยู่อันดับ 42 จากคู่ผสม 48 แบบ
- เนื่องจากแต่ละคู่อาจมีความยากโดยธรรมชาติต่างกัน จึงใช้การวิเคราะห์ถดถอยแบบ fixed effects กับภาพทั้งหมด 1,008 ภาพ
- สมการพื้นฐานคือ
score ~ lab + animal × vehicle - เพิ่มเทอมปฏิสัมพันธ์รายแล็บสำหรับ pelican, bicycle, pelican-bicycle
- ใช้ robust standard errors
- สมการพื้นฐานคือ
- เทอม
animal × vehicleดูดซับความยากเฉพาะที่แตกต่างกันของคู่ผสมทั้ง 48 แบบ - ใช้เทอมปฏิสัมพันธ์รายแล็บเพื่อวัด ส่วนเพิ่มเฉพาะเบนช์มาร์ก เมื่อเทียบกับแล็บเฉลี่ย พร้อมช่วงความเชื่อมั่น
ไม่พบผลที่มีนัยสำคัญในการวิเคราะห์ถดถอย
- ผลของนกเพลิแกนรายแล็บอยู่ระหว่าง -0.11 ถึง +0.14 คะแนน และทั้งหมดไม่มีนัยสำคัญทางสถิติ
- ค่า p ที่ต่ำที่สุดก็อยู่ที่ 0.25
- ผลของจักรยานรายแล็บกระจายตั้งแต่ -0.18 คะแนนของ Grok 4.5 (p=0.11) ถึง +0.27 คะแนนของ Gemini 3.5 Flash (p=0.022)
- ทิศทางของผลทั้ง 7 รายการแบ่งเป็นทั้งบวกและลบ
- โมเดลที่ผ่าน p<0.05 มีเพียง Gemini 3.5 Flash
- หลังหักผลของนกเพลิแกนและจักรยานของแต่ละแล็บแล้ว ส่วนเพิ่มที่ได้เฉพาะจากคู่นกเพลิแกน-จักรยานไม่มีรายการใดผ่าน p<0.05
- ผลบวกที่ใหญ่ที่สุดคือ +0.35 คะแนนของ GLM-5.2 แต่ p=0.12
- เป็นผลลัพธ์ที่ใกล้สัญญาณมากที่สุดในการทดลอง แต่ยังอยู่ในขอบเขตของความบังเอิญ
- ช่วงความเชื่อมั่นทั้งหมดของผลนกเพลิแกนและผลเซลล์นกเพลิแกน-จักรยานครอบคลุม 0
- หากทำการทดสอบ 21 รายการที่ p<0.05 จะคาดว่าจะเกิด false positive ประมาณ 1 รายการจากความบังเอิญล้วน ๆ
21 × 0.05 ≈ 1.05และผลที่มีนัยสำคัญจริง ๆ ก็มีเพียงผลจักรยานของ Gemini หนึ่งรายการ- เกณฑ์หลังปรับ Bonferroni คือ
0.05/21 ≈ 0.002ดังนั้น p=0.022 ของ Gemini จึงไม่ผ่าน
- ความกว้างของช่วงความเชื่อมั่นเฉลี่ยประมาณ ±0.6 คะแนน ทำให้การทดลองจับผลเพิ่มที่เล็กกว่านี้ได้ยาก
องค์ประกอบภาพที่หันไปทางขวา
- ภาพนกเพลิแกน-จักรยาน ทั้ง 21 ภาพ ที่สร้างโดย 7 แล็บหันไปทางขวาทั้งหมด
- เป็นคู่ผสมเดียวใน 48 คู่ที่ภาพทั้งหมดมีทิศทางตรงกัน
- อย่างไรก็ตาม ภาพทั้งหมด 1,008 ภาพมี 60% ที่หันไปทางขวา ดังนั้นทิศทางขวาเองเป็นเรื่องพบได้ทั่วไป
- สัดส่วนการหันขวาตามยานพาหนะคือ scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45%, boat 35%
- สัดส่วนการหันขวาตามสัตว์คือ antelope และ pelican อย่างละ 78%, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40%, raccoon 36%
- เนื่องจากการวาดนกเพลิแกนหรือจักรยานแบบมุมตรงอาจทำได้ยาก โมเดลจึงมักเลือกมุมมองด้านข้างซ้าย-ขวา และทำให้มีภาพที่ทิศทางกำกวมน้อย
- คู่ผสมอื่น ๆ ก็มีอัตราความสอดคล้องของทิศทางสูงเช่นกัน
- antelope-scooter และ pelican-scooter มีภาพที่ไปทางเดียวกันอย่างละ 20 จาก 21 ภาพ
- heron-bicycle มี 19 จาก 21 ภาพที่ไปทางเดียวกัน
- การที่หนึ่งใน 48 คู่ผสมมีภาพ 21 ภาพหันไปทางเดียวกันทั้งหมด เพียงอย่างเดียวถือว่ายากจะมองว่าเป็นค่าผิดปกติพิเศษ
ค้นหาร่องรอยการท่องจำจากองค์ประกอบฉาก
- Gemini 3.1 Flash-Lite ดึงองค์ประกอบฉากที่พบในภาพแบบ free-form เพื่อตรวจสอบว่า องค์ประกอบที่ถูกจดจำ ซ้ำ ๆ ปรากฏขึ้นหรือไม่
- ในบางคู่ผสม มีองค์ประกอบเฉพาะที่เกิดซ้ำบ่อย
- ภาพ flamingo-boat ทั้งหมดมีดวงอาทิตย์
- 38% ของภาพ otter-plane มีผ้าพันคอ
- 38% ของภาพ cat-bicycle มีตะกร้า
- ในคู่นกเพลิแกน-จักรยานก็มีบางองค์ประกอบที่มีความถี่สูง แต่ไม่พบรูปแบบการทำซ้ำพิเศษที่แยกจากคู่สัตว์·ยานพาหนะอื่น ๆ ได้
โมเดลประเมินเดี่ยวและงบประมาณจำกัด
- คะแนนทั้งหมดให้โดย GPT-5.6 Luna ซึ่งเป็นโมเดลประเมินเดี่ยวที่ดูภาพทีละภาพ
- ไม่ได้จัดแนวเกณฑ์การประเมินอย่างเพียงพอ และไม่ได้ตรวจสอบความสม่ำเสมอเมื่อประเมินซ้ำ
- หากโมเดลประเมินตัดสินภาพได้ไม่น่าเชื่อถือ คุณค่าของผลเชิงปริมาณก็จะลดลง
- ยังมีข้อจำกัดที่โมเดลประเมินกับโมเดลผู้เข้าร่วม GPT-5.6 Terra อยู่ในตระกูลผลิตภัณฑ์เดียวกัน
- อย่างไรก็ตาม แต่ละแล็บสร้างครบทั้ง 48 คู่ผสม ดังนั้นแม้จะชอบสไตล์ภาพของแล็บใดเป็นพิเศษ คะแนนของกริดทั้งหมดก็จะสูงขึ้นพร้อมกัน
- การวิเคราะห์เปรียบเทียบความแตกต่างระหว่างคู่ผสมภายในแล็บ ดังนั้นความชอบเช่นนี้ไม่น่าจะเปลี่ยนผลลัพธ์หลัก
- SVGmaxxing ซึ่งเป็นการปรับแต่งการสร้าง SVG โดยรวม หรือหมวดหมู่อย่าง ‘สัตว์ที่ขี่ยานพาหนะ’ ไม่ใช่พรอมป์ต์เฉพาะ ไม่สามารถตรวจจับได้
- เพราะประสิทธิภาพของทุกเซลล์จะเพิ่มขึ้นพร้อมกัน จึงแยกไม่ออกจากโมเดลที่สร้าง SVG ได้ดีโดยทั่วไป
- Google/DeepMind ทำการปรับแต่งลักษณะนี้ อย่างเปิดเผย
- ค่าใช้จ่ายการทดลองทั้งหมดอยู่ที่ API credit ประมาณ 80 ดอลลาร์
- จำกัดไว้ที่ตัวอย่าง 3 ภาพต่อเซลล์ โมเดลประเมิน 1 ตัว และโมเดลผู้เข้าร่วม 7 ตัว
- ไม่ได้ปรับปรุงพรอมป์ต์และไปป์ไลน์ซ้ำมากพอ จึงยังเหลือปัญหาอย่าง “plane” กับ “airplane”
ไม่มีหลักฐานของการปรับแต่งเพื่อพรอมป์ต์เฉพาะ
- นกเพลิแกนไม่ได้ถูกวาดดีกว่าสัตว์อื่น และจักรยานก็ไม่ได้ดีกว่ายานพาหนะอื่น อีกทั้งไม่มีแล็บใดวาดคู่ผสมนี้ได้ดีกว่าระดับที่คาดจากประสิทธิภาพรายนกเพลิแกน·จักรยานอย่างมีนัยสำคัญ
- GLM-5.2 มีส่วนเพิ่มมากที่สุดในเซลล์นกเพลิแกน-จักรยานเฉพาะนี้ แต่ผลมีขนาดเล็กและไม่มีนัยสำคัญทางสถิติ
- จุดที่ภาพทั้ง 21 ภาพหันไปทางขวาทั้งหมดนั้นสะดุดตา แต่โดยรวมแล้วองค์ประกอบที่หันขวาพบได้ทั่วไป และอีกสามคู่ผสมก็มีอัตราความสอดคล้องเกิน 90%
- รูปแบบที่เป็นไปได้มากกว่า pelicanmaxxing ที่เล็งเฉพาะเบนช์มาร์กใดเบนช์มาร์กหนึ่ง คือ SVGmaxxing ที่เสริมการสร้าง SVG โดยรวม แต่การทดลองนี้ไม่สามารถตัดสินได้ว่าแล็บใดทำสิ่งนี้อยู่
1 ความคิดเห็น
ความเห็นจาก Hacker News
ผมลองเช็กคู่ผสมสัตว์กับพาหนะอื่น ๆ เป็นระยะ ๆ ด้วย และเคยหวังว่าจะหาหลักฐานได้ว่าสถาบันวิจัย AI แห่งใดแห่งหนึ่งวาด นกกระทุงขี่จักรยาน ได้เก่งเป็นพิเศษ
วิธีการของ Dylan ที่สร้าง SVG 1,008 ชิ้น จากชุดผสม 8×6 นั้นแน่นกว่าที่ผมคิดไว้มาก แต่ก็ยังไม่พบว่าในโมเดลใด นกกระทุงขี่จักรยานออกมาดีกว่าคู่ผสมอื่นอย่างเด่นชัด
ในตลาดที่แข่งขันสูง การผ่าน benchmark เป็นเหมือนค่าเข้าประตู แต่การ optimize แบบแคบ ๆ ด้วยการ hardcode เฉพาะฉากนั้น แล้วไม่ปรับปรุงปัญหาข้างเคียง เป็นเรื่องที่ไม่ดี ทำให้นึกถึง benchmark “Quack3” สำหรับการ์ด ATI ในวงการ GPU
การที่นกกระทุงขี่จักรยานหันไปทางขวาดูเป็นธรรมชาติ เพราะ ระบบขับเคลื่อนของจักรยานอยู่ด้านขวา ถ้าจะให้เห็นโดยไม่ถูกเฟรมบังก็มักต้องวาดด้านขวา และมีความเป็นไปได้สูงว่าข้อมูลฝึกก็สะท้อนมุมมองแบบนี้
หลักฐาน: https://www.rei.com/c/bikes
ถ้าดูดี ๆ จักรยานทุกคันหันไปทางขวาโดยไม่เกี่ยวกับทิศของสัตว์ และขาของผู้ขี่ทั้งสองข้างก็อยู่ด้านขวาของจักรยานทั้งหมด ยกเว้นวาฬ ซึ่งชี้ว่าโมเดลยัง ขาดความเข้าใจเชิงปฏิบัติว่าจักรยานทำงานอย่างไรอย่างมาก
ทุกครั้งที่ Simon Willison โพสต์ SVG ก็มักมีคนตอบแบบไม่ใส่ใจการประเมินว่า “ตอนนี้คงฝึกไปแล้วแน่ ๆ” แต่ก็มีบทความที่อธิบายเชิงตรรกะไว้เหมือนกันว่าการฝึกลักษณะนั้นถูกจับได้ง่ายแค่ไหน ผมดีใจที่มีการ วิเคราะห์เชิงปริมาณ ผลลัพธ์ของสัตว์ตัวเล็กขี่จักรยานให้ดู
https://simonwillison.net/2025/Nov/13/training-for-pelicans-...
ผลรอบนี้แสดงว่ายังไม่ได้เกิดการปรับปรุงแบบนั้นด้วยซ้ำ ตรงกันข้าม อาจเป็นไปได้ว่าโมเดลไปเรียนรู้จากผลลัพธ์แย่ ๆ บนอินเทอร์เน็ตจน ประสิทธิภาพลดลง
ถ้าคำอธิบายที่น่าเชื่อกว่าคือการ optimize เรื่อง SVG เราก็ควรถามต่อด้วยว่าคำว่า “optimize” ในที่นี้หมายถึงอะไร ความสามารถในการ วาด SVG ได้ดีขึ้น เองก็เป็นทักษะที่มีประโยชน์
ผมเพิ่มรูปแบบหนึ่งให้กับการทดลองคล้าย ๆ กันนี้ โดยเช็กด้วยว่าเมื่อไม่ได้ระบุนกหรือพาหนะเฉพาะ โมเดลจะเลือก นกกระทุงขี่จักรยาน เองหรือไม่
ผลลัพธ์: https://www.modelbias.ai/pelican-on-a-bicycle-test
ข้อมูลดิบต้นฉบับเปิดไว้บน GitHub: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...
การให้ LLM สร้าง SVG นั้นยากและไม่เป็นธรรมชาติมาก คล้ายกับการให้จิตรกรมนุษย์วาดรูปโดยท่องรายการพิกัด ทุกวันนี้โมเดลสร้างภาพสามารถทำจักรยานที่โครงสร้างสมบูรณ์และนกกระทุงที่สมจริงได้ง่าย แต่ผลลัพธ์ก็ยังเป็นเพียงภาพแรสเตอร์
ยังขาดขั้นตอนการแยกภาพออกมาเป็น SVG path หรือคำสั่งแปรง แล้วสร้างกลับขึ้นใหม่ ซึ่งถ้าจะทำให้ดีต้องอาศัยความเข้าใจโครงสร้างของฉากอย่างแท้จริง และ AI ยังอ่อนในจุดนี้
พอวิธีให้คะแนนผลลัพธ์ของ LLM กลายเป็นที่รู้จัก คนตัดสินใจเรื่องเงินทุนและสถาบันวิจัยก็จะเริ่มสนใจตัวชี้วัดนั้นและปรับแก้ตาม ในกรณีที่ดีที่สุด พวกเขาอาจปรับปรุงความสามารถด้าน SVG โดยรวมพร้อมกับ optimize การสร้างนกกระทุงไปด้วย แต่เมื่อมันกลายเป็นมาตรวัดที่รู้จักกันแล้ว ก็ยากจะใช้เป็น การประเมินอิสระที่เชื่อถือได้ อีกต่อไป