แคตตาล็อกของโมเดลภาพส่วนใหญ่มักรวมแต่ภาพที่ออกมาดี สิ่งที่จำเป็นจริง ๆ อย่าง "อันนี้ทำไม่ได้"
กลับไม่มี ดังนั้นผมจึงรันไป 561 ภาพ เหลือไว้ 475 ภาพ และเปิดเผยแม้แต่ 65 ภาพที่ทิ้งไปพร้อมเหตุผลว่าเพราะอะไรถึงล้มเหลว
ทั้งภาพที่เก็บไว้และภาพที่ทิ้งไปต่างก็แนบ seed มาครบ จึงลองทำซ้ำตามเดิมได้เลย

ภาษาเกาหลีทำได้ แต่คำที่พลาดจะพลาดแบบเดิมทุกครั้ง

ตอนแรกผมดูแค่ภาพเดียวแล้วเขียนว่า "ถึงจะสั่งให้เขียนภาษาเกาหลี มันก็เขียนผิด" แต่พอลองรันหกแบบ มันเป็นคำกล่าวที่แรงเกินไป
สี่แบบออกมาถูกต้องเป๊ะ ได้แก่ guksu, doseogwan, "3beon chulgu" (ตัวเลข+ฮันกึล),
"oneurui chucheon menyu" (สามคำ หกพยางค์)

ความยาวไม่ใช่ตัวแปร 2 พยางค์ก็ได้ 6 พยางค์ก็ได้ แต่ 4 พยางค์กลับผิด

สองคำที่ผิดน่าสนใจมาก "jeongjikhan guksu" ออกมาเป็น "jeongjeokhan guksu" และถึงจะเปลี่ยน seed
ก็ยังออกมาเหมือนเดิม (1167746582, 1910572019) สะกดผิดแบบเดิมสองครั้ง จึงไม่ใช่เรื่องดวงของ seed แต่เป็นปัญหาของคำนั้นเอง ส่วน "Hanbat Sikdang" กลายเป็น "hanppaetsikdang" ซึ่งเป็นพยางค์ที่ไม่มีอยู่จริง

ทั้งสองกรณีพังตรงตัวสะกดท้ายพยางค์ แต่คำอย่าง guk·neul·cheon ก็มีตัวสะกดท้ายและยังออกมาปกติดี ผมจึงยังไม่สรุปสาเหตุจากแค่สองเคสนี้

ดังนั้นถ้ามันเขียนผิด อย่าหมุน seed ใหม่ แต่ให้เปลี่ยนข้อความแทน ต่อให้หมุนใหม่ก็จะพลาดตรงเดิม

ตัวอักษรที่เขียนให้มัน จะวาดได้ แต่ตัวอักษรที่มันต้องแต่งเองจะวาดไม่ได้

ตลอดสามแบตช์ ผมเข้าใจผิดว่า "จำนวนสตริงคือข้อจำกัด" เพื่อหาขีดจำกัด ผมใช้ป้ายชื่อเดียวกันแล้วเพิ่มจำนวนสตริงอย่างเดียวจาก 1→8 ปรากฏว่า ถูกต้องครบทั้งแปด

จำนวนไม่ใช่ตัวแปร พอกลับไปดูงานที่เคยพลาด จุดที่แยกผลก็ชัดเจน

  • เมนูคาเฟ่: สามรายการที่เขียนในพรอมป์ต์ถูกต้อง ที่เหลือเป็น CAPEME, CABIELO
  • ไทม์ไลน์: กำหนดแค่ช่วงปี ปีออกมาได้ แต่ป้ายกำกับล้มเหลว
  • ม็อกอัปคัมบัง: ไม่ได้ให้ชื่อคอลัมน์ คอลัมน์ทั้งสามเลยกลายเป็น "Kanban" หมด

ข้อความทุกชิ้นที่จะปรากฏบนหน้าจอ ให้เขียนลงในพรอมป์ต์ทั้งหมดแบบตรงตัว แปดไม่ได้เป็นขีดจำกัด แต่เป็นแค่จุดที่ผมหยุดทดสอบ

อย่างไรก็ตาม การเขียนให้ครบไม่ได้พอเสมอไป ผมนำสามเคสที่เคยล้มเหลวกลับมารันใหม่โดยใส่แค่สตริง ปรากฏว่าเมนูบอร์ดถูกครบทั้งสิบบรรทัด สันหนังสือถูก 10 จาก 12 แต่แผนผังเส้นทางถูกเพียง 4 จาก 9 ถ้าตัวอักษรเล็กและหมุนหลายมุม ก็จะติดข้อจำกัดชั้นที่สอง

ผมเคยเขียนว่า "มือโดยรวมทำได้" แล้วต้องถอนคำพูดภายในสามชั่วโมง

ผมล็อกแสงกับมุมภาพไว้ แล้วเพิ่มความยากของมือเป็น 8 ระดับ ซูมดูที่ 1.5~2 เท่า แล้วเขียนว่า "7 จาก 8 ภาพ กายวิภาคของมือยังปกติดี" มันเป็นประโยคที่พร้อมจะแพร่กระจายที่สุด เพราะขัดกับความเชื่อทั่วไป

r/StableDiffusion มีคอมเมนต์เข้ามาภายในสองชั่วโมงหลังโพสต์ว่า "รูปที่ดูเหมือนมีสามนิ้ว จริง ๆ มีหกนิ้ว" พอขยาย 4 เท่าก็จริง และอีก 20 นาทีต่อมา มีอีกคนชี้ไปที่มือที่วางซ้อนกันว่า "อันนั้นก็ผิด มีแค่สี่นิ้ว"

จาก 8 ภาพ มีคนสองคนไปเจอ 3 ภาพ โดยทำสิ่งหนึ่งที่ผมไม่ได้ทำ นั่นคือ นับมันจริง ๆ

ผมจึงถอดหมวดนี้ออกทั้งก้อน และไม่ได้กลับไปให้คะแนนใหม่ทีละภาพ เพราะเครื่องมือที่ล้มเหลวคือสายตาของผมเอง ถ้าใช้ตาเดิมตัดสินอีกห้าภาพที่เหลือ ก็เท่ากับทำพลาดแบบเดิมเป็นครั้งที่สาม
ผมย้ายภาพทั้ง 8 ภาพไปอยู่ในรายการล้มเหลวพร้อม seed ครบทั้งหมด

ผลการวัดอื่น ๆ

  • มันนับวัตถุได้ แต่นับคุณสมบัติไม่ได้ ไข่ "จำนวน N ฟองเป๊ะ" ถูกต้องครบตั้งแต่ 2~8 ฟอง แต่ "มีสีอยู่สองสีเป๊ะ" กลับออกมาเป็นสี่สี ถ้าชี้ทีละชิ้นได้ จะสั่งจำนวนได้ แต่ถ้ากำลังนับสี·พื้นที่·แหล่งกำเนิดแสง ให้ตรวจนับผลลัพธ์เอง
  • ถ้าเรียกแสงด้วยชื่ออุปกรณ์ อุปกรณ์จัดแสงจะโผล่เข้ามาในภาพ พรอมป์ต์สองอันที่เขียนว่า "softbox" ต่างก็มี softbox โผล่มาเป็นวัตถุในภาพ ให้เขียนหน้าที่ของแสงแทน
  • ถึงจะเขียนว่า "seamless" ก็ยังไม่ tile ใน 8 แพตเทิร์น มีแค่ 1 อันที่ต่อเนื่อง และอันนั้นก็เป็นลายทางแนวตั้งที่ขอบมาต่อกันเองโดยบังเอิญ
  • "straight down" เป็นคำขอ ไม่ใช่คำสั่ง จากภาพมุมอากาศ 8 ภาพ มี 5 ภาพที่ออกมาเฉียง ถ้ามีสิ่งที่ตั้งตรงอย่างเครนหรือบ้าน กล้องจะก้มลงเพื่อให้เห็นสิ่งนั้น
  • การเปรียบเทียบขนาดทำให้ตัวแบบสลับกัน พอสั่ง "ด้วงขนาดเท่าม้าแคระ" กลับได้ม้าแคระใส่อานมา และไม่มีด้วงเลย
  • เอาคนเดียวกันไปใส่ในอีกรูปไม่ได้ ถ้า strength 0.45 ใบหน้ายังอยู่ แต่คอมโพสตามมาทั้งชุด ถ้า 0.72 ก็กลายเป็นคนละคน ไม่มีค่าตรงกลางที่ใช้งานได้
  • image-to-image เพิ่มหรือลบวัตถุไม่ได้ แต่การแปลงสื่อ (ภาพถ่าย→กัวช์ เป็นต้น) เสถียรดี ในช่วง strength 0.50~0.60

ต้นทุนรวมทั้งหมดคือ $4.54 (fal.ai, $0.008 ต่อเมกะพิกเซล)

README ภาษาเกาหลี: https://github.com/sjh9714/awesome-krea-2/blob/main/README_KO.md
ดูภาพทั้งหมดแบบไล่ครบ: https://sjh9714.github.io/awesome-krea-2/
สิ่งที่ดึงเฉพาะสูตรแต่งภาพออกมาเป็น agent skill: https://github.com/sjh9714/same-frame

ยังไม่มีความคิดเห็น

ยังไม่มีความคิดเห็น