- โมเดลสร้างภาพรุ่นที่ 3 ของซีรีส์ Qwen-Image โดยตั้งเป้าหมายหลักที่คำว่า 'Real(实)' เพื่อให้ใช้งานด้านประสิทธิภาพการทำงานได้ ไม่ใช่แค่สร้างภาพที่ดูดี
- รองรับอินพุตได้สูงสุด 4.5k โทเคน จึงสร้างเลย์เอาต์ที่มีข้อมูลหนาแน่น เช่น หนังสือพิมพ์ สตอรี่บอร์ด ข้อสอบ และภาพที่มีหลายแนวคิดวางแบบขนานหรือซ้อนกันได้ในครั้งเดียว
- เรนเดอร์ ตัวอักษรขนาด 10px สมการ LaTeX และหมายเหตุลายมือให้อ่านได้ พร้อมถ่ายทอดพื้นผิวละเอียดอย่างรูขุมขน เส้นผม ผิวหนัง และรอยพู่กัน
- รองรับ 12 ภาษา หลายฟอนต์ สไตล์ศิลปะมากกว่า 100 แบบ รวมถึง UI สำหรับเว็บ เกม และไลฟ์สตรีมมิง อีกทั้งยังค้นหาข้อมูลล่าสุดจากอินเทอร์เน็ตแล้วสะท้อนลงในภาพได้
- เป็นโมเดลที่มุ่งขยายการสร้างภาพให้เป็น เครื่องมือเพิ่มประสิทธิภาพที่พร้อมใช้งานจริง สำหรับงานอย่าง PDF หนังสือพิมพ์ สตอรี่บอร์ดละครสั้น UI ที่ซับซ้อน ตลอดจนงานออกแบบ การสร้างคอนเทนต์ การศึกษา และอีคอมเมิร์ซ
โมเดลรุ่นที่ 3 ที่มุ่งสู่ ‘Real’
- Qwen-Image-3.0 คือ โมเดลสร้างภาพพื้นฐานรุ่นที่ 3 ของซีรีส์ Qwen-Image
- แนวทางหลักของแต่ละรุ่นมีดังนี้
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- ‘Real’ ประกอบด้วยความสามารถ 3 ด้าน
- เนื้อหาหลากหลาย: รองรับอินพุตสูงสุด 4.5k โทเคนและเลย์เอาต์ที่ซับซ้อน
- รายละเอียดสมจริง: ถ่ายทอดตัวอักษรขนาด 10px และองค์ประกอบจิ๋วอย่างรูขุมขนหรือเส้นผม
- ความรู้ลึกซึ้ง: รองรับ 12 ภาษา UI หลากหลาย และการสร้างโดยอาศัยความรู้ของโลก
- มีเป้าหมายยกระดับการสร้างภาพจากระดับ ‘ใช้งานได้’ ไปสู่ ‘ใช้งานจริง’ และจาก ‘ดูดี’ ไปสู่ มีประโยชน์
เนื้อหาหลากหลายและการจัดวางที่ซับซ้อน
- สามารถเรนเดอร์ทั้งความสัมพันธ์เชิงพื้นที่ สัญลักษณ์ทางคณิตศาสตร์ คำอธิบายทฤษฎีบท และตำแหน่งสัมพัทธ์ของแต่ละองค์ประกอบในสไลด์คณิตศาสตร์ได้พร้อมกัน
- ด้วยคำสั่งยาวประมาณ 3.7k โทเคน สามารถสร้างกริด 3×3 หนึ่งภาพได้ใน single pass โดยไม่ต้องนำหลายภาพมาต่อกัน
- แต่ละช่องประกอบเป็นอินโฟกราฟิกซับซ้อนที่ผสมประโยคภาษาจีนและอังกฤษ สมการ แผนภูมิ และตัวการ์ตูน
- จัดวางการ์ตูนความปลอดภัยในอุโมงค์ บทเรียนเรขาคณิตเชิงพื้นที่ การวิเคราะห์สำนวนใน 「Chu Shi Biao」 การเคลื่อนที่แบบพาราโบลา ปรสิตวิทยา แผนภาพการแพทย์อาการเจ็บหน้าอกด้านขวา ทฤษฎีบท Sylow การควบคุมภายในของธนาคาร และการเปรียบเทียบโครงสร้าง DNA ของเซลล์ไว้ในภาพเดียว
- รับคำสั่งได้สูงสุด 4.5k โทเคน เพื่อทำความเข้าใจและเรนเดอร์เลย์เอาต์ภาพที่มีความหนาแน่นของข้อมูลสูง
-
การขยายในแนวนอน
- หมายถึงความสามารถในการวางองค์ประกอบหลายส่วนแบบขนานบนแคนวาสเดียว
- ใช้ การวางเคียงกันเชิงความหมาย และการควบคุมเชิงพื้นที่เพื่อจัดหลายแนวคิดให้อยู่ร่วมกันอย่างเป็นระเบียบโดยไม่รบกวนกัน
-
ความลึกในแนวตั้ง
- คือความสามารถในการแยกความหมายและถ่ายทอดอินเทอร์เฟซที่ซ้อนกันตามลำดับอย่างมีเหตุผล
- สามารถสร้าง โครงสร้างหลายหน้าจอ ที่มีหน้าจอเขียนโปรแกรม VSCode, Qwen Chat, WeChat และโปสเตอร์กาแฟดริปซ้อนกันได้จากคำสั่งเดียว
- แต่ละชั้นยังคงสไตล์และรายละเอียดของ UI นั้นไว้
จากตัวอักษรเล็กสู่การบูรณะภาพวาด
-
ตัวอักษรเล็กและการจัดพิมพ์ที่ซับซ้อน
- เรนเดอร์ ตัวอักษรขนาดเล็ก 10px ให้อ่านได้
- สามารถสร้างพื้นที่ที่มีทั้งข้อความและภาพประกอบจำนวนมากร่วมกันได้ เช่น อินโฟกราฟิกความรู้เกี่ยวกับฉลามวาฬ
- จำลองสมการ LaTeX ตัวยก-ตัวห้อย อักษรกรีก หมายเลขทฤษฎีบท วงเล็บปีกกา เส้นเศษส่วน และการจัดเรียงหลายบรรทัดจากหน้าหนึ่งของงานวิจัยเรขาคณิตเชิงพีชคณิตได้
- คงความอ่านง่ายของสมการและเนื้อความแม้ใช้ฟอนต์ขนาดเล็ก
- ผสานพื้นผิวกระดาษที่สมจริงเข้ากับข้อความแน่นหนาเพื่อสร้าง ภาพรูปแบบหนังสือพิมพ์
-
การแก้ไขและลายมือ
- สามารถเพิ่มหมายเหตุลายมือสีแดงลงบนหน้าหนังสือได้
- รวมถึงการขีดเส้นใต้ เส้นคลื่น วงกลม ลูกศร และบันทึกสั้น ๆ
- ถ่ายทอดสไตล์ลายมือที่เป็นธรรมชาติแบบโน้ตเรียนของนักเรียนมัธยมปลาย
-
การถ่ายทอดพื้นผิวและการบูรณะ
- บรรยาย องค์ประกอบละเอียด อย่างรูขุมขน เส้นผม และพื้นผิวผิวหนังในภาพบุคคลได้ รวมถึงพื้นผิวละเอียดของวัตถุอื่น ๆ
- บูรณะภาพวาดดั้งเดิมที่เสียหายหรือสูญหายบางส่วนให้กลับมาเข้ากับลายเส้นและรอยพู่กันเดิม
- รักษาระดับน้ำหมึก พื้นผิวขนนก และสมดุลขององค์ประกอบในภาพนกอินทรีต่อสู้ ขณะลบรอยเชื้อราและร่องรอยความเสียหาย พร้อมเติมส่วนที่หายไปให้สมบูรณ์
การใช้ภาษา UI และความรู้ของโลก
- รองรับ 12 ภาษา หลายฟอนต์ สไตล์ศิลปะมากกว่า 100 แบบ และอินเทอร์เฟซ UI หลากหลาย
- มีตัวอย่างการเรนเดอร์ภาษาญี่ปุ่น เกาหลี และสเปนได้อย่างแม่นยำ
- สามารถสร้าง หน้าจอ UI ที่สมจริงได้หลายประเภท เช่น เว็บเพจ เกม และไลฟ์สตรีมมิง
-
อินโฟกราฟิกฐานความรู้
- คงวัตถุหลักของภาพถ่ายแมลงจริงไว้ แล้วขยายเป็นอินโฟกราฟิกเพื่อการวิจัย
- ใส่ข้อมูลอนุกรมวิธาน หมายเหตุลักษณะทางสัณฐานวิทยา หน้ารายละเอียดแบบขยาย และแถบมาตราส่วน
- จัดผลลัพธ์ให้อยู่ในรูปแผนภาพวิจัยที่พร้อมใช้ในงานตีพิมพ์วิชาการได้ทันที
-
การใช้ข้อมูลล่าสุดและ IP
- นอกจากความรู้ที่โมเดลมีอยู่แล้ว ยังเชื่อมต่ออินเทอร์เน็ตเพื่อค้นหา ข้อมูลล่าสุด ได้
- ค้นหาสภาพอากาศของ Hangzhou วันที่ 21 กรกฎาคม แล้วสร้างภาพพยากรณ์อากาศ
- สามารถค้นหาตัวละครจาก IP เฉพาะแล้วนำมาสร้างภาพได้
- สร้างฉากที่ Qi Baishi และ Van Gogh แนะนำ Qwen-Image-3.0 ในห้องไลฟ์สตรีมมิง
การขยายสู่การทำงานด้านประสิทธิภาพ
- จากความสามารถหลักทั้งสามด้าน รองรับงานมูลค่าสูงอย่าง PDF หนังสือพิมพ์ สตอรี่บอร์ดละครสั้น และอินเทอร์เฟซ UI ที่ซับซ้อน
- มีเป้าหมายเชื่อมความสามารถในการสร้างภาพไปสู่คุณค่าด้านประสิทธิภาพในสาขาอื่น ๆ มากขึ้น เช่น งานออกแบบ การสร้างคอนเทนต์ การศึกษา และอีคอมเมิร์ซ
1 ความคิดเห็น
ความเห็นจาก Hacker News
รู้สึกแปลก ๆ ที่ผลักดันโมเดลแบบนี้กับการช้อปปิ้งออนไลน์ เพราะมันแต่งให้เสื้อผ้าดูเข้ารูปกับร่างกายและทำให้แสงดูสวย ดังนั้น ความรู้สึกเวลาใส่และทรงของเสื้อผ้าจริง ก็ยังยากจะรู้เหมือนเดิม
อีก 50 ปีข้างหน้า “ความจริงของโฆษณา” เองอาจถูกมองเป็นอดีตอันงดงามที่ไม่มีวันเอาคืนได้
แต่ถ้าเป็นแพลตฟอร์มที่มีสินค้าใหม่ขึ้นเดือนละ 1,000 ชิ้น รูปจริงที่ไม่สมบูรณ์อาจช่วยเรื่อง conversion ได้ดีกว่าก่อนซื้อ โดยเฉพาะภาพสไตล์ 3D ที่ทำให้ทุกสีดูเหมือนกันหมดกลับชวนให้ไม่อยากซื้อ
น่าสนใจที่ใน meta keywords ของ HTML มีรายการเกี่ยวกับสื่อผู้ใหญ่ เช่น hentai, nudes มากกว่า 100 รายการ
รัน
document.querySelector('meta[name="keywords"]').contentในคอนโซลแล้วจะเห็นแท็กทั้งหมดqwenอยู่ในนั้น มันอาจรวมแม้แต่คำพิมพ์ผิดอย่างgwenหรือbenในบริบทสื่อผู้ใหญ่ด้วยkeywordsยังมีค่าอะไรไหม และมันแค่เพิ่มข้อมูลไร้ประโยชน์ เกิน 77KB ให้หน้าเว็บดูเหมือนฝึกจากเอาต์พุตของ GPT Image 1 เพราะมี โทนเหลือง อันเป็นเอกลักษณ์ชัดเจน
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
ตัวอักษร ภาษาอาหรับ ในภาพปกพังอย่างเห็นได้ชัด แต่เวลาใช้งานโมเดลจริงกลับไม่เป็นแบบนั้น ภาพปกอาจไม่ได้สร้างด้วย Qwen Image 3.0 ก็ได้
เขาบอกว่า “ต้องใช้ 3,700 โทเค็น เพื่อบรรยายกริด 3×3 ทั้งหมดได้อย่างแม่นยำ” แต่ไม่ได้เปิดเผยพรอมป์ต์ จึงทำให้เดโมไม่น่าเชื่อถือเท่าไร
ไม่มีการพูดถึงเลยว่า จะเปิดเผยเวตหรือไม่ และเมื่อไร เลยสงสัยว่ามีเขียนไว้ที่ไหนหรือเปล่า
ให้โลโก้จริง 2 อัน, สเปก design language แบบสมบูรณ์, และภาพหน้าจอแอป 3 ภาพ แต่กลับได้ภาพห่วย ๆ มา 3 ภาพ และไม่มีอันไหนเหมือน โลโก้ต้นฉบับ ที่ให้ไปเลย
จากที่ลองบน chat.qwen.ai ทั้งองค์ประกอบภาพและความถูกต้องทางกายวิภาคยัง ไม่ถึงระดับ Qwen Image 1 เลย ได้ผลลัพธ์แบบมีขาสามข้างหรือตาเรืองแสง คุณภาพประมาณ Microsoft Lens ที่ถูกถอนไปแล้ว
ถ้ามีโมเดลแบบนี้ตอนเรียนมหาวิทยาลัยก็น่าจะดี ในฐานะคนที่เรียนรู้ด้วยภาพ น่าจะเข้าใจบางหัวข้อได้ง่ายกว่ามากผ่าน แผนภาพและภาพประกอบอธิบาย มากกว่าข้อความยาว ๆ
ลองขอ Nano Banana 2 ว่า “โปสเตอร์อินโฟกราฟิกสำหรับนักศึกษาปริญญาตรีที่อธิบายการทำงานของอะตอม” แล้ว มันสร้าง แบบจำลองโบร์ ที่เหมือนหนังสือเรียนวิทยาศาสตร์ระดับมัธยมต้นออกมา
ยังมี ฟิลเตอร์เหลืองหม่น ติดอยู่ทั่วภาพเหมือนเดิม