2 คะแนน โดย GN⁺ 3 시간 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • โมเดลสร้างภาพรุ่นที่ 3 ของซีรีส์ Qwen-Image โดยตั้งเป้าหมายหลักที่คำว่า 'Real(实)' เพื่อให้ใช้งานด้านประสิทธิภาพการทำงานได้ ไม่ใช่แค่สร้างภาพที่ดูดี
  • รองรับอินพุตได้สูงสุด 4.5k โทเคน จึงสร้างเลย์เอาต์ที่มีข้อมูลหนาแน่น เช่น หนังสือพิมพ์ สตอรี่บอร์ด ข้อสอบ และภาพที่มีหลายแนวคิดวางแบบขนานหรือซ้อนกันได้ในครั้งเดียว
  • เรนเดอร์ ตัวอักษรขนาด 10px สมการ LaTeX และหมายเหตุลายมือให้อ่านได้ พร้อมถ่ายทอดพื้นผิวละเอียดอย่างรูขุมขน เส้นผม ผิวหนัง และรอยพู่กัน
  • รองรับ 12 ภาษา หลายฟอนต์ สไตล์ศิลปะมากกว่า 100 แบบ รวมถึง UI สำหรับเว็บ เกม และไลฟ์สตรีมมิง อีกทั้งยังค้นหาข้อมูลล่าสุดจากอินเทอร์เน็ตแล้วสะท้อนลงในภาพได้
  • เป็นโมเดลที่มุ่งขยายการสร้างภาพให้เป็น เครื่องมือเพิ่มประสิทธิภาพที่พร้อมใช้งานจริง สำหรับงานอย่าง PDF หนังสือพิมพ์ สตอรี่บอร์ดละครสั้น UI ที่ซับซ้อน ตลอดจนงานออกแบบ การสร้างคอนเทนต์ การศึกษา และอีคอมเมิร์ซ

โมเดลรุ่นที่ 3 ที่มุ่งสู่ ‘Real’

  • Qwen-Image-3.0 คือ โมเดลสร้างภาพพื้นฐานรุ่นที่ 3 ของซีรีส์ Qwen-Image
  • แนวทางหลักของแต่ละรุ่นมีดังนี้
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • ‘Real’ ประกอบด้วยความสามารถ 3 ด้าน
    • เนื้อหาหลากหลาย: รองรับอินพุตสูงสุด 4.5k โทเคนและเลย์เอาต์ที่ซับซ้อน
    • รายละเอียดสมจริง: ถ่ายทอดตัวอักษรขนาด 10px และองค์ประกอบจิ๋วอย่างรูขุมขนหรือเส้นผม
    • ความรู้ลึกซึ้ง: รองรับ 12 ภาษา UI หลากหลาย และการสร้างโดยอาศัยความรู้ของโลก
  • มีเป้าหมายยกระดับการสร้างภาพจากระดับ ‘ใช้งานได้’ ไปสู่ ‘ใช้งานจริง’ และจาก ‘ดูดี’ ไปสู่ มีประโยชน์

เนื้อหาหลากหลายและการจัดวางที่ซับซ้อน

  • สามารถเรนเดอร์ทั้งความสัมพันธ์เชิงพื้นที่ สัญลักษณ์ทางคณิตศาสตร์ คำอธิบายทฤษฎีบท และตำแหน่งสัมพัทธ์ของแต่ละองค์ประกอบในสไลด์คณิตศาสตร์ได้พร้อมกัน
  • ด้วยคำสั่งยาวประมาณ 3.7k โทเคน สามารถสร้างกริด 3×3 หนึ่งภาพได้ใน single pass โดยไม่ต้องนำหลายภาพมาต่อกัน
    • แต่ละช่องประกอบเป็นอินโฟกราฟิกซับซ้อนที่ผสมประโยคภาษาจีนและอังกฤษ สมการ แผนภูมิ และตัวการ์ตูน
    • จัดวางการ์ตูนความปลอดภัยในอุโมงค์ บทเรียนเรขาคณิตเชิงพื้นที่ การวิเคราะห์สำนวนใน 「Chu Shi Biao」 การเคลื่อนที่แบบพาราโบลา ปรสิตวิทยา แผนภาพการแพทย์อาการเจ็บหน้าอกด้านขวา ทฤษฎีบท Sylow การควบคุมภายในของธนาคาร และการเปรียบเทียบโครงสร้าง DNA ของเซลล์ไว้ในภาพเดียว
  • รับคำสั่งได้สูงสุด 4.5k โทเคน เพื่อทำความเข้าใจและเรนเดอร์เลย์เอาต์ภาพที่มีความหนาแน่นของข้อมูลสูง
  • การขยายในแนวนอน

    • หมายถึงความสามารถในการวางองค์ประกอบหลายส่วนแบบขนานบนแคนวาสเดียว
    • ใช้ การวางเคียงกันเชิงความหมาย และการควบคุมเชิงพื้นที่เพื่อจัดหลายแนวคิดให้อยู่ร่วมกันอย่างเป็นระเบียบโดยไม่รบกวนกัน
  • ความลึกในแนวตั้ง

    • คือความสามารถในการแยกความหมายและถ่ายทอดอินเทอร์เฟซที่ซ้อนกันตามลำดับอย่างมีเหตุผล
    • สามารถสร้าง โครงสร้างหลายหน้าจอ ที่มีหน้าจอเขียนโปรแกรม VSCode, Qwen Chat, WeChat และโปสเตอร์กาแฟดริปซ้อนกันได้จากคำสั่งเดียว
    • แต่ละชั้นยังคงสไตล์และรายละเอียดของ UI นั้นไว้

จากตัวอักษรเล็กสู่การบูรณะภาพวาด

  • ตัวอักษรเล็กและการจัดพิมพ์ที่ซับซ้อน

    • เรนเดอร์ ตัวอักษรขนาดเล็ก 10px ให้อ่านได้
    • สามารถสร้างพื้นที่ที่มีทั้งข้อความและภาพประกอบจำนวนมากร่วมกันได้ เช่น อินโฟกราฟิกความรู้เกี่ยวกับฉลามวาฬ
    • จำลองสมการ LaTeX ตัวยก-ตัวห้อย อักษรกรีก หมายเลขทฤษฎีบท วงเล็บปีกกา เส้นเศษส่วน และการจัดเรียงหลายบรรทัดจากหน้าหนึ่งของงานวิจัยเรขาคณิตเชิงพีชคณิตได้
    • คงความอ่านง่ายของสมการและเนื้อความแม้ใช้ฟอนต์ขนาดเล็ก
    • ผสานพื้นผิวกระดาษที่สมจริงเข้ากับข้อความแน่นหนาเพื่อสร้าง ภาพรูปแบบหนังสือพิมพ์
  • การแก้ไขและลายมือ

    • สามารถเพิ่มหมายเหตุลายมือสีแดงลงบนหน้าหนังสือได้
    • รวมถึงการขีดเส้นใต้ เส้นคลื่น วงกลม ลูกศร และบันทึกสั้น ๆ
    • ถ่ายทอดสไตล์ลายมือที่เป็นธรรมชาติแบบโน้ตเรียนของนักเรียนมัธยมปลาย
  • การถ่ายทอดพื้นผิวและการบูรณะ

    • บรรยาย องค์ประกอบละเอียด อย่างรูขุมขน เส้นผม และพื้นผิวผิวหนังในภาพบุคคลได้ รวมถึงพื้นผิวละเอียดของวัตถุอื่น ๆ
    • บูรณะภาพวาดดั้งเดิมที่เสียหายหรือสูญหายบางส่วนให้กลับมาเข้ากับลายเส้นและรอยพู่กันเดิม
    • รักษาระดับน้ำหมึก พื้นผิวขนนก และสมดุลขององค์ประกอบในภาพนกอินทรีต่อสู้ ขณะลบรอยเชื้อราและร่องรอยความเสียหาย พร้อมเติมส่วนที่หายไปให้สมบูรณ์

การใช้ภาษา UI และความรู้ของโลก

  • รองรับ 12 ภาษา หลายฟอนต์ สไตล์ศิลปะมากกว่า 100 แบบ และอินเทอร์เฟซ UI หลากหลาย
  • มีตัวอย่างการเรนเดอร์ภาษาญี่ปุ่น เกาหลี และสเปนได้อย่างแม่นยำ
  • สามารถสร้าง หน้าจอ UI ที่สมจริงได้หลายประเภท เช่น เว็บเพจ เกม และไลฟ์สตรีมมิง
  • อินโฟกราฟิกฐานความรู้

    • คงวัตถุหลักของภาพถ่ายแมลงจริงไว้ แล้วขยายเป็นอินโฟกราฟิกเพื่อการวิจัย
    • ใส่ข้อมูลอนุกรมวิธาน หมายเหตุลักษณะทางสัณฐานวิทยา หน้ารายละเอียดแบบขยาย และแถบมาตราส่วน
    • จัดผลลัพธ์ให้อยู่ในรูปแผนภาพวิจัยที่พร้อมใช้ในงานตีพิมพ์วิชาการได้ทันที
  • การใช้ข้อมูลล่าสุดและ IP

    • นอกจากความรู้ที่โมเดลมีอยู่แล้ว ยังเชื่อมต่ออินเทอร์เน็ตเพื่อค้นหา ข้อมูลล่าสุด ได้
    • ค้นหาสภาพอากาศของ Hangzhou วันที่ 21 กรกฎาคม แล้วสร้างภาพพยากรณ์อากาศ
    • สามารถค้นหาตัวละครจาก IP เฉพาะแล้วนำมาสร้างภาพได้
    • สร้างฉากที่ Qi Baishi และ Van Gogh แนะนำ Qwen-Image-3.0 ในห้องไลฟ์สตรีมมิง

การขยายสู่การทำงานด้านประสิทธิภาพ

  • จากความสามารถหลักทั้งสามด้าน รองรับงานมูลค่าสูงอย่าง PDF หนังสือพิมพ์ สตอรี่บอร์ดละครสั้น และอินเทอร์เฟซ UI ที่ซับซ้อน
  • มีเป้าหมายเชื่อมความสามารถในการสร้างภาพไปสู่คุณค่าด้านประสิทธิภาพในสาขาอื่น ๆ มากขึ้น เช่น งานออกแบบ การสร้างคอนเทนต์ การศึกษา และอีคอมเมิร์ซ

1 ความคิดเห็น

 
GN⁺ 3 시간 전
ความเห็นจาก Hacker News
  • รู้สึกแปลก ๆ ที่ผลักดันโมเดลแบบนี้กับการช้อปปิ้งออนไลน์ เพราะมันแต่งให้เสื้อผ้าดูเข้ารูปกับร่างกายและทำให้แสงดูสวย ดังนั้น ความรู้สึกเวลาใส่และทรงของเสื้อผ้าจริง ก็ยังยากจะรู้เหมือนเดิม

    • เป้าหมายระยะสั้นคือขายสินค้า แต่เป้าหมายระยะยาวที่ทะเยอทะยานกว่าคือการทำให้ เส้นแบ่งระหว่างโฆษณากับความจริง เลือนลง และเปลี่ยนบรรทัดฐานทางวัฒนธรรมจนคนทั่วไปไม่ตั้งคำถามแบบนี้ตอนตัดสินใจซื้อ
      อีก 50 ปีข้างหน้า “ความจริงของโฆษณา” เองอาจถูกมองเป็นอดีตอันงดงามที่ไม่มีวันเอาคืนได้
    • สิ่งที่บางคนต้องการอาจไม่ใช่ generative AI เอง แต่เป็น การแปลงภาพเป็นภาพ แบบ “ช่วยทำให้เหมือนช่างภาพฝีมือดีถ่ายมา”
      แต่ถ้าเป็นแพลตฟอร์มที่มีสินค้าใหม่ขึ้นเดือนละ 1,000 ชิ้น รูปจริงที่ไม่สมบูรณ์อาจช่วยเรื่อง conversion ได้ดีกว่าก่อนซื้อ โดยเฉพาะภาพสไตล์ 3D ที่ทำให้ทุกสีดูเหมือนกันหมดกลับชวนให้ไม่อยากซื้อ
    • ในโฆษณาเฟอร์นิเจอร์มือสองบน Facebook Marketplace ก็คล้ายกัน ภาพส่วนใหญ่ถูก AI ตกแต่งให้เหมือน แคตตาล็อก Pottery Barn แล้วค่อยปิดท้ายด้วยรูปของจริงที่มีรอยขีดข่วนและความเสียหายเต็มไปหมด วางอยู่ในโรงรถรก ๆ
    • ก็ยังสงสัยว่ามันจะ บิดเบือนน้อยกว่า วิธีเดิมที่ให้ช่างภาพมืออาชีพถ่ายนางแบบใส่เสื้อภายใต้แสงที่สมบูรณ์แบบจริงหรือ
  • น่าสนใจที่ใน meta keywords ของ HTML มีรายการเกี่ยวกับสื่อผู้ใหญ่ เช่น hentai, nudes มากกว่า 100 รายการ

    • คีย์เวิร์ดนี้ถูกใส่แบบครอบคลุมทั้งเว็บแม้กระทั่งในหน้าที่ขอไม่ให้นำผลิตภัณฑ์ไปใช้กับคอนเทนต์ทางเพศ เช่น https://qwen.ai/usagepolicy
      รัน document.querySelector('meta[name="keywords"]').content ในคอนโซลแล้วจะเห็นแท็กทั้งหมด
    • ดูเหมือนมีเครื่องมือทำ SEO บางตัวเพิ่ม meta keywords ให้อัตโนมัติ ระหว่างรวบรวมคำค้นยอดนิยมที่มี qwen อยู่ในนั้น มันอาจรวมแม้แต่คำพิมพ์ผิดอย่าง gwen หรือ ben ในบริบทสื่อผู้ใหญ่ด้วย
    • ทุกวันนี้ไม่รู้ว่าเมตาแท็ก keywords ยังมีค่าอะไรไหม และมันแค่เพิ่มข้อมูลไร้ประโยชน์ เกิน 77KB ให้หน้าเว็บ
    • ทีม Qwen ก็น่าจะรู้ว่าชุมชนคอนเทนต์ผู้ใหญ่รับโมเดลสร้างภาพใหม่เร็วมาก แบบที่เห็นใน Civitai นี่ดูเป็น กลยุทธ์ SEO เพื่อให้โมเดลไปโผล่ในผลการค้นหาที่คนกลุ่มนี้ดูอยู่แล้ว
  • ดูเหมือนฝึกจากเอาต์พุตของ GPT Image 1 เพราะมี โทนเหลือง อันเป็นเอกลักษณ์ชัดเจน
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1 เองก็มีโทนเหลืองโดยไม่ได้ฝึกจากเอาต์พุตของโมเดลสร้างภาพอื่น เพราะคนชอบภาพแสงพระอาทิตย์ตกนุ่ม ๆ และโมเดล preference ก็จับสิ่งนี้ได้ง่าย ดังนั้นถ้าปรับแต่งเพื่อเพิ่มความสวยงาม โดยไม่กดมันไว้โดยตั้งใจ ภาพทั้งหมดก็มักจะมีโทนสีบาง ๆ ติดมา
    • โทนเหลือง·โทนแดง เป็นปัญหาที่พบบ่อยมาก ไม่ว่าภาพฝึกจะมาจากไหน สตาร์ตอัปด้านภาพถ่ายบางแห่งฝึกจากภาพต้นฉบับก็ยังเกิดโทนสีแบบนี้ และรับมือได้ยากมาตลอด
    • ตอนนี้ภาพที่ AI สร้างได้กลายเป็นส่วนหนึ่งของเว็บไปแล้ว ดังนั้นการทำ web scraping ทั่วไปจึงหลีกเลี่ยงภาพสร้างจาก AI ในชุดข้อมูลฝึกไม่ได้
  • ตัวอักษร ภาษาอาหรับ ในภาพปกพังอย่างเห็นได้ชัด แต่เวลาใช้งานโมเดลจริงกลับไม่เป็นแบบนั้น ภาพปกอาจไม่ได้สร้างด้วย Qwen Image 3.0 ก็ได้

    • นี่เป็นเกณฑ์ที่ดีสำหรับทดสอบโมเดลใหม่ ตอนลอง GPT Image 2 และ Nano Banana Pro ด้วยภาษาทมิฬและโองการอัลกุรอานภาษาอาหรับ มันสร้างได้ถูกต้อง ซึ่งอาจเป็นเพราะมีข้อมูลฝึกจำนวนมหาศาล
  • เขาบอกว่า “ต้องใช้ 3,700 โทเค็น เพื่อบรรยายกริด 3×3 ทั้งหมดได้อย่างแม่นยำ” แต่ไม่ได้เปิดเผยพรอมป์ต์ จึงทำให้เดโมไม่น่าเชื่อถือเท่าไร

  • ไม่มีการพูดถึงเลยว่า จะเปิดเผยเวตหรือไม่ และเมื่อไร เลยสงสัยว่ามีเขียนไว้ที่ไหนหรือเปล่า

    • เวตของ Qwen-Image-2.0 ก็ไม่เคยเปิดเผย ดังนั้นรอบนี้ก็ดูไม่น่าจะต่างกัน
    • ดูเหมือนหลังจาก Z-Image และ Qwen-Image รุ่นแรก พวกเขาจะเปลี่ยนไปเป็น โมเดลปิดทั้งหมด แล้ว ถ้าดูจากภาพที่ปล่อยออกมา Qwen-Image 3.0 ก็ดูเป็นแค่ทางเลือกที่ด้อยกว่าพวกโมเดล proprietary อย่าง gpt-image-2 หรือ nb-pro
    • เปิดไปก็มีแต่ Cursor, Azure, Amazon ที่จะเอาไปทำเงิน จึงไม่มีเหตุผลมากพอจะทำ เว้นแต่ OpenAI จะเปิดจริง โอกาสก็น้อยมาก
  • ให้โลโก้จริง 2 อัน, สเปก design language แบบสมบูรณ์, และภาพหน้าจอแอป 3 ภาพ แต่กลับได้ภาพห่วย ๆ มา 3 ภาพ และไม่มีอันไหนเหมือน โลโก้ต้นฉบับ ที่ให้ไปเลย

  • จากที่ลองบน chat.qwen.ai ทั้งองค์ประกอบภาพและความถูกต้องทางกายวิภาคยัง ไม่ถึงระดับ Qwen Image 1 เลย ได้ผลลัพธ์แบบมีขาสามข้างหรือตาเรืองแสง คุณภาพประมาณ Microsoft Lens ที่ถูกถอนไปแล้ว

  • ถ้ามีโมเดลแบบนี้ตอนเรียนมหาวิทยาลัยก็น่าจะดี ในฐานะคนที่เรียนรู้ด้วยภาพ น่าจะเข้าใจบางหัวข้อได้ง่ายกว่ามากผ่าน แผนภาพและภาพประกอบอธิบาย มากกว่าข้อความยาว ๆ

    • แต่แผนภาพที่สร้างออกมาก็เป็นแค่สิ่งเลียนแบบ ถ้าขอโปสเตอร์ที่อธิบายองค์ประกอบของอะตอมอย่างถูกต้อง มันก็จะออกมาเป็นลูกปิงปองสีแดง น้ำเงิน เทา วิ่งเป็นวงโคจร แทนที่จะสื่อเรื่องเมฆความน่าจะเป็น และถ้าโชคดีก็อาจได้แผนภาพเปลือกอิเล็กตรอน
      ลองขอ Nano Banana 2 ว่า “โปสเตอร์อินโฟกราฟิกสำหรับนักศึกษาปริญญาตรีที่อธิบายการทำงานของอะตอม” แล้ว มันสร้าง แบบจำลองโบร์ ที่เหมือนหนังสือเรียนวิทยาศาสตร์ระดับมัธยมต้นออกมา
    • ภรรยาของผมเอาสูตรอาหารทุกอย่างไปใส่ในตัวสร้างภาพของ ChatGPT แล้วทำเป็นหน้าสไตล์นิตยสาร ผลลัพธ์ดีมาก ตอนนี้กำลังทำ หนังสือสูตรอาหารของครอบครัว เพื่อให้ลูก ๆ รู้จักอาหารที่เคยกินตอนเด็ก
  • ยังมี ฟิลเตอร์เหลืองหม่น ติดอยู่ทั่วภาพเหมือนเดิม