2 คะแนน โดย GN⁺ 2 시간 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • เป็นโมเดลสำหรับใช้งานจริงที่ขยาย Kimi Linear ซึ่งเปิดตัวเมื่อปีที่แล้วจาก 48B เป็น 2.8T และปัจจุบันเป็นโมเดลแบบเปิดน้ำหนักที่มีขนาดใหญ่ที่สุด
  • LatentMoE ที่เพิ่งนำมาใช้ใหม่จะบีบอัดเลเยอร์เชิงเส้นขนาดใหญ่ด้วยการทำ down-projection และโครงสร้างโดยรวมจะแทนที่ MoE ทั่วไปและ attention ด้วยองค์ประกอบที่เน้นประสิทธิภาพในการอนุมาน
  • attention residuals เชื่อมต่อ residual ระหว่างเลเยอร์ด้วยค่าน้ำหนักตามคะแนน attention ทำให้ validation loss และประสิทธิภาพ downstream ดีขึ้นเล็กน้อยอย่างสม่ำเสมอ
  • attention residuals ทำให้ต้นทุนการเทรนเพิ่มขึ้นราว 4% และต้นทุนการอนุมานเพิ่มขึ้นราว 2% พร้อมทั้งถอดเลเยอร์ RoPE ทั้งหมดออกและใช้ NoPE กับทั้งโมเดล
  • เพิ่มการรองรับ มัลติโมดัล แบบเนทีฟ โดยมุ่งทั้งการขยาย Kimi Linear ไปสู่ขนาดใหญ่ การเพิ่มประสิทธิภาพการอนุมาน และการปรับปรุงเส้นทาง residual

ขยายจาก Kimi Linear เป็น 2.8T

  • Kimi K3 เป็นเวอร์ชันสำหรับใช้งานจริงของ Kimi Linear ที่ ขยายจาก 48B เป็น 2.8T และเป็นโมเดลแบบเปิดน้ำหนักที่มีขนาดใหญ่ที่สุดในปัจจุบัน
  • LatentMoE ที่เพิ่มเข้ามาใหม่เมื่อเทียบกับ Kimi Linear โดยพื้นฐานแล้วเหมือนกับแนวทางของ Nemotron 3 Ultra
    • เช่นเดียวกับ multi-head latent attention คือบีบอัดเลเยอร์เชิงเส้นขนาดใหญ่ด้วยการทำ down-projection
  • มุ่งเน้นที่ การปรับปรุงประสิทธิภาพการอนุมาน ตามกระแสที่เห็นใน Nemotron 3 และ DeepSeek V4 เป็นต้น
    • แทนที่ MoE ทั่วไปด้วย LatentMoE
    • ใช้ multi-head latent attention และ Kimi Delta Attention แทน attention ทั่วไป

เส้นทาง residual และข้อมูลตำแหน่ง

  • attention residuals เป็นองค์ประกอบสำหรับ ปรับปรุงเส้นทาง residual ไม่ใช่การเพิ่มประสิทธิภาพเชิงประสิทธิผล และถูกใช้ใน Kimi Linear อยู่แล้ว
    • ต่างจาก mHC (manifold-constrained Hyper-Connections) ของ DeepSeek V4 ที่ขยายเส้นทาง residual ให้กว้างขึ้น attention residuals จะเชื่อม residual ระหว่างเลเยอร์
    • ใช้ คะแนน attention ที่แสดงความสำคัญหรือการมีส่วนร่วมของ residual แต่ละตัวเป็นค่าน้ำหนักในการเชื่อมต่อ
    • ตามรายงานทางเทคนิค validation loss และประสิทธิภาพ downstream ดีขึ้นเล็กน้อยอย่างสม่ำเสมอ แต่ต้นทุนการเทรนเพิ่มขึ้นราว 4% และต้นทุนการอนุมานเพิ่มขึ้นราว 2%
  • ถอดเลเยอร์ RoPE ทั้งหมดออก และใช้ NoPE หรือ ไม่มี positional embedding กับทุกเลเยอร์
    • สถาปัตยกรรมอื่น ๆ ช่วงหลังมีแนวโน้มใช้ RoPE กับ local attention อย่าง sliding window attention และใช้ NoPE กับเลเยอร์แบบ global
    • มีสถาปัตยกรรมเดิมที่ใช้เฉพาะ NoPE อยู่แล้ว แต่เท่าที่ตรวจสอบได้ Kimi K3 เป็น โมเดลระดับ frontier รุ่นแรกที่นำแนวทางนี้มาใช้เต็มรูปแบบ

รองรับมัลติโมดัลแบบเนทีฟ

  • Kimi K3 ยังเพิ่มการรองรับ มัลติโมดัล แบบเนทีฟด้วย

1 ความคิดเห็น

 
GN⁺ 2 시간 전
ความเห็นจาก Hacker News
  • ต่างจากที่หัวหน้าสถาบันวิจัยฝั่งตะวันตกพยายามเหมารวมว่า Kimi เป็นแค่ ผลผลิตจากการโจมตีแบบ distillation แต่ในความเป็นจริงมันกำลังนำแนวทางใหม่และมีความเป็นต้นฉบับมาใช้

  • Sebastian Raschka เป็นทั้งนักวิจัยและนักเขียนด้านโมเดลภาษาขนาดใหญ่ที่ยอดเยี่ยม และขอแนะนำ Substack ของเขาอย่างมาก

    • ก่อนหน้านี้ไม่เคยรู้มาก่อน แต่ประทับใจที่เขา เข้าแก่นได้ทันทีและยังเขียนให้อ่านเข้าใจง่าย
    • ในวงการที่เต็มไปด้วยสรุปจาก AI แบบลวกๆ นี่เหมือนอัญมณีหายาก จนต้องเพิ่มไว้ใน RSS feed
  • มีการบอกว่า “ที่น่าสนใจคือ Kimi K3 เอา RoPE ออกทั้งหมด และใช้ NoPE (No Positional Embeddings) แทนในทุกส่วน”
    แค่ข้อเท็จจริงที่ว่าวิธีนี้ใช้ได้ก็น่าประหลาดใจแล้ว ถ้าไม่มีข้อมูลตำแหน่ง มันจะไม่กลายเป็นซุปของโทเค็นหรือ และ attention จะละเอียดพอให้โทเค็นตัวที่สองรู้ว่าตัวเองเป็นตัวที่สองได้ เพียงแค่เรียนรู้วิธีสะสมอะไรบางอย่างใน embedding space หรือไม่

    • ด้วย causal masking โมเดลสามารถเรียนรู้ positional embedding แบบแฝงได้ ความเชื่อที่ว่า Transformer block ไม่แปรตามการเรียงสับเปลี่ยนเป็นเรื่องที่ไม่จริง
    • สำหรับ causal Transformer แบบ decoder-only ไม่จำเป็นต้องมี positional embedding เสมอไป แต่สำหรับ โมเดลแบบไม่เป็นเชิงสาเหตุ อย่าง encoder ในงาน Transformer ต้นฉบับนั้นจำเป็นแน่นอน
      สัญชาตญาณเรื่องการสะสมก็เหมาะสมเช่นกัน ถ้า attention head บางส่วนยังคงเขียนค่าลงในบริเวณเดิมของ residual stream เมื่อโทเค็นอินพุตเพิ่มขึ้น ค่าเหล่านั้นก็จะสะสมผ่านการรวมของ attention และทำหน้าที่เป็น ดัชนี ชนิดหนึ่งได้โดยไม่ต้องมีการเข้ารหัสตำแหน่งแยกต่างหาก
    • ชั้นเชิงเส้นสามารถให้ตำแหน่งสัมพัทธ์ได้อย่างเป็นธรรมชาติผ่าน การลดทอน แบบ FIR filter จากนั้นชั้น attention แบบเต็มก็สามารถโฟกัสกับการเชื่อมโยงแนวคิดเข้าด้วยกันโดยไม่สนระยะห่าง
    • ใน โมเดล attention แบบไฮบริด แบบนี้ อย่างน้อยชั้น state space model (SSM) ก็น่าจะมี relative positional embedding ฝังอยู่แล้วผ่านโครงสร้างแบบ recurrent
  • การใช้ NoPE ทุกที่เป็นเรื่องน่าสนใจ โมเดลอื่นมักจะยังคงเก็บ RoPE ไว้ในชั้นโลคัล แต่ที่นี่ดูเหมือนว่าชั้น linear attention อย่าง Kimi Delta จะแอบรับหน้าที่จัดการเรื่องตำแหน่งอยู่เงียบๆ จึงตัดทิ้งได้ น่าสงสัยว่าจะยังใช้ได้เมื่อขยายไปถึงสเกลล้ำสมัยที่สุดหรือไม่

    • แม้ชื่อจะเป็น Kimi Delta Attention (KDA) แต่จริงๆ แล้วมันใกล้กับ RNN ที่ขนานการฝึกได้อย่างมีประสิทธิภาพมากกว่าจะเป็น attention ตามความหมายทั่วไป เป็นโครงสร้างที่ดัดแปลงเล็กน้อยจาก Gated DeltaNet ซึ่งเป็น RNN ที่มี hidden state ทำงานเหมือน editable attention memory ขนาดเล็ก
      เพราะมันคล้าย RNN จึงรับรู้ลำดับของ X, Y, Z ใน XYZ ได้โดยเนื้อแท้ ขณะที่ Transformer พื้นฐานประมวลผลชุดข้อมูลที่ไม่มีลำดับ จึงต้องบอกตำแหน่งระหว่างรายการแยกต่างหาก
      มี KDA 3 ชั้นต่อทุกชั้น attention และยังมีอีก 3 ชั้นก่อนชั้น attention จริงชั้นแรก ดังนั้นทุกโทเค็นจึงสามารถเรียนรู้ข้อมูลตำแหน่งของตัวเองได้ก่อนจะไปถึงชั้น attention จริงชั้นแรก
      RoPE ทำให้ข้อมูลบางส่วนเสียหาย ดังนั้นถ้าตัดออกได้แบบนี้ก็เป็นข้อได้เปรียบ Gemma-4 ก็มีโครงสร้าง 5:1 ที่คล้ายกัน โดยมี sliding window attention (SWA) 5 ชั้นต่อ global attention 1 ชั้น SWA มีราคาถูกกว่าและประสิทธิภาพต่ำกว่า แต่จัดการข้อมูลเฉพาะที่และคั่นระหว่างชั้น global ที่ทรงพลัง ส่วนในโมเดลนี้ KDA ทำหน้าที่แบบเดียวกัน
      ใน Gemma นั้น RoPE จำเป็นเฉพาะกับ SWA ซึ่งเป็น attention จริง และละได้ใน global attention ส่วน KDA ไม่ใช่ attention จึงไม่ต้องมี positional embedding
      ไม่แน่ใจว่าต้องใหญ่กว่านี้อีกแค่ไหนถึงจะเรียกว่าสเกลล้ำสมัยที่สุด แต่ก็ไม่มีเหตุผลว่าทำไมมันจะใช้ไม่ได้ในสเกลที่ใหญ่ขึ้น ยิ่งมีพารามิเตอร์มากขึ้น ชั้น KDA ก็ยิ่งส่งต่อข้อมูลตำแหน่งได้ง่ายขึ้น
    • Kimi K3 อยู่ในช่วงใกล้เคียงกับ Opus และ Fable ตาม benchmark จึงน่าสงสัยว่าสเกลที่ใหญ่กว่านี้จะยังถือว่าล้ำสมัยหรือไม่ ทั้งหมดอยู่ในช่วง 2–4 ล้านล้านพารามิเตอร์ และคาดว่าความต่างหลักอยู่ที่คุณภาพการฝึกกับสถาปัตยกรรม
    • ยังมีผลข้างเคียงที่ค่อนข้างแปลกอยู่ ผู้ให้บริการที่เคยลองใช้ไม่ได้เก็บ KV cache ไว้ถึงแค่พรอมป์ตอินพุตล่าสุด แต่ทำเป็น บล็อกเพิ่มคงที่ 1,024 โทเค็น แทน ผลคือในแต่ละการอนุมานจะมีโทเค็นอินพุตที่ cache miss เพิ่มเข้ามาได้สูงสุดถึง 1,023 โทเค็น