1 คะแนน โดย GN⁺ 2 시간 전 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • การตั้งค่าการให้เหตุผลสูงสุดทำคะแนน AAII ได้ 50 คะแนน อยู่ในอันดับ 3 รองจาก Kimi K3 (max) และ GLM-5.2 (max)
  • เป็นโมเดล MoE ที่มีพารามิเตอร์ทั้งหมด 284,000 ล้านตัว แต่ เปิดใช้งานเพียง 13,000 ล้านตัวต่อโทเคน รองรับอินพุต/เอาต์พุตแบบข้อความและคอนเท็กซ์ 1 ล้านโทเคน
  • ราคา API คืออินพุต $0.14 ต่อ 1 ล้านโทเคน, เอาต์พุต $0.28, cache hit $0.003 และต้นทุนการประเมิน Intelligence Index ทั้งหมดอยู่ที่ $72.02
  • ระหว่างการประเมินใช้โทเคนเอาต์พุต 210 ล้านโทเคน ซึ่งยืดยาวกว่าค่ามัธยฐานของโมเดลระดับเดียวกันที่ 100 ล้านโทเคนมาก และยังไม่มีการเปิดเผยความเร็วเอาต์พุต
  • เปิดเผยน้ำหนักโมเดลและใช้ ไลเซนส์ MIT ทำให้โฮสต์เองและใช้งานเชิงพาณิชย์ได้ โดยปัจจุบันมีผู้ให้บริการ API 1 ราย

โครงสร้างโมเดลและรูปแบบการเผยแพร่

  • DeepSeek V4 Flash 0731 เป็นโมเดลให้เหตุผลแบบ open weight ที่เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026
  • มีพารามิเตอร์ทั้งหมด 284,000 ล้านตัว และใช้สถาปัตยกรรม Mixture of Experts(MoE) ที่เปิดใช้งาน 13,000 ล้านตัวต่อโทเคนระหว่างการอนุมาน
  • สามารถดาวน์โหลด น้ำหนักโมเดล เพื่อนำไปโฮสต์เองได้
  • ใช้ ไลเซนส์ MIT จึงอนุญาตให้ใช้งานเชิงพาณิชย์ได้
  • เป็นเวอร์ชันให้เหตุผลที่ใช้ความพยายามในการให้เหตุผลสูงสุด (Max Effort) และอาจมีเวอร์ชันที่ไม่ใช่แบบให้เหตุผลแยกต่างหาก

การประเมินความฉลาด

  • ทำคะแนนได้ 50 คะแนน ใน Artificial Analysis Intelligence Index v4.1
    • อันดับ 3 รองจาก Kimi K3 (max), GLM-5.2 (max) ตามมาด้วย Kimi K3 (low), MiniMax-M3 ในอันดับ 4/5
    • ค่ามัธยฐานของโมเดล open weight ขนาดใหญ่ระดับเดียวกันอยู่ที่ 25 คะแนน
    • Artificial Analysis จัดให้โมเดลนี้อยู่ในกลุ่มโมเดลระดับแนวหน้าในด้านความฉลาด
  • Intelligence Index v4.1 รวมการประเมิน 9 รายการต่อไปนี้
    • GDPval-AA v2: งานจริงเชิงเอเจนต์
    • 𝜏³-Banking: การใช้เครื่องมือเชิงเอเจนต์
    • Terminal-Bench v2.1: การเขียนโค้ด/การใช้เทอร์มินัลเชิงเอเจนต์
    • SciCode: การเขียนโค้ด
    • Humanity's Last Exam: การให้เหตุผล/ความรู้
    • GPQA Diamond: การให้เหตุผลทางวิทยาศาสตร์
    • CritPt: การให้เหตุผลทางฟิสิกส์
    • AA-Omniscience: ความถูกต้องของความรู้และการยับยั้ง hallucination
    • AA-LCR: การให้เหตุผลในคอนเท็กซ์ยาว

ขอบเขตเบนช์มาร์กเพิ่มเติม

  • มีผลการประเมินต่อไปนี้ให้ด้วย เพื่อเปรียบเทียบการใช้งานเฉพาะด้านของแต่ละโมเดล
    • AA-Briefcase: งานความรู้เชิงเอเจนต์
    • AutomationBench-AA: งานอัตโนมัติบน SaaS
    • Harvey LAB-AA: งานเอเจนต์ด้านกฎหมาย
    • EnterpriseOps-Gym-AA: งานปฏิบัติการองค์กร
    • IFBench: การทำตามคำสั่ง
    • APEX-Agents-AA: งานเอเจนต์ระยะยาว
    • ITBench-AA: การวิเคราะห์สาเหตุความขัดข้องของ Kubernetes
    • MMMU-Pro: การให้เหตุผลเชิงภาพ
  • DeepSeek V4 Flash 0731 ไม่รองรับอินพุตภาพ จึงเป็นโมเดลเฉพาะข้อความ ไม่ใช่โมเดลมัลติโมดัล

ความน่าเชื่อถือของความรู้และการประเมิน hallucination

  • AA-Omniscience Index ให้คะแนนคำตอบที่ถูกต้องและลงโทษ hallucination โดยไม่ลงโทษการปฏิเสธที่จะตอบ
  • ช่วงคะแนนอยู่ตั้งแต่ -100 ถึง 100
    • 0 คะแนนหมายถึงจำนวนคำตอบถูกและผิดเท่ากัน
    • คะแนนติดลบหมายถึงมีคำตอบผิดมากกว่าคำตอบถูก

ปริมาณการใช้โทเคนและลักษณะการตอบสนอง

  • ในการประเมิน Intelligence Index ทั้งหมด สร้าง โทเคนเอาต์พุต 210 ล้านโทเคน
    • ค่ามัธยฐานของโมเดล open weight ระดับเดียวกันอยู่ที่ 100 ล้านโทเคน
    • Artificial Analysis จัดว่าอยู่ในระดับที่ยืดยาวมาก
  • จำนวนโทเคนเอาต์พุตต่อหนึ่งงานคำนวณโดยนำปริมาณเอาต์พุตของแต่ละเบนช์มาร์กมาถ่วงน้ำหนักตาม Intelligence Index แล้วหารด้วยจำนวนงานที่ไม่รวมการรันซ้ำ
  • ยังไม่ได้วัดความเร็วเอาต์พุต จึงยังไม่มีการเปิดเผยจำนวนโทเคนเอาต์พุตต่อวินาที

ราคา API และต้นทุนการประเมิน

  • ราคามาตรฐานของ DeepSeek API มีดังนี้
    • อินพุต: $0.14 ต่อ 1 ล้านโทเคน
    • เอาต์พุต: $0.28 ต่อ 1 ล้านโทเคน
    • Cache hit: $0.003 ต่อ 1 ล้านโทเคน
  • หากผสม cache hit/อินพุต/เอาต์พุตในสัดส่วน 7:2:1 ราคาต่อ 1 ล้านโทเคนจะอยู่ที่ $0.06
  • ต้นทุนการประเมิน Intelligence Index ทั้งหมดอยู่ที่ $72.02
  • ส่วนสรุปแสดงค่ามัธยฐานของโมเดลเปรียบเทียบเป็นอินพุต $0.43/เอาต์พุต $1.20 และส่วน FAQ แสดงเป็นอินพุต $0.58/เอาต์พุต $2.20
  • ต้นทุนต่อหนึ่งงานคำนวณโดยนำต้นทุนโทเคนของอินพุต, cache hit, การเขียนแคช, การให้เหตุผล และคำตอบสุดท้ายมาหารด้วยจำนวนงาน จากนั้นถ่วงน้ำหนักตาม Index ของแต่ละเบนช์มาร์ก
  • ค่าเขียนแคชและค่าจัดเก็บอาจถูกเรียกเก็บแยกต่างหากตามผู้ให้บริการ API

คอนเท็กซ์และขอบเขตการให้บริการ

  • หน้าต่างคอนเท็กซ์อยู่ที่ 1 ล้านโทเคน เทียบได้กับประมาณ 1,500 หน้า A4 ที่ใช้ Arial ขนาด 12 พอยต์
  • สามารถใช้กับเวิร์กโฟลว์ RAG ที่ต้องการค้นหาและให้เหตุผลบนเอกสารขนาดใหญ่
  • รองรับเฉพาะอินพุตข้อความและเอาต์พุตข้อความ
  • ปัจจุบันมีผู้ให้บริการ API 1 ราย และราคาอาจแตกต่างกันไปตามผู้ให้บริการ

1 ความคิดเห็น

 
GN⁺ 2 시간 전
ความคิดเห็นบน Hacker News
  • น้ำหนักโมเดลเพิ่งถูกเปิดเผย: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • คาดหวังเวอร์ชัน quantization ของ DwarfStar อยู่ เคยใช้ตัวพรีวิว DeepSeek V4 Flash บน MacBook Pro 128GB เป็นเอเจนต์เขียนโค้ดหลักมาหลายเดือน และดูเหมือนจะเหนือกว่า GLM 5.2 แทบทุกตัวชี้วัด
    • เล็งไปที่ตัวเร่งฮาร์ดแวร์ที่มี primitive การคูณเมทริกซ์ 128×128 เลยสงสัยว่าหมายถึง Warp Group Matrix Multiply Accumulate ของ H100 หรือไม่
    • ถ้าเป็น Unsloth GGUF ต่ำกว่า 165GB ก็รันได้บนระบบ CPU-only ส่วนใหญ่ที่มี RAM 256GB และยังทำคอนฟิกแบบผสมด้วย llama-server ได้ โดยใส่ให้เต็มที่สุดบน GPU 32GB·48GB·96GB แล้ววางส่วนที่เหลือไว้ใน system DRAM
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • โมเดล DeepSeek ใหม่เหมือนของขวัญคริสต์มาส โมเดล API ราคาถูก DeepSeek ทำได้ดีที่สุด และจนกว่าราคา VRAM จะลงมาจนรันในเครื่องได้ วิธีนี้ก็น่าจะดีที่สุด
    โมเดลสมัครสมาชิกที่พึ่งเงินอุดหนุนคงอยู่ได้ไม่นาน ส่วนการคิดเงินผ่าน API ดูใกล้เคียงกับโมเดลธุรกิจที่ยั่งยืนกว่า

    • ผมใช้ DeepSeek กับโปรเจกต์หนึ่ง และทึ่งมากที่ใช้ โทเค็นหลักสิบล้านได้ในราคาไม่กี่เซนต์ มันไม่เหมาะกับทุกงาน แต่สำหรับงานบางประเภทก็ทำได้ยอดเยี่ยมในต้นทุนที่แทบจะเหมือนฟรี
    • ตั้งตารอวันที่จีนไล่ทันด้านหน่วยความจำและฮาร์ดแวร์ประมวลผล จนสามารถเอาชนะบริษัทสหรัฐฯ ได้ ทั้งด้านราคาและประสิทธิภาพ
    • เพื่อนนักพัฒนาบ่นว่าใช้โทเค็น Claude หมดในหนึ่งชั่วโมง แต่ผมใช้ DS Flash ได้ทั้งวัน ถ้ามันพลาดเป็นครั้งคราว ค่อยหยิบโมเดลอย่าง Claude มาใช้เฉพาะงานยาก ๆ ก็พอ
    • แม้คิดเป็นต่อโทเค็น DeepSeek API ก็มีแนวโน้มคุ้มค่ากว่าการสมัครสมาชิก จากที่ลองเอง Flash ทำตามคำสั่งได้ดีขึ้นมากและเชิงรุกขึ้น ตอนนี้แทบไม่มีโมเดลไหนเทียบได้ในด้านความคุ้มค่าต่อราคา
    • ถ้าดูราคาโดยตรง เพื่อให้ได้ผลลัพธ์แบบเดียวกับ GPT 5.6 Luna ต้องใช้โทเค็นมากกว่า 5 เท่า และจำนวนโทเค็นต่อวินาทีก็ต่ำกว่ามาก ถึงอย่างนั้นก็ชัดเจนว่าแรงกดดันจาก DeepSeek ทำให้ผู้ให้บริการเดิมต้องปรับแต่งต่อไป
  • ที่อยู่เดิมเป็น 404 และ URL ที่ถูกต้องน่าจะเป็น: https://artificialanalysis.ai/models/deepseek-v4-flash

  • ได้เพิ่มจุดข้อมูล DeepSeek V4 Flash 0731 ลงในกราฟ OpenAI ที่เผยแพร่เมื่อวาน และมันอยู่บนขอบเขตด้านราคา·ประสิทธิภาพ
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    ต้นฉบับ: https://openai.com/index/advancing-the-price-performance-fro...

  • เห็นว่าในงานเอเจนต์เขียนโค้ดของ benchmark สาธารณะ ใช้ โหมดขั้นต่ำของ DeepSeek Harness ที่ยังไม่เปิดตัว เลยสงสัยว่าจะประกาศ harness สำหรับเอเจนต์เขียนโค้ดที่ปรับแต่งแล้วด้วยหรือไม่
    ถ้าใช้ DSv4 Flash ร่วมกับ reasonix หรือ pi ก็เขียนโค้ดได้ทั้งวันในราคาไม่กี่เซนต์โดยไม่ต้องกังวลเรื่องโทเค็น ในทางกลับกัน ถ้าใช้โมเดลเดียวกันบน Fireworks หรือ OpenRouter พร้อม ZDR ค่าใช้จ่ายจะเพิ่มขึ้นเรื่อย ๆ แบบไม่มีเหตุผล ดูเหมือนจะอุดหนุนราคาเพื่อเก็บข้อมูลการใช้งาน และกำลังรอวันที่จะรันในเครื่องได้

    • ถ้าไม่ผ่าน OpenRouter ก็สงสัยว่าซื้อจากผู้ให้บริการรายไหน ผมเข้าใจว่าถ้าเป็นผู้ให้บริการที่อยู่ใน OpenRouter ราคาเมื่อซื้อโดยตรงจะเท่ากัน
    • ในรายงานเทคนิคได้เกริ่นถึง DeepSeek Harness ไว้แล้ว งานเอเจนต์เขียนโค้ดถูกประเมินด้วยโหมดขั้นต่ำ, ความพยายามในการให้เหตุผลระดับสูงสุด, temperature = 1.0, top_p = 0.95 และจะเผยแพร่ harness ในภายหลัง
  • สำหรับผู้ใช้ RTX PRO 6000 96GB หนึ่งใบหรือ DGX Spark 128GB เอนจิน vllm-moet ที่ไม่ค่อยเป็นที่รู้จักนั้นดีมาก มันสร้างระนาบ 2 บิตแบบสมมาตรสำหรับ inference โดยอัตโนมัติ และสร้างแคชเดลตา 4 บิตเพื่อกู้คืนความแม่นยำ พร้อมรองรับการสตรีม weights จาก SSD ที่ใหญ่กว่า RAM
    สามารถกำหนด VRAM ที่จัดสรรให้แต่ละส่วนเพื่อปรับสมดุลระหว่างความเร็วกับความแม่นยำได้ และมีการสาธิต 170 โทเค็นต่อวินาที บน DS V4 Flash โดยใช้โมเดลต้นฉบับตามเดิม ไม่ต้องมีโมเดลที่แปลงแยกต่างหาก
    บน DGX Spark ต้องมี workaround เล็ก ๆ เพื่อมองข้ามความต่างระหว่าง sm120 กับ sm121 แต่ก็รันบน sm121 ได้ จึงคุ้มค่าที่จะลองลงทุนเวลาสักสองสามชั่วโมง

  • ให้ระดับความฉลาดเทียบชั้น GLM 5.2·Gemini 3.6 ในราคา 0.28 ดอลลาร์ต่อ output 1 ล้านโทเค็น และโมเดล Pro ที่อัปเดตก็กำลังจะออกเร็ว ๆ นี้
    Unsloth lossless Q8 มีขนาด 162GB จึงเป็นขนาดที่พอจะรันที่บ้านได้จริง

    • ถ้ารันของระดับนั้นที่บ้านได้ อยากเห็นว่าบ้านแบบไหน
    • ขนาด Q8 อยู่ราว 151GB
  • ถ้า DeepSeek V4 Flash เหนือกว่า V4 Pro ก็สงสัยว่าในอีกไม่กี่สัปดาห์จะคาดหวัง V4 Pro ระดับ Opus 5 ได้ไหม ถ้าเหนือกว่า Opus ได้ยิ่งดี

    • ผมใช้ V4 Flash กับแอปที่กำลังทำอยู่ หลังจากใช้แต่ GPT·Opus·Sonnet แล้วเปลี่ยนมาใช้ตัวนี้ ความคุ้มค่าต่อราคาและประสิทธิภาพน่าทึ่งมาก ด้วยต้นทุนที่ต่ำมาก จึงสามารถให้ free tier ที่ค่อนข้าง generous กับแอปที่ไม่ได้ทำเพื่อกำไรได้ด้วย
      https://trysojourn.app
    • ถ้าได้ ประสิทธิภาพ Opus 5 ในราคา V4 Pro ก็คงยอดเยี่ยมจนแทบไม่น่าเชื่อ แต่อาจใกล้เคียงกับความฝันมากกว่า
    • เคยบอกไว้ว่า V4 Pro เวอร์ชันสุดท้ายที่อัปเดตแล้ว จะเปิดตัวในเร็ว ๆ นี้
  • ส่วนที่น่าสนใจจริง ๆ คือการได้ประสิทธิภาพเพิ่มขึ้นมากจากเพียงการ fine-tuning เพิ่มเติม โดยไม่เปลี่ยนสถาปัตยกรรม เป็นผลจากการใส่ข้อมูล การประมวลผล และเวลามากขึ้น
    DS V4 Flash ค่อนข้างเล็กเมื่อเทียบกับตระกูลโมเดลคู่แข่ง ดังนั้นถ้านำข้อมูลคุณภาพสูงและ pipeline การเทรนไปใช้กับโมเดลขนาดเล็กอื่น ๆ ก็น่าจะมีโอกาสได้การปรับปรุงคล้ายกันสูง

  • ในราคาต่องาน นำ Luna ไปแล้วราว 2 เท่า: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • อยากเห็นด้วยว่าเมื่อเทียบกับ Luna ในงานเฉพาะแต่ละประเภทเป็นอย่างไร
    • เนื่องจากแกน X คือค่าใช้จ่าย พูดให้แม่นคือ DeepSeek V4 Flash 0731 ที่ inference สูงสุดมีค่าใช้จ่ายต่องานราว 0.03 ดอลลาร์ และดัชนี 50 ส่วน OpenAI Luna ที่ reasoning สูงมีค่าใช้จ่าย 0.03 ดอลลาร์·ดัชนี 46, reasoning สูงมาก 0.04 ดอลลาร์·ดัชนี 49, และ reasoning สูงสุด 0.07 ดอลลาร์·ดัชนี 51
      ดังนั้นการมองว่า Luna แพงกว่า DeepSeek Flash 2–3 เท่า แต่ความเร็ว inference เร็วกว่า 2–5 เท่า น่าจะยุติธรรมกว่า โมเดล OpenAI ที่ถูกที่สุดที่เหนือกว่า DeepSeek คือ Luna reasoning สูงสุด ซึ่งประสิทธิภาพใกล้เคียงกันและแพงกว่าราว 3 เท่าก่อนปัดเศษ แต่ความเร็วก็มากกว่าเกือบ 3 เท่าเช่นกัน
      การที่ Artificial Analysis ใช้สีน้ำเงินเข้มกับทั้ง DeepSeek และ OpenAI เป็นการเลือกสีที่ไม่เหมาะอย่างยิ่ง โดยเฉพาะในวันแบบวันนี้