- การตั้งค่าการให้เหตุผลสูงสุดทำคะแนน AAII ได้ 50 คะแนน อยู่ในอันดับ 3 รองจาก Kimi K3 (max) และ GLM-5.2 (max)
- เป็นโมเดล MoE ที่มีพารามิเตอร์ทั้งหมด 284,000 ล้านตัว แต่ เปิดใช้งานเพียง 13,000 ล้านตัวต่อโทเคน รองรับอินพุต/เอาต์พุตแบบข้อความและคอนเท็กซ์ 1 ล้านโทเคน
- ราคา API คืออินพุต $0.14 ต่อ 1 ล้านโทเคน, เอาต์พุต $0.28, cache hit $0.003 และต้นทุนการประเมิน Intelligence Index ทั้งหมดอยู่ที่ $72.02
- ระหว่างการประเมินใช้โทเคนเอาต์พุต 210 ล้านโทเคน ซึ่งยืดยาวกว่าค่ามัธยฐานของโมเดลระดับเดียวกันที่ 100 ล้านโทเคนมาก และยังไม่มีการเปิดเผยความเร็วเอาต์พุต
- เปิดเผยน้ำหนักโมเดลและใช้ ไลเซนส์ MIT ทำให้โฮสต์เองและใช้งานเชิงพาณิชย์ได้ โดยปัจจุบันมีผู้ให้บริการ API 1 ราย
โครงสร้างโมเดลและรูปแบบการเผยแพร่
- DeepSeek V4 Flash 0731 เป็นโมเดลให้เหตุผลแบบ open weight ที่เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026
- มีพารามิเตอร์ทั้งหมด 284,000 ล้านตัว และใช้สถาปัตยกรรม Mixture of Experts(MoE) ที่เปิดใช้งาน 13,000 ล้านตัวต่อโทเคนระหว่างการอนุมาน
- สามารถดาวน์โหลด น้ำหนักโมเดล เพื่อนำไปโฮสต์เองได้
- ใช้ ไลเซนส์ MIT จึงอนุญาตให้ใช้งานเชิงพาณิชย์ได้
- เป็นเวอร์ชันให้เหตุผลที่ใช้ความพยายามในการให้เหตุผลสูงสุด (Max Effort) และอาจมีเวอร์ชันที่ไม่ใช่แบบให้เหตุผลแยกต่างหาก
การประเมินความฉลาด
- ทำคะแนนได้ 50 คะแนน ใน Artificial Analysis Intelligence Index v4.1
- อันดับ 3 รองจาก Kimi K3 (max), GLM-5.2 (max) ตามมาด้วย Kimi K3 (low), MiniMax-M3 ในอันดับ 4/5
- ค่ามัธยฐานของโมเดล open weight ขนาดใหญ่ระดับเดียวกันอยู่ที่ 25 คะแนน
- Artificial Analysis จัดให้โมเดลนี้อยู่ในกลุ่มโมเดลระดับแนวหน้าในด้านความฉลาด
- Intelligence Index v4.1 รวมการประเมิน 9 รายการต่อไปนี้
- GDPval-AA v2: งานจริงเชิงเอเจนต์
- 𝜏³-Banking: การใช้เครื่องมือเชิงเอเจนต์
- Terminal-Bench v2.1: การเขียนโค้ด/การใช้เทอร์มินัลเชิงเอเจนต์
- SciCode: การเขียนโค้ด
- Humanity's Last Exam: การให้เหตุผล/ความรู้
- GPQA Diamond: การให้เหตุผลทางวิทยาศาสตร์
- CritPt: การให้เหตุผลทางฟิสิกส์
- AA-Omniscience: ความถูกต้องของความรู้และการยับยั้ง hallucination
- AA-LCR: การให้เหตุผลในคอนเท็กซ์ยาว
ขอบเขตเบนช์มาร์กเพิ่มเติม
- มีผลการประเมินต่อไปนี้ให้ด้วย เพื่อเปรียบเทียบการใช้งานเฉพาะด้านของแต่ละโมเดล
- AA-Briefcase: งานความรู้เชิงเอเจนต์
- AutomationBench-AA: งานอัตโนมัติบน SaaS
- Harvey LAB-AA: งานเอเจนต์ด้านกฎหมาย
- EnterpriseOps-Gym-AA: งานปฏิบัติการองค์กร
- IFBench: การทำตามคำสั่ง
- APEX-Agents-AA: งานเอเจนต์ระยะยาว
- ITBench-AA: การวิเคราะห์สาเหตุความขัดข้องของ Kubernetes
- MMMU-Pro: การให้เหตุผลเชิงภาพ
- DeepSeek V4 Flash 0731 ไม่รองรับอินพุตภาพ จึงเป็นโมเดลเฉพาะข้อความ ไม่ใช่โมเดลมัลติโมดัล
ความน่าเชื่อถือของความรู้และการประเมิน hallucination
- AA-Omniscience Index ให้คะแนนคำตอบที่ถูกต้องและลงโทษ hallucination โดยไม่ลงโทษการปฏิเสธที่จะตอบ
- ช่วงคะแนนอยู่ตั้งแต่ -100 ถึง 100
- 0 คะแนนหมายถึงจำนวนคำตอบถูกและผิดเท่ากัน
- คะแนนติดลบหมายถึงมีคำตอบผิดมากกว่าคำตอบถูก
ปริมาณการใช้โทเคนและลักษณะการตอบสนอง
- ในการประเมิน Intelligence Index ทั้งหมด สร้าง โทเคนเอาต์พุต 210 ล้านโทเคน
- ค่ามัธยฐานของโมเดล open weight ระดับเดียวกันอยู่ที่ 100 ล้านโทเคน
- Artificial Analysis จัดว่าอยู่ในระดับที่ยืดยาวมาก
- จำนวนโทเคนเอาต์พุตต่อหนึ่งงานคำนวณโดยนำปริมาณเอาต์พุตของแต่ละเบนช์มาร์กมาถ่วงน้ำหนักตาม Intelligence Index แล้วหารด้วยจำนวนงานที่ไม่รวมการรันซ้ำ
- ยังไม่ได้วัดความเร็วเอาต์พุต จึงยังไม่มีการเปิดเผยจำนวนโทเคนเอาต์พุตต่อวินาที
ราคา API และต้นทุนการประเมิน
- ราคามาตรฐานของ DeepSeek API มีดังนี้
- อินพุต: $0.14 ต่อ 1 ล้านโทเคน
- เอาต์พุต: $0.28 ต่อ 1 ล้านโทเคน
- Cache hit: $0.003 ต่อ 1 ล้านโทเคน
- หากผสม cache hit/อินพุต/เอาต์พุตในสัดส่วน 7:2:1 ราคาต่อ 1 ล้านโทเคนจะอยู่ที่ $0.06
- ต้นทุนการประเมิน Intelligence Index ทั้งหมดอยู่ที่ $72.02
- ส่วนสรุปแสดงค่ามัธยฐานของโมเดลเปรียบเทียบเป็นอินพุต $0.43/เอาต์พุต $1.20 และส่วน FAQ แสดงเป็นอินพุต $0.58/เอาต์พุต $2.20
- ต้นทุนต่อหนึ่งงานคำนวณโดยนำต้นทุนโทเคนของอินพุต, cache hit, การเขียนแคช, การให้เหตุผล และคำตอบสุดท้ายมาหารด้วยจำนวนงาน จากนั้นถ่วงน้ำหนักตาม Index ของแต่ละเบนช์มาร์ก
- ค่าเขียนแคชและค่าจัดเก็บอาจถูกเรียกเก็บแยกต่างหากตามผู้ให้บริการ API
คอนเท็กซ์และขอบเขตการให้บริการ
- หน้าต่างคอนเท็กซ์อยู่ที่ 1 ล้านโทเคน เทียบได้กับประมาณ 1,500 หน้า A4 ที่ใช้ Arial ขนาด 12 พอยต์
- สามารถใช้กับเวิร์กโฟลว์ RAG ที่ต้องการค้นหาและให้เหตุผลบนเอกสารขนาดใหญ่
- รองรับเฉพาะอินพุตข้อความและเอาต์พุตข้อความ
- ปัจจุบันมีผู้ให้บริการ API 1 ราย และราคาอาจแตกต่างกันไปตามผู้ให้บริการ
1 ความคิดเห็น
ความคิดเห็นบน Hacker News
น้ำหนักโมเดลเพิ่งถูกเปิดเผย: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-serverได้ โดยใส่ให้เต็มที่สุดบน GPU 32GB·48GB·96GB แล้ววางส่วนที่เหลือไว้ใน system DRAMhttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
โมเดล DeepSeek ใหม่เหมือนของขวัญคริสต์มาส โมเดล API ราคาถูก DeepSeek ทำได้ดีที่สุด และจนกว่าราคา VRAM จะลงมาจนรันในเครื่องได้ วิธีนี้ก็น่าจะดีที่สุด
โมเดลสมัครสมาชิกที่พึ่งเงินอุดหนุนคงอยู่ได้ไม่นาน ส่วนการคิดเงินผ่าน API ดูใกล้เคียงกับโมเดลธุรกิจที่ยั่งยืนกว่า
ที่อยู่เดิมเป็น 404 และ URL ที่ถูกต้องน่าจะเป็น: https://artificialanalysis.ai/models/deepseek-v4-flash
ได้เพิ่มจุดข้อมูล DeepSeek V4 Flash 0731 ลงในกราฟ OpenAI ที่เผยแพร่เมื่อวาน และมันอยู่บนขอบเขตด้านราคา·ประสิทธิภาพ
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
ต้นฉบับ: https://openai.com/index/advancing-the-price-performance-fro...
เห็นว่าในงานเอเจนต์เขียนโค้ดของ benchmark สาธารณะ ใช้ โหมดขั้นต่ำของ DeepSeek Harness ที่ยังไม่เปิดตัว เลยสงสัยว่าจะประกาศ harness สำหรับเอเจนต์เขียนโค้ดที่ปรับแต่งแล้วด้วยหรือไม่
ถ้าใช้ DSv4 Flash ร่วมกับ reasonix หรือ pi ก็เขียนโค้ดได้ทั้งวันในราคาไม่กี่เซนต์โดยไม่ต้องกังวลเรื่องโทเค็น ในทางกลับกัน ถ้าใช้โมเดลเดียวกันบน Fireworks หรือ OpenRouter พร้อม ZDR ค่าใช้จ่ายจะเพิ่มขึ้นเรื่อย ๆ แบบไม่มีเหตุผล ดูเหมือนจะอุดหนุนราคาเพื่อเก็บข้อมูลการใช้งาน และกำลังรอวันที่จะรันในเครื่องได้
temperature = 1.0,top_p = 0.95และจะเผยแพร่ harness ในภายหลังสำหรับผู้ใช้ RTX PRO 6000 96GB หนึ่งใบหรือ DGX Spark 128GB เอนจิน vllm-moet ที่ไม่ค่อยเป็นที่รู้จักนั้นดีมาก มันสร้างระนาบ 2 บิตแบบสมมาตรสำหรับ inference โดยอัตโนมัติ และสร้างแคชเดลตา 4 บิตเพื่อกู้คืนความแม่นยำ พร้อมรองรับการสตรีม weights จาก SSD ที่ใหญ่กว่า RAM
สามารถกำหนด VRAM ที่จัดสรรให้แต่ละส่วนเพื่อปรับสมดุลระหว่างความเร็วกับความแม่นยำได้ และมีการสาธิต 170 โทเค็นต่อวินาที บน DS V4 Flash โดยใช้โมเดลต้นฉบับตามเดิม ไม่ต้องมีโมเดลที่แปลงแยกต่างหาก
บน DGX Spark ต้องมี workaround เล็ก ๆ เพื่อมองข้ามความต่างระหว่าง
sm120กับsm121แต่ก็รันบนsm121ได้ จึงคุ้มค่าที่จะลองลงทุนเวลาสักสองสามชั่วโมงให้ระดับความฉลาดเทียบชั้น GLM 5.2·Gemini 3.6 ในราคา 0.28 ดอลลาร์ต่อ output 1 ล้านโทเค็น และโมเดล Pro ที่อัปเดตก็กำลังจะออกเร็ว ๆ นี้
Unsloth lossless Q8 มีขนาด 162GB จึงเป็นขนาดที่พอจะรันที่บ้านได้จริง
ถ้า DeepSeek V4 Flash เหนือกว่า V4 Pro ก็สงสัยว่าในอีกไม่กี่สัปดาห์จะคาดหวัง V4 Pro ระดับ Opus 5 ได้ไหม ถ้าเหนือกว่า Opus ได้ยิ่งดี
https://trysojourn.app
ส่วนที่น่าสนใจจริง ๆ คือการได้ประสิทธิภาพเพิ่มขึ้นมากจากเพียงการ fine-tuning เพิ่มเติม โดยไม่เปลี่ยนสถาปัตยกรรม เป็นผลจากการใส่ข้อมูล การประมวลผล และเวลามากขึ้น
DS V4 Flash ค่อนข้างเล็กเมื่อเทียบกับตระกูลโมเดลคู่แข่ง ดังนั้นถ้านำข้อมูลคุณภาพสูงและ pipeline การเทรนไปใช้กับโมเดลขนาดเล็กอื่น ๆ ก็น่าจะมีโอกาสได้การปรับปรุงคล้ายกันสูง
ในราคาต่องาน นำ Luna ไปแล้วราว 2 เท่า: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
ดังนั้นการมองว่า Luna แพงกว่า DeepSeek Flash 2–3 เท่า แต่ความเร็ว inference เร็วกว่า 2–5 เท่า น่าจะยุติธรรมกว่า โมเดล OpenAI ที่ถูกที่สุดที่เหนือกว่า DeepSeek คือ Luna reasoning สูงสุด ซึ่งประสิทธิภาพใกล้เคียงกันและแพงกว่าราว 3 เท่าก่อนปัดเศษ แต่ความเร็วก็มากกว่าเกือบ 3 เท่าเช่นกัน
การที่ Artificial Analysis ใช้สีน้ำเงินเข้มกับทั้ง DeepSeek และ OpenAI เป็นการเลือกสีที่ไม่เหมาะอย่างยิ่ง โดยเฉพาะในวันแบบวันนี้