ai models

การพุ่งทะยานสามสัปดาห์ของโมเดลเปิดน้ำหนักจากจีน: Kimi K3, Qwen3.8-Max และจุดพลิกที่อาจยุติทุกอย่าง

ภายในสามสัปดาห์ ห้องแล็บ AI รายใหญ่ที่สุดของจีนปล่อยหรือเปรยถึงโมเดลเปิดน้ำหนักระดับแนวหน้า — Kimi K3, Qwen3.8-Max และ DeepSeek V4 ที่พร้อมใช้งานทั่วไป บทวิเคราะห์อย่างตรงไปตรงมา: อะไรออกมาจริง อะไรยังเป็นเพียงคำสัญญา และเหตุใดปักกิ่งอาจจำกัดคลื่นลูกที่ตนเองก่อขึ้น

T
Telli.sh Team
#open-llm#kimi-k3#qwen#deepseek#open-weight#china-ai#ai-models#meeting-notes

ระหว่างวันที่ 16 ถึง 26 กรกฎาคม ห้องแล็บ AI รายใหญ่ที่สุดของจีนสามแห่งนำโมเดลเปิดระดับแนวหน้าออกมาวางบนโต๊ะ Moonshot AI ประกาศ Kimi K3 เมื่อวันที่ 16 กรกฎาคม และปล่อยน้ำหนักในวันที่ 26 กรกฎาคม Alibaba เปิดตัว Qwen3.8-Max เมื่อวันที่ 19 กรกฎาคมในงาน WAIC ที่เซี่ยงไฮ้ ส่วนสายผลิตภัณฑ์ V4 ของ DeepSeek ก้าวสู่การพร้อมใช้งานทั่วไป (GA) ราววันที่ 20 กรกฎาคม สามห้องแล็บ ราวสามสัปดาห์

รูปแบบนี้ยากจะมองข้าม และมันไม่ใช่รูปแบบที่วงการโมเดลเปิดของจีนใช้สร้างชื่อเสียงมา ห้องแล็บเหล่านี้เคยขึ้นชื่อเรื่องโมเดลที่เล็ก เร็ว ถูก แต่ต่อยเหนือรุ่นน้ำหนักของตัวเอง คลื่นลูกนี้คือการเดิมพันในทางตรงข้าม: ระบบระดับล้านล้านพารามิเตอร์ที่ปล่อยออกมาหรือรับปากว่าจะปล่อยในรูปแบบน้ำหนักเปิด

นี่คือบทวิเคราะห์อย่างตรงไปตรงมาต่อคลื่นลูกนั้น: อะไรออกมาจริง อะไรยังเป็นเพียงตัวอย่างหรือคำสัญญา และจุดพลิกที่มาพร้อมกัน — รัฐบาลชุดเดียวกันที่ทำให้การปล่อยเหล่านี้เป็นไปได้ กำลังชั่งใจว่าจะจำกัดมันหรือไม่ หากคุณอ่านบทสรุปเดือนกรกฎาคมของเราแล้ว นี่คือภาคต่อ และปมที่ค้างไว้ปมหนึ่งได้คลี่คลายลงแล้ว

แถวตู้แร็คในศูนย์ซูเปอร์คอมพิวเตอร์ขนาดใหญ่

Image: OLCF at ORNL, Wikimedia Commons, CC BY 2.0.

สิ่งที่ออกมาจริงคือ Kimi K3

ตอนที่เราเขียนถึง Kimi K3 ในเดือนกรกฎาคม น้ำหนักยังเป็นเพียงคำสัญญา — Moonshot AI เคยบอกว่า "ภายในวันที่ 27 กรกฎาคม" มันมาถึงในวันที่ 26 กรกฎาคม: 1.56 เทราไบต์ แบ่งเป็น 96 ชาร์ดบน Hugging Face ภายใต้ moonshotai/Kimi-K3 นี่แหละคือข่าว การประกาศคือข่าวประชาสัมพันธ์ แต่น้ำหนักที่ดาวน์โหลดได้คือข้อเท็จจริงที่คุณสร้างต่อยอดได้

สถาปัตยกรรมคือโมเดล mixture-of-experts ขนาดใหญ่ — 2.8 ล้านล้านพารามิเตอร์รวม ราว 104 พันล้านพารามิเตอร์ที่ทำงานต่อโทเคน โดยกำหนดเส้นทางราว 16 จาก 896 ผู้เชี่ยวชาญผ่านกลไกที่ Moonshot เรียกว่า Kimi Delta Attention มีหน้าต่างบริบทหนึ่งล้านโทเคน และมีรายงานว่าประสิทธิภาพการสเกลเพิ่มขึ้นราว 2.5 เท่าเมื่อเทียบกับ K2 ในการจัดอันดับอิสระของ Artificial Analysis มันอยู่อันดับ 4 จาก 189 โมเดล — ตามหลัง Claude Fable 5 และคอนฟิก GPT-5.6 "Sol" สองแบบ แต่นำหน้า Opus 4.8 และ GPT-5.5 สำหรับโมเดลเปิดที่ดาวน์โหลดได้ การได้อยู่ในกลุ่มนั้นก็คือเรื่องราวในตัวมันเองแล้ว

อ่านสัญญาอนุญาตก่อนวางแผนธุรกิจรอบตัวมัน Kimi K3 ไม่ใช่ MIT มันปล่อยภายใต้สัญญาอนุญาตของตัวเองที่ชื่อ "Kimi K3 License" ซึ่งไม่ได้รับการรับรองจาก OSI และมีข้อกำหนดเรื่องเกณฑ์รายได้: หากจะรัน K3 เป็นเครื่องยนต์ของธุรกิจ Model-as-a-Service ขนาดใหญ่ คุณต้องมีข้อตกลงแยกต่างหากกับ Moonshot สำหรับทีมส่วนใหญ่นั่นไม่เปลี่ยนอะไร แต่สำหรับใครก็ตามที่สร้างผลิตภัณฑ์แบบโฮสต์ในระดับใหญ่ "น้ำหนักเปิด" กับ "สัญญาอนุญาตเปิด" คือสองคำถามที่ต่างกัน — และในที่นี้มีเพียงข้อแรกเท่านั้นที่เป็น "ใช่" อย่างชัดเจน

Qwen3.8-Max เป็นตัวอย่าง ไม่ใช่ของที่ดาวน์โหลดได้

Qwen3.8-Max ของ Alibaba คือพาดหัวที่ใหญ่ที่สุดของคลื่นลูกนี้ และนุ่มที่สุดด้วย เปิดตัวเมื่อวันที่ 19 กรกฎาคมในงาน WAIC มันคือ MoE แบบเบาบางขนาด 2.4 ล้านล้านพารามิเตอร์ — ไม่เปิดเผยจำนวนพารามิเตอร์ที่ทำงาน — และเป็น Qwen ตัวแรกที่เกินหนึ่งล้านล้านพารามิเตอร์ซึ่งเป็นมัลติโมดัล รองรับข้อความ ภาพ วิดีโอ และเอกสาร และในตอนนี้มันยังเป็นเพียงตัวอย่างแบบโฮสต์: qwen3.8-max-preview ให้บริการที่ราว 10% ของราคามาตรฐานผ่าน Token Plan และ Qoder ของ Alibaba

นี่คือสิ่งที่ยังไม่มา: วันปล่อยน้ำหนักเปิด สัญญาอนุญาต โมเดลการ์ด หรือตารางเบนช์มาร์กอิสระ Alibaba บอกว่าน้ำหนักจะมา "เร็ว ๆ นี้" แต่องค์กร Qwen บน Hugging Face ไม่มีอะไรใหม่ตั้งแต่เดือนมิถุนายน คำกล่าวอ้างของบริษัทที่ว่าโมเดลนี้ "เป็นรองแค่ Fable 5" ก็คือแค่นั้น — คำกล่าวอ้างของบริษัทเองที่ยังไม่มีตัวเลขจากบุคคลที่สามหนุนหลัง จงถือว่ามันเป็นถ้อยคำการตลาดของผู้ขายจนกว่าจะมีใครนอก Alibaba วัดผล

อีกเรื่องที่ต้องพูดให้ชัด เพราะมันแพร่ไปราวกับเป็นข้อเท็จจริง: เรื่องที่ว่า "Qwen3.8 27B" จะออกสัปดาห์หน้า เป็นเพียงข่าวลือในชุมชน มันสืบย้อนไปถึงความเห็นหนึ่งบน Hacker News และเว็บรวบรวมข่าวหนึ่งที่นำมาพูดต่อ Alibaba ไม่ได้ระบุวัน ขนาด หรือสัญญาอนุญาตใด ๆ เมื่อดูจากประวัติการปล่อยของบริษัท มันเป็นความคาดหวังที่สมเหตุสมผล — และไม่มากไปกว่าความคาดหวัง

DeepSeek V4 ก้าวสู่การพร้อมใช้งานทั่วไปอย่างเงียบ ๆ

DeepSeek ประกาศน้อยที่สุด แต่ส่งมอบสิ่งที่ใช้งานได้มากที่สุด สาย V4 ซึ่งปล่อยตั้งแต่วันที่ 24 เมษายน มีสองขนาดภายใต้สัญญาอนุญาตเปิด: V4-Pro ที่ 1.6 ล้านล้านรวมและ 49 พันล้านพารามิเตอร์ที่ทำงาน และ V4-Flash ที่ 284 พันล้านรวมและ 13 พันล้านที่ทำงาน ทั้งคู่เป็น MIT ทั้งคู่มีหน้าต่างบริบทหนึ่งล้านโทเคนและหน้าต่างเอาต์พุตสูงสุด 384K โทเคน ราววันที่ 20 กรกฎาคม V4 ก้าวสู่การพร้อมใช้งานทั่วไปด้วยการคิดราคาตามเวลา ซึ่งนั่นแหละที่ดึงมันเข้ามาอยู่ในกรอบสามสัปดาห์เดียวกับ K3 และ Qwen ไม่มี R2 ไม่มี V5 ไม่มี V4.1 — มีเพียงตระกูล V4 ที่สุกงอมจนกลายเป็นสิ่งที่ทีมพึ่งพาได้

ช่องว่างแคบลงเร็วกว่าที่กระดานจัดอันดับยอมรับ

ถอยออกมามองภาพรวม ความชันสำคัญกว่าการปล่อยแต่ละครั้ง Nathan Lambert อ่านว่าระยะห่างระหว่างโมเดลเปิดที่ดีที่สุดกับโมเดลปิดที่ดีที่สุดได้บีบตัวจากราวหกถึงเก้าเดือนเหลือสามถึงห้าเดือน — "โมเดลเปิดไม่เคยใกล้แนวหน้าเท่านี้นับตั้งแต่ DeepSeek R1" ข้อมูลการใช้งานก็ชี้ไปทางเดียวกัน บน OpenRouter ส่วนแบ่งโทเคนของโมเดลสัญชาติอเมริกันร่วงจากราว 70% ในเดือนมิถุนายน 2025 เหลือราว 30% หนึ่งปีถัดมา ขณะที่โมเดลสัญชาติจีนตอนนี้ทะลุ 30% เป็นประจำ ราคาเป็นเหตุผลใหญ่: โมเดลเปิดของจีนมักถูกกว่า 60% ถึง 90% ต่อโทเคน และบริการโฮสต์ก็มาทันที — ทั้ง Together AI และ Modal ตั้ง endpoint สำหรับ Kimi K3 ในวันแรกที่ปล่อย

การเปลี่ยนแปลงที่เงียบกว่าคือเรื่องขนาด แบรนด์ของโมเดลเปิดจีนเคยคือ เล็ก เร็ว ถูก แต่ K3 ที่ 2.8 ล้านล้านพารามิเตอร์และ Qwen3.8-Max ที่ 2.4 ล้านล้าน กลับตรงกันข้ามพอดี — เป็นการเดิมพันว่าการไปตัวใหญ่ในโลกเปิดตอนนี้คุ้มค่าแล้ว GLM-5.2 ของ Z.ai ซึ่งปล่อยเมื่อวันที่ 16 มิถุนายนภายใต้ MIT และนำหน้าหมวดน้ำหนักเปิดของ Artificial Analysis Index ด้วยคะแนน 51 ก็เป็นสารเดียวกันจากห้องแล็บที่สี่

จุดพลิก: รัฐบาลที่ทำให้สิ่งนี้เกิดขึ้น อาจจำกัดมัน

จากนั้นลมก็เปลี่ยนทิศ ราววันที่ 22 ถึง 25 กรกฎาคม Financial Times และ Reuters รายงานว่ากระทรวงพาณิชย์ของจีนกำลังชั่งใจเรื่องการควบคุมการส่งออกโมเดล AI — รวมถึง LLM น้ำหนักเปิด — โดยมี Alibaba, ByteDance และ Z.ai อยู่ในวงหารือด้วย กรอบที่ถูกหยิบยกมาเป็นแบบหลายชั้น: หน้าที่แจ้งสำหรับโมเดลที่อ่อนกว่า การตรวจสอบด้านความมั่นคงสำหรับโมเดลที่แข็งกว่า และความเป็นไปได้ที่จะห้ามเผยแพร่ต่อสาธารณะสำหรับโมเดลที่ทรงพลังที่สุด ยังไม่มีอะไรเป็นกฎหมาย แต่ทิศทางนั้นน่าสังเกต: คลื่นลูกนี้อาจกำลังขึ้นถึงจุดสูงสุดในจังหวะเดียวกับที่รัฐบาลของตัวเองเริ่มมองโมเดลเหล่านี้เป็นสินค้าส่งออกเชิงยุทธศาสตร์ ไม่ใช่การมีส่วนร่วมแบบเปิด

บทสรุป: เมื่อสิ่งที่เปิดกลายเป็นสินทรัพย์เชิงยุทธศาสตร์

เรื่องเล่าที่เรียบร้อยคือ "จีนไล่ทัน" แต่เรื่องที่แม่นยำกว่าคือ น้ำหนักเปิดกลายเป็นสินทรัพย์เชิงยุทธศาสตร์เร็วพอจนรัฐบาลอยากวางมือไว้ที่ก๊อกน้ำ ในสามสัปดาห์ โมเดลเปิดขยับจากการตามหลังแนวหน้าสองถึงสามไตรมาสเหลือเพียงหนึ่ง — และจากเล็กและถูก กลายเป็นหนึ่งในโมเดลที่ใหญ่ที่สุดเท่าที่เคยเผยแพร่ในรูปแบบใด ๆ แนวหน้าแบบเปิดไม่ได้แค่ขยับ มันขยับไปยังที่ที่ผู้สร้างอาจไม่มีอิสระที่จะส่งออกต่อไป

สำหรับทีมที่สร้างต่อยอดบนโมเดลเหล่านี้ บทสรุปเชิงปฏิบัติยังคงเดิมและคมขึ้นเล็กน้อย Telli.sh รันโมเดลเปิดอย่าง Qwen3 ในชั้นสรุปอยู่แล้ว ดังนั้นทุกก้าวของคุณภาพและราคาโมเดลเปิดจึงไหลตรงเข้าสู่การถอดเสียง การแปล และการสรุปการประชุม รายการใหม่คือ "อุปทาน": หากกฎการส่งออกของจีนลงตัวตามที่ข่าวชี้ คำถามว่าโมเดลเปิดใดจะยังดาวน์โหลดได้อย่างอิสระคือสิ่งที่ต้องเฝ้าดู ไม่ใช่ตั้งสมมติเอาเอง การที่โมเดลป้อนชั้นนี้ดีขึ้นคือแนวโน้ม ส่วนโมเดลเหล่านั้นจะได้รับอนุญาตให้มาจากที่ไหน คือสิ่งที่ต้องคอยจับตา

เริ่มบันทึก AI แบบเรียลไทม์

แหล่งอ้างอิง


กลับไปที่บล็อก