
Alibaba เปิดตัว Qwen3.8-Flash โมเดล AI แบบมัลติโมดัลที่เปิดเผยค่าน้ำหนักหลังเทรน ใช้สถาปัตยกรรม Mixture-of-Experts หรือ MoE เพื่อดึงพารามิเตอร์เพียงบางส่วนมาประมวลผลในแต่ละโทเคน จุดขายจึงไม่ได้อยู่ที่ขนาดโมเดลอย่างเดียว แต่เป็นการคุมสมดุลระหว่างความสามารถ ความเร็ว และต้นทุนสำหรับงานที่ต้องประมวลผลปริมาณมาก
โมเดลนี้รองรับตั้งแต่งานเขียนโค้ดด้วยเอเจนต์ งานอัตโนมัติระยะยาว ไปจนถึงการประมวลผลข้อมูลหลายรูปแบบ พร้อมทำหน้าที่เป็นต้นแบบสถาปัตยกรรมสำหรับซีรีส์ Qwen4 ที่ Alibaba ระบุว่าจะเปิดตัวในลำดับถัดไป
โครงสร้างของ Qwen3.8-Flash ประกอบด้วยโมเดลหลัก 125 พันล้านพารามิเตอร์ เสริม N-gram Embeddings อีก 51 พันล้านพารามิเตอร์ แต่ในแต่ละโทเคนจะดึงพารามิเตอร์มาใช้งานจริง 6 พันล้านพารามิเตอร์ วิธีนี้ช่วยให้โมเดลมีความจุสูงโดยไม่ต้องเปิดทุกพารามิเตอร์พร้อมกัน
ในมุมใช้งาน สถาปัตยกรรมลักษณะนี้เหมาะกับระบบที่ต้องรองรับคำขอจำนวนมาก งานเอเจนต์ที่เรียกเครื่องมือหลายขั้นตอน ระบบช่วยเขียนโค้ด และผู้ช่วยทำงานร่วม เพราะต้นทุนต่อคำขอและความเร็วตอบสนองมีผลโดยตรงต่อการนำโมเดลไปใช้จริง
แกนของสถาปัตยกรรมใหม่คือ hybrid attention ที่ผสาน Gated DeltaNet หรือ GDN สำหรับบีบอัดข้อมูลย้อนหลัง เข้ากับ Qwen Sparse Attention หรือ QSA ซึ่งใช้ดัชนีบีบอัดน้ำหนักเบาเพื่อเลือกเฉพาะบริบทที่เกี่ยวข้อง แนวทางนี้มุ่งลดต้นทุนของ attention เมื่อโมเดลต้องจัดการลำดับข้อมูลขนาดยาว
Alibaba ยังเพิ่ม Gated Residual เพื่อขยายช่องทางส่งข้อมูลระหว่างเลเยอร์และเพิ่มเสถียรภาพการเทรน ใช้ N-gram Embedding เพิ่มความจุของโมเดลด้วยทรัพยากรที่เพิ่มขึ้นเพียงเล็กน้อย และใช้ Muon Optimizer เพื่อยกระดับประสิทธิภาพการเทรนโมเดลขนาดใหญ่
บริษัทระบุว่า Qwen3.8-Flash ใช้ทรัพยากรในการเทรนประมาณหนึ่งในเก้าของ Qwen3.7-Plus ซึ่งมีขนาดใหญ่กว่าสามเท่า แต่ให้ประสิทธิภาพด้านการเขียนโค้ดและงานออฟฟิศเหนือกว่า ตัวเลขนี้เป็นผลเปรียบเทียบจาก Alibaba โดย Source ไม่ได้ให้รายละเอียดฮาร์ดแวร์หรือคะแนนรายชุดทดสอบเพิ่มเติม
Alibaba ระบุว่าโมเดลทำคะแนนเทียบชั้น DeepSeek-V4-Flash และ Claude-Opus-4.6 ในหลาย benchmark ครอบคลุม SWE-bench Pro สำหรับ agentic coding, CoWorkBench สำหรับงานออฟฟิศหลายขั้นตอน, Toolathlon Verified สำหรับการเรียกเครื่องมือ, MathVision, AndroidWorld และ ERQA
ด้านบริบทยาว Qwen3.8-Flash รองรับ 262K โทเคนในตัวและขยายได้ถึง 1 ล้านโทเคน นักพัฒนาสามารถดาวน์โหลด weights ได้จาก Hugging Face และ ModelScope หรือเรียกใช้ API ผ่าน Model Studio กับ Qwen Cloud
อัตราค่าบริการ API ต่อ 1 ล้านโทเคนอยู่ที่ 1 หยวน หรือ 0.16 ดอลลาร์สหรัฐสำหรับ input และ 3 หยวน หรือ 0.47 ดอลลาร์สหรัฐสำหรับ output ทำให้ทีมพัฒนามีทั้งทางเลือกโฮสต์โมเดลจาก weights และทางเลือกใช้บริการคลาวด์ตามลักษณะเวิร์กโหลด
Qwen3.8-Flash ถูกนำไปใช้กับ standard mode ที่ออกแบบใหม่บน QwenWork แพลตฟอร์ม AI agent สำหรับงานแบบครบวงจร โดย Alibaba ระบุว่าช่วยลดการใช้โทเคนต่องานลง 75% และเพิ่มความเร็วสร้างเนื้อหาได้เกือบสองเท่าเมื่อเทียบกับโหมดปัจจุบัน
ในภาพใหญ่ Alibaba ระบุว่าได้เปิดโอเพนซอร์สโมเดลมากกว่า 460 โมเดล เกิดโมเดลอนุพันธ์มากกว่า 300,000 โมเดล และมียอดดาวน์โหลดทั่วโลกสะสมมากกว่า 3 พันล้านครั้ง Qwen3.8-Flash จึงเป็นทั้งโมเดลสำหรับใช้งานทันทีและพื้นที่ทดสอบแนวคิดสถาปัตยกรรมก่อนเข้าสู่ Qwen4
สำหรับนักพัฒนา จุดที่ควรจับตาคือการเปิดใช้เพียง 6B ต่อโทเคนควบคู่กับ Context ระดับ 1 ล้านโทเคน ซึ่งอาจช่วยให้เวิร์กโหลดเอเจนต์ขนาดยาวควบคุมต้นทุนได้ง่ายขึ้นเมื่อเทียบกับการเปิดโมเดลหนาแน่นทั้งชุด ผู้สนใจบริการ AI ของ Alibaba สามารถดูข้อมูลเพิ่มเติมได้ที่ เว็บไซต์ Alibaba Cloud
ติดตามข้อมูลข่าวสารน่าสนใจได้ทาง www.zanzab.com และช่องทางโซเชียล
Facebook , YouTube , Instagram และ Tiktok