Alibaba เปิดตัว Qwen3.8-27B เน้นงาน Coding, Agent และ Multimodal

Alibaba Cloud เปิดโมเดล Qwen3.8-27B ที่เหมาะกับผู้ใช้งานพีซีทั่วไปให้ดาวน์โหลดและนำไปใช้งานได้แล้ว โดยโมเดลรุ่นนี้อยู่ในกลุ่ม Dense Model ขนาด 27 พันล้านพารามิเตอร์ และยังคงใช้สัญญาอนุญาต Apache License 2.0 ซึ่งเปิดทางให้สามารถนำไปพัฒนาต่อยอดและใช้งานเชิงพาณิชย์ได้ภายใต้เงื่อนไขของสัญญาอนุญาตดังกล่าว

Qwen ระบุว่า Qwen3.8 เป็นโมเดลในตระกูล open-model ที่มีความสามารถสูงที่สุดของบริษัทในขณะนี้ โดย Qwen3.8-27B ถูกวางตำแหน่งให้เป็นรุ่นที่มีขนาดยังพอเหมาะสำหรับการนำไปติดตั้งใช้งานเอง ขณะเดียวกันก็เพิ่มความสามารถด้าน Coding, Professional Work, Research และ Long-horizon Agentic Tasks ขึ้นจาก Qwen3.6 อย่างชัดเจน

Qwen3.8-27B รองรับงานที่หลากหลาย

ความน่าสนใจของ Qwen3.8-27B คือมันไม่ได้ถูกออกแบบให้เป็น LLM สำหรับรับและตอบข้อความเพียงอย่างเดียว แต่เป็น Vision-Language Model แบบ Native ที่สามารถประมวลผลทั้งข้อความ ภาพ และวิดีโอได้

Qwen บอกว่าสามารถนำโมเดลนี้ไปใช้งานกับข้อมูลหลายรูปแบบ ตั้งแต่เอกสาร ภาพ แผนภาพทางวิทยาศาสตร์หรือ STEM ไปจนถึงวิดีโอที่มีความยาวระดับชั่วโมง ทำให้ขอบเขตการใช้งานกว้างกว่าการเป็น Chatbot หรือ Coding Assistant ทั่วไป

โครงสร้างหลักของโมเดลประกอบด้วย Language Model ขนาด 27B parameters และ Vision Encoder โดยมี hidden dimension 5,120 และ Language Model จำนวน 64 layers นอกจากนี้ยังมีการฝึกด้วย Multi-Token Prediction (MTP) หลายขั้น ซึ่งเป็นอีกส่วนหนึ่งที่เกี่ยวข้องกับการเพิ่มประสิทธิภาพด้านการสร้างโทเคนของโมเดล

Context Window สูงสุด 262K แบบ Native

Qwen3.8-27B รองรับ Context Length แบบ Native ที่ 262,144 tokens และสามารถขยายได้สูงสุดประมาณ 1 ล้าน tokens

อย่างไรก็ตาม ตัวเลข Context Window สูงสุดไม่ได้หมายความว่า Local AI ทุกเครื่องจะสามารถเปิด Context 262K หรือ 1M ได้ทันที เพราะการใช้งาน Context ที่ยาวขึ้นต้องใช้หน่วยความจำเพิ่มสำหรับ KV Cache และข้อมูลระหว่างการประมวลผลด้วย

ดังนั้นเวลานำโมเดลนี้มาใช้งานจริงบนคอมพิวเตอร์ของเรา คงจะต้องพิจารณาถึงเรื่องของขนาด VRAM ที่เหลือ หรือต้องดู RAM ของระบบที่เหลือว่ามีเพียงพอต่อการขยายพื้นที่ของ KV Cache มากน้อยขนาดไหนด้วย

ปรับระดับ Thinking ได้ ไม่จำเป็นต้องคิดหนักทุกคำถาม

Qwen3.8 ใช้ Thinking Mode เป็นค่าเริ่มต้น แต่สามารถปิดได้เป็นราย Request และยังเพิ่มความสามารถในการควบคุมระดับ Reasoning ผ่านพารามิเตอร์ reasoning_effort ซึ่งมี 3 ระดับ ได้แก่

  • xhigh ค่าเริ่มต้น เหมาะกับงานที่ต้องวิเคราะห์ซับซ้อน
  • medium สมดุลระหว่างคุณภาพกับความเร็ว
  • low ลดการใช้เวลาและทรัพยากรในการคิด

นอกจากนี้ยังมี preserve_thinking ซึ่งเปิดเป็นค่าเริ่มต้น เพื่อให้โมเดลสามารถนำบริบทจากการ reasoning ในข้อความก่อนหน้ามาใช้ต่อในบทสนทนาหลายรอบได้

จุดนี้น่าสนใจสำหรับงาน Agent เพราะการลดระดับ Reasoning ไม่ได้หมายความว่างานจะเสร็จเร็วกว่าเสมอไป ทาง Qwen เองเตือนว่า Agent ที่คิดน้อยเกินไปอาจตัดสินใจผิด ทำงานล้มเหลว และต้องย้อนกลับมาทำใหม่ ซึ่งสุดท้ายอาจใช้ทั้งเวลาและ Token มากกว่าเดิม

เน้น Agent มากกว่าแค่ตอบ Prompt

Qwen ระบุว่าการพัฒนาครั้งนี้ให้ความสำคัญกับ Agent Execution โดยเฉพาะความสามารถในการวางแผนอัตโนมัติ การรับ Feedback จาก Environment และการทำงานหลายขั้นตอนต่อเนื่องจนเสร็จสิ้น

ความแตกต่างนี้สำคัญ เพราะการทดสอบ LLM แบบเดิม เช่น ให้โมเดลเขียนบทความ ตอบคำถาม หรือสร้างโค้ดหนึ่งฟังก์ชัน อาจไม่สามารถสะท้อนความสามารถของโมเดลประเภทนี้ได้ครบ

สำหรับ Qwen3.8-27B งานอย่าง Coding Agent ที่ต้องอ่าน Repository, แก้หลายไฟล์, รันคำสั่ง, ดู Error แล้วแก้ไขต่อ รวมถึง Computer-use Agent ที่ต้องใช้งานเว็บหรือโปรแกรมจริง อาจเป็น Workload ที่เหมาะกว่าในการพิสูจน์ความสามารถของโมเดล

Benchmark ดีขึ้นจาก Qwen3.6-27B หลายด้าน

ผล Benchmark ที่ Qwen เปิดเผยแสดงให้เห็นว่า Qwen3.8-27B ทำคะแนนสูงกว่า Qwen3.6-27B ในหลายงาน โดยเฉพาะ Coding และ Agentic Tasks

BenchmarkQwen3.8-27BQwen3.6-27B
Terminal Bench 2.173.063.4
SWE-bench Pro61.753.5
DeepSWE 1.142.213.3
QwenSWEBench79.049.3
CoWorkBench70.761.0
LiveCodeBench v690.383.9
OSWorld-Verified84.363.9
WebArena-Verified64.848.8
SWE-MM38.625.7

ตัวเลขดังกล่าวมาจากผลการประเมินที่ Qwen รายงานเอง และควรรอผลทดสอบอิสระจากผู้ใช้งานและชุมชนเพิ่มเติม แต่แนวโน้มที่เห็นได้ค่อนข้างชัดคือ Qwen3.8-27B ไม่ได้เพิ่มความสามารถเฉพาะการตอบคำถามทั่วไป แต่ให้ความสำคัญกับงานที่โมเดลต้อง ลงมือทำงานหลายขั้นตอน มากขึ้น

ตัวอย่างที่เห็นความแตกต่างชัดคือ DeepSWE 1.1 เพิ่มจาก 13.3 เป็น 42.2 ขณะที่ OSWorld-Verified เพิ่มจาก 63.9 เป็น 84.3

บาง Benchmark แซง Claude Opus 4.6 Max

Qwen ยังนำผลของ Claude Opus 4.6 Max มาแสดงเปรียบเทียบในตารางเดียวกัน และ Qwen3.8-27B สามารถทำคะแนนสูงกว่าในบางงาน

ตัวอย่างเช่น SWE-bench Pro อยู่ที่ 61.7 ต่อ 53.4, LiveCodeBench v6 อยู่ที่ 90.3 ต่อ 88.8 และ OSWorld-Verified อยู่ที่ 84.3 ต่อ 72.7

แต่ไม่ควรสรุปจากตัวเลขเหล่านี้ตรง ๆ ว่า Qwen3.8-27B เก่งกว่า Claude Opus 4.6 เพราะแต่ละ Benchmark วัดความสามารถคนละด้านและบางรายการใช้ Evaluation Harness หรือเงื่อนไขต่างกัน

ตัวอย่างเช่น Qwen ระบุว่า SWE-bench Pro ของโมเดลส่วนใหญ่ถูกทดสอบผ่าน Claude Code harness ขณะที่คะแนน Opus 4.6 Max เป็นคะแนนที่รายงานอย่างเป็นทางการของโมเดลนั้นเอง

ในงาน Scientific Reasoning อย่าง GPQA Diamond นั้น Qwen3.8-27B ได้ 89.2 ขณะที่ Opus 4.6 Max อยู่ที่ 91.3 และ Humanity’s Last Exam หรือ HLE อยู่ที่ 30.8 เทียบกับ 40.0 ตามข้อมูลที่ Qwen รายงาน

ดังนั้น Benchmark เหล่านี้ควรใช้เพื่อดู ลักษณะความสามารถและพัฒนาการของโมเดล มากกว่าการใช้ตัดสินผู้ชนะจากตัวเลขเพียงค่าเดียว

แล้ว Local AI ต้องใช้ VRAM เท่าไร?

จุดที่น่าสนใจสำหรับผู้ใช้ Local AI คือตอนนี้มี Qwen3.8 Q4_K_M ให้ใช้งานแล้ว โดยโมเดลใน Ollama มีน้ำหนักส่วน Language Model ประมาณ 17GB และ metadata ระบุเป็น Q4_K_M แต่ ไฟล์โมเดล 17GB ไม่ได้หมายความว่า GPU ที่มี VRAM มากกว่า 17GB จะสามารถรันทุกอย่างใน VRAM ได้พอดี

การใช้งานจริงยังต้องเผื่อหน่วยความจำสำหรับ Runtime, KV Cache, Context และในกรณี Multimodal ยังมี Vision Projector เพิ่มเข้ามาอีก โดย Ollama แสดงไฟล์ Vision Projector ขนาดประมาณ 931MB สำหรับโมเดลนี้

เพราะฉะนั้น GPU ระดับ 24GB VRAM จะมีพื้นที่ทำงานที่สมเหตุสมผลกว่าสำหรับ Q4_K_M ขณะที่ GPU 16GB อาจต้องใช้ Quantization ที่เล็กกว่า, ลด Context หรือแบ่งบางส่วนไปใช้ System RAM

สำหรับการทดสอบ Local AI จริง เราจึงควรวัดทั้งความเร็วการสร้าง Token, TTFT, Context Scaling และการใช้ VRAM ไม่ใช่ดูจากขนาดไฟล์โมเดลเพียงอย่างเดียว

Qwen3.8-27B กับ Local AI

ถ้ามองจากมุม Local AI จุดสำคัญของ Qwen3.8-27B ไม่ได้อยู่ที่การเป็นโมเดล 27B รุ่นใหม่เท่านั้น แต่เป็นการรวมความสามารถหลายแบบไว้ในโมเดลขนาดที่ผู้ใช้ VRAM 32GB สามารถนำมาทดลองใช้งานได้หลายอย่าง ไม่ว่าจะเป็น

  • Text Generation และ Reasoning
  • Coding
  • Vision และ Document Understanding
  • Video Understanding
  • Tool Calling
  • Computer Use
  • Coding Agent
  • Long-horizon Agentic Tasks

ทั้งหมดอยู่ในโมเดล Dense ขนาด 27B ตัวเดียว

นี่ทำให้ Qwen3.8-27B เป็นโมเดลที่น่าสนใจมากสำหรับการทดสอบ Local AI รุ่นต่อไป เพราะโจทย์ไม่ได้มีเพียงว่า GPU สร้างข้อความได้กี่ Token ต่อวินาที อีกแล้ว แต่รวมถึงว่า Hardware และ Runtime แต่ละแบบสามารถพาโมเดลทำ งานจริงตั้งแต่ต้นจนจบ ได้ดีแค่ไหน

สำหรับ AIPCMag เราจะทดลอง Qwen3.8-27B กับการ์ดจอที่มี VRAM 32GB และแบบ VRAM 16GB + 16GB และ Runtime แบบ Local เพิ่มเติม เพื่อดูทั้งประสิทธิภาพในการรันโมเดล, การใช้ VRAM, Context Scaling รวมถึง Workload ที่สะท้อนการใช้งานจริงมากกว่าการวัดความเร็ว Token เพียงอย่างเดียวในเร็ว ๆ นี้ครับ

หมายเหตุ: ตัวเลข Benchmark ในบทความนี้เป็นผลที่ทีม Qwen รายงาน ณ วันที่ 15 สิงหาคม 2026 การเปรียบเทียบกับโมเดลอื่นควรพิจารณา Evaluation Method, Harness และเงื่อนไขการทดสอบของแต่ละ Benchmark ประกอบ และควรรอผลทดสอบอิสระจากชุมชนเพิ่มเติม

Similar Posts