Qwen3.8-27B: एक 27B ओपन-वेट मॉडल जो एक GPU पर फ़िट होता है, और वह बेंचमार्क दावा जो टिकता नहीं
अलीबाबा की Qwen टीम ने 13-14 अगस्त 2026 को Qwen3.8-27B रिलीज़ किया, Apache 2.0 के तहत 27.8-बिलियन-पैरामीटर वाला एक मॉडल, जिसका एक क्वांटाइज़्ड बिल्ड एक ही 24GB कंज़्यूमर GPU पर चलता है। एक वायरल दावा कहता है कि यह 19 में से 15 बेंचमार्क पर Claude Opus 4.6 को पीछे छोड़ देता है। यह आंकड़ा अलीबाबा की अपनी प्रकाशित तालिका से मेल नहीं खाता। असली तस्वीर ज़्यादा दिलचस्प है: एक सचमुच सक्षम, मुफ़्त मॉडल जो उन लोगों के लिए अब भी खुरदुरा है जो लोकल LLM टूलिंग से पहले से सहज नहीं हैं।
Qwen3.8-27B असली है, मुफ़्त है, और लोकली चलता है। यह एक 27.8B-पैरामीटर डेंस मॉडल है, Apache 2.0 लाइसेंस के तहत, अलीबाबा की Qwen टीम द्वारा 13-14 अगस्त 2026 को रिलीज़ किया गया। एक 4-बिट क्वांटाइज़्ड बिल्ड मध्यम कॉन्टेक्स्ट लंबाई पर 24GB कंज़्यूमर GPU (RTX 3090/4090-क्लास) पर फ़िट होता है; पूरे 262,144-टोकन नेटिव कॉन्टेक्स्ट के लिए कहीं ज़्यादा मेमोरी चाहिए।
"19 में से 15 टेस्ट पर Claude Opus 4.6 को पीछे छोड़ता है" वाले दावे का कोई प्राइमरी स्रोत नहीं है। यह एक X पोस्ट तक जाता है, अलीबाबा के अपने मॉडल कार्ड तक नहीं। एक स्वतंत्र तुलना ने पाया कि Opus के मुक़ाबले सीधी टक्कर वाले 5 में से सिर्फ़ 1 मेट्रिक पर Qwen आगे है। इसे एक असत्यापित सोशल-मीडिया टॉकिंग पॉइंट के तौर पर लीजिए।
जो असली है: Qwen3.8-27B कई एजेंटिक और कोडिंग बेंचमार्क पर Meta के Muse Glimmer (30B, 10 अगस्त को रिलीज़) को सचमुच पीछे छोड़ देता है। इसके SWE-bench Pro, OSWorld-Verified और LiveCodeBench v6 स्कोर इस आकार के मॉडल के लिए सचमुच मज़बूत हैं, Qwen के अपने टेस्टिंग स्कैफ़ोल्ड द्वारा ख़ुद रिपोर्ट किए गए।
ख़ास तौर पर दस्तावेज़-विश्लेषण के लिए: मॉडल का नेटिव विज़न एनकोडर और लंबा कॉन्टेक्स्ट इसे PDF, चार्ट और रिसर्च पेपर लोकली और निजी तौर पर पढ़ने के लिए संरचनात्मक रूप से उपयुक्त बनाता है। अभी तक कोई बेंचमार्क यह साबित नहीं करता कि यह उस काम में अच्छा है। यह एक वाजिब उम्मीद है, कोई सिद्ध नतीजा नहीं।
असल में क्या रिलीज़ हुआ, और कब
अलीबाबा की Tongyi Lab ने 13-14 अगस्त 2026 को Qwen3.8-27B के लिए ओपन वेट रिलीज़ किए, इसे बड़े Qwen3.8-Max के साथ पहले से घोषित करने के एक हफ़्ते बाद। यह 27.8-बिलियन-पैरामीटर वाला एक डेंस मॉडल है (मिक्सचर-ऑफ़-एक्सपर्ट्स नहीं), Apache 2.0 लाइसेंस के तहत, नेटिव विज़न-लैंग्वेज सपोर्ट के साथ। इसका मतलब है कि यह इमेज और वीडियो को एक अलग एडाप्टर जोड़ने के बजाय सीधे अपने एम्बेडिंग स्पेस में प्रोसेस करता है। आर्किटेक्चर एक हाइब्रिड है: 64 लेयर, तीन Gated DeltaNet (लीनियर-अटेंशन) लेयर से एक Gated Attention (फ़ुल-अटेंशन) लेयर तक दोहराए जाने वाले ब्लॉक से बने, यानी लगभग 48 लीनियर-अटेंशन लेयर बनाम 16 फ़ुल-अटेंशन लेयर, साथ ही तेज़ डिकोडिंग के लिए मल्टी-टोकन प्रेडिक्शन।
कॉन्टेक्स्ट विंडो: 262,144 टोकन नेटिव, YaRN RoPE स्केलिंग के ज़रिए 1,048,576 टोकन (1M) तक बढ़ाई जा सकती है। यह एक ही पास में कुछ सौ पन्नों का टेक्स्ट रखने के लिए काफ़ी लंबी है, Gemini Notebook की प्रति-notebook स्रोत क्षमता के बराबर के क्रम में, हालांकि दोनों सीधे तुलना करने लायक़ नहीं हैं क्योंकि एक UI वाला होस्टेड प्रोडक्ट है और दूसरा वह रॉ मॉडल वेट है जिसे आप ख़ुद चलाते हैं।
बेंचमार्क आंकड़े, जैसा अलीबाबा ने असल में प्रकाशित किया
नीचे दिया हर आंकड़ा आधिकारिक Hugging Face मॉडल कार्ड (Qwen/Qwen3.8-27B) से आया है, उसी तालिका के एक थर्ड-पार्टी रीप्रोडक्शन के मुक़ाबले क्रॉस-चेक किया गया। ये Qwen के अपने एजेंट स्कैफ़ोल्ड का इस्तेमाल करते हुए ख़ुद रिपोर्ट किए गए नंबर हैं। किसी स्वतंत्र लैब ने अभी तक इन्हें दोहराकर नहीं दिखाया, और यह यहां सामान्य से ज़्यादा मायने रखता है, क्योंकि जिस हार्नेस से आप जांचते हैं वही स्कोर बदल देता है।
Benchmark Qwen3.8-27B Claude Opus 4.6 (Max) Who leads
--------------------------------------------------------------------
Terminal-Bench 2.1 73.0 78.2 Opus
SWE-bench Pro 61.7 53.4 Qwen
OSWorld-Verified 84.3 72.7 Qwen
LiveCodeBench v6 90.3 88.8 Qwen
GPQA Diamond 89.2 91.3 Opus
IFBench 79.5 62.5 Qwen
DeepSWE 1.1 (self, v3.6→3.8) 13.3 → 42.2 n/a improvedयह सचमुच एक मिला-जुला स्कोरकार्ड है: कोडिंग और कंप्यूटर-यूज़ टास्क पर Qwen आगे, शुद्ध नॉलेज (GPQA Diamond) और एक एजेंटिक टर्मिनल बेंचमार्क पर Opus आगे। यह "19 में से 15 टेस्ट" नहीं है। यह आंकड़ा एक ही X/Twitter पोस्ट (@hosseeb) तक जाता है जिसे एग्रीगेटर साइटों ने तब तक दोहराया जब तक यह किसी उद्धरण-योग्य तथ्य जैसा नहीं लगने लगा। यह Qwen के अपने मॉडल कार्ड पर कहीं नहीं दिखता, और एक अलग स्वतंत्र राइट-अप (ExplainX.ai) ने पाया कि Qwen सीधे Opus के मुक़ाबले जिन 5 मेट्रिक की तुलना की उनमें से सिर्फ़ 1 पर आगे है। अगर आप "19 में से 15" कहीं और दोहराया हुआ देखें, तो यह चक्रीय है: हर कोई उसी असत्यापित पोस्ट का हवाला दे रहा है।
इन आंकड़ों को किसी ख़रीद-फ़ैसले के तौर पर भरोसा करने से पहले जानने लायक़ दो और चेतावनियां। SWE-bench Pro, एक जैसी शर्तों के तहत दोबारा चलाने के बजाय Anthropic के पहले प्रकाशित Opus नतीजे को इम्पोर्ट करता है, और DeepSWE, QwenSWEBench, CoWorkBench व RecreationBench Qwen के अपने इन-हाउस बेंचमार्क सूट हैं, जिनमें SWE-bench या LiveCodeBench जैसी सार्वजनिक जांच-योग्यता नहीं। इनमें से कुछ भी मॉडल को ख़राब नहीं बनाता। यह सिर्फ़ मार्केटिंग तालिका को ख़ुद मॉडल से कम भरोसेमंद बनाता है।
उसी हफ़्ते, दो और ओपन-वेट रिलीज़
Qwen3.8-27B अकेले नहीं आया। Meta का Muse Glimmer (लगभग 29.6B पैरामीटर, जिसमें 1.8B विज़न एनकोडर शामिल है, Apache 2.0) 10 अगस्त को रिलीज़ हुआ, ख़ास तौर पर हमेशा-चालू लोकल एजेंट वर्कफ़्लो के लिए आक्रामक 4-बिट क्वांटाइज़ेशन और स्पेकुलेटिव डिकोडिंग के ज़रिए बनाया गया। Meta की अपनी सामग्री दावा करती है कि यह बिना किसी नेटवर्क कॉल के एक 24GB GPU या M4/M5 Max Mac पर चलता है। DeepSeek का V4-Pro 13 अगस्त को आम तौर पर उपलब्ध हुआ: एक 1.6-ट्रिलियन-पैरामीटर मिक्सचर-ऑफ़-एक्सपर्ट्स मॉडल (प्रति टोकन लगभग 49B एक्टिव) जिसमें MIT लाइसेंस के तहत 1M-टोकन कॉन्टेक्स्ट विंडो है। यह सचमुच फ़्रंटियर-स्केल है, लेकिन एक-GPU वाली कहानी नहीं; MoE स्पार्सिटी के बावजूद इसे मल्टी-GPU या डेटासेंटर-क्लास हार्डवेयर चाहिए।
तीनों में साझा पैटर्न: ओपन-वेट मॉडल क्लोज़्ड फ़्रंटियर मॉडल के साथ फ़ासला उससे तेज़ी से पाट रहे हैं जितना सिर्फ़ ChatGPT और Gemini की सुर्खियां देखने वाले ज़्यादातर लोगों ने नोटिस किया है। यही यहां की असली कहानी है, और यह इस साइट के पाठकों के लिए किसी भी अकेली बेंचमार्क तालिका से ज़्यादा उपयोगी है। इसका मतलब है कि एक सचमुच सक्षम AI मॉडल अब कोई ऐसी चीज़ है जिसे आप मालिक बनकर चला सकते हैं, सिर्फ़ किराए पर नहीं।
इसे असल में कैसे चलाएं (और यह वाक़ई कितना मुश्किल है)
क्वांटाइज़्ड GGUF बिल्ड llama.cpp, LM Studio और Ollama पर रिलीज़ के कुछ घंटों के भीतर सामने आ गए। Hugging Face पर lmstudio-community/Qwen3.8-27B-GGUF और unsloth/Qwen3.8-27B-GGUF वे हैं जिन्हें देखना चाहिए; पुल करने से पहले पुष्टि कर लें कि आपको मिली कोई भी Ollama लिस्टिंग आधिकारिक है, क्योंकि पहले कुछ दिनों में थोड़े अलग नामों के तहत कम्युनिटी अपलोड सामने आए। सिद्धांत में: LM Studio इंस्टॉल करें, "Qwen3.8-27B" खोजें, एक Q4_K_M क्वांटाइज़्ड बिल्ड (लगभग 16GB) डाउनलोड करें, लोड करें, चैट करें।
व्यवहार में, Hacker News पर शुरुआती अपनाने वालों को असली दिक़्क़तें मिलीं जिन्हें कोई पहली बार इस्तेमाल करने वाला अकेले सुलझाने की उम्मीद नहीं करेगा। डिफ़ॉल्ट रीज़निंग मोड ("xhigh") असामान्य रूप से बड़ी संख्या में टोकन खर्च करता है और अपने थिंकिंग ट्रेस में ख़राब, व्याकरणिक रूप से छीना हुआ टेक्स्ट पैदा करता है। कई यूज़र्स को टूल-कॉलिंग ठीक करने और समझदार KV-कैश व्यवहार पाने के लिए रीज़निंग एफ़र्ट को हाथ से "medium" पर लाना पड़ा और कम्युनिटी-मेंटेन्ड चैट टेम्पलेट लगाने पड़े। एक यूज़र ने बताया कि सिर्फ़ मॉडल का 32K-कॉन्टेक्स्ट KV कैश ही 2.5GB VRAM खा गया, जो Gemma 4 या Muse Glimmer जैसे तुलनीय मॉडल की तुलना में साफ़ तौर पर कम कुशल है, और एक अच्छे उपकरण वाली मशीन पर भी 4-बिट क्वांटाइज़ेशन पर 128K कॉन्टेक्स्ट फ़िट नहीं हुआ। ईमानदार फ़्रेमिंग: उत्साही लोगों के लिए दोस्ताना, अभी प्लग-एंड-प्ले नहीं। अगर आपने पहले कभी कोई लोकल मॉडल नहीं चलाया, तो पांच मिनट नहीं बल्कि एक दोपहर का कॉन्फ़िगरेशन समय रखिए।
हार्डवेयर की असली तस्वीर
Format Size on disk Practical fit
-----------------------------------------------
BF16 (full) 51.8 GB 80GB-class GPU or multi-GPU
FP8 28.8 GB 48GB card, reduced context
Q6_K GGUF 21.3 GB 32GB+ GPU
Q4_K_M GGUF 15.9 GB 24GB consumer GPU, moderate context only"एक कंज़्यूमर GPU पर चलता है" छोटे-से-मध्यम कॉन्टेक्स्ट पर सच है। पूरी 262K-टोकन विंडो की तरफ़ धकेलिए और अकेले KV कैश ही और 60-80GB मांग सकता है। उस बिंदु पर आप इसे किसी गेमिंग PC पर नहीं चला रहे, क्वांटाइज़्ड वेट हों या न हों।
निजी दस्तावेज़-विश्लेषण के लिए इसका क्या मतलब है
यही वह हिस्सा है जिसकी परवाह इस साइट के पाठक असल में करेंगे, और यह किसी हाइप पैराग्राफ़ के बजाय एक ईमानदार हेज के लायक़ है। Qwen3.8-27B का नेटिव विज़न एनकोडर और लंबा कॉन्टेक्स्ट इसे चार्ट-डायग्राम वाली PDF पढ़ने, रिसर्च पेपर का सारांश देने, और बड़े दस्तावेज़ सेट पर सवालों के जवाब पूरी तरह ऑफ़लाइन देने के लिए संरचनात्मक रूप से उपयुक्त बनाता है: कोई अपलोड नहीं, कोई सब्सक्रिप्शन नहीं, कोई क्लाउड प्रोवाइडर आपकी स्रोत सामग्री देखता नहीं। यह Gemini Notebook सहित किसी भी क्लाउड-होस्टेड टूल से सचमुच अलग प्राइवेसी मुद्रा है।
लेकिन अभी तक कोई प्रकाशित बेंचमार्क और कोई दर्ज यूज़र वर्कफ़्लो नहीं है जो ख़ास तौर पर यह साबित करे कि Qwen3.8-27B दस्तावेज़ RAG या पेपर सारांश में अच्छा है। लिखे जाने के समय यह मॉडल लगभग दो दिन पुराना है। सामान्य लोकल-LLM मार्गदर्शन (इस मॉडल के लिए ख़ास नहीं) एक व्यावहारिक चुनाव का समर्थन ज़रूर करता है: जो दस्तावेज़ कॉन्टेक्स्ट विंडो में फ़िट होते हैं, उनके लिए पूरी चीज़ एक ही पास में डालिए न कि उसे टुकड़ों में बांटिए, क्योंकि चंकिंग और एम्बेडिंग-आधारित रिट्रीवल क्रॉस-चंक कॉन्टेक्स्ट खो देते हैं जिसे एक अकेला लंबा-कॉन्टेक्स्ट पास बरक़रार रखता है। चंकिंग सिर्फ़ उन दस्तावेज़ों के लिए रखिए जो मॉडल की कॉन्टेक्स्ट सीमा से सचमुच आगे निकल जाते हैं।
अगर आपकी असली ज़रूरत है "इस PDF का सारांश दीजिए और मुझे फ़ॉलो-अप सवाल पूछने दीजिए," और आप क्वांटाइज़ेशन व चैट टेम्पलेट कॉन्फ़िगर करने में एक दोपहर नहीं लगाना चाहते, तो Gemini Notebook अब भी तेज़ रास्ता है। यह वही काम बिना किसी लोकल सेटअप के करता है, इस क़ीमत पर कि आपके दस्तावेज़ आपकी मशीन छोड़ देते हैं। जब कुछ भी अपलोड न करने की प्राइवेसी सुविधा से ज़्यादा मायने रखती है, या जब आप कुछ ऐसा प्रोसेस कर रहे हों जिसे किसी थर्ड पार्टी को भेजने की इजाज़त बिल्कुल नहीं है, तब Qwen3.8-27B सही टूल है।
जब यह सही टूल नहीं है
- आपके पास कम से कम 24GB VRAM वाला GPU नहीं है। MacBook Air या इंटीग्रेटेड GPU वाला लैपटॉप इसे इस्तेमाल लायक़ रफ़्तार पर नहीं चलाएगा; आपको इसकी बजाय एक छोटा मॉडल देखना होगा।
- आपको कुछ ऐसा चाहिए जो पांच मिनट में काम करे। मॉडल के समझदारी से बर्ताव करने से पहले डिफ़ॉल्ट सेटिंग्स (रीज़निंग एफ़र्ट, चैट टेम्पलेट) में बदलाव चाहिए। यह अभी वन-क्लिक अनुभव नहीं है।
- आपको नियमित रूप से पूरा 262K-टोकन कॉन्टेक्स्ट चाहिए। लंबे कॉन्टेक्स्ट पर KV कैश की मेमोरी लागत उस चीज़ से कहीं आगे निकल जाती है जो एक कंज़्यूमर GPU रख सकता है, जो "एक GPU पर चलता है" वाली पिच को ठीक उसी लंबाई पर कमज़ोर कर देता है जहां यह किसी पूरे रिसर्च-पेपर कॉर्पस के लिए सबसे ज़्यादा मायने रखती।
- आपको आज ही किसी साइटेशन-संवेदनशील काम के लिए एकदम पक्की सटीकता चाहिए। किसी स्वतंत्र लैब ने अभी तक Qwen के बेंचमार्क आंकड़ों को दोहराकर नहीं दिखाया; मॉडल को किसी भी ऐसी चीज़ के लिए आशाजनक और असत्यापित मानिए जहां ग़लत होने के असली नतीजे हों।
क्या Qwen3.8-27B सचमुच Claude Opus 4.6 को पीछे छोड़ता है?
कुछ बेंचमार्क पर, हां: SWE-bench Pro, OSWorld-Verified और LiveCodeBench v6 सब अलीबाबा के अपने प्रकाशित आंकड़ों में Qwen के पक्ष में हैं। दूसरों पर, Opus आगे है (Terminal-Bench 2.1, GPQA Diamond)। व्यापक रूप से दोहराया गया "19 में से 15 टेस्ट पर Opus को पीछे छोड़ता है" वाला आंकड़ा Qwen के आधिकारिक मॉडल कार्ड पर नहीं दिखता और एक असत्यापित सोशल मीडिया पोस्ट तक जाता है। इसे तथ्य न मानें।
Qwen3.8-27B चलाने के लिए मुझे किस GPU की ज़रूरत है?
एक 4-बिट क्वांटाइज़्ड बिल्ड (Q4_K_M, लगभग 16GB) मध्यम कॉन्टेक्स्ट लंबाई पर RTX 3090 या 4090 जैसे 24GB कंज़्यूमर GPU पर फ़िट होता है। पूरे BF16 वेट 51.8GB के हैं और इन्हें 80GB-क्लास कार्ड या कई GPU चाहिए। लंबा कॉन्टेक्स्ट (लगभग 32-64K टोकन से आगे) कम प्रिसिज़न पर भी उस मेमोरी ज़रूरत से कहीं ऊपर धकेल देता है जो एक कंज़्यूमर GPU रख सकता है।
क्या Qwen3.8-27B कमर्शियल इस्तेमाल के लिए मुफ़्त है?
हां। यह Apache 2.0 लाइसेंस के तहत रिलीज़ हुआ है, जो कमर्शियल इस्तेमाल, बदलाव और पुनर्वितरण की इजाज़त देता है, कुछ ओपन-वेट मॉडल के उलट जो कमर्शियल डिप्लॉयमेंट को सीमित करते हैं।
क्या मैं रिसर्च के लिए Gemini Notebook की जगह Qwen3.8-27B इस्तेमाल कर सकता हूं?
एक सीधे विकल्प के तौर पर नहीं। Gemini Notebook एक होस्टेड प्रोडक्ट है जिसमें स्रोत प्रबंधन, साइटेशन, Audio Overview और शुरू से ही रिसर्च वर्कफ़्लो के लिए बना वेब इंटरफ़ेस है। Qwen3.8-27B रॉ मॉडल वेट है: आपको दस्तावेज़-लोडिंग, चंकिंग और इंटरफ़ेस ख़ुद बनाना होगा, या LM Studio के डॉक्यूमेंट चैट जैसे किसी रैपर टूल का इस्तेमाल करना होगा। जब दस्तावेज़ों को किसी क्लाउड सर्वर से दूर रखना सुविधा से ज़्यादा मायने रखे, तब यह सही चुनाव है।
एक क्लिक में अपना NotebookLM एक्सपोर्ट करें
मुफ़्त Chrome एक्सटेंशन। PDF, Word और Markdown। आपकी मशीन पर ही रेंडर होता है — कुछ भी अपलोड नहीं होता।