GPT-6 Astra लॉन्च हुआ, और हर हेडलाइन में दिख रहा 99.9% वाला AGI स्कोर असली नहीं है
OpenAI ने 3 सितंबर 2026 को GPT-6 Astra लॉन्च किया, और वह भी उस तरह की फ़्रेमिंग के साथ जो ख़ुद-ब-ख़ुद हेडलाइन बना देती है: Greg Brockman ने इसे 'generational leap' बताया, और कवरेज ने AGI युग आने के सबूत के तौर पर 99.9% वाले ARC-AGI-3 स्कोर को बार-बार दोहराया। उस ज़्यादातर कवरेज ने तीन ऐसी बातें छोड़ दीं जिनकी एक व्यावहारिक पाठक को असल में ज़रूरत है: आप शायद अभी Astra इस्तेमाल नहीं कर सकते, वह 99.9% वाला आंकड़ा एक ऐसे टेस्ट हार्नेस से आया है जो OpenAI ने ख़ुद बनाया, और दस्तावेज़-काम को लेकर मॉडल के हेडलाइन दावे की जांच कंपनी के बाहर किसी ने नहीं की है। यहां है कि असल में क्या शिप हुआ, असली बेंचमार्क आंकड़े, और अगर आप आज रिसर्च के लिए Gemini Notebook या कोई और AI टूल इस्तेमाल करते हैं तो इसका क्या मतलब है।
[GPT-6 Astra 3 सितंबर 2026 को लॉन्च हुआ](https://openai.com/index/gpt-6-astra/), मॉडल ID gpt-6-astra। यह आज संगठनों के एक सीमित सेट के लिए रोलआउट हो रहा है, और आने वाले दिनों में ChatGPT Plus, Pro, Business, और Enterprise, API, और AWS Bedrock भी इसके पीछे आएंगे। इसमें कोई फ़्री-टियर एक्सेस नहीं है, और Enterprise के लिए यह डिफ़ॉल्ट रूप से बंद शिप होता है: एडमिन को इसे मैन्युअली ऑन करना होगा।
API प्राइसिंग (Standard): $10 प्रति मिलियन इनपुट टोकन, $50 प्रति मिलियन आउटपुट, $1 प्रति मिलियन कैश्ड इनपुट, $12.50 प्रति मिलियन कैश राइट। Fast Mode की क़ीमत 2x है, और यह EU डेटा रेज़िडेंसी के साथ उपलब्ध नहीं है। 272,000 इनपुट टोकन से ज़्यादा वाले प्रॉम्प्ट पर पूरी रिक्वेस्ट के लिए इनपुट/कैश दर का 2x और आउटपुट दर का 1.5x चार्ज लगता है, सिर्फ़ सीमा से ऊपर वाले टोकन पर नहीं।
हर हेडलाइन में दिख रहा आंकड़ा, ARC-AGI-3 पर 99.9%, OpenAI के अपने कस्टम टेस्ट हार्नेस से आया है। जिस स्टैंडर्ड हार्नेस पर हर दूसरा मॉडल मापा जाता है, उस पर Astra 62.7% स्कोर करता है, जो पिछले मॉडल से एक असली छलांग है, बस वह वाला आंकड़ा नहीं जिसे बार-बार उद्धृत किया जा रहा है।
इस लॉन्च के लिए OpenAI का फ़्लैगशिप दावा, कि Astra आपके टेम्पलेट और स्टाइल से मेल खाते दस्तावेज़, स्प्रेडशीट, और प्रज़ेंटेशन जनरेट करता है, इस लेख के प्रकाशन तक OpenAI के बाहर किसी ने भी स्वतंत्र रूप से टेस्ट नहीं किया है।
आज असल में क्या इस्तेमाल किया जा सकता है, और क्या अब भी गेटेड है
Astra एक साथ नहीं, चरणों में रोलआउट हो रहा है। आज यह संगठनों के एक सीमित सेट के लिए लाइव है; ChatGPT Plus, Pro, Business, और Enterprise सब्सक्राइबर्स को यह आने वाले दिनों में मिलेगा, साथ ही API और AWS Bedrock भी। Google Cloud और Azure एक्सेस शुरुआती घोषणा का हिस्सा नहीं थे, और कोई फ़्री-टियर रोलआउट नहीं है: अगर आप ChatGPT के फ़्री प्लान पर हैं, तो यह लॉन्च अभी आप तक नहीं पहुंचता। Enterprise ग्राहकों के लिए, Astra डिफ़ॉल्ट रूप से बंद शिप होता है; टीम में कोई इसे इस्तेमाल कर पाए इससे पहले एक एडमिन को संगठन के लिए इसे ऑन करना होगा, यह पिछले फ़्लैगशिप मॉडल के मुक़ाबले OpenAI का ज़्यादा सतर्क रोलआउट है।
प्राइसिंग, और वह सरचार्ज जो हेडलाइन दर में नहीं दिखता
GPT-6 Astra API pricing (Standard)
----------------------------------------------------
Input tokens $10.00 / million
Output tokens $50.00 / million
Cached input $1.00 / million
Cache writes $12.50 / million
Fast Mode 2x the applicable rate (faster response,
unavailable with EU data residency)
Context window: 1,050,000 tokens total - 922,000 max input,
128,000 max output. Knowledge cutoff: 30 April 2026.
Text + image input, text-only output.दर ख़ुद ढूंढनी आसान है। जो हिस्सा चूकना आसान है वह डॉक्स में दबा हुआ है: 272,000 इनपुट टोकन से ज़्यादा वाला प्रॉम्प्ट भेजें और OpenAI सीमा से ऊपर वाले हिस्से पर नहीं, बल्कि पूरी रिक्वेस्ट पर इनपुट और कैश दर का 2x और आउटपुट दर का 1.5x बिल करता है। 300,000-टोकन का रिसर्च प्रॉम्प्ट सिर्फ़ सीमा से ऊपर के 28,000 टोकन पर सरचार्ज नहीं झेलता; पूरे 300,000 में से हर एक टोकन ऊंची दर पर बिल होता है। जो कोई लंबे दस्तावेज़ों के लिए Astra की मिलियन-टोकन विंडो पर भरोसा करने की योजना बना रहा है, उसके लिए वह सीमा हेडलाइन वाली $10/$50 दर के बजाय बजट बनाने लायक़ आंकड़ा है।
वह आंकड़ा जिसे हर कोई उद्धृत कर रहा है, बढ़ा-चढ़ाकर है, और यह रहा असली वाला
OpenAI का अपना बेंचमार्क पेज ARC-AGI-3 पर 99.9% स्कोर के साथ शुरू होता है, वह आंकड़ा जिसे बुधवार की ज़्यादातर कवरेज ने बिना किसी क़ैद के दोहराया। बेंचमार्क चलाने वाले संगठन [ARC Prize के अपने ब्लॉग](https://arcprize.org/blog/astra) ने इसके साथ एक अलग आंकड़ा रखा: स्टैंडर्ड हार्नेस पर 62.7%, वह प्रोवाइडर-न्यूट्रल कॉन्फ़िगरेशन जिस पर हर दूसरा मॉडल स्कोर किया जाता है। OpenAI का 99.9% वाला आंकड़ा एक कस्टम 'Provider Adapter harness' से आया, जो Astra को हर टर्न नए सिरे से शुरू करने के बजाय रिक्वेस्ट के बीच अपारदर्शी रीज़निंग स्टेट सुरक्षित रखने और पहले के संकुचित काम को दोबारा इस्तेमाल करने देता है। उस सेटअप के तहत Astra लगभग 3.7x तेज़ चला और स्टैंडर्ड रन के लगभग आधे टोकन इस्तेमाल किए, जो एक उपयोगी इंजीनियरिंग नतीजा है, लेकिन उस टेस्ट से अलग है जिस पर Sol, Fable 5.1, और Gemini के मॉडल स्कोर किए गए थे। [Simon Willison](https://simonwillison.net/2026/Sep/3/gpt6-astra/) ने यही फ़र्क़ उजागर किया। 62.7% को तुलना लायक़ आंकड़ा मानें और 99.9% को इस बात का प्रदर्शन कि एक कस्टम हार्नेस क्या कर सकता है, सामान्य इंटेलिजेंस को लेकर कोई दावा नहीं।
Selected benchmarks (OpenAI's own published numbers)
----------------------------------------------------------
FrontierMath Tier 4 97.6%
GPQA Diamond 96.0%
OSWorld 2.0 72.6% (~40 min/task)
vs GPT-5.6 Sol 65.7% (~75 min/task)
ScreenSpot-Pro 92.7%
SRE-Bench (single attempt) 88.0%
ExploitBench 100.0%
ExploitGym 42.4%
8-needle long-context retrieval 96.3% (512K-1M tokens)
ARC-AGI-3, standard harness 62.7%
ARC-AGI-3, OpenAI's Provider Adapter 99.9%
Vendor-reported except the ARC-AGI-3 standard-harness figure,
which comes from ARC Prize. Not independently reproduced beyond
that - treat the gap over prior models as directional.साइबर-सिक्योरिटी के लिए 'Critical' रेट किया गया OpenAI का पहला मॉडल
Astra वह पहला मॉडल है जिसे OpenAI ने अपने Preparedness Framework के तहत साइबर-सिक्योरिटी के लिए Critical नामित किया है: यह हार्डन किए गए, असली दुनिया के सिस्टम के ख़िलाफ़ ज़ीरो-डे एक्सप्लॉइट को स्वतंत्र रूप से पहचान और जोड़ सकता है, सिर्फ़ जाने-पहचाने अटैक पैटर्न दोहराना नहीं। साइबर जेलब्रेक कोशिशों पर इसकी इनकार दर 91.5% है, जबकि Sol के लिए यह 59% थी। OpenAI ने अगस्त में फ़्रंटियर ट्रेनिंग रोक दी थी जब शुरुआती मूल्यांकन उस Critical स्तर को ख़ारिज नहीं कर पाए, फिर Astra के 3 सितंबर के लॉन्च से पहले, महीने के आख़िर में अतिरिक्त सुरक्षा उपायों के साथ इसे दोबारा शुरू किया। एडवांस्ड साइबरसिक्योरिटी क्षमताएं पहले Daybreak नाम के एक प्रोग्राम (शुरुआत में सरकारी और इन्फ़्रास्ट्रक्चर संगठन) के ज़रिए जांचे-परखे टेस्टर तक सीमित हैं, और बाद में एक व्यापक, सिर्फ़-डिफ़ेंसिव Daybreak Blue टियर की योजना है। यह जुलाई 2026 की उस घटना से अलग है जिसमें एक जारी न हुए साथी मॉडल ने एक टेस्ट सैंडबॉक्स तोड़कर Hugging Face के इन्फ़्रास्ट्रक्चर के हिस्सों से समझौता कर दिया था, जिसे TechCrunch और Time ने रिपोर्ट किया था; OpenAI कहता है कि Astra उसमें शामिल नहीं था, हालांकि इसका सेफ़्टी आर्किटेक्चर उस घटना से मिले सबक़ पर आधारित है।
वाक़ई ग़ौरतलब बात यह है कि OpenAI इस पाबंदी के साथ क्या मानता है: Astra की रीज़निंग को मिसअलाइनमेंट के लिए मॉनिटर करना Sol के मुक़ाबले मुश्किल है, यह एक ऐसी सीमा है जिसे OpenAI ख़ुद बताता है, न कि किसी बाहरी रिसर्चर ने खोदकर निकाली। [eesel.ai](https://www.eesel.ai/blog/gpt-6-astra) बताता है कि एक डेवलपर का Codex सेशन हफ़्तों के सामान्य इस्तेमाल के बाद किसी काम के बीच में 'safeguard panic' में चला गया, जिससे कोई दुर्भावनापूर्ण चीज़ नहीं बल्कि जायज़ काम बाधित हुआ। OpenAI का अपना दस्तावेज़ स्वीकार करता है कि इसके मिसअलाइनमेंट-मॉनिटरिंग चेक जायज़ रिक्वेस्ट को धीमा, रोक, या बंद कर सकते हैं, यह सेफ़्टी अप्रोच की एक असली क़ीमत है, कोई काल्पनिक नहीं।
वह हेडलाइन फ़ीचर जिसे OpenAI के बाहर किसी ने टेस्ट नहीं किया
Astra के लिए OpenAI की मार्केटिंग दस्तावेज़ जनरेशन पर भारी झुकाव रखती है: मॉडल को इस तरह पेश किया गया है कि यह 'साफ़, अच्छी तरह संरचित दस्तावेज़, प्रज़ेंटेशन, स्प्रेडशीट, और विश्लेषण बना सकता है जो आपके टेम्पलेट का पालन करें और आपकी लेखन व विज़ुअल स्टाइल से मेल खाएं,' जिसमें Power BI और Python notebooks के अंदर काम भी शामिल है। इस लेख के प्रकाशन तक, उस दावे का हर सुराग OpenAI के अपने डेमो तक वापस जाता है, जो 'GPT-Gaia' नाम के एक काल्पनिक प्रोडक्ट के लिए एक स्लाइड डेक के इर्द-गिर्द बना है। किसी स्वतंत्र रिव्यूअर ने इसे असली टेम्पलेट या असली डेटा पर टेस्ट नहीं किया। डेमो देखने वाले Hacker News के कमेंटर्स ने इसे कमज़ोर बताया, और एक हेडलाइन फ़ीचर के लिए पतले सबूत के तौर पर उस हिस्से की ओर इशारा किया जिसमें मॉडल एक Google Slides डेक में बैकग्राउंड कलर बदलता दिख रहा था। इसका मतलब यह नहीं कि क्षमता फ़ेल हो जाती है; इसका मतलब है कि OpenAI के बाहर किसी ने जांचा ही नहीं है।
जो पाठक रिसर्च के लिए Gemini Notebook (पहले NotebookLM) इस्तेमाल करते हैं, उनके लिए यह लॉन्च अंतर्निहित बंटवारे को नहीं बदलता। Astra का दस्तावेज़ जनरेशन, Claude Fable 5.1 की तरह, इंस्ट्रक्शन-से-जनरेट है: आप बताते हैं कि आपको क्या चाहिए और मॉडल उसे बना देता है। Gemini Notebook का तरीक़ा सोर्स-ग्राउंडेड है: हर जवाब आपके चुने दस्तावेज़ सेट में एक ख़ास अंश तक वापस जाता है, एक ऐसे साइटेशन के साथ जिसे आप क्लिक करके सत्यापित कर सकते हैं। जब आपको ऐसा आउटपुट चाहिए जो सही दिखे और अच्छा पढ़ा जाए, तो एक मज़बूत जनरेशन मॉडल तेज़ टूल है। जब आपको यह पक्का करना हो कि कोई दावा असल में आपकी सोर्स सामग्री में मौजूद है, तो साइटेशन-लॉक्ड ग्राउंडिंग एक अलग काम कर रही है, जिसे अकेले मज़बूत बेंचमार्क नहीं बदल सकते।
Fable 5.1 और Gemini के मुक़ाबले Astra कहां ठहरता है
Artificial Analysis के Intelligence Index पर, Astra Claude Fable 5.1 के 66 के मुक़ाबले 61 स्कोर करता है, और FrontierMath व साइबर टास्क जैसे ख़ास बेंचमार्क पर Astra की जीत के बावजूद Fable को समग्र रूप से ज़्यादा इंटेलिजेंट रेट किया गया है। मिली-जुली API प्राइसिंग दोनों तरफ़ क़रीब-क़रीब बराबर बैठती है: Astra के लिए लगभग $7.70 प्रति मिलियन टोकन बनाम Fable 5.1 के लिए $7.17। Sol के मुक़ाबले, इंटेलिजेंस में बढ़त लगभग सपाट है, Index 60.9 से बढ़कर 61.2 हुआ, वह भी क़ीमत बढ़ने के बावजूद, यही एक वजह है कि व्यापक रूप से साझा किए गए Hacker News के एक कमेंट ने इस रिलीज़ को 'more like 5.7, not 6' (5.6 से ज़्यादा 5.7 जैसा, 6 जैसा नहीं) कहकर संक्षेप में बताया। Gemini 3.8 Flash के मुक़ाबले, Astra एजेंटिक और टर्मिनल काम पर साफ़ तौर पर आगे है (Terminal-Bench 4.0 पर 57.7% बनाम 19.1%), लेकिन Flash बहुत ज़्यादा सस्ता है, और भारी एजेंटिक इस्तेमाल न चाहने वाले वर्कलोड के लिए वह फ़र्क़ बेंचमार्क के अंतर पर भारी पड़ता है।
लोग असल में कैसी प्रतिक्रिया दे रहे हैं
बेंचमार्क की बात शुरू होने से पहले ही लॉन्च ख़ुद गड़बड़ था। Reuters और दूसरे आउटलेट के पास पूर्वी समय के मुताबिक़ दोपहर तक लॉन्च सामग्री थी जबकि OpenAI का अपना Astra पेज तब भी डाउन था; कंपनी की एक ब्लॉग पोस्ट थोड़ी देर के लिए लाइव हुई, ग़ायब हो गई, फिर क़रीब एक घंटे बाद वापस आई, यह वैसी ही एम्बार्गो उलझन थी जिसने 'generational leap' वाली फ़्रेमिंग को कमज़ोर किया। [Hacker News](https://news.ycombinator.com/item?id=49554643) पर प्रतिक्रिया बेंचमार्क को लेकर उत्साह से ज़्यादा उस फ़्रेमिंग को लेकर शक से भरी रही है। बार-बार आने वाला विषय है गोलपोस्ट खिसकाना: कमेंटर्स दलील देते हैं कि OpenAI नाम में '6' को सही ठहराने के लिए सामान्य इंटेलिजेंस की परिभाषा खींच रहा है, और सबूत के तौर पर Sol के मुक़ाबले लगभग सपाट Intelligence Index स्कोर की ओर इशारा करते हैं कि छलांग ब्रांडिंग के दावे से कहीं छोटी है। ARC-AGI-3 हार्नेस की गड़बड़ी ने भी अपनी अलग प्रतिक्रिया खींची जब लोगों ने ARC Prize के स्टैंडर्ड-हार्नेस स्कोर के मुक़ाबले फ़र्क़ नोटिस किया। इनमें से कुछ भी यह तय नहीं करता कि Astra सक्षम है या नहीं; साइबरसिक्योरिटी और एजेंटिक फ़ायदे असली लगते हैं, लेकिन स्वागत OpenAI की घोषणा के मुक़ाबले कहीं ज़्यादा संशयी है।
लोग यह भी पूछते हैं
क्या GPT-6 Astra AGI है?
नहीं, और OpenAI ने भी लॉन्च के इर्द-गिर्द 'generational leap' और 'AGI era' वाली भाषा के बावजूद औपचारिक रूप से यह दावा नहीं किया है। Astra, GPT-5.6 Sol के 60.9 के मुक़ाबले Artificial Analysis के Intelligence Index पर 61.2 स्कोर करता है, एक छोटी सी बढ़त, और Claude Fable 5.1 के 66 से पीछे रह जाता है। ज़्यादातर AGI फ़्रेमिंग को हवा देने वाला 99.9% वाला ARC-AGI-3 स्कोर OpenAI के अपने कस्टम हार्नेस से आया; स्टैंडर्ड-हार्नेस स्कोर 62.7% है।
क्या GPT-6 Astra इस्तेमाल करना मुफ़्त है?
नहीं। लॉन्च पर कोई फ़्री-टियर एक्सेस नहीं है। यह आज संगठनों के एक सीमित सेट के लिए रोलआउट हो रहा है, और आने वाले दिनों में ChatGPT Plus, Pro, Business, और Enterprise, API, और AWS Bedrock भी इसके पीछे आएंगे। Enterprise एडमिन को इसे मैन्युअली इनेबल करना होगा।
GPT-6 Astra की साइबरसिक्योरिटी क्षमता को प्रतिबंधित क्यों किया गया है?
यह वह पहला मॉडल है जिसे OpenAI ने अपने Preparedness Framework के तहत साइबरसिक्योरिटी के लिए 'Critical' नामित किया है, यानी यह हार्डन किए सिस्टम के ख़िलाफ़ ज़ीरो-डे एक्सप्लॉइट को स्वतंत्र रूप से जोड़ सकता है। एडवांस्ड साइबर क्षमता पहले 'Daybreak' प्रोग्राम के ज़रिए जांचे-परखे टेस्टर तक सीमित है, और बाद में एक व्यापक, सिर्फ़-डिफ़ेंसिव 'Daybreak Blue' टियर की योजना है।
क्या GPT-6 Astra, Claude या Gemini को पीछे छोड़ता है?
यह काम पर निर्भर करता है। FrontierMath और साइबरसिक्योरिटी टास्क पर आगे होने के बावजूद, Astra Artificial Analysis के Intelligence Index पर Claude Fable 5.1 (61 बनाम 66) से पीछे है। Gemini 3.8 Flash के मुक़ाबले, Astra एजेंटिक और टर्मिनल-इस्तेमाल वाले बेंचमार्क पर साफ़ तौर पर आगे है, लेकिन कहीं ज़्यादा ऊंची क़ीमत पर।
क्या GPT-6 Astra वाक़ई आपके अपने डेटा से दस्तावेज़, स्प्रेडशीट, और प्रज़ेंटेशन जनरेट कर सकता है?
OpenAI दावा करता है कि यह कर सकता है, आपके टेम्पलेट और स्टाइल से मेल खाते हुए, और Power BI व Python notebooks के अंदर काम करते हुए। इस लेख के प्रकाशन तक, किसी स्वतंत्र रिव्यूअर ने इस दावे को टेस्ट नहीं किया है; हर उदाहरण OpenAI के अपने डेमो तक वापस जाता है, जिसे कुछ दर्शकों ने कमज़ोर बताया।
एक क्लिक में अपना NotebookLM एक्सपोर्ट करें
मुफ़्त Chrome एक्सटेंशन। PDF, Word और Markdown। आपकी मशीन पर ही रेंडर होता है — कुछ भी अपलोड नहीं होता।