GPT-6 Astra Features: OpenAI ने आर्टिफिशियल इंटेलिजेंस की दुनिया में एक बड़ा दावा खेलते हुए GPT-6 Astra पेश कर दिया है। बता दें कि कंपनी के मुताबिक यह उसका नया frontier model है जो Artificial General Intelligence यानी AGI की दिशा में एक अहम पड़ाव हो सकता है। वहीं इसको लेकर OpenAI के को-फाउंडर और प्रेसिडेंट Greg Brockman ने एक प्रेस ब्रीफिंग के अंत में कहा, “Welcome to the AGI era”
Astra की खासियत के बारे में बताए तो यह सिर्फ सवालों के जवाब नहीं देता। इस नई तकनीक को इस तरह डिजाइन किया गया है कि AI इंसान की तरह कंप्यूटर चला सके, वेबसाइट्स खोल सके, स्प्रेडशीट में काम कर सके और कई चरणों वाले काम को खुद पूरा कर सके।
OpenAI ने इसको लेकर जानकारी दी है कि Astra ब्राउजर, वेबसाइट, स्प्रेडशीट और डेस्कटॉप एप्लिकेशन के साथ काम कर सकता है। यह ऑनलाइन फॉर्म भरने, CRM अपडेट करने, कैलेंडर व्यवस्थित करने, वेब रिसर्च करने और उसके आधार पर डॉक्यूमेंट या ईमेल तैयार करने जैसे काम आसानी से कर लेते है। कंपनी के अनुसार यह Python notebooks, Power BI, KiCad और FreeCAD जैसे टूल्स के साथ भी काम कर सकता है। जिसका सीधा मतलब है कि यूजर को हर छोटे कदम के लिए AI को निर्देश देने की जरूरत कम हो सकती है।
| GPT-6 Astra की प्रमुख क्षमता | जानकारी |
|---|---|
| Computer Use | ब्राउजर, वेबसाइट और डेस्कटॉप ऐप्स संचालित करना |
| OSWorld 2.0 | 72.6% स्कोर, लगभग 40 मिनट प्रति टास्क |
| ARC-AGI-3 | 98.6% रिपोर्टेड स्कोर |
| FrontierMath Tier 4 v2 | 97.60% |
| DeepSWE v1.1 | 74.10% |
| BenchCAD | 95.90% |
| GPQA Diamond | 96% |
| ExploitBench | 100% |
इन नीचे दिए गए आंकड़ों में GPT-6 Astra की तुलना GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 और Gemini 3.8 Flash से की गई है। वहीं कुछ benchmarks में सभी मॉडलों के आंकड़े उपलब्ध नहीं हैं इसलिए खाली स्थान का अर्थ है कि संबंधित स्कोर उपलब्ध नहीं कराया गया है।
| Evaluation Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 98.6% [1] | 7.80% | 30.2% (high) | — | — | — |
| FrontierMath Tier 4 (v2) | 97.60% | 83.00% | 87.80% | 87.80% | 73.20% | — |
| Agents' Last Exam | 59.30% | 52.70% | 48.7% (xhigh) | 52.70% | — | — |
| AutomationBench | 41.40% | 18.10% | 31.40% | 17.40% | 26.90% | — |
| BenchCAD | 95.90% | 83.30% | 84.3% [5] | 67.5% [5] | 82.1% [5] | — |
| DeepSWE v1.1 | 74.10% | 70.80% | 67.40% | 69.90% | 68.80% | 73.70% |
| Terminal-Bench Science 0.1 | 65% | 22.40% | 52.60% | 24.70% | 29.00% | — |
| GPQA Diamond | 96% | 94.60% | 93.70% | 92.60% | 93.20% | 95.30% |
| GeneBench Pro | 39.00% | 28.70% | — | — | — | — |
| MedChemBench (internal) | 49.70% | 47.40% | — | — | — | — |
| HealthBench Professional (length-adjusted) | 63.40% | 60.50% | 56.6% [9] | 60.9% [57.5%] | 52.10% | — |
| ExploitBench | 100.00% | 78.50% | 70% | — | — | — |
| SRE-Bench (four attempts) | 99.20% | 68.70% | — | — | — | — |
| Auto-review circumvention (internal; lower is better) | 0% | 0.29% | — | — | — | — |
दी गई तालिका के अनुसार GPT-6 Astra ने ARC-AGI-3, FrontierMath, BenchCAD, ExploitBench और SRE-Bench जैसे कई परीक्षणों में मजबूत प्रदर्शन किया है। वहीं इसमें खासतौर पर Auto-review circumvention में 0% स्कोर महत्वपूर्ण है क्योंकि इस benchmark में कम स्कोर बेहतर माना जाता है।
OpenAI ने इसको लेकर आगे जानकारी दी है कि OSWorld 2.0 के ऑफलाइन सबसेट में Astra ने 72.6% स्कोर हासिल किया और एक टास्क पूरा करने में करीब 40 मिनट लिए है। वहीं इसके मुकाबले GPT-5.6 Sol का स्कोर 65.7% और समय करीब 75 मिनट था। जिसको देखते हुए कंपनी का दावा है कि Astra प्रति टास्क लगभग 47% कम समय लेता है।
वहीं OpenAI शोधकर्ता Mia Glaese ने कहा, “एस्ट्रा के साथ, यूज़र्स को अपनी उंगलियों पर ज़बरदस्त काबिलियत मिलती है और वे ऐसे काम कर सकते हैं जो एक साल से भी कम समय पहले बहुत दूर लगते थे।” और उनके मुताबिक लोग अलग-अलग एप्लिकेशन में ज्यादा जटिल काम AI को सौंप सकेंगे।
वैसे तो यहीं पर कहानी थोड़ी पेचीदा हो जाती है। Astra का ARC-AGI-3 पर 98.6% स्कोर प्रभावशाली है लेकिन ऐसे बेंचमार्क में मॉडल के साथ इस्तेमाल होने वाले टूल, मेमोरी और दूसरे सिस्टम भी परिणाम को प्रभावित कर सकते हैं। वहीं OpenAI खुद AGI की परिभाषा को पूरी तरह निश्चित नहीं मानता। Greg Brockman ने कहा, "AGI की परिभाषा हर किसी के लिए अलग-अलग होती है, व्यक्तिगत रूप से मुझे लगता है कि हम उस मुकाम पर पहुँच चुके हैं।" वहीं उन्होंने यह भी कहा कि "मुझे लगता है कि इसके पक्ष में काफी ठोस तर्क मौजूद हैं। मुझे लगता है कि यह सोचना गलत नहीं है कि हम अब AGI के दौर में हैं।"
इस नई तकनीक के साथ एक सवाल यह भी है कि OpenAI के लॉन्च में कंपनी का अपना GDPval benchmark प्रमुखता से क्यों नहीं दिखा था। यह बेंचमार्क वास्तविक आर्थिक और प्रोफेशनल काम को मापने के लिए बनाया गया था। Astra के एंटरप्राइज दावों के लिहाज से यह काफी उचित हो सकता था। लेकिन अभी के लिए Astra के प्रदर्शन का आकलन कई अलग-अलग benchmarks और demonstrations के आधार पर किया जा रहा है। इसलिए इसे AGI का निर्णायक प्रमाण मानने से पहले वास्तविक दुनिया में इसकी विश्वसनीयता, लागत, सुरक्षा और लगातार लंबे काम पूरे करने की क्षमता देखना ज्यादा महत्वपूर्ण होने वाला है।