कोडिंग, गणित, वैज्ञानिक रिसर्च और साइबर सुरक्षा में दमदार प्रदर्शन का दावा; AI एजेंट के तौर पर जटिल काम करने में सक्षम
कोडिंग, गणित, वैज्ञानिक रिसर्च और साइबर सुरक्षा में दमदार प्रदर्शन का दावा; AI एजेंट के तौर पर जटिल काम करने में सक्षम
OpenAI ने अपने सबसे शक्तिशाली AI मॉडल के तौर पर GPT-6 एस्ट्रा पेश किया है। कंपनी के मुताबिक, यह मॉडल पारंपरिक चैटबॉट से आगे बढ़कर एक ऑटोनॉमस AI एजेंट के रूप में काम करने के लिए तैयार किया गया है। GPT-6 एस्ट्रा को कोडिंग, वैज्ञानिक रिसर्च, कंप्यूटर यूज, गणित और साइबर सुरक्षा जैसे क्षेत्रों में उच्च स्तर का प्रदर्शन करने के लिए डिजाइन किया गया है। हालांकि, AI की दुनिया में Google का Gemini और Anthropic का Claude पहले से ही मजबूत दावेदार हैं और कई क्षेत्रों में GPT-6 एस्ट्रा को कड़ी टक्कर दे रहे हैं।
हालिया प्रकाशित बेंचमार्क आंकड़ों के मुताबिक, GPT-6 एस्ट्रा ने कंप्यूटर यूज, कोडिंग और गणित जैसे तकनीकी परीक्षणों में शानदार प्रदर्शन किया है। कंप्यूटर यूज के क्षेत्र में एस्ट्रा ने Agents Last Exam में 59.3 प्रतिशत और OSWorld में 72.6 प्रतिशत स्कोर हासिल किया। वहीं Claude का स्कोर 55.8 प्रतिशत रहा। Gemini के लिए इन परीक्षणों का सीमित प्रकाशित डेटा उपलब्ध बताया गया है।
कोडिंग के मोर्चे पर भी एस्ट्रा ने मजबूत प्रदर्शन किया। Terminal-Bench 4.0 में इसने 57.9 प्रतिशत और SWE-Bench में 74.1 प्रतिशत का स्कोर दर्ज किया। इन परीक्षणों में Claude ने भी कड़ी चुनौती पेश की, जबकि Gemini का प्रदर्शन Terminal-Bench के उपलब्ध आंकड़ों में पीछे रहा।
गणित के कठिन FrontierMath Tier 4 टेस्ट में GPT-6 एस्ट्रा ने 97.6 प्रतिशत का स्कोर हासिल किया, जबकि Claude का स्कोर 87.8 प्रतिशत रहा। वैज्ञानिक तर्क क्षमता के GPQA Diamond टेस्ट में भी एस्ट्रा ने 96 प्रतिशत स्कोर दर्ज किया। इसकी तुलना में Gemini 3.8 Flash ने 95.3 प्रतिशत और Claude ने करीब 93 से 94 प्रतिशत के बीच प्रदर्शन किया।
साइबर सुरक्षा से जुड़े ExploitBench और ExploitGym जैसे आकलनों में भी एस्ट्रा ने प्रभावी प्रदर्शन किया। उपलब्ध आंकड़ों के आधार पर इन तकनीकी क्षेत्रों में मॉडल ने अपनी मजबूत स्थिति दर्ज कराई है। हालांकि, अलग-अलग बेंचमार्क की पद्धति और उपलब्ध डेटा में अंतर होने के कारण इन आंकड़ों की तुलना को उसी संदर्भ में देखना जरूरी है।
एक बार में बड़ी मात्रा में डेटा समझने की क्षमता
किसी AI मॉडल की क्षमता का आकलन केवल सवालों के जवाब देने से नहीं होता। उसकी Context Window भी बेहद महत्वपूर्ण होती है। टोकन AI द्वारा प्रोसेस किए जाने वाले टेक्स्ट की एक मूल इकाई है और सामान्य तौर पर एक टोकन को लगभग 0.75 शब्द के बराबर माना जा सकता है।
एक मिलियन टोकन करीब 7.5 लाख शब्दों के बराबर हो सकते हैं। इतनी बड़ी Context Window वाला मॉडल एक ही प्रॉम्प्ट में पूरी किताब, बड़े कोडबेस या लंबे ऑडियो ट्रांसक्रिप्ट जैसी सामग्री का विश्लेषण कर सकता है। वहीं, MRCR जैसे परीक्षण यह जांचते हैं कि मॉडल बहुत बड़े डेटा सेट के बीच से किसी खास जानकारी को कितनी सटीकता से खोज पाता है।
सिर्फ चैटबॉट नहीं, AI एजेंट के तौर पर काम करेगा एस्ट्रा
GPT-6 एस्ट्रा को सामान्य चैटबॉट की सीमाओं से आगे ले जाकर AI एजेंट के तौर पर विकसित किया गया है। यह वेब ब्राउजिंग, सॉफ्टवेयर संचालन, स्प्रेडशीट और प्रेजेंटेशन एडिटिंग, कोड लिखने, एप्लिकेशन की समस्याओं को ठीक करने और वैज्ञानिक डेटा के विश्लेषण जैसे काम कर सकता है।
इसका उद्देश्य ऐसे कई चरणों वाले वर्कफ्लो को पूरा करना है, जिनमें पहले लगातार मानवीय हस्तक्षेप की जरूरत पड़ती थी। OpenAI के मुताबिक, मॉडल यूजर के इरादे को बेहतर तरीके से समझने, तय सीमाओं के भीतर काम करने और जरूरत पड़ने पर स्पष्टीकरण मांगने में सक्षम है। कंपनी का दावा है कि यह ऑटोनॉमस वर्कफ्लो के दौरान अनावश्यक काम करने से भी बचता है।
OpenAI के अनुसार, एस्ट्रा GPT-5.6 Sol की तुलना में तेज है और कम आउटपुट टोकन का इस्तेमाल करता है। इससे डेवलपर्स और एंटरप्राइज यूजर्स के लिए इसकी दक्षता बढ़ने का दावा किया गया है।
Claude की ताकत: कोडिंग और तकनीकी लेखन
Anthropic का Claude AI क्षेत्र में पहले से मजबूत विकल्प बना हुआ है। खासकर कोडिंग, डॉक्यूमेंटेशन, लंबे दस्तावेजों और तकनीकी लेखन में इसकी क्षमता को प्रमुखता दी जाती है। Claude FrontierCode और Terminal-Bench जैसे कोडिंग परीक्षणों में अच्छा प्रदर्शन करता है और बड़े कोडबेस व लंबे दस्तावेजों को समझने की क्षमता के लिए भी जाना जाता है।
कई डेवलपर्स इसकी स्वाभाविक लेखन शैली और व्यवस्थित जवाबों को पसंद करते हैं। यही वजह है कि तकनीकी रिपोर्ट, डॉक्यूमेंटेशन और सहयोगी कार्यों के लिए Claude को उपयोगी विकल्प माना जाता है।
Gemini की सबसे बड़ी ताकत Google का इकोसिस्टम
Google का Gemini अलग रणनीति के साथ AI बाजार में आगे बढ़ रहा है। इसकी सबसे बड़ी ताकत Google के विशाल इकोसिस्टम के साथ इसका इंटीग्रेशन है। Gemini को Gmail, Docs, Sheets, Meet, Android, Search और Google Cloud जैसी सेवाओं के साथ जोड़ा गया है।
इस इंटीग्रेशन का फायदा खास तौर पर उन यूजर्स को मिल सकता है जो पहले से Google के इन प्रोडक्ट्स पर निर्भर हैं। ऐसे में Gemini का अनुभव केवल AI चैट तक सीमित नहीं रहता, बल्कि रोजमर्रा के डिजिटल कामकाज का हिस्सा बन सकता है।
किसके लिए कौन-सा AI मॉडल बेहतर?
अगर प्राथमिकता बेंचमार्क प्रदर्शन, एडवांस्ड रीजनिंग, कोडिंग, वैज्ञानिक तर्क, साइबर सुरक्षा और जटिल AI एजेंट वर्कफ्लो है, तो उपलब्ध आंकड़ों के आधार पर GPT-6 एस्ट्रा बेहद मजबूत विकल्प के रूप में सामने आता है।
वहीं, कोडिंग, लंबे दस्तावेजों, तकनीकी लेखन और प्राकृतिक भाषा में व्यवस्थित जवाबों को प्राथमिकता देने वाले यूजर्स के लिए Claude आक
र्षक विकल्प बना हुआ है। दूसरी ओर, जो लोग Gmail, Docs, Sheets, Android, Search और Google Cloud जैसे Google के प्रोडक्ट्स का बड़े पैमाने पर इस्तेमाल करते हैं, उनके लिए Gemini का इंटीग्रेटेड अनुभव अधिक उपयोगी साबित हो सकता है।
कुल मिलाकर, GPT-6 एस्ट्रा की एंट्री ने AI की प्रतिस्पर्धा को और तेज कर दिया है। हालांकि किसी एक मॉडल को हर काम के लिए सबसे बेहतर कहना मुश्किल है, लेकिन उपलब्ध दावों और बेंचमार्क के आधार पर OpenAI का नया मॉडल तकनीकी क्षमताओं की दौड़ में एक बड़ी चुनौती के रूप में उभरता है।
Like
Dislike
Love
Angry
Sad
Funny
Wow
पंजाब : सभी पुलिस थानों व सरकारी स्थानों पर मौजूद लावारिस वाहन 30 दिन के भीतर हटाने के आदेश
January 18, 2026
Comments 0