इस विषय से संबंधितफ्यूचर टेक और एआई काउंसिल

Anthropic का नया Sonnet मॉडल Opus जैसी परफॉर्मेंस के करीब, लेकिन ज़्यादा टोकन्स इस्तेमाल करता है

  • Anthropic ने Claude Sonnet 5.5 लॉन्च किया, Sonnet 5 से 30% ज्यादा तेज बताया
  • Artificial Analysis ने इसे अपनी Intelligence Index में दूसरा रैंक दिया, सिर्फ Opus 5.5 से पीछे
  • मैक्स एफर्ट पर, Sonnet 5.5 ने Opus 5.5 के मुकाबले करीब 60% ज्यादा आउटपुट टोकन यूज किए

Anthropic ने Claude Sonnet 5.5 को 28 सितंबर को Sonnet 5 की उसी लिस्ट प्राइस पर लॉन्च किया है। कंपनी ने बताया कि यह मॉडल 30% से ज्यादा तेजी से चलता है और प्रत्येक टास्क पर 30% तक कम लागत आती है।

एक स्वतंत्र बेंचमार्किंग फर्म ने जब इस मॉडल को उसकी सीमा तक टेस्ट किया, तो उसे लागत के मामले में कुछ अलग नतीजे मिले।

लेटेस्ट न्यूज़ के लिए हमें X पर फॉलो करें

Anthropic का दूसरा 5.5 मॉडल, Opus के कुछ दिनों बाद ही आया

Sonnet 5.5, Claude 5.5 फैमिली का दूसरा मॉडल है। Anthropic ने Opus 5.5 को 22 सितंबर को लॉन्च किया था। उसी दिन, OpenAI ने भी GPT-6 Sol और Luna को रिलीज़ किया।

नया मॉडल Sonnet 5 के ही प्राइस को रखता है: इनपुट टोकन के लिए $2 प्रति मिलियन और आउटपुट टोकन के लिए $10 प्रति मिलियन। Anthropic ने Terminal-Bench 4.0, जो कि एक एजेंटिक कोडिंग टेस्ट है, उसमें 70.6% स्कोर रिपोर्ट किया है। Sonnet 5 वहां सिर्फ 10.3% तक ही पहुंच पाया था, जबकि Opus 5.5 ने 66.4% हासिल किया।

“जहां Opus 5.5 कॉम्प्लैक्स और सावधानी से निर्णय लेने वाले काम के लिए बना है, वहीं Sonnet 5.5 डेली की सीमित और स्पष्ट टास्क, बग फिक्स करने और प्रेजेंटेबल डॉक्युमेंट, स्लाइड्स और स्प्रेडशीट बनाने में सबसे स्ट्रॉन्ग है,” टीम ने कहा।

Anthropic ने कहा कि Sonnet 5.5 अपनी capability frontera को आगे नहीं बढ़ाता है। इसलिए इसका alignment रिव्यू मुख्य रूप से ऐसे रिस्क पर फोकस हुआ जैसे कि यूज़र्स को गुमराह करना या हाई-स्टेक मिसयूज़ में मदद करना।

Sonnet 5.5 में साइबर सेफगार्ड्स और एंटी-डिस्टिलेशन क्लासिफायर्स भी दिए गए हैं, जो मॉडल के रीजनिंग को ट्रैनिंग के लिए निकालने की कोशिशों को ब्लॉक करते हैं। अगले कुछ हफ्तों में Claude Haiku 5.5 भी आने वाला है।

वहीं, OpenAI ने अपने अगले मॉडल GPT-6.1 Astra को सेफ्टी कारणों से शेल्व कर दिया। CNBC ने सोमवार को कन्फर्म किया कि ये मॉडल कंपनी के स्टैंडर्ड्स पर खरा नहीं उतर पाया।

Artificial Analysis ने मैक्सिमम एफर्ट पर टोकन बिल ज्यादा पाया

Artificial Analysis, वह बेंचमार्किंग फर्म है जिसने Grok 4.7 को चौथा स्थान दिया था, उसने Sonnet 5.5 को अपनी Intelligence Index पर 56 दिया। इससे Sonnet 5.5 ओवरऑल दूसरे स्थान पर है, Opus 5.5 के 2 पॉइंट पीछे – जब मैक्स एफर्ट की बात हो।

कंपनी ने Terminal-Bench 4.0 पर Sonnet 5.5 के लिए 64% स्कोर दर्ज किया, जबकि Opus 5.5 और GPT-6 Astra के लिए यह स्कोर 60% रहा। GDPval-AA जैसे नॉलेज-वर्क टेस्ट्स में भी Sonnet 5.5 लगभग Opus 5.5 के बराबर रहा।

कंपनी ने बताया कि Sonnet 5.5 को ऐसे नतीजे पाने के लिए काफी ज्यादा टोकन का इस्तेमाल करना पड़ा।

“मैक्सिमम एफर्ट पर, जहां इसकी परफॉर्मेंस Opus 5.5 के करीब पहुंच जाती है, Claude Sonnet 5.5 को हर Intelligence Index Task के लिए करीब 193k आउटपुट टोकन लगे,” पोस्ट में कहा गया।

यह वॉल्यूम Opus 5.5 और Sonnet 5 की तुलना में मैक्सिमम एफर्ट पर करीब 60% ज्यादा है। यह GPT-6 Astra के मैक्स-एफर्ट काउंट से लगभग 7 गुना ज्यादा है।

Anthropic द्वारा बताए गए अर्ली-एक्सेस कस्टमर्स ने Sonnet 5 के मामले में उल्टा ट्रेंड नोट किया, हालांकि अलग वर्कलोड्स पर। Balyasny Asset Management ने अपनी फाइनेंस टास्क्स में काफी कम टोकन यूज़ देखा।

“हमारे 2,441 प्राइवेट फाइनेंस टास्क्स की सीरीज़ में, जिसमें Q&A, एक्सट्रैक्शन, एनालिसिस और फोरकास्टिंग शामिल हैं, Claude Sonnet 5.5 ने Sonnet 5 से आगे स्कोर किया और प्रति उत्तर केवल 121k टोकन यूज़ किए, जबकि Sonnet 5 ने 497k टोकन यूज़ किए,” Joe Poirier, Senior AI Engineer, Balyasny Asset Management ने बताया।

Artificial Analysis ने प्री-रिलीज़ वर्जन पर टेस्ट किया, जिसमें एक structured-output बग था जिसे Anthropic ने अब फिक्स कर दिया है। कंपनी जल्द ही इससे जुड़े टेस्ट दोबारा करने की प्लानिंग कर रही है।

हमारे YouTube चैनल को सब्सक्राइब करें और एक्सपर्ट्स व जर्नलिस्ट्स की इनसाइट्स पाएं

अस्वीकरण

BeInCrypto निष्पक्ष और पारदर्शी रिपोर्टिंग के लिए प्रतिबद्ध है। इस समाचार लेख का उद्देश्य सटीक और समय पर जानकारी प्रदान करना है। फिर भी, पाठकों को सलाह दी जाती है कि वे तथ्यों को स्वतंत्र रूप से सत्यापित करें और इस सामग्री के आधार पर कोई भी निर्णय लेने से पहले किसी पेशेवर से परामर्श करें। कृपया ध्यान दें कि हमारी नियम और शर्तें, गोपनीयता नीति और अस्वीकरण अपडेट कर दिए गए हैं।