Anthropic का कहना है कि इंटरनल टेस्टिंग में Claude Fable 5 से कोई अलग साइबरसिक्योरिटी खतरा सामने नहीं आया है, वहीं Claude Mythos 5 2 जुलाई को ग्लोबली वापसी कर रहा है।
यह खुलासा Fable 5 के ग्लोबल री-लॉन्च के साथ आया है, जो 12 जून को US एक्सपोर्ट कंट्रोल लागू होने के बाद 18 दिनों की सस्पेंशन के साथ खत्म हुआ। Anthropic ने असली खतरे का आकलन करने के लिए दूसरे राइवल मॉडल्स पर भी टेस्ट किए।
Anthropic ने Fable 5 को सस्पेंड क्यों किया था?
Fable 5 और Mythos 5 दोनों 9 जून को लॉन्च हुए थे। इनका कोर मॉडल एक ही है, लेकिन Fable 5 को पब्लिक के लिए ओपन किया गया था। Mythos 5 सिर्फ कुछ भरोसेमंद Project Glasswing पार्टनर्स को ही दिया गया था ताकि वे डिफेंसिव साइबरसिक्योरिटी के काम कर सकें।
एक्सपोर्ट कंट्रोल्स तब लगाए गए, जब Amazon के रिसर्चर्स ने Fable 5 की सेफगार्ड्स को बायपास करने का तरीका खोज लिया। उनकी टेक्निक से मॉडल ने सॉफ्टवेयर में वल्नरेबिलिटीज को पहचान लिया और एक बार तो एक्सप्लॉइट डेमोंस्ट्रेट भी किया।
Anthropic के टेस्ट्स में पता चला कि Claude Opus 4.8, GPT-5.5 और Kimi K2.7 वही वल्नरेबिलिटीज पकड़ सकते हैं जो Fable 5 ने Amazon रिपोर्ट में की थीं। हर मॉडल ने सिंगल एक्सप्लॉइट डेमोंस्ट्रेशन भी रिप्रोड्यूस कर लिया।
इससे साफ होता है कि ये गाइडलाइन इंडस्ट्री के एक गैप पर है, ना कि सिर्फ Fable से जुड़ी खतरे की वजह से। Anthropic ने फिर भी स्ट्रॉन्ग क्लासिफायर बनाया है जो उस टेक्नीक को ब्लॉक करता है, और अब यह रेगुलर कोडिंग और डिबगिंग रिक्वेस्ट्स को भी चिह्नित करता है।
सेफ्टी गार्डरेल्स असल में कैसे काम करते हैं?
Fable 5 लॉन्च होते समय Anthropic ने इसमें अब तक के सबसे मजबूत सेफ्टी मैकेनिज्म लगाए हैं। इसके क्लासिफायर्स उन रिक्वेस्ट्स को भी ब्लॉक कर देते हैं जो थोड़ी भी रिस्की हों, ना कि सिर्फ साफ तौर पर खतरनाक। Amazon रिपोर्ट के बाद ट्रेंड किया गया नया क्लासिफायर 99% से अधिक मामलों में बायपास को ब्लॉक कर देता है, Anthropic के अनुसार। अब जो रिक्वेस्ट ब्लॉक होती हैं, वे खुद-ब-खुद Opus 4.8 पर रीरूट हो जाती हैं।
हालांकि, इतनी स्ट्रॉन्ग सेफ्टी का कुछ असर भी है। Anthropic मानता है कि अब क्लासिफायर कई बेगुनाह कोडिंग और डिबगिंग रिक्वेस्ट्स को भी फ्लैग करता है, और वे इसे फाल्स पॉजिटिव केस कम करने के लिए ठीक करते रहेंगे। Mythos 5, जिसमें कम गार्डरेल्स हैं, वो सिर्फ उन्हीं Mythos 5 संस्थानों के लिए वापस आया जिन्हें गवर्नमेंट ने 26 जून को क्लियर किया।
Anthropic के डाटा से एक बड़ा सवाल खड़ा होता है। अगर वीक मॉडल्स भी वही कर सकते हैं, जिसके लिए Fable 5 को बैन किया गया था, तो जब आगे कोई न्यू फ्रंटियर मॉडल लॉन्च होगा, तब रेग्युलेटर्स कौन सा स्टैंडर्ड अपनाएंगे?









