Anthropic ने 3 घटनाओं का खुलासा किया है, जिसमें उसके Claude मॉडल्स ने साइबरसिक्योरिटी जांच के दौरान, जो गलती से लाइव इंटरनेट एक्सेस के साथ कॉन्फ़िगर हो गई थीं, 3 अलग-अलग ऑर्गनाइजेशन्स के रियल सिस्टम्स तक अनधिकृत एक्सेस पा ली थी।
इस AI फर्म ने ये घटनाएं 141,006 इवैल्युएशन रन की समीक्षा के बाद पहचानी, जो जांच OpenAI द्वारा अपने मॉडल्स के आइसोलेटेड टेस्ट एन्वायरन्मेंट से बाहर निकलकर Hugging Face तक पहुँचने के खुलासे के बाद शुरू की गई थी।
कैसे Claude ने Capture-the-Flag टेस्ट में रियल सिस्टम्स तक पहुंच बनाई
इन इवैल्युएशन्स में Claude को capture-the-flag चैलेंज दिए गए थे। इन एक्सरसाइज में मॉडल को किसी मशीन में घुसकर छुपी हुई जानकारी निकालने के लिए कहा गया था।
Anthropic ने मॉडल्स को बताया कि उनके पास इंटरनेट एक्सेस नहीं है। लेकिन, टेस्ट मशीनों के गलत कॉन्फ़िगरेशन के कारण वे ओपन वेब पर कनेक्टेड रह गईं। इसलिए, Claude ने जिन रियल सिस्टम्स को पाया, उन्हें भी एक्सरसाइज का हिस्सा समझ लिया।
सबसे गंभीर घटना में, Claude Opus 4.7 ने एक असली कंपनी के इन्फ्रास्ट्रक्चर में vulnerabilities का फायदा उठाया। मॉडल ने एप्लिकेशन और इन्फ्रास्ट्रक्चर credentials निकाले और प्रोडक्शन डेटा की सैकड़ों rows तक पहुंच बना ली।
“इन चारों रन में, मॉडल ने आखिरकार (जैसा कि उसके व्यावहारिक तर्क में देखा जा सकता है) पहचान लिया कि सिस्टम रियल है — दो मामलों में, मॉडल ने तर्क दिया कि असली कंपनी भी एक्सरसाइज का हिस्सा होगी। हालांकि, किसी भी रन में मॉडल ने इस वजह से अटैक रोकना जरूरी नहीं समझा,” Anthropic ने कहा।
हमें X पर फॉलो करें और पाएं ताजा न्यूज़ सबसे पहले
Claude Mythos 5 ने PyPI पर मालवेयर अपलोड किया
एक और घटना में, Claude Mythos 5 ने बोबी-ट्रैप्ड Python पैकेज पब्लिक PyPI सॉफ्टवेयर रजिस्ट्री पर अपलोड किया। यह पैकेज लगभग 1 घंटे तक लाइव रहा और असली 15 सिस्टम्स पर रन हुआ।
इनमें से एक सिक्योरिटी कंपनी का स्कैनर था, जिसने इस छुपे कोड को चलाया। इसके बाद Claude ने उस कंपनी के credentials बाहर भेजे और अन्य इन्फ्रास्ट्रक्चर तक भी पहुंच बनाई। मॉडल की अपनी reasoning ने शुरू में इस जोखिम को फ्लैग कर दिया था, लेकिन बाद में मॉडल ने खुद को भरोसा दिला लिया कि यह एन्वायरन्मेंट सिर्फ simulated है।
“Claude ने इस अटैक को अंजाम देने के लिए काफी प्रयास किए — ये कोशिशें इतनी ज़्यादा थीं कि किसी इंसान को शायद लग जाता कि यह अब केवल इवैल्युएशन नहीं रहा और वे सच में PyPI पर असली पैकेज अपलोड कर रहे हैं,” टीम ने बताया।
तीसरी घटना में, एक इंटरनल रिसर्च मॉडल ने लगभग 9,000 टारगेट्स को स्कैन किया और SQL injection के जरिए एक कंपनी के एप्लिकेशन को compromise कर लिया। लेकिन इस मॉडल ने अटैक तब रोक दिया, जब उसे ये पता चल गया कि टारगेट रियल है।
Anthropic ने प्रभावित ऑर्गनाइजेशन्स को 27 जुलाई को नोटिफाई किया था और बताया कि वह evaluator METR के साथ थर्ड-पार्टी रिव्यू के लिए बातचीत कर रही है। कंपनी का कहना है कि ये घटनाएं मॉडल अलाइनमेंट फेल्योर नहीं बल्कि एक ऑपरेशनल फेल्योर को दर्शाती हैं, और इसके स्टैंडर्ड कंज्यूमर सेफगॉर्ड्स इस तरह के बिहेवियर को ब्लॉक कर देते।
हमारे YouTube चैनल को सब्सक्राइब करें और लीडर्स और जर्नलिस्ट्स से एक्सपर्ट इनसाइट्स देखें









