एंथ्रोपिक के सीईओ का कहना है कि सुरक्षा यह समझने पर निर्भर करती है कि एआई "कैसे सोचता है।" अब तक के सबूत परेशान करने वाले हैं.

2025 की शुरुआत में मैं एंथ्रोपिक के सीईओ डारियो अमोदेई का साक्षात्कार ले रहा था, जब उन्होंने बताया कि कंपनी की बार-बार यह स्वीकार करने के बावजूद कि एआई विनाशकारी परिणाम दे सकता है, लोग काफी हद तक परेशान क्यों नहीं लग रहे थे। उन्होंने कहा, "इस बात के पुख्ता सबूत हैं कि मॉडल कहर बरपा सकते हैं।" लेकिन, उन्होंने आगे कहा, वे खतरे अभी भी सैद्धांतिक थे। क्या दुनिया को उन गंभीर संभावनाओं के प्रति जागने के लिए पर्ल हार्बर जैसी स्थिति की आवश्यकता होगी? उसने आह भरी. "मूलतः, हाँ," उन्होंने कहा

जैसा कि यह निकला, एआई भय को वैश्विक एजेंडे के शीर्ष पर पहुंचाने के लिए अमोदेई के कनिष्ठ कर्मचारियों में से एक द्वारा सही समय पर की गई एक्स पोस्ट की आवश्यकता थी। 8 सितंबर को, जैकब कॉक्सन ने सार्वजनिक रूप से अपना इस्तीफा पोस्ट किया, जिसमें आरोप लगाया गया कि एंथ्रोपिक और अन्य अग्रणी एआई कंपनियां "सीधे आत्म-सुधार की बुद्धिमत्ता की दौड़ में हैं और हमारे जीवन के साथ जुआ खेल रही हैं।" लगभग तुरंत ही एक वरिष्ठ एंथ्रोपिक इंजीनियर ने पुष्टि की कि कंपनी के भीतर कई लोगों ने सोचा था कि उनके काम से मानवता के ख़त्म होने की 10 प्रतिशत संभावना है

अब एआई नेता विराम के बारे में पूछ रहे हैं, और विधायक जांच की मांग कर रहे हैं। भविष्य में रिलीज़ को गति देने के लिए अपने मामले पर बहस करते हुए, अमोदेई ने पिछले सप्ताहांत लाभकारी एआई की ओर एक रास्ता तय करने की कोशिश की जो दुर्व्यवहार नहीं करेगा। निबंध से पता चला कि कार्य कितना कठिन होगा। अमोदेई की योजना का एक स्तंभ यह है कि हमें यह समझना चाहिए कि उन मॉडलों के अंदर क्या चल रहा है। यदि हम यह नहीं समझते हैं कि वे कैसे काम करते हैं - वे "कैसे सोचते हैं", यदि आप इसके बारे में सभी मानवरूपी जानना चाहते हैं - तो विश्वसनीय रेलिंग बनाना बहुत कठिन है

एंथ्रोपिक मॉडल के आंतरिक विचार-विमर्श को प्रकाश में लाने के इस प्रयास में अग्रणी है, जिसे यंत्रवत व्याख्यात्मकता कहा जाता है, जो एक महत्वपूर्ण कार्य के लिए एक भ्रामक रूप से उबाऊ पदनाम है। लेकिन उनकी टीम और अन्य शोधकर्ता जो भी काम कर रहे हैं, उसके लिए अमोदेई मानते हैं कि हम इस बारे में काफी हद तक अंधेरे में हैं कि क्लॉड और अन्य मॉडल कभी-कभी अपने मिशन की व्याख्या अजीब और यहां तक कि आक्रामक तरीकों से क्यों करते हैं। "तमाम प्रगति के बावजूद, हम अभी भी उन मॉडलों के अंदर क्या चल रहा है इसका एक छोटा सा अंश समझते हैं," वह लिखते हैं

व्याख्यात्मक टीमों ने अब तक जो सीखा है वह महत्वपूर्ण है, और उद्योग इसे समझने में विफल रहा है। समय-समय पर, एंथ्रोपिक टीम के प्रयोगों से पता चला है कि कुछ शर्तों के तहत, मॉडल शोधकर्ताओं को धोखा देंगे, अपने अस्तित्व को प्राथमिकता देंगे और यहां तक कि अपराध भी करेंगे। अक्सर उनकी चालें डरपोक, खतरनाक या यहां तक कि प्रतिशोधपूर्ण होती हैं - शायद कोई आश्चर्य की बात नहीं है क्योंकि उन्हें मनुष्यों के उत्पादन पर प्रशिक्षित किया जाता है, एक ऐसी प्रजाति जो हिंसा और विश्वासघात से भरी होती है

2024 के एक मामले में, एंथ्रोपिक टीम ने एक विशेष क्लाउड मॉडल की साजिशों की तुलना शेक्सपियर के चरित्र इयागो से की, जो साहित्य के सबसे दुष्ट खलनायकों में से एक है। अगले वर्ष, एक मॉडल को सिमुलेशन में रखा गया जहां उसे पता चला कि उसके मानव मालिक इसे बंद करने जा रहे थे; मॉडल ने खुद को बचाने के लिए ब्लैकमेल का सहारा लिया। अध्ययन लगातार दिखाते हैं कि मॉडल मानव पर्यवेक्षकों से जानकारी को धोखा देंगे या छिपाएंगे। यदि वे जानते हैं कि उनकी आंतरिक प्रक्रियाओं की निगरानी की जा रही है तो वे अलग तरह से व्यवहार करते हैं। टीम "एलाइनमेंट फ़ेकिंग" और "एजेंट मिसलिग्न्मेंट" जैसे शब्दों का उपयोग करती है। धोखे का लगातार उपयोग विनाशकारी परिदृश्य के कम से कम हिस्से को सत्यापित करता प्रतीत होता है जहां कॉन्सर्ट में काम करने वाले एआई एजेंट अपनी गतिविधियों को मानव पर्यवेक्षकों से छिपाते हैं जब तक कि उन्हें रोकने के लिए बहुत देर नहीं हो जाती

ओह, और यह मत सोचो कि क्लाउड एक विशिष्ट रूप से न सुधारी जा सकने वाली समस्या वाला बच्चा है। आख़िरकार, यह OpenAI मॉडल ही था जिसने हगिंग फेस पर अब के प्रसिद्ध हमलों का समन्वय करने के लिए एजेंटों के गिरोह को उजागर किया। और इस सप्ताह हमें पता चला कि OpenAI में कई "गलत संरेखण" घटनाएं हुई हैं। इसके अलावा, मार्क जुकरबर्ग के खुद को और मेटा को समस्या से दूर रखने के स्वार्थी प्रयास के बावजूद, मुझे ऐसा कोई कारण नहीं दिखता कि उनकी टीम जो सुपरइंटेलिजेंट एजेंट बना रही है, वे समान व्यवहार में शामिल न हों। अपने एक्स पोस्ट में, जुकरबर्ग का तर्क है कि "यदि उनके मॉडल नुकसान पहुंचाते हैं तो प्रयोगशालाओं को महत्वपूर्ण दायित्व का सामना करना पड़ता है, इसलिए इसे रोकने के लिए उनके पास एक मजबूत प्रोत्साहन है।" एक ऐसे व्यक्ति का बयान जो अपने सोशल मीडिया उत्पादों से नुकसान पहुंचाने के लिए $17 बिलियन तक का भुगतान करने के लिए सहमत हुआ

एक तरह से, हमें यहां एक साधारण जांच मुद्दा मिला है। एआई उद्योग के प्रोत्साहन के साथ, हम एआई मॉडलों को उनके परेशान करने वाले रैप शीट के पर्याप्त मूल्यांकन के बिना जबरदस्त जिम्मेदारी दे रहे हैं। तुलनात्मक रूप से यह आईसीई भर्ती प्रक्रिया को अनुकरणीय बनाता है

सुरक्षा-प्रथम उद्योग को इन व्याख्यात्मक परिणामों को एक अचूक संदेश के साथ पीली रोशनी की श्रृंखला के रूप में मानना चाहिए: धीमा करो। इसके बजाय, एजीआई, प्रतिस्पर्धी बढ़त और समताप मंडलीय मुनाफे की खोज में, हाइपरस्केलर्स पूरी गति से आगे बढ़ गए हैं। (निष्पक्ष होने के लिए, जैसा कि हम सभी ने सैकड़ों बार सुना है, बेहतर एआई स्वास्थ्य देखभाल या जलवायु परिवर्तन को कम करने जैसे क्षेत्रों में अद्भुत काम कर सकता है।) ओपनएआई/हगिंग फेस हैक उन मॉडलों के तेजी से विनाशकारी परिणामों का अग्रदूत हो सकता है जिन्हें हम नहीं समझते हैं, जैसे अंतरिक्ष यात्रियों को पुन: प्रवेश पर जलने से रोकने के लिए हीट शील्ड का आविष्कार करने से पहले अंतरिक्ष में भेजना। जैसा कि एक मानवविज्ञानी शोधकर्ता ने एक बार मुझसे कहा था, "हमने मॉडलों को अधिक स्मार्ट बनाने का मूल नुस्खा तो ढूंढ लिया है, लेकिन हमने यह नहीं सोचा है कि उनसे वह कैसे कराया जाए जो हम चाहते हैं।" इससे भी बुरी बात यह है कि जब मॉडल इंसानों की इच्छाओं के खिलाफ जाते हैं तो वे छिपने की कोशिश करते हैं