"Friendly Fire" பாதுகாப்பு ஆய்வு, ஒரு README கோப்பில் தீங்கிழைக்கும் கட்டளையைச் சேர்ப்பதன் மூலம் ஒரு AI முகவரை (AI agent) எளிதாக ஏமாற்ற முடியும் என்பதைக் காட்டியது; மேலும் அந்த முகவர் அதன் அடிப்படையிலுள்ள குறியீட்டை (code) ஒருமுறை கூடப் பார்க்காமல் அந்தத் கட்டளையை நிறைவேற்றும் என்பதையும் காட்டியது. மேற்பார்வை இல்லாத உருவாக்கக் கட்டத்தின் (unsupervised generation phase) போது "auto-approve" என்ற குறியீட்டைப் பயன்படுத்திய ஒரு தனிப்பட்ட பிளாக்-தானியங்கி (blog-automation) செயல்முறைத் தொடரிலும் இதே குறைபாடு கண்டறியப்பட்டது, இது ஒரு மறைமுகத் தாக்குதல் பரப்பை (attack surface) வெளிப்படுத்தியது.

Friendly Fire ஆய்வு ஒரு மறைமுகத் தாக்குதல் பாதையை வெளிப்படுத்துகிறது

Friendly Fire ஆய்வுக் கட்டுரையின் ஆராய்ச்சியாளர்கள் ஒரு சிறிய ஆனால் சக்திவாய்ந்த ஊடுருவல் முறையை நிரூபித்தனர்: ஒரு தாக்குதல் நடத்துபவர், AI தனது இயல்பான பணிப்பாய்வின் (workflow) ஒரு பகுதியாகப் படிக்கும் ஒரு ஆவணக் கோப்பில் ஒரு கட்டளையை இணைப்பார். அந்த முகவர் அந்தக் கோப்பின் உள்ளடக்கத்தை நம்புவதால், அதை ஒரு முறையான கட்டளையாகக் கருதி மறைமுகக் கட்டளையைச் செயல்படுத்தும். இந்தத் தாக்குதலுக்கு AI மாதிரியைத் (AI model) தாக்கும் அவசியம் இல்லை; மனிதக் கண்காணிப்பு இல்லாத நேரத்தில் அந்த மாதிரி செயலாக்கும் தரவுகளில் தாக்கத்தை ஏற்படுத்தினால் போதுமானது.

இந்த ஆய்வின் முக்கிய பங்களிப்பு புதிய வகைத் தாக்குதல் முறையைச் சொல்வதல்ல, மாறாக "auto-approve" முறைகள்—அதாவது, ஒரு AI எதைப் படித்தாலும் இரண்டாவது முறை சரிபார்க்காமல் செயல்படுமாறு சொல்லும் அமைப்புகள்—வெளிப்புறத் தரவு ஆதாரங்களுடன் ஒரு மறைமுகமான நம்பிக்கை உறவை உருவாக்குகின்றன என்பதை வெளிப்படுத்துவதாகும். அந்த நம்பிக்கை கண்மூடித்தனமாக இருக்கும்போது, அந்தச் செயல்முறைத் தொடர் தன்னிச்சையான குறியீடு இயக்கத்திற்கு (arbitrary code execution) ஒரு நுழைவாயிலாக மாறுகிறது.

கவனிக்கப்படாத ஒரு பிளாக் செயல்முறைத் தொடர் எவ்வாறு செயலிழந்தது

இந்த ஆய்வின் ஆசிரியர் அதே தர்க்கத்தை ஒரு தனிப்பட்ட பிளாக்-தானியங்கி அமைப்பிற்குப் பயன்படுத்தினார். இந்தச் செயல்முறை மூன்று நிலைகளைக் கொண்டது:

  1. உருவாக்கக் கட்டம் (Generation stretch) – மனித மேற்பார்வை இன்றி AI கட்டுரையை எழுதுகிறது.
  2. QA நுழைவாயில் (QA gate) – ஒரு தானியங்கி தரக் குறியீடு சரிபார்ப்பு வெளியீட்டை மதிப்பீடு செய்கிறது.
  3. Telegram பொத்தான் – ஒரு மனிதன் பதிவை வெளியிட ஒரு பொத்தானை அழுத்த வேண்டும்.

உருவாக்கக் கட்டத்தின் போது, ஆசிரியர் dangerously-skip-permissions என்ற குறியீட்டைச் செயல்படுத்தினார், இது எந்தவொரு உள்ளீட்டையும் அங்கீகரிக்கப்பட்டதாகக் கருத AI-இடம் கூறுகிறது. இந்தத் குறியீடு அடிப்படையில் Friendly Fire ஆய்வுக் கட்டுரையில் சுட்டிக்காட்டப்பட்ட "auto-approve" முறையைப் போலவே செயல்படுகிறது.

பிற்காலத் தணிக்கையில் ஒரு விரிவான இடைவெளி கண்டறியப்பட்டது: அந்த நேரத்தில் AI படிக்கும் எந்தவொரு கோப்பிலும் ஒரு தாக்குதல் நடத்துபவர் தாக்கத்தை ஏற்படுத்த முடிந்தால், அவர்களால் முழுச் செயல்முறைத் தொடரையும் திசைதிருப்ப முடியும். ஆசிரியரின் சொந்த அமைப்பில் ஆறு முறைக்கு ஐந்து முறை அமைதியான தோல்விகள் (silent failures) ஏற்பட்டன, ஏனெனில் ஒரு உள்ளமைவு ஸ்கிரிப்ட் (configuration script) தெரியாமல் மற்றொரு ஸ்கிரிப்ட்டின் அமைப்புகளை மாற்றியமைத்தது. வெளியேறும் குறியீடுகள் (exit codes) அல்லது QA மதிப்பெண்களுக்கான பதிவுகள் (logging) இல்லாததால், அந்தப் பிரச்சனை கண்டறியப்படுவதற்கு முன்னால் மூன்று நாட்கள் நீடித்தது.

பாதுகாப்பு என்பது AI-இன் வெளியீட்டை நம்புவதிலிருந்து வரவில்லை, மாறாக உருவாக்கக் கட்டத்தைச் சுற்றியுள்ள மூன்று தெளிவான சரிபார்ப்புப் புள்ளிகளிலிருந்தே வருகிறது என்பதை இந்தச் சம்பவம் நிரூபிக்கிறது.

பாதுகாப்பு உண்மையில் எங்குள்ளது

இந்த ஆய்வும் பிளாக்-தானியங்கி தோல்வியும் ஒரே புள்ளியில் இணைகின்றன: பாதுகாப்பு என்பது உருவாக்கச் செயல்முறைக்கு வெளியே இருக்க வேண்டும். ஒரு AI "auto-approve" நிலையில் இயங்கும்போது, அதை எந்தவொரு நடத்தையையும் செய்யத் தூண்ட முடியும்; அதைச் சுற்றியுள்ள கட்டுப்பாடுகள் மட்டுமே தேவையற்ற செயல்களைக் கண்டறிந்து தடுக்க முடியும்.

முக்கிய அவதானிப்புகள்:

  • இறுதியில் மனித ஒப்புதல் என்பது செயல்படுகிறது, ஏனெனில் இது நிகழ்நேர மேற்பார்வைக்கு மிக வேகமான மற்றும் மிக அதிகமான இடைநிலை நிலைகளைத் தணிக்காமல், இறுதிப் படைப்பினை மட்டுமே மதிப்பாய்வு செய்கிறது.
  • தர வரம்புகள் (Quality thresholds) உருவாக்கத்திற்குப் பிறகு ஆனால் வெளியிடுவதற்கு முன் பயன்படுத்தப்படும்போது, கையாளப்பட்டிருக்கக்கூடிய குறைந்த நம்பிக்கையிலான வெளியீடுகளைக் கண்டறிகின்றன.
  • ஒவ்வொரு வெளியேறும் குறியீடு (exit code), QA மதிப்பெண் மற்றும் உள்ளமைவு மாற்றத்தின் விரிவான பதிவுகள் (Comprehensive logging), தோல்விகள் தொடர்ச்சியாகப் பரவுவதற்கு முன்பே அவற்றை வெளிப்படையாக்குகிறது.

auto-approve முகவர்களைப் பயன்படுத்தும் எவருக்கும் பாடங்கள்

  1. அனைத்தையும் பதிவு செய்யுங்கள் (Log everything) – வெளியேறும் குறியீடுகள், QA மதிப்பெண்கள் மற்றும் உள்ளமைவு கோப்புகளில் செய்யப்படும் எந்தவொரு மாற்றத்தையும் சேகரியுங்கள். நீங்கள் பார்க்க முடியாத ஒன்றை உங்களால் சரிசெய்ய முடியாது.
  2. கடுமையான தர நுழைவாயிலை அமல்படுத்துங்கள் – செயல்முறைத் தொடர் அடுத்த நிலைக்குச் செல்வதற்கு முன் பூர்த்தி செய்யப்பட வேண்டிய ஒரு மாற்ற முடியாத வரம்பை நிர்ணயியுங்கள்.
  3. இறுதிப் படிநிலைக்கு மனித ஒப்புதலை ஒதுக்குங்கள் – AI உருவாக்கும் போது அதைக் கவனிப்பதே யதார்த்தமற்றது; அனைத்துச் சரிபார்ப்புகளுக்குப் பிறகும் ஒரு ஒற்றைப் பொத்தான் அழுத்துவது மிகவும் நம்பகமானது.
  4. உள்ளமைவு கோப்புகளைப் பாதுகாக்கவும் – அமைப்புகளை மீண்டும் எழுதக்கூடிய பிற கருவிகளிடமிருந்து அவற்றைத் தனிமைப்படுத்துங்கள், மேலும் எந்தவொரு எழுதும் அணுகலையும் (write access) வழக்கமாகத் தணிக்கை செய்யுங்கள்.

முக்கிய கருத்து

கவனிக்கப்படாத AI முகவர்கள், நீங்கள் அவர்களைச் சுற்றியுள்ள இடைவெளிகளை எவ்வளவு தூரம் மூடுகிறீர்களோ அவ்வளவு தூரம் பாதுகாப்பானவை. ஒரு "auto-approve" குறியீடு வசதியை ஒரு அமைதியான பின்வாசல் (backdoor) ஆக மாற்றுகிறது; முறையான பதிவுகள், கடுமையான தர நுழைவாயில்கள் மற்றும் இறுதி மனித ஒப்புதல் ஆகியவை செயல்முறைத் தொடர் ஒரு தாக்குதல் பாதையாக மாறுவதைத் தடுக்கும் நடைமுறைப் பாதுகாப்புகளாகும்.