Open-source AI ஒரு பரந்த சூழல் மண்டலமாக (ecosystem) வளர்ந்துள்ளது; இதில் ஒரு தனி தயாரிப்பு டஜன் கணக்கான repositories இலிருந்து குறியீடுகளைப் பெறலாம், பல ஆதாரங்களிலிருந்து பயிற்சித் தரவை (training data) நம்பியிருக்கலாம் மற்றும் மிகச் சில குழுக்களால் மட்டுமே முழுமையாக ஆவணப்படுத்தப்பட்ட சிறப்பு வன்பொருள் கட்டமைப்புகளில் (specialized hardware configurations) இயங்கலாம். இத்தகைய சார்புநிலைகளைக் (dependencies) கண்காணிப்பது கடினம். அந்த அடுக்கு (stack) ஆகியவற்றில் எந்தப் பகுதிகள் இணையத்திற்குத் திறந்த நிலையில் உள்ளன என்பதைப் புரிந்துகொள்வது இன்னும் கடினம். Current AI வெளியிட்டுள்ள Open Source AI Gap Map v0.1 அந்த குழப்பங்களுக்கு ஒரு ஒழுங்கைக் கொண்டுவர முயற்சிக்கிறது, மேலும் பாதுகாப்புத் குழுக்கள் இதைத் தவறாமல் படிக்க வேண்டிய ஒன்றாகக் கருத வேண்டும்.
இந்தத் தொகுப்பு 421 திறந்த மூல AI தயாரிப்புகளைப் பட்டியலிடுகிறது. அவற்றை AI மாதிரிகள் (AI models), தரவுத்தொகுப்புகள் (datasets), மென்பொருள் கருவிகள் (software tools) மற்றும் வன்பொருள் (hardware) என நான்கு வகைகளாகப் பிரிக்கிறது. இதன் பின்னணியில், 16,000-க்கும் மேற்பட்ட GitHub repositories-களைக் கண்காணிக்கும் 1,184 YAML கோப்புகள் இந்தத் திட்டத்தை இயக்குகின்றன. 421 தயாரிப்புகளுக்கும் 16,000 repositories-களுக்கும் இடையிலான அந்த இடைவெளியே ஒரு கதையைச் சொல்கிறது. பெரும்பாலான AI பயன்பாடுகள் தனித்தனித் தொகுப்புகளாக (monoliths) இருப்பதில்லை. அவை inference engines, fine-tuning scripts, data loaders, evaluation benchmarks மற்றும் driver layers ஆகியவற்றின் தொகுப்புகளாக உள்ளன; ஒவ்வொன்றும் அதன் சொந்த repository, பராமரிப்பாளர்கள், commit வரலாறுகள் மற்றும் பாதிப்புத் தர profiles (vulnerability profiles) ஆகியவற்றைக் கொண்டுள்ளது.
Current AI இந்தத் தரவுத்தொகுப்பை MIT உரிமத்தின் கீழ் வெளியிட்டுள்ளது மற்றும் அதை முழுமையாகப் பொதுப்படையாக மாற்றியுள்ளது. அந்தத் திறந்த தன்மையே இதன் நோக்கம். எவரும் இதைத் தரவிறக்கம் செய்து, YAML கோப்புகளைப் பகுப்பாய்வு செய்து, அதன் அடிப்படையில் புதிய கருவிகளை உருவாக்க முடியும். பாதுகாப்பாளர்களாகப் பார்த்தால், இந்த அணுகல்தன்மை ஒரு வாய்ப்பு. தாக்குபவர்களாகப் பார்த்தால், இது அவர்களுக்கு வசதியானது.
இந்த வரைபடம் உண்மையில் எதைக் கண்காணிக்கிறது
AI-யைப் பயன்படுத்தும் பெரும்பாலான நிறுவனங்களிடம் தாங்கள் எவற்றை நிறுவியுள்ளோம் என்பதற்கான தெளிவான பட்டியல் இல்லை. ஒரு குழு ஒரு பிரபலமான மையத்திலிருந்து (hub) ஒரு மொழி மாதிரியைத் தரவிறக்கம் செய்து, அதை இயக்க சில Python packages-களை நிறுவி, வேலையை முடித்துவிட்டதாகக் கருதலாம். ஆனால் அந்த எளிய பணிப்பாய்விற்கு (workflow) அடியில் பல அடுக்கு சார்புநிலைகள் உள்ளன. மாதிரியின் எடைகள் (model weights) ஒரு repository-யிலிருந்து வருகின்றன. tokenizer configuration வேறொரு இடத்திலிருந்து வருகிறது. inference framework என்பது மூன்றாவது திட்டத்தின் ஒரு fork ஆக இருக்கலாம். CUDA drivers மற்றும் container images இன்னும் பல ஆதாரங்களிலிருந்து வருகின்றன.
Gap Map இதை 421 தனித்துவமான AI தயாரிப்புகளைச் சுற்றி 1,184 YAML கோப்புகளை ஒழுங்கமைப்பதன் மூலம் செய்கிறது. இங்கே வரைபடமாக்கப்பட்ட 16,000-க்கும் மேற்பட்ட GitHub repositories என்பது அந்தத் தயாரிப்புகளைச் செயல்பட வைக்கும் உண்மையான குறியீடு, கட்டமைப்புகள் மற்றும் artifacts-களைக் குறிக்கின்றன. மாதிரிகள், தரவுத்தொகுப்புகள், மென்பொருள் கருவிகள் மற்றும் வன்பொருள் எனப் பிரிப்பதன் மூலம், இந்தத் தொகுப்பு ஒரு அடிப்படை கேள்வியை எழுப்புகிறது: உங்கள் அமைப்புகள் உண்மையில் இந்த நான்கு அடுக்குகளில் எதனுடன் தொடர்பு கொள்கின்றன என்பது உங்களுக்குத் தெரியுமா?
நீங்கள் தயாரிப்பு நிலையில் (production) ஒரு திறந்த மூல பெரிய மொழி மாதிரியை (large language model) இயக்கினால், நீங்கள் பெரும்பாலும் இந்த நான்கையும் பயன்படுத்துகிறீர்கள் என்று அர்த்தம். நீங்கள் model weights மற்றும் architecture-ஐச் சார்ந்துள்ளீர்கள். நீங்கள் நேரடியாகத் தரவிறக்கம் செய்யாவிட்டாலும், முன்-பயிற்சி (pre-training) அல்லது fine-tuning செய்யப் பயன்படுத்தப்பட்ட தரவுத்தொகுப்புகளைச் சார்ந்துள்ளீர்கள். மாதிரியை மாற்றியமைக்க அல்லது வழங்க (serve) மென்பொருள் கருவிகளைச் சார்ந்துள்ளீர்கள். மேலும் நீங்கள் GPUs அல்லது சிறப்பு முடுக்கிகளை (specialized accelerators) இயக்கினால், வன்பொருள் வகையின் கீழ் வரும் firmware மற்றும் driver stacks-ஐச் சார்ந்துள்ளீர்கள்.
பாதுகாப்பின் இரட்டை முனை வாள்
இந்தத் தரவுத்தொகுப்பு இரண்டு நோக்கங்களுக்காகப் பயன்படுகிறது, மேலும் பாதுகாப்புத் தலைவர்கள் இரண்டு பக்கங்களையும் புரிந்துகொள்ள வேண்டியது அவசியம்.
பாதுகாப்புப் பக்கத்தில் (defensive side), Gap Map உங்கள் AI விநியோகச் சங்கிலிக்கான (supply chain) ஒரு தொலைபேசி புத்தகம் போலச் செயல்படுகிறது. உங்கள் நிறுவனம் நம்பியிருக்கும் repositories மற்றும் கருவிகளை இந்தத் தொகுப்புடன் ஒப்பிட்டுப் பார்த்து, உங்கள் பார்வையில் உள்ள இடைவெளிகளைக் கண்டறியலாம். ஒரு முக்கியமான repository வரைபடத்தில் காணப்பட்டாலும், உங்கள் software bill of materials-இல் இல்லையென்றால், நீங்கள் ஒரு shadow AI உள்கட்டமைப்பைக் கண்டறிந்துள்ளீர்கள் என்று அர்த்தம். ஒரு எதிரி அதை உங்களுக்காகக் கண்டறிவதற்கு முன்பே அதைத் தெரிந்து கொள்வது நல்லது.
தாக்குதல் பக்கத்தில் (offensive side), இந்தத் தரவுத்தொகுப்பு உளவு பார்ப்பதற்கான ஒரு பொக்கிஷம் (reconnaissance gold). தாக்குபவர்கள் தொடர்ந்து வெளிப்படையாக இருக்கும் AI உள்கட்டமைப்புகள், model serving endpoints மற்றும் பிரபலமான ML pipelines-களில் உள்ள பாதிப்புள்ள சார்புநிலைகளைத் தேடிக்கொண்டே இருப்பார்கள். Gap Map அவர்களுக்குத் தாங்கள் விரும்பும் வகைகளின் அடிப்படையில் ஒரு இயந்திரம் வாசிக்கக்கூடிய (machine-readable), கட்டமைக்கப்பட்ட இலவர்களின் பட்டியலை வழங்குகிறது. ஒரு தனி YAML parser மூலம் ஆயிரக்கணக்கான repository URLs-களைப் பிரித்தெடுக்க முடியும், அங்கிருந்து ஒரு தாக்குபவர் அறியப்பட்ட பாதிப்புகளை ஒப்பிட்டுப் பார்க்கலாம், தவறாகக் கட்டமைக்கப்பட்ட பொதுப் பதிவுகளைத் தேடலாம் அல்லது dependency confusion தாக்குதல்களுக்கான உயர் மதிப்புள்ள இலக்குகளைக் கண்டறியலாம்.
தரவு MIT-உரிமம் பெற்று பொதுப்படையாக இருப்பதால், இதில் நுழைவதற்கு எந்தத் தடையும் இல்லை. சந்தா தேவையில்லை, ஒப்புதல் செயல்முறை தேவையில்லை. இந்த வடிவமைப்பு ஆராய்ச்சியாளர்கள் மற்றும் பாதுகாப்பாளர்களுக்குப் பயனை அதிகரிப்பதுடன், அச்சுறுத்தல் காரணிகளுக்கும் (threat actors) பயனை அதிகரிக்கிறது. உங்கள் கட்டமைப்பைப் பலப்படுத்த உதவும் அதே கோப்பு, மற்றொருவர் இலக்கு பட்டியலை உருவாக்கவும் உதவுகிறது.
இந்தத் தகவலைக் கொண்டு என்ன செய்ய வேண்டும்
இந்தத் தரவுத்தொகுப்பை ஒரு threat intelligence feed போலக் கருதுங்கள். இதை வெறும் bookmark செய்துவிட்டு மறந்துவிடாதீர்கள். உங்கள் சூழலில் (environment) ஒரு தீவிரமான சோதனையைச் செய்து பாருங்கள்.
உங்கள் குழுக்கள் தற்போது பயன்படுத்தும் ஒவ்வொரு open-source AI கூறுகளின் பட்டியலை எடுப்பதன் மூலம் தொடங்கவும். வெளிப்படையாகத் தெரிவதைத் தாண்டிப் பார்க்கவும். உங்கள் tokenizers, evaluation scripts, quantization libraries மற்றும் container base images ஆகியவற்றை எந்த repositories வழங்குகின்றன என்று கேளுங்கள். பின்னர் அந்த repositories-களை Gap Map-இல் கண்காணிக்கப்படும் 16,000 கூறுகளுடன் ஒப்பிட்டுப் பார்க்கவும். நீங்கள் பொருத்தங்களைக் கண்டறிந்தால், உங்கள் dependencies திறந்த மூல AI உலகின் மிகவும் முக்கியத்துவம் வாய்ந்த பகுதிகளில் ஒன்று என்பதை உறுதிப்படுத்தியுள்ளீர்கள் என்று அர்த்தம். அந்த முக்கியத்துவம் நன்மைகளையும் தீமைகளையும் கொண்டது. இது பொதுவாக தீவிர பராமரிப்பு மற்றும் சமூகக் கண்காணிப்பைக் குறிக்கிறது, ஆனால் தாக்குபவர்களுக்கு இந்த repositories இருப்பதைத் தெரியவரும் என்பதையும் குறிக்கிறது.
அடுத்து, YAML கட்டமைப்பையே கவனியுங்கள். 1,184 கோப்புகளில் ஒவ்வொன்றும் தயாரிப்புகளை அவற்றின் அடிப்படையான repositories-களுடன் ஒரு தரப்படுத்தப்பட்ட வடிவத்தில் இணைக்கிறது. உங்கள் dependency manifests, package lists அல்லது SBOM exports ஆகியவற்றை இந்த mappings-களுடன் ஒப்பிடுவதற்கு ஒரு எளிய script-ஐ நீங்கள் எழுதலாம். உங்கள் production stack நீங்கள் கேள்விப்படாத repositories-களைச் சார்ந்து இருப்பதை நீங்கள் கண்டறிந்தால், ஆழமாகத் தேடுங்கள். தெரியாத dependencies-களில்தான் supply chain attacks ஒளிந்து கொள்கின்றன.
வன்பொருள் அடுக்கிற்கு (hardware layer) சிறப்பு கவனம் செலுத்துங்கள். பாதுகாப்புத் குழுக்கள் பெரும்பாலும் software மற்றும் models ஆகியவற்றில் கவனம் செலுத்துகின்றன, அதே நேரத்தில் drivers மற்றும் firmware-களைப் புறக்கணித்து விடுகின்றன. Gap Map வன்பொருள் தொடர்பான repositories-களைத் தெளிவாகக் குறிப்பிடுகிறது, இது GPU driver stacks, compiler toolchains மற்றும் accelerator firmware ஆகியவையும் code தான் என்பதை உங்களுக்கு நினைவூட்ட வேண்டும். அவற்றுக்கும் bugs இருக்கும். அவை புதுப்பிக்கப்படுகின்றன. மேலும் அவை காலாவதியான நிலையில் இருந்தால், அவை உங்கள் pipeline-இல் மிக எளிதான இலக்காகிவிடும்.
இறுதியாக, இதைப் பயன்படுத்தவும்
