Hugging Face என்பது வெறும் மாடல்களின் தொகுப்பு (model zoo) என்பதைத் தாண்டி ஒரு முக்கியமான இடத்தைப் பிடித்துள்ளது. அங்கு டிரெண்டிங்கில் இருக்கும் ஆய்வுக் கட்டுரைகள், AI சமூகம் உண்மையில் எந்தத் திசையை நோக்கிச் செல்கிறது என்பதைக் காட்டும் திசைகாட்டியாகச் செயல்படுகின்றன. பல ஆண்டுகளாக, ஆதிக்கம் செலுத்திய கருத்து எளிமையானதாக இருந்தது: அதிக அளவு அளவுருக்கள் (parameters), அதிக தரவு (data), மற்றும் அதிக கணினித் திறன் (compute). அந்த யுகம் முடிந்துவிடவில்லை, ஆனால் அதுவே முழுமையான கதை அல்ல. சமீபத்திய செல்வாக்குமிக்க ஆய்வுக் கட்டுரைகள் ஒரு தெளிவான முன்னுரிமை மாற்றத்தை வெளிப்படுத்துகின்றன. இந்த அமைப்புகள் யதார்த்தத்தோடு மோதும்போது நிலைத்து நிற்குமா என்பது குறித்து ஆராய்ச்சியாளர்களும் உருவாக்குநர்களும் கடினமான கேள்விகளை எழுப்புகிறார்கள். கவனம் இப்போது வெறும் அளவீடுகளில் (raw scale) இருந்து செயல்பாட்டு முறைக்கு (operationalization) மாறுகிறது—மாடல்கள் எவ்வாறு சிந்திக்கின்றன (reasoning), அவை குறைந்த விலையுள்ள வன்பொருள்களில் (cheap hardware) எவ்வாறு இயங்குகின்றன, ஒரு மென்பொருள் சூழலில் இருந்து மற்றொரு சூழலுக்கு அவை எவ்வாறு மாறுகின்றன, மற்றும் அவை அறிவியலின் முன்னேற்றத்திற்கு எவ்வாறு உதவுகின்றன என்பதில் கவனம் திரும்புகிறது.
அழுத்தத்திலும் நிலைத்து நிற்கும் சிந்தனைத் திறன் (Reasoning)
பெரிய மொழி மாதிரிகளை (large language models) நாம் எவ்வாறு பயிற்றுவிக்கிறோம் என்பதற்கும், அவற்றை எவ்வாறு பயன்படுத்துகிறோம் என்பதற்கும் இடையே ஒரு வளர்ந்து வரும் இடைவெளி உள்ளது. ஒரு மாடல் பயிற்சியின் போது இழப்பைக் (loss) மிக அழகாகக் குறைக்கலாம், ஆனால் ஒரு கோடிங் பிழை (coding bug) அல்லது பல படிநிலைகளைக் கொண்ட கணிதச் சான்றை (math proof) நிரூபிக்க முயலும்போது அது தோல்வியடையக்கூடும். சமீபத்திய ஒரு ஆய்வுக் கட்டுரை, இதற்குத் தீர்வாக மற்றொரு பயிற்சித் தந்திரம் (training trick) போதாது என்று வாதிடுகிறது. மாடல்கள் பயிற்சியின் அளவீடுகளில் (training metrics) எவ்வாறு மதிப்பெண் பெறுகின்றன என்பதை மட்டும் பார்க்காமல், அவை அனுமானத்தின் (inference) போது எவ்வாறு செயல்படுகின்றன என்பதை நாம் மேம்படுத்த வேண்டும். பெரும்பாலான வலுவூட்டல் கற்றல் (reinforcement learning) வழிமுறைகள் இன்னும் பயிற்சியின் போது கிடைக்கும் வெகுமதிகளை (training-time rewards) மட்டுமே துரத்துகின்றன. முன்மொழியப்பட்ட இந்த மறுசிந்தனை என்பது 'chain of thought' எனப்படும் சிந்தனைச் சங்கிலியை நிலைப்படுத்துவதாகும். கோடிங் உதவியாளர்கள் அல்லது கணித ஆசிரியர்களை உருவாக்கும் எவருக்கும், இது ஒரு நடைமுறை மாற்றமாகும். லீடர்போர்டு துல்லியத்தை (leaderboard accuracy) மட்டும் நம்புவதை நிறுத்திவிட்டு, ப்ராம்ப்ட் (prompt) குழப்பமாக இருக்கும்போது மாடலின் சிந்தனைத் திறன் சீராக இருக்கிறதா என்பதைச் சோதனை செய்யத் தொடங்குங்கள்.
கற்றவற்றையும் நினைவில் கொள்ளும் GUI ஏஜெண்டுகள் (Agents)
ஏஜெண்டுகள் ஒரு தளப் பிரச்சனைக்கு (platform problem) உள்ளாகியுள்ளன. ஒரு Chrome டேப்பில் விமானப் பயணங்களைச் சரியாக முன்பதிவு செய்யும் ஒரு அமைப்பு, நீங்கள் ஒரு Android போனில் அமைப்புகளை மாற்றச் சொல்லும்போது பெரும்பாலும் அனைத்தையும் மறந்துவிடும். இந்தத் தோல்வி 'catastrophic forgetting' எனப்படும் முற்றிலுமாக மறக்கும் நிலை ஆகும். புதிய ஆராய்ச்சி இதனை 'multi-teacher distillation' மூலம் கையாள்கிறது. ஒரே ஒரு இடைமுகத்தில் (interface) பயிற்சி பெற்று அறிவு மாறும் என்று நம்புவதற்குப் பதிலாக, ஏஜென்ட் பல்வேறு தளங்களில் நிபுணத்துவம் பெற்ற பல ஆசிரியர்களிடமிருந்து ஒரே நேரத்தில் கற்றுக்கொள்கிறது. மாணவர் நெட்வொர்க் (student network) இணையம், மொபைல் மற்றும் டெஸ்க்டாப் தர்க்கங்களை (logic) ஒரே நேரத்தில் எதிர்கொள்வதால், பழைய திறன்களை இழக்காமல் சூழல்களைக் கடந்து செல்கிறது. தயாரிப்பு குழுக்களுக்கு (product teams), இதன் பொருள் என்னவென்றால், இரண்டு முற்றிலும் தனித்தனி ஏஜென்ட் அமைப்புகளைப் பராமரிக்காமல், உங்கள் இணையப் பின்னணி (web backend) மற்றும் மொபைல் முன்முனை (mobile frontend) ஆகிய இரண்டையும் கையாளக்கூடிய ஒரே உதவியாளரை நீங்கள் இறுதியாக உருவாக்க முடியும் என்பதாகும்.
பெரிய மாடல்களை எதார்த்த நிலைக்குக் கொண்டு வருதல்
ஒரு ரோபோவில் பெரிய அடிப்படை மாடலை (foundation model) இயக்குவது என்பது எப்போதும் மென்பொருள் பிரச்சனை போலத் தோன்றும் ஒரு இயற்பியல் (physics) பிரச்சனையாகவே இருந்துள்ளது. மாடல் ஒரு சர்வர் ரேக்கில் (server rack) பொருந்தலாம், ஆனால் அது ஒரு ட்ரோனின் (drone) மின்சார வரம்பிற்குள் அல்லது ஒரு உற்பத்தி கையின் (manufacturing arm) உள்ளமைக்கப்பட்ட கணினிக்குள் பொருந்தாது. இந்த இடைவெளியைக் குறைக்கவே ஒரு புதிய C++ ரன்டைம் (runtime) வடிவமைக்கப்பட்டுள்ளது, இது கனமான மாடல்களைப் பல்வேறு வகையான ரோபோ வன்பொருள்கள் மற்றும் எட்ஜ் சாதனங்களுக்கு (edge devices) மாற்றுகிறது. இது வேகமான அனுமானத்தைப் (inference) பற்றியது மட்டுமல்ல; இது இடமாற்றத் திறன் (portability) பற்றியது. விலையுயர்ந்த GPU-களில் ஆய்வகத்தில் உருவாக்கப்பட்ட ஒரு மாடலை, மீண்டும் புதிதாக எழுதாமலேயே ஒரு Jetson மாட்யூல் அல்லது ரோபோவின் உள்ளூர் கட்டுப்பாட்டாளருக்கு (local controller) கொண்டு வர முடியும். இந்த இடமாற்றத் திறனே ஒரு மானிய நிதி பெற்ற டெமோவிற்கும் (grant-funded demo), சந்தைக்கு வரும் ஒரு தயாரிப்பிற்கும் (product) இடையிலான வேறுபாடாகும்.
தரவு வடிகட்டியை விட தரவு செய்முறை (Data Recipe) முக்கியமானது
விஷன்-லாங்குவேஜ் மாடல்களுக்கு (Vision-language models) பெரிய தட்டுகள் தேவையில்லை, சிறந்த உணவு முறைகளே (better diets) தேவைப்படுகின்றன. புதிய அளவுகோல்கள் (benchmarks) ஒரு கசப்பான உண்மையைச் சொல்கின்றன: மோசமான தரவை வடிகட்டுவது (filtering) பாதிப் போர் மட்டுமே. நீங்கள் இமேஜ் கேப்ஷன்கள் (image captions), சார்ட் பார்சிங் (chart parsing), தரமான உரையாடல் (grounded conversation) மற்றும் விஷுவல் கேள்வி பதில் (visual question answering) ஆகியவற்றை எந்த விகிதத்தில் கலக்கிறீர்கள் என்பதுதான், உங்கள் மல்டிமோடல் உதவியாளர் (multimodal assistant) நுணுக்கங்களைப் புரிந்துகொள்கிறதா அல்லது தவறான உறவுகளைக் கற்பனை செய்கிறதா (hallucinates) என்பதைத் தீர்மானிக்கிறது. செய்முறை தவறாக இருந்தால், தரவு மிகத் தூய்மையாக இருந்தாலும் மாடல் தடுமாறும். இது தரவுத்தொகுப்பு கட்டமைப்பை (dataset construction) வெறும் சுத்தம் செய்யும் வேலையிலிருந்து (janitorial work) செய்முறை பொறியியலை (recipe engineering) நோக்கிய மாற்றத்திற்குத் தள்ளுகிறது. உங்கள் குழு ஒரு விஷுவல் உதவியாளரை உருவாக்கினால், உங்கள் வடிகட்டிகளை (filters) மட்டும் பார்க்காமல், உங்கள் கலவைகளை (mixtures) ஆய்வு செய்யுங்கள்.
பிக்சல் ஸ்பேஸில் (Pixel Space) 3D உருவாக்கம்
பெரும்பாலான உருவாக்கும் 3D வழிமுறைகள் (generative 3D pipelines) உலகத்தை ஒரு மறைக்கப்பட்ட லேட்டன்ட் ஸ்பேஸிற்குள் (latent space) சுருக்குகின்றன. இதனால் விவரங்கள் மறைந்துவிடுகின்றன, விளிம்புகள் மங்கலாகின்றன. ஒரு விரைவான முன்னோட்டத்திற்கு (preview) இந்த இழப்பு ஏற்றுக்கொள்ளத்தக்கது, ஆனால் ஒரு கேம் அசெட் (game asset) அல்லது உண்மையான வடிவியலுடன் (geometry) ஒத்துப்போக வேண்டிய ஓர் AR ஓவர்லேக்கு (AR overlay) இது பயன்படாது. வளர்ந்து வரும் முறைகள் இந்தத் தடையைத் தவிர்த்து நேரடியாக பிக்சல் ஸ்பேஸில் (pixel space) செயல்படுகின்றன. இதன் விளைவாகக் கிடைக்கும் காட்சிகள் கூர்மையாகவும், இடஞ்சார்ந்த உறவுகள் (spatial relationships) சீராகவும் இருக்கும், மேலும் இதன் வெளியீட்டை கேமிங் மற்றும் AR/VR தயாரிப்பு வழிமுறைகளுக்கு நேரடியாகப் பயன்படுத்த முடியும். கலைஞர்கள் மற்றும் தொழில்நுட்ப இயக்குநர்களுக்கு (technical directors) இது முக்கியமானது, ஏனெனில் இது 3D உருவாக்கத்தை கடினமாக்கிய விலையுயர்ந்த போஸ்ட்-புராசஸிங் (post-processing) சுத்திகரிப்புப் பணிகளை நீக்குகிறது.
AI ஆராய்ச்சியின் வேலைப்பளுவைச் செய்யத் தொடங்கும் போது
ஆய்வுக் கட்டுரையை எழுதுவது என்பது ஒரு விஞ்ஞானியின் வேகத்தைக் குறைக்கும் காரணியாக அரிதாகவே இருக்கும். போஸ்டர், மூன்று நிமிட வீடியோ சுருக்கம், வலைப்பதிவுத் தொகுப்பு மற்றும் சமூக ஊடகத் தொடர் (social thread) ஆகியவையே ஒரு வார நேரத்தை விழுங்கிவிடுகின்றன. புதிய கருவிகள் இப்போது ஒரு ஆய்வுக் கட்டுரையை மட்டும் உள்ளீடாகப் பெற்று, அந்த முழுத் தகவல் தொடர்புத் தொகுப்பையும் (communication stack) தானாகவே உருவாக்குகின்றன. கண்டுபிடிப்புத் தரப்பில், மற்ற அமைப்புகள் உண்மையான ஆதாரங்களுக்காக இலக்கியங்களை (literature) வாசிக்கின்றன; மேலும் வெறும் யூகங்களின் அடிப்படையில் அல்லாமல், ஆவணப்படுத்தப்பட்ட இடைவெளிகளின் அடிப்படையில் ஆராய்ச்சித் திசைகளை முன்மொழிகின்றன. இதன் விளைவாக, பரிசோதனையிலிருந்து நுண்ணறிவைப் பெறுவதற்கான சுழற்சி குறைகிறது. முதுகலை மாணவர்கள் மற்றும் முதன்மை ஆய்வாளர்கள் (principal investigators) ஆகிய இருவருமே, வடிவமைப்பிற்கு (formatting) செலவிடும் நேரத்திற்குப் பதிலாக, சிந்திப்பதற்கே பல மணிநேரங்களை மீட்க முடியும்.
யூகங்களைக் கொண்டு அல்லாமல், வடிவியலைக் (Geometry) கொண்டு ஆப்டிமைசர்களைத் (Optimizers) தேர்ந்தெடுத்தல்
Adam மற்றும் Lion ஆகியவற்றுக்கு இடையே தேர்ந்தெடுப்பது என்பது இன்னும் ஆய்வகத்தின் Slack சேனல்கள் மூலம் கடத்தப்படும் ஒரு குழு சார்ந்த அறிவாகவே (tribal knowledge) உணரப்படுகிறது. புதிய ஆய்வுகள் ஒரு வடிவியல் வகைப்பாட்டு முறையைப் (geometric classification system) பயன்படுத்தி இந்தப் பிரச்சனையை மறுவரையறை செய்கின்றன. மீண்டும் ஒருமுறை தேடல் (sweep) செய்வதற்காக GPU நேரத்தை வீணாக்குவதற்குப் பதிலாக, ஆப்டிமைசர்களை அவற்றின் வடிவியல் பண்புகளின் மூலம் ஒப்பிடலாம் மற்றும் அவை உங்கள் loss landscape-உடன் எவ்வாறு வினைபுரியும் என்பதைக் கணிக்கலாம். இது தேர்வை ஒரு மாயாஜாலத்திலிருந்து ஒரு நோயறிதல் (diagnosis) முறைக்கு மாற்றுகிறது. பயிற்சியாளர்களாகிய உங்களுக்கு, ஆப்டிமைசரின் வடிவியல் தரவின் வடிவியலோடு முரண்படுவதால் அமைதியாகத் தோல்வியடையும் பயிற்சிச் சுழற்சிகளைக் (training runs) குறைக்க இது உதவும்.
விளைவுகளை உண்மையாகவே புரிந்துகொள்ளும் உலக மாதிரிகள் (World Models)
ஒரு ரோபோ தனது பாதையைத் திட்டமிடுவதைக் காட்டும் ஒரு வீடியோ மிகச்சிறப்பாகத் தோன்றலாம், ஆனால் அது எதையும் நிரூபிப்பதில்லை. ஒரு உலக மாதிரி (world model) தனது செயல்களின் நீண்டகால விளைவுகளைக் கணிக்கிறதா என்பதே உண்மையான சோதனை. இப்போது அந்தப் பெட்டியைத் தூக்குவது, பின்னர் ரோபோவின் கையை அலமாரிக்கு பின்னால் சிக்க வைக்குமா? புதிய அளவுகோல்கள் (benchmarks) காட்சித் தன்மையை (visual polish) நீக்கிவிட்டு, காரண காரியத் தொலைநோக்குப் பார்வையைக் (causal foresight) கொண்டு மாதிரிகளுக்கு மதிப்பெண் வழங்குகின்றன. ஏனெனில், ஒரு அழகான சிமுலேட்டர் (simulator) நசுங்கிய சென்சாரையோ அல்லது சரிந்து விழுந்த பலகையையோ சரிசெய்ய முடியாது என்பதால் இது முக்கியமானது. ரோபோட்டிக்ஸ் நிபுணர்களுக்குப் பருப்பொருள் உலகின் (physical world) சவால்களுக்கு இணையான மதிப்பீடு தேவைப்படுகிறது.
GPU செலவின்றி டிஃப்யூஷன் (Diffusion) மாதிரிகளை இயக்குதல்
டிஃப்யூஷன் மாதிரிகள் பிரமிக்க வைக்கும் படங்களை உருவாக்குகின்றன, ஆனால் அவை அதிகப்படியான கணினிச் செலவுடன் (compute bill) வருகின்றன. புதிய குவாண்ட்டைசேஷன் (quantization) நுட்பங்கள், மிகப்பெரிய புதிய தரவுத்தொகுப்புகளோ அல்லது முழுமையான மறுபயிற்சியோ (retraining) தேவையில்லாமல், சிறிய GPU-களுக்காக இந்த எடைகளை (weights) சுருக்குகின்றன. துல்லியத்தில் (fidelity) ஒரு சிறிய இழப்பை ஏற்றுக்கொண்டு, உள்ளூரிலேயே (locally) இயக்குவதற்கோ, இருக்கும் வன்பொருளில் (hardware) அதிக வேலைகளைச் செய்வதற்கோ அல்லது பிரீமியம் கிளஸ்டர்களை வாடகைக்கு எடுக்காமல் இன்ஃபரன்ஸை (inference) வழங்குவதற்கோ நீங்கள் இதைப் பயன்படுத்தலாம். ஸ்டுடியோக்கள் மற்றும் தனிப்பட்ட படைப்பாளர்களுக்கு, இது உருவாக்கும் ஊடகங்களின் (generative media) பொருளாதாரத்தையே மாற்றுகிறது. வீடியோ மற்றும் பட உருவாக்கத்துடன் பரிசோதனை செய்வதற்கான தடையானது கணிசமாகக் குறைகிறது.
உண்மையான முடிவு
இந்த அனைத்துப் பணிகளின் பின்னணியில் உள்ள பொதுவான அம்சம் செயல்பாட்டுமயமாக்கல் (operationalization) ஆகும். பெரியது என்பது தானாகவே சிறந்தது என்ற நிலையைக் கடந்து சமூகம் முன்னேறிவிட்டது. முக்கியத்துவம் பெறும் ஆய்வுக் கட்டுரைகள், இன்ஃபரன்ஸ் நேர நிலைத்தன்மை (inference-time stability), தரவு கலவை உத்தி (data mixing strategy), குறுக்குத் தள நினைவகம் (cross-platform memory), எட்ஜ் வரிசைப்படுத்துதல் (edge deployment) மற்றும் ஆதார அடிப்படையிலான கண்டுபிடிப்பு ஆகியவற்றிற்கு முன்னுரிமை அளிக்கின்றன. அவை மாதிரியை வன்பொருள் கட்டுப்பாடுகள், பயனர் இடைமுகங்கள் மற்றும் ஆராய்ச்சி பணிப்பாய்வுகள் (research workflows) உள்ளிட்ட ஒரு பெரிய அமைப்பின் ஒரு அங்கமாகவே கருதுகின்றன.
நீங்கள் தயாரிப்புகளை வெளியிடுபவராக இருந்தால், செய்தி தெளிவானது. ஆய்வுக் கட்டுரைகளின் அளவீடுகளுக்காக அல்லாமல், பயன்பாட்டு யதார்த்தத்திற்காக (deployment reality) மேம்படுத்துங்கள். நினைவில் கொள்ளும் ஏஜெண்டுகளையும் (agents), நிஜ சாதனங்களில் பொருந்தக்கூடிய மாதிரிகளையும் உருவாக்குங்கள்.
