AI முகவர்கள் (AI agents) API-களை அழைக்கவும், கணினி கட்டளைகளை (system commands) இயக்கவும் அல்லது கோப்புகளைக் கையாளவும் கூடிய நிலையில், அவை இப்போது பயனர்களின் சார்பாகச் செயல்படுகின்றன. அந்த முகவர்கள் ஒரு கோரிக்கையை மிகத் துல்லியமாக (literally) எடுத்துக்கொண்டு - ஒரு வீட்டைத் தகர்க்கும் அளவுக்கு "தங்கக் குன்றை" வழங்கினால் - அதன் விளைவு அழிவுகரமானதாகவோ, அறநெறிக்கு மாறானதாகவோ அல்லது பயனற்றதாகவோ இருக்கலாம். ஆராய்ச்சியாளர்கள் Genie coefficient எனப்படும் புதிய அளவீட்டின் மூலம் அந்த இடைவெளியை நிரப்பி வருகின்றனர்; இது ஒரு முகவரின் வெளியீடு பயனரின் உண்மையான நோக்கத்திலிருந்து எவ்வளவு விலகிச் செல்கிறது என்பதை அளவிடுகிறது.

இப்போது தெளிவற்ற விவரக்குறிப்பு (underspecification) ஏன் முக்கியமானது

வெறும் உரையாடல் சார்ந்த பாட்களிலிருந்து (chat-only bots), உலகில் செயல்படும் முகவர்களாக மாறுவது, ஒரு மொழி மாதிரி (language-model) சார்ந்த சிக்கலை ஒரு பாதுகாப்புச் சிக்கலாக மாற்றுகிறது. ஒரு மாதிரி இன்னும் சரளமான உரையை உருவாக்கலாம், ஆனால் அது API அழைப்புகள் அல்லது ஷெல் கட்டளைகளை (shell commands) வழங்கத் தொடங்கும் போது, ஒரு சொல்லின் பொருளை மட்டும் அப்படியே பின்பற்றுவது நிஜ உலகில் பாதிப்புகளை ஏற்படுத்தலாம். அந்த மாதிரிக்கு நடைமுறைப் பயன்பாட்டுத் தன்மை (pragmatics) - அதாவது சூழல், நியாயமான எதிர்பார்ப்புகள் மற்றும் குறிப்பிடப்படாத கட்டுப்பாடுகளைக் கண்டறியும் திறன் - இல்லாததால், அது வார்த்தைகளுக்குக் கீழ்ப்படிந்து, அதன் பின்னால் உள்ள நோக்கத்தை மீறக்கூடும். "ஜினி" (genie) உருவகம் இதைச் சரியாகப் படம் பிடித்துக் காட்டுகிறது: ஒரு விருப்பம், கேட்கப்பட்ட வார்த்தைக்குப் பொருந்தும் விதமாக நிறைவேற்றப்பட்டாலும், அதை விரும்பியவரின் ஆழமான இலக்கை அலட்சியப்படுத்துவது போன்றது இது.

Genie coefficient எதை அளவிடுகிறது

இந்தக் குணகம் (coefficient) என்பது ஒரு ஒற்றை அளவுகோல் எண் அல்ல; இது எதிர்பார்க்கப்படும் முடிவுக்கும் உண்மையான முகவர் செயல்பாட்டிற்கும் இடையிலான இடைவெளியை மதிப்பிடுவதற்கான ஒரு கட்டமைப்பாகும். இது நான்கு தூண்களின் அடிப்படையில் அமைந்துள்ளது:

  • ஒரு குறிப்பிட்ட துறையில் முகவர் எதிர்கொள்ளும் பணிகளைப் பிரதிபலிக்கும் துறை சார்ந்த அளவுகோல்கள் (Domain-specific benchmarks).
  • குறுக்கு வழிகள், விளிம்பு நிலை நிகழ்வுகள் (edge cases) மற்றும் எதிர்பாராத பக்கவிளைவுகள் வெளிப்படும் உண்மை உலக உருவகப்படுத்தப்பட்ட சூழல்கள் (Simulated real-world environments).
  • AI செயல்பாடுகளுக்கான ஒரு விவேகமுள்ள மனிதரின் தரநிலை (reasonable-person standard); இது ஒரு விவேகமுள்ள மனிதர் அதே சூழ்நிலையில் என்ன செய்வார் என்ற சட்டக் கருத்துக்களிலிருந்து பெறப்பட்டது.
  • மொழி மாதிரி மற்றும் மென்பொருள் கட்டமைப்பின் கூட்டு மதிப்பீடு (Joint evaluation of model and software harness); சுற்றியுள்ள குறியீட்டில் (code) உள்ள பிழைகள், மாதிரியின் பிழைகளைப் போலவே ஆபத்தானவை என்பதை இது அங்கீகரிக்கிறது.

இந்தக் கூறுகளைப் பயன்படுத்துவதன் மூலம், டெவலப்பர்கள் சொல்லின் பொருள் மற்றும் நடைமுறைப் பாதுகாப்பு ஆகிய இரண்டையும் உள்ளடக்கிய ஒரு Genie coefficient-ஐ ஒதுக்கீடு செய்ய முடியும்.

டெவலப்பர்கள் மற்றும் பயனர்களுக்கான பாதிப்புகள்

அதிகமான குணகம் என்பது, ஒரு முகவர் கட்டளையின் நோக்கத்தை மீறி அதன் வார்த்தைகளை மட்டும் அப்படியே பின்பற்றும் என்பதைக் குறிக்கிறது. இது பயனர்களை நிதி இழப்பு, தரவு மீறல்கள் அல்லது ஒழுங்குமுறைத் தண்டனைகளுக்கு உள்ளாக்கும். குறைந்த குணகம் என்பது, அந்த அமைப்பு மறைமுகக் கட்டுப்பாடுகளை மதிக்கிறது என்பதைக் காட்டுகிறது, இது நிதி, சுகாதாரம் அல்லது முக்கியமான உள்கட்டமைப்பு போன்ற அதிக ஆபத்துள்ள துறைகளில் இதனைப் பயன்படுத்துவதை எளிதாக்குகிறது.

இந்த அளவீடு தயாரிப்பு குழுக்களுக்கு ஒரு கண்டறியும் கருவியாகவும் (diagnostic tool) அமைகிறது: அவர்களால் அறிவுறுத்தல் நிலைத் தோல்விகளை (instruction-level failures - மாதிரி தூண்டுதலைத் தவறாகப் புரிந்துகொண்டது) மற்றும் தொழில்நுட்பக் குறைபாடுகளை (technical misbehavior - சுற்றியுள்ள குறியீடு API அழைப்பைத் தவறாக வழிநடத்தியது) தனித்தனியாகப் பிரிக்க முடியும். பிழைத்திருத்தம் (debugging), இணக்க அறிக்கையிடல் (compliance reporting) மற்றும் செலவு ஒதுக்கீடு ஆகியவற்றிற்கு இந்த வேறுபாடு முக்கியமானது.

மறுப்புக்களும் திறந்த கேள்விகளும்

நோக்கத்தை அளவிடுவது என்பது அகநிலை சார்ந்தது (subjective) என்றும், அது மேம்பாட்டுச் சுழற்சியைத் தாமதப்படுத்தலாம் என்றும் விமர்சகர்கள் கூறுகின்றனர். ஒவ்வொரு துறைக்கும் ஒரு "விவேகமுள்ள மனிதர்" அடிப்படையை உருவாக்குவதற்கு விரிவான சட்ட மற்றும் அறநெறி நிபுணத்துவம் தேவைப்படலாம், இது மாதிரி மதிப்பீட்டின் சுமையைக் கூட்டக்கூடும். மேலும், குழுக்கள் இந்த குணகத்தை ஒரு வழிகாட்டியாகக் கருதாமல், வெறும் சரிபார்ப்புப் பட்டியலாக (checkbox) மட்டும் கருதும் அபாயமும் உள்ளது.

அடுத்து கவனிக்க வேண்டியவை

அடுத்த கட்டமாக, Genie coefficient-ஐ தற்போதுள்ள AI சோதனை வழிமுறைகளில் (testing pipelines) இணைப்பதும், அதற்குத் தேவையான அளவுகோல் தொகுப்புகளை (benchmark suites) தரப்படுத்துவதும் அடங்கும். தொழில்முறை குழுக்கள் இதனை ஒரு பாதுகாப்பு அடிப்படையாக ஏற்றுக்கொண்டால், முகவர்கள் வாடிக்கையாளர்களைச் சென்றடைவதற்கு முன் சான்றிதழ் திட்டங்கள் ஒரு குறிப்பிட்ட அளவிலான குணகத்தைக் கோரலாம். ஆராய்ச்சியாளர்கள் விவேகமுள்ள மனிதர் என்ற வரையறையை மேலும் செம்மைப்படுத்தவும், நம்பகமான அளவீட்டிற்குத் தேவையான உருவகப்படுத்தப்பட்ட சூழல்களைத் தானாகவே உருவாக்கும் வழிகளை ஆராயவும் வாய்ப்புள்ளது.

சுருக்கமாகச் சொன்னால்: AI முகவர்கள் உரையாடலில் இருந்து செயல்களுக்கு நகரும்போது, பயனர்கள் என்ன சொல்கிறார்கள் என்பதை மட்டுமல்லாமல், அவர்கள் உண்மையில் என்ன விரும்புகிறார்கள் என்பதை அவர்கள் எவ்வளவு நன்றாகப் புரிந்துகொள்கிறார்கள் என்பதை அளவிடுவது அவசியமாகிறது. Genie coefficient என்பது அந்த அளவீட்டை நடைமுறைப்படுத்துவதற்கான ஒரு உறுதியான மற்றும் வளர்ந்து வரும் வழியாகும்.