நிறுவனங்கள் தன்னாட்சி பெற்ற AI ஏஜென்ட்களை (autonomous AI agents) பயன்பாட்டிற்கு கொண்டு வரப் போட்டியிடுகின்றன, ஆனால் உள்நாட்டுச் சோதனைகளுக்கும் நிஜ உலகச் செயல்பாடுகளுக்கும் இடையே ஒரு ஆபத்தான இடைவெளி உருவாகி வருகிறது. நிறுவனங்கள் ஏஜென்ட்களுக்கு அதிக தன்னாட்சியை வழங்குகின்றன, ஆனால் நிர்வாகக் கட்டமைப்புகள் (governance frameworks) வாடிக்கையாளர் சார்ந்த பிழைகளை முன்கூட்டியே கணிக்கத் தவறிவிடுகின்றன.

யதார்த்த-ஒத்திசைவுப் பிரச்சினை (The Reality-Alignment Problem)

VentureBeat Pulse ஆராய்ச்சி நிறுவன AI-இல் ஒரு வியக்கத்தக்க "மதிப்பீட்டு இடைவெளியை" (evaluation gap) வெளிப்படுத்தியுள்ளது. நிறுவனங்களில் 50 சதவீதம், அனைத்து உள்நாட்டு மதிப்பீடுகளையும் தேர்ச்சி பெற்ற ஒரு AI ஏஜென்ட் அல்லது LLM அம்சத்தை வெளியிட்டன, ஆனால் ஒரு உண்மையான வாடிக்கையாளர் அதனுடன் தொடர்பு கொள்ளும் தருணத்தில் அது தோல்வியடைந்தது.

இன்னும் மோசமாக, அந்த நிறுவனங்களில் 24% ஒரே தோல்வி மீண்டும் மீண்டும் ஏற்படுவதைக் கண்டன, இது சிக்கலான விளிம்புநிலை நிகழ்வுகளை (edge cases) உருவகப்படுத்துவதில் உள்ள தொடர்ச்சியான இயலாமையை வெளிப்படுத்துகிறது. பிழைகள் பெரும்பாலும் தனித்தனி தவறான பதில்களிலிருந்து உருவாவதில்லை, மாறாகச் சிதைந்த தர்க்கச் சங்கிலிகளிலிருந்து (broken reasoning chains) உருவாகின்றன; இது தற்போதைய அளவுகோல்கள் (benchmarks) ஏஜென்டிக் பணிப்பாய்வுகளின் (agentic workflows) கணிக்க முடியாத தன்மையைக் கண்டறிவதில்லை என்பதைக் காட்டுகிறது.

தானியங்கி மதிப்பீடுகளில் நம்பிக்கையின் நெருக்கடி (The Crisis of Trust in Automated Evals)

இன்று ஆய்வு செய்யப்பட்ட நிறுவனங்களில் 5% மட்டுமே தானியங்கி மதிப்பீடுகளை முழுமையாக நம்புகின்றன. இந்த நம்பிக்கையின்மை இரண்டு தொழில்நுட்பக் குறைபாடுகளிலிருந்து உருவாகிறது:

  • மோசமான நிஜ உலக ஒத்திசைவு: 29% தலைவர்கள் தங்கள் மதிப்பீடுகள் வாடிக்கையாளர் தொடர்புகளில் உண்மையில் என்ன நடக்கிறது என்பதைப் பிரதிபலிக்கவில்லை என்று கூறுகின்றனர்.
  • சார்பு மற்றும் நிலையற்ற தன்மை: 21% பேர் தங்கள் சோதனை கட்டமைப்புகளிலிருந்து சாய்ந்த அல்லது நிலையற்ற முடிவுகள் கிடைப்பதாகத் தெரிவிக்கின்றனர்.

மதிப்பீட்டு அடுக்கு (evaluation stack) சிதறிக்கிடக்கிறது. பல நிறுவனங்கள் மாடல் உருவாக்குநர்களிடமிருந்து கிடைக்கும் இயல்பான கருவிகளை (native tools) மட்டுமே நம்பியிருக்கின்றன; 17% நிறுவனங்களிடம் பிரத்யேக மதிப்பீட்டு கருவிகளே இல்லை. தோராயமாக கால் பகுதி நிறுவனங்கள் நேரடிப் போக்குவரத்தில் (live traffic) நிகழ்நேரத் தரக் கட்டுப்பாடுகளைச் செய்கின்றன, மற்றவை பயனர்களைச் சென்றடைந்த பின்னரே சிக்கல்களைக் கண்டறிய வேண்டிய நிலைக்குத் தள்ளப்படுகின்றன.

தன்னாட்சியின் வேகம் vs. உறுதித்தன்மையின் மெதுவான வேகம் (The Velocity of Autonomy vs. the Slow Pace of Assurance)

மூன்றில் இரண்டு பங்கு (66%) நிறுவனங்கள் 'மனிதத் தலையீடு இல்லாத' (zero-human-in-the-loop) பயன்பாட்டை நோக்கி நகர்கின்றன. முப்பத்து நான்கு சதவீதம் நிறுவனங்கள் ஏற்கனவே குறைந்த ஆபத்துள்ள ஏஜென்ட்களுக்கு முழுமையான தானியங்கி வெளியீட்டை அனுமதிக்கின்றன, மேலும் மற்ற 33% நிறுவனங்கள் பன்னிரண்டு மாதங்களுக்குள் அந்த நிலையை அடையப் பொறியியல் கட்டமைப்புகளை (pipelines) உருவாக்கி வருகின்றன.

ஏஜென்ட்கள் அவற்றைக் கண்காணிக்கவும் திருத்தவும் வடிவமைக்கப்பட்ட வழிமுறைகளை விட வேகமாக முடிவெடுக்கும் அதிகாரத்தைப் பெறுகின்றன. நிலையான அளவுகோல்களுக்குப் பதிலாக, நேரடி மற்றும் கணிக்க முடியாத பயனர் நடத்தையை வைத்து ஏஜென்ட்களைச் சரிபார்க்கும் பிரத்யேகக் கண்காணிப்பு (observability) மற்றும் மதிப்பீட்டுத் தளங்களைச் சந்தை இப்போது கோருகிறது.

முக்கியக் கருத்துக்கள் (Key Takeaways)

  • வெற்றி முரண்பாடு (The Success Paradox): 50% நிறுவனங்கள் உள்நாட்டுச் சோதனைகளில் தேர்ச்சி பெற்ற ஆனால் பயன்பாட்டில் (production) தோல்வியடைந்த ஏஜென்ட்களை வெளியிட்டன.
  • நம்பிக்கை பற்றாக்குறை (The Trust Deficit): சோதனைகள் நிஜ உலக முடிவுகளுடன் ஒத்திசைவு இல்லாததால், 5% மட்டுமே தானியங்கி மதிப்பீடுகளை முழுமையாக நம்புகின்றன.
  • தன்னாட்சிப் போட்டி (The Autonomy Race): 66% நிறுவனங்கள் ஏற்கனவே மனிதத் தலையீடு இல்லாத பயன்பாடுகளைப் பயன்படுத்துகின்றன அல்லது திட்டமிட்டு வருகின்றன.

நிறுவனங்கள் முழுமையான தன்னாட்சி பயன்பாடுகளை நோக்கித் துரிதப்படுத்தும் வேளையில், உள்நாட்டுச் சோதனைகளைத் தாண்டும் நிறுவன AI ஏஜென்ட்களில் பாதி, உண்மையான வாடிக்கையாளரைச் சந்திக்கும்போது தடுமாறுகின்றன என்று VentureBeat Pulse ஆராய்ச்சி காட்டுகிறது, இது விரிவடைந்து வரும் “மதிப்பீட்டு இடைவெளியை” (evaluation gap) அடிக்கோடிட்டுக் காட்டுகிறது.

LLM சார்ந்த ஏஜென்ட்களைப் பயன்பாட்டிற்கு கொண்டு வந்த அல்லது அதற்காகத் தயாராகி வரும் நிறுவனங்களை இந்த ஆய்வு விசாரித்தது. பதிலளித்தவர்களில் 50% பேர் ஒவ்வொரு உள்நாட்டு அளவுகோலையும் (benchmark) தேர்ச்சி பெற்ற ஒரு ஏஜென்ட்டை வெளியிட்டனர், ஆனால் அது பயன்பாட்டில் தோல்வியடைவதைக் கண்டனர். கூடுதலாக 24% பேர் இதே தோல்வி ஒன்றுக்கும் மேற்பட்ட முறை ஏற்பட்டதாகத் தெரிவித்தனர், இது இன்றைய சோதனை முறைகளில் இந்தப் பிரச்சினை ஒரு தொடர்ச்சியான மறைவிடமாக (blind spot) இருப்பதை உறுதிப்படுத்துகிறது.

ஏன் உள்நாட்டுச் சோதனைகள் இலக்கைத் தவறவிடுகின்றன

இந்த இடைவெளி வெறும் பரப்பளவைப் (coverage) பற்றியது மட்டுமல்ல. ஆய்வக உருவகங்களுக்கும் (lab simulations) நிஜ உலகத் தொடர்புகளின் சிக்கல்களுக்கும் இடையே உள்ள ஆழமான ஒத்திசைவின்மையைக் பதிலளிப்பவர்கள் சுட்டிக்காட்டினர். பிழைகள் பெரும்பாலும் தனித்தனி தவறான பதில்களிலிருந்து உருவாவதில்லை, மாறாக ஒரு ஏஜென்ட்டின் உள் தர்க்கம் எதிர்பார்க்கப்படும் முடிவுகளிலிருந்து விலகிச் செல்லும்—அதாவது சிதைந்த தர்க்கச் சங்கிலிகளிலிருந்து (broken reasoning chains) உருவாகின்றன.

புகார்களில் இரண்டு தொழில்நுட்பக் குறைபாடுகள் ஆதிக்கம் செலுத்துகின்றன:

  • மோசமான நிஜ உலக ஒத்திசைவு – 29% தலைவர்கள், ஒரு வாடிக்கையாளர் ஏஜென்ட்டுடன் தொடர்பு கொள்ளும்போது உண்மையில் என்ன நடக்கிறது என்பதைத் தங்கள் மதிப்பீடுகள் பிரதிபலிக்கவில்லை என்று கூறினர்.
  • சார்பு மற்றும் நிலையற்ற தன்மை – 21% பேர் தங்கள் சோதனை கட்டமைப்புகள் சாய்ந்த அல்லது நிலையற்ற முடிவுகளைத் தருவதாகக் குறிப்பிட்டனர், இது அவர்கள் நம்பியிருக்கும் அளவீடுகளின் மீதான நம்பிக்கையைச் சிதைக்கிறது.

இந்தப் பிரச்சினையை மேலும் சிக்கலாக்கும் வகையில், மதிப்பீட்டு அடுக்கு (evaluation stack) மிகவும் சிதறிக்கிடக்கிறது. பல நிறுவனங்கள் மாடல் விற்பனையாளர்களால் வழங்கப்படும் இயல்பான கருவிகளை மட்டுமே நம்பியிருக்கின்றன, அதே சமயம் 17% நிறுவனங்கள் தங்களுக்குத் பிரத்யேக மதிப்பீட்டு கருவிகளே இல்லை என்பதை ஒப்புக்கொள்கின்றன. கால் பகுதி நிறுவனங்கள் மட்டுமே நேரடிப் போக்குவரத்தில் நிகழ்நேரத் தரக் கட்டுப்பாடுகளைச் செய்கின்றன, இதனால் பெரும்பாலானவை பயனர்களைச் சென்றடைந்த பின்னரே சிக்கல்களைக் கண்டறிய வேண்டிய நிலைக்குத் தள்ளப்படுகின்றன.

நம்பிக்கையின் பற்றாக்குறை

ஆய்வு செய்யப்பட்ட நிறுவனங்களில் வெறும் 5% மட்டுமே இன்று தானியங்கி மதிப்பீடுகளை முழுமையாக நம்புவதாகக் கூறுகின்றன. இந்த நம்பிக்கையின்மை மேலே விவரிக்கப்பட்ட ஒத்திசைவு மற்றும் சார்புப் பிரச்சினைகளின் நேரடி விளைவாகும். ஒரு சோதனைத் தொகுப்பால் (test suite) பயன்பாட்டு நடத்தையை நம்பகமான முறையில் கணிக்க முடியாதபோது, மனித மேற்பார்வை இன்றி ஏஜென்ட்களைச் செயல்பட அனுமதிக்க நிர்வாகிகள் தயங்குகிறார்கள்.

Autonomy is outpacing assurance

Despite low confidence in testing, the push for autonomy is relentless. Two-thirds of respondents—66 %—are moving toward zero-human-in-the-loop deployments. Within that group, 34 % already allow fully automated rollout for low-risk agents, and another 33 % are engineering pipelines to reach the same point within the next twelve months.

Agents gain decision-making power faster than the mechanisms designed to monitor and correct them. The market implication is clear: a growing demand for specialized observability and evaluation platforms that can validate agents against live, unpredictable user behavior rather than static benchmarks.