ஸ்டான்போர்ட் AI முன்னாள் மாணவர்கள் Max Spero மற்றும் Bradley Emi ஆகியோரால் தொடங்கப்பட்ட நியூயார்க் ஸ்டார்ட்அப் நிறுவனமான Pangram, Menlo Ventures தலைமையிலான $9 மில்லியன் Series A நிதிச் சுற்றுத் தொகையைத் திரட்டியுள்ளது. இந்த நிதி, பல்வேறு தளங்களுக்கான API மற்றும் மாதம் $20 கட்டணத்தில் கிடைக்கும் ஒரு Chrome extension ஆகியவற்றை மேம்படுத்தப் பயன்படும். இது AI உதவியுடன் எழுதப்பட்ட உரைகளைக் 99 சதவீதத் துல்லியத்துடன் கண்டறியும் என்று கூறுகிறது—இந்தக் கூற்று செய்தியாளர்கள், அறிஞர்கள் மற்றும் பணியாளர்களைத் தேர்ந்தெடுப்பவர்கள் (recruiters) நம்பகத்தன்மையைச் சரிபார்க்கும் முறையையே மாற்றியமைக்கக்கூடும்.

AI மூலம் உருவாக்கப்படும் "slop" (குப்பைத் தரவு) பெருக்கம்

பெரிய மொழி மாதிரிகள் (Large language models) இப்போது கட்டுரைகள், சமூக ஊடகப் பதிவுகள் மற்றும் சட்டக் குறிப்புகளைக் கூட பெருமளவில் உருவாக்கி வருகின்றன. இதன் விளைவாக: தரமற்ற SEO ஸ்பேம் (spam), ஒருங்கிணைக்கப்பட்ட தவறான தகவல் பிரச்சாரங்கள் மற்றும் மனிதர்கள் AI உருவாக்கிய வரைவுகளைச் செம்மைப்படுத்தும் ஒரு சாம்பல் நிற மண்டலம் (gray zone) உருவாகியுள்ளன. நிறுவனங்கள் ஏற்கனவே இதற்கு எதிர்வினையாற்றத் தொடங்கியுள்ளன. ஆய்வுக்கட்டுரைகளை வெளியிடும் arXiv தளம், சரிபார்க்கப்படாத LLM வெளியீடுகளைச் சமர்ப்பிக்கும் ஆசிரியர்களுக்கு ஓராண்டுத் தடை விதிக்கப்படலாம் என்று எச்சரித்துள்ளது; மேலும், AI உருவாக்கிய போலியான மேற்கோள்களைச் சார்ந்திருக்கும் வழக்கறிஞர்களுக்கு நீதிமன்றங்கள்த் தண்டனை வழங்கத் தொடங்கியுள்ளன. மனிதத் தயாரிப்பிற்கும் இயந்திரத் தயாரிப்பிற்கும் இடையிலான வேறுபாட்டைக் கண்டறிய வேண்டிய அழுத்தம் அதிகரித்து வருகிறது, மேலும் தனது தொழில்நுட்பம் ஒரு இயல்பான சரிபார்ப்புத் தளமாக (default verification layer) மாறும் என்று Pangram நம்புகிறது.

செயற்கை பிரதிபலிப்பு (Synthetic mirroring): ஒவ்வொரு ஆவணத்தின் இரட்டையையும் கொண்டு பயிற்சி செய்தல்

Pangram நிறுவனத்தின் முதன்மை மாதிரியான Pangram 4, "synthetic mirroring" என்று அந்நிறுவனம் அழைக்கும் ஒரு முறையைப் பயன்படுத்துகிறது. அதன் பயிற்சித் தொகுப்பில் உள்ள (பத்து மில்லியன் கணக்கான சரிபார்க்கப்பட்ட ஆவணங்கள்) ஒவ்வொரு மனிதனால் எழுதப்பட்ட ஆவணத்திற்கும், ஒரு மேம்பட்ட LLM மூலம் அதற்கு இணையான ஒரு ஆவணத்தை அந்தத் குழு உருவாக்கியது. இந்தச் செயற்கை இரட்டை ஆவணம், தலைப்பு, நீளம் மற்றும் தொனியில் அசல் ஆவணத்தைப் போலவே இருக்கும், ஆனால் அது AI மூலம் உருவாக்கப்பட்டது. இந்த இரண்டு பதிப்புகளையும் ஒரே நரம்பியல் வலையமைப்பில் (neural net) செலுத்துவதன் மூலம், இயந்திர வெளியீட்டை மறைக்க வடிவமைக்கப்பட்ட "AI humanizer" கருவிகளை எழுத்தாளர்கள் பயன்படுத்தினாலும், AI மூலம் உருவாக்கப்பட்ட உரைகளில் தொடர்ச்சியாக இருக்கும் நுணுக்கமான புள்ளிவிவரத் தடயங்களைக் (statistical fingerprints) கண்டறிய Pangram அந்த மாதிரியைப் பயிற்றுவிக்கிறது.

போட்டியாளர்கள் மெட்டாடேட்டா (metadata) அல்லது கண்ணுக்குத் தெரியாத வாட்டர்மார்க்குகளைப் பயன்படுத்துகின்றனர், ஆனால் அவற்றை நீக்கவோ அல்லது புறக்கணிக்கவோ முடியும். அதற்குப் பதிலாக, Pangram பாணி பகுப்பாய்வில் (stylistic analysis) கவனம் செலுத்துகிறது: அதாவது சொற்களின் தேர்வு, வாக்கியத்தின் ஓட்டம் மற்றும் டோக்கன் விநியோகம் (token distribution) ஆகியவற்றில் ஒரு மாதிரியின் வெளியீட்டில் நிலையாக இருக்கும் முறைகளைக் கண்டறிகிறது. நிறுவனத்தின் அறிக்கையின்படி, உள்நாட்டுச் சோதனைகளில், இந்த அமைப்பு AI உதவியுடன் எழுதப்பட்டவற்றை 99 சதவீதத் துல்லியத்துடன் கண்டறிந்துள்ளது.

API-கள் முதல் உலாவிகள் வரை: இந்தத் தொழில்நுட்பம் எங்கு சென்றடைகிறது

Pangram தன்னை ஒரு குறிப்பிட்ட நோக்கத்திற்காக மட்டுமே பயன்படும் செயலியாகக் கருதாமல், ஒரு உள்கட்டமைப்பாக (infrastructure) முன்வைக்கிறது. இதன் API ஏற்கனவே Substack உடன் ஒருங்கிணைக்கப்பட்டுள்ளது, அங்கு செய்திமடல்கள் (newsletters) எவ்வளவு சதவீதம் AI மூலம் உருவாக்கப்பட்டது என்பதைக் காட்டும் லேபிளைக் காட்டுகின்றன. Q&A தளமான Quora, பல பல்கலைக்கழக எழுத்து மையங்கள் மற்றும் விண்ணப்பதாரர்களின் படைப்புகளின் உண்மைத்தன்மையைச் சரிபார்க்க வேண்டிய ஆட்சேர்ப்பு முகமைகளிலும் (recruitment agencies) இது பயன்படுத்தப்படுகிறது.

தனிப்பட்ட பயனர்களுக்காக, இந்த ஸ்டார்ட்அப் X, LinkedIn, Reddit மற்றும் Medium போன்ற தளங்களில் "feed health score" என்ற மதிப்பீட்டைக் காட்டும் ஒரு Chrome extension-ஐ வழங்குகிறது. இந்த மதிப்பீடு, ஒரு உரை மனிதனால் எழுதப்பட்டதா அல்லது AI மூலம் உருவாக்கப்பட்டதா என்பதன் சதவீதத்தைப் பிரித்துக் காட்டுகிறது. சந்தாதாரர்கள் நிகழ்நேர லேபிளிங் (real-time labeling) மற்றும் சந்தேகத்திற்குரிய பகுதிகளை மேலும் ஆய்வு செய்யக் குறித்துக் காட்டும் வசதிக்காக மாதம் $20 செலுத்துகின்றனர்.

ஒரு சந்தேகப் பார்வை

துல்லியத்தன்மை குறித்தக் கூற்றுகள் தவிர்க்க முடியாமல் ஆய்வுக்கு உட்படுத்தப்படும். ஒரு எழுத்தாளர் ஒரு மாதிரி (model) உருவாக்கிய வரைவைத் திருத்தும் அந்த "சாம்பல் நிற மண்டலத்தில்" (gray area), AI உதவியைக் கண்டறிவது என்பது ஒரு சவாலான காரியமாகும். உருவாக்கும் மாதிரிகள் (generative models) மேம்பட மேம்பட, Pangram நம்பியிருக்கும் பாணி வேறுபாடு குறையக்கூடும், இது கண்டறிதல் மற்றும் தப்பித்தல் நுட்பங்களுக்கு இடையே ஒரு போட்டியை (arms race) உருவாக்கும். தவறான முடிவுகள் (false positives) குறித்தும் விமர்சகர்கள் எச்சரிக்கின்றனர்: ஒரு உண்மையான மனிதப் படைப்பை AI உருவாக்கியது என்று தவறாகக் குறிப்பிட்டால், அது நற்பெயரைப் பாதிக்கலாம், குறிப்பாக கல்வி அல்லது சட்டத் துறைகளில் இதன் பாதிப்பு அதிகமாக இருக்கும்.

புதிய LLM-கள் தோன்றும் போது, புதிய செயற்கை பிரதிபலிப்புகளைக் கொண்டு தனது மாதிரியைத் தொடர்ந்து பயிற்றுவிப்பதாகக் கூறி, இந்தச் சவாலை Pangram ஒப்புக்கொள்கிறது. இருப்பினும், நிறுவனம் தனது உள்நாட்டுச் சோதனைகளைத் தாண்டி, சுயாதீனமான ஒப்பீட்டு முடிவுகளை (benchmark results) வெளியிடவில்லை, இதனால் அந்த 99 சதவீதத் துல்லியத்தை பொதுமக்களே சரிபார்க்க வேண்டியுள்ளது.

கவனிக்க வேண்டியவை

அடுத்த சில மாதங்கள், Pangram தனது முன்னோடி ஒருங்கிணைப்புகளிலிருந்து (pilot integrations) விலகி, பரந்த அளவிலான தளங்களின் பயன்பாட்டிற்குச் செல்ல முடியுமா என்பதை வெளிப்படுத்தும். முக்கியக் குறிகாட்டிகள் பின்வருமாறு:

  • தற்போதைய ஆரம்பகால கூட்டாளிகளின் பட்டியலைத் தாண்டி API ஒப்பந்தங்களின் விரிவாக்கம்.
  • தவறான முடிவுகளின் விகிதம் மற்றும் ஆசிரியர் பணிப்பாய்வுகளில் (editorial workflows) ஏற்படும் தாக்கம் குறித்த நிறுவனப் பயனர்களின் கருத்துக்கள்.
  • மனித பாணியை இன்னும் நெருக்கமாகப் பின்பற்றும் வகையில் மாதிரிகளைப் புதுப்பிக்கும் LLM உருவாக்குநர்களின் எதிர்வினைகள்.
  • சில வெளியீடுகள் அல்லது கல்விச் சமர்ப்பிப்புகளுக்கு AI-கண்டறிதல் கருவிகளைக் கட்டாயமாக்கக்கூடிய ஒழுங்குமுறை மாற்றங்கள்.

இந்த ஸ்டார்ட்அப் குறைந்த பிழை விகிதத்தைப் பராமரித்து, தனது கண்டறியும் திறனைத் தக்கவைத்துக் கொண்டால், அது டிஜிட்டல் நம்பகத்தன்மைக்கான ஒரு தரநிலையாக (de-facto standard) மாறக்கூடும். இல்லையெனில், சந்தையானது பல்வேறு போட்டியிடும் கருவிகளின் தொகுப்பாகப் பிரிந்துவிடும், ஒவ்வொன்றும் அதன் சொந்தக் குறைபாடுகளைக் கொண்டிருக்கும்.

முடிவு

Pangram நிறுவனத்தின் $9 மில்லியன் முதலீடு, கிட்டத்தட்டத் துல்லியமான AI-உதவி கண்டறிதலை உறுதி செய்வதற்காக, இரட்டை-ஆவணப் பயிற்சி முறையை அடிப்படையாகக் கொண்ட ஒரு கண்டறியும் உத்தியை வலுப்படுத்துகிறது. இந்த முறை வளர்ந்து வரும் மொழி மாதிரிகளுடன் இணக்கமானதாகச் செயல்படுகிறதா மற்றும் இதை அதிகம் தேவைப்படும் தளங்கள் மற்றும் நிறுவனங்களிடமிருந்து நம்பிக்கையைப் பெறுகிறதா என்பதில் இதன் வெற்றி தங்கியுள்ளது.