ChatGPT ஒரு பொதுவான பெயராக மாறியதிலிருந்து, AI கண்டறியும் கருவிகளைச் (AI detectors) சுற்றி ஒரு கற்பனை உலகம் உருவாகியுள்ளது. மக்கள் இவற்றை ChatGPT-ன் கைரேகைகளைத் தேடும் டிஜிட்டல் வேட்டை நாய்கள் போலக் கற்பனை செய்கிறார்கள். ஆனால் உண்மை reality அவ்வளவு சினிமாத்தனமானது அல்ல. இந்தத் கருவிகள் ஒரு LLM இதுவரை எழுதிய அனைத்தையும் கொண்ட ரகசியத் தரவுத்தளத்தைத் தேடுவதில்லை. உங்கள் பிரவுசர் வரலாற்றிற்கும் (browser history) அவற்றுக்கும் நேரடித் தொடர்பு இல்லை. உண்மையில், அவை உங்கள் உரையை புள்ளிவிவர மாதிரிகளின் (statistical models) மூலம் இயக்கி, இயந்திரத்தால் உருவாக்கப்பட்ட உரைக்குத் தொடர்புடைய கணித சமிக்ஞைகளைத் (mathematical signals) தேடுகின்றன. அந்தச் சமிக்ஞைகளைப் புரிந்துகொள்வது, அவற்றின் முடிவுகளைத் புத்திசாலித்தனமாகத் தெரிந்துகொள்ள உதவும், மேலும் ஒரு சதவீத மதிப்பெண்ணை மட்டும் வைத்து குருட்டு நம்பிக்கையைத் தவிர்க்கவும் உதவும்.
இந்தத் கருவிகள் உண்மையில் எவ்வாறு செயல்படுகின்றன
இவை அடிப்படையில் நிகழ்தகவு (probability) மூலம் இயங்கும் வடிவங்களை ஒப்பிடும் இயந்திரங்கள் (pattern-matching engines). பெரிய மொழி மாதிரிகள் (Large language models), வாக்கியத்திற்கு வாக்கியமாக அடுத்ததாக வரக்கூடிய மிகச் சாத்தியமான டோக்கனை (token) கணிப்பதன் மூலம் செயல்படுகின்றன. ஆயிரக்கணக்கான சொற்களுக்குப் பிறகு, அந்தப் பழக்கம் ஒரு புள்ளிவிstatistikத் தடத்தை (statistical residue) விட்டுச் செல்கிறது. கண்டறியும் கருவிகள் அந்தத் தடத்தை அளவிட முயல்கின்றன.
இதை கையெழுத்து பகுப்பாய்வு (handwriting analysis) போலக் கருதலாம். ஒரு நிபுணர் உங்கள் "g" எழுத்தை, இதுவரை எழுதப்பட்ட அனைத்து "g" எழுத்துக்களின் மாஸ்டர் தரவுத்தளத்துடன் ஒப்பிடுவதில்லை. மாறாக, அவர்கள் அதன் தாளம் (rhythm), சாய்வு (slant), அழுத்தம் (pressure) மற்றும் இடைவெளியை (spacing) கவனிக்கிறார்கள். கண்டறியும் கருவிகளும் உரையில் இதே போன்ற தர்க்கத்தைப் பயன்படுத்துகின்றன. மொழி எவ்வளவு கணிக்கக்கூடியது, அதன் அமைப்பு எவ்வளவு சீராக உள்ளது மற்றும் அந்தச் சொற்கள் செயற்கையான எழுத்துக்களுக்குப் பொதுவான குறுகிய புள்ளிவிவர வரம்பிற்குள் பொருந்துகிறதா என்பதை அவை ஆராய்கின்றன.
ஒவ்வொரு கண்டறியும் கருவி வழங்கும் நிறுவனமும் வெவ்வேறு தரவுத் தொகுப்புகளைக் (corpora) கொண்டு தனது மாதிரியைப் பயிற்றுவிப்பதாலும், அதன் உணர்திறனை (sensitivity) வெவ்வேறு விதமாகச் சரிசெய்வதாலும், ஒரே பத்தி ஒரு தளத்தில் 12 சதவீதமாகவும், மற்றொரு தளத்தில் 87 சதவீதமாகவும் மதிப்பெண் பெறலாம். "AI-த்தன்மைக்கு" (AI-ness) என்று சொல்லும் பொதுவான தரநிலை எதுவும் இல்லை. ஒவ்வொரு கருவியும் அடிப்படையில் கணிதத்தால் வெளிப்படுத்தப்படும் ஒரு கருத்தாகும்.
கண்டறியும் கருவிகள் தேடும் நான்கு சமிக்ஞைகள்
பெரும்பாலான கண்டறியும் தளங்கள் சில குறிப்பிட்ட குறிகாட்டிகளைத் தேடுகின்றன. அவை என்னவென்று தெரிந்துகொள்வது குழப்பங்களைத் தெளிவுபடுத்தும்.
கணிக்கக்கூடிய தன்மை (Predictability)
மனித மொழி நிலையற்றது. ஒரு காபிக் கடையைப் பற்றி விவரிக்கும் நபர், எஸ்பிரெசோவின் கருகிய வாசனையைக் குறிப்பிடலாம், பிறகு தனது பாட்டியின் சமையலறை பற்றிய நினைவுக்குச் செல்லலாம், பின்னர் மீண்டும் தரையில் உள்ள கறைகளைப் பற்றிப் பேசலாம். ஆனால் ஒரு AI, அதிக நிகழ்தகவு கொண்ட பாதையையே பின்பற்றும். அதன் பயிற்சித் தரவுகள் (training data) எதைச் பாதுகாப்பானதாகவும், எதிர்பார்க்கப்படுபதாகவும் காட்டினவோ, அந்தச் சொற்களையே அது தேர்ந்தெடுக்கும். கண்டறியும் கருவிகள் இதை perplexity போன்ற காரணிகள் மூலம் அளவிடுகின்றன. உங்கள் உரை கண்டறியும் கருவியின் சொந்த மொழி மாதிரியை அரிதாகவே ஆச்சரியப்படுத்தினால், அந்த உரை AI மூலம் உருவாக்கப்பட்டது என்று கருவி சந்தேகப்படும். உரை எவ்வளவு கணிக்கக்கூடியதாக இருக்கிறதோ, அவ்வளவு அதிகமாக அது AI எனக் குறிக்கப்படும்.
வாக்கிய மாறுபாடுகள் (Sentence variation) திருத்தப்படாத AI வெளியீட்டின் ஆயிரம் சொற்களை நீங்கள் சத்தமாக வாசித்தால், ஒரு மெட்ரோனோம் (metronome) போன்ற சீரான ஓட்டத்தை நீங்கள் கவனிக்கலாம். வாக்கியங்கள் பெரும்பாலும் ஒரே மாதிரியான சொல் எண்ணிக்கையைக் கொண்டிருக்கும், பொதுவாக இணைப்புச் சொற்களால் இணைக்கப்பட்ட கூட்டு வாக்கியங்களாக இருக்கும். ஆனால் மனித எழுத்தாளர்கள் பக்கத்தில் வெவ்வேறு விதமாகச் சுவாசிக்கிறார்கள். அவர்கள் முழுமையற்ற வாக்கியங்களை (fragments) எழுதுகிறார்கள். ஒரு நீண்ட, வளைந்து நெளிந்து செல்லும் வாக்கியத்திற்குப் பிறகு ஒரு சிறிய வாக்கியத்தை வைப்பார்கள். அவர்கள் கேள்விகளைக் கேட்பார்கள். வேண்டுமென்றே தாளத்தை உடைப்பார்கள். கண்டறியும் கருவிகள் இந்த ஒழுங்கற்ற தன்மையைத் தேடுகின்றன, இது பெரும்பாலும் "burstiness" என்று அழைக்கப்படுகிறது. சீரான, ஒரே மாதிரியான ஓட்டம் புள்ளிவிவரத் தன்மையைக் காட்டும். தாளம் மாறுபடும், சீரற்ற ஓட்டம் மனிதத் தன்மையைக் காட்டும்.
தொனி மற்றும் பார்வையின் ஒருமைப்பாடு (Consistency of tone and perspective) AI வெளியீடு முதல் வாக்கியம் முதல் கடைசி வாக்கியம் வரை ஒரே மாதிரியான தொனியில் (register) இருக்க முயல்கிறது. அது ஒரு முறையான மூன்றாம் நபர் குரலில் தொடங்கினால், பொதுவாக அங்கேயே தொடரும். ஆனால் மனிதர்கள் மாறுபடுகிறார்கள். அவர்கள் ஒரு தொழில்முறை அவதானிப்புடன் தொடங்கி, பிறகு ஒரு தனிப்பட்ட அனுபவத்தைப் பகிர்ந்து கொள்ளலாம், பின்னர் ஒரு நகைச்சுவை செய்யலாம், பிறகு மீண்டும் தீவிரமான நிலைக்கு வரலாம். அவர்கள் கருத்துக்களைத் திசைதிருப்பலாம், சொற்களை மாற்றலாம் அல்லது முந்தைய கருத்தை மாற்றியமைக்கலாம். இத்தகைய தொனி மாற்றங்களை (tonal wobbles) நீண்ட பகுதிகளில் தற்போதைய மொழி மாதிரிகளால் நம்பகமான முறையில் நகலெடுக்க முடியாது. இந்தத் தொடர்ச்சியற்ற தன்மையை, விசைப்பலகைக்குப் பின்னால் ஒரு உண்மையான மனிதர் இருக்கிறார் என்பதற்கான ஆதாரமாக கண்டறியும் கருவிகள் கருதுகின்றன.
சொல் தேர்வு மற்றும் பயன்பாட்டு முறை (Word choice and register) செயற்கையான எழுத்துக்கள் வழக்கமாக ஒரு விசித்திரமான முறையான இடைப்பட்ட நிலையில் இருக்கும். அவை குறிப்பிட்ட வட்டார வழக்குகள் (slang), பிராந்திய மரபுத்தொடர்கள் (regional idioms) அல்லது தொழில்முறைச் சுருக்கங்களை விட, பொதுவான அருவப் பெயர்ச்சொற்களையும் (abstract nouns) பரவலாகப் பயன்படுத்தப்படும் வினைச்சொற்களையும் விரும்புகின்றன. ஒரு மனித புரோகிராமர் தான் ஒரு ஸ்கிரிப்டை "hacked together" செய்ததாகவோ அல்லது "wrestled with the build pipeline" செய்ததாகவோ எழுதலாம். ஆனால் ஒரு AI, ஒரு தீர்வை "developed a solution" அல்லது "addressed the deployment issue" என்று கூற அதிக வாய்ப்புள்ளது. உரை ஒரு குறுகிய, அதிகப்படியான பயன்பாட்டுச் சொற்களுக்குள் மட்டுமே இருக்கும்போதும், வழக்கத்திற்கு மாறான சொற்றொடர்களையோ அல்லது திட்டமிட்ட இலக்கண மாற்றங்களையோ பயன்படுத்துவதில்லை எனும்போதும் கண்டறியும் கருவிகள் அதைக் கவனிக்கின்றன.
வெவ்வேறு தளங்களில் உங்கள் மதிப்பெண் ஏன் மாறுகிறது
ஒரே கட்டுரையை மூன்று வெவ்வேறு கண்டறியும் கருவிகளில் நீங்கள் பதிவேற்றினால், உங்களுக்கு முரண்பட்ட மூன்று முடிவுகள் கிடைக்கலாம். ஏனெனில் அவற்றின் அடிப்படையிலான இயந்திரங்கள் குறிப்பிடத்தக்க வழிகளில் வேறுபடுகின்றன.
சில கருவிகள் முதன்மையாக பழைய GPT-3.5 வெளியீடுகளைக் கொண்டு பயிற்றுவிக்கப்பட்டன. மற்றவை புதிய GPT-4 தலைமுறைகளை உள்வாங்குகின்றன அல்லது பல மாதிரிகளிலிருந்து செயற்கை உரையை (synthetic text) கலந்து பயன்படுத்துகின்றன. அவற்றின் அம்சங்களின் முக்கியத்துவ விகிதங்களும் (feature weightings) மாறுபடுகின்றன. ஒரு தளம் வாக்கிய நீளத்தின் சீரான தன்மைக்கு அதிக முக்கியத்துவம் அளிக்கலாம், மற்றொரு தளம் perplexity-க்கு முன்னுரிமை அளிக்கலாம். வரம்புகள் (Thresholds) தன்னிச்சையான உள்முடிவுகளாகும். ஒரு விற்பனையாளர் 60 சதவீதத்திற்கு மேல் உள்ள எதையும் "AI ஆக இருக்க வாய்ப்புள்ளது" என்று வகைப்படுத்தலாம், ஆனால் ஒரு போட்டியாளர் அந்த லேபிளை 90 சதவீதத்திற்கு மட்டுமே பயன்படுத்துகிறார்.
இந்த கருவிகளைச் சான்றளிப்பதற்கு எந்தவொரு ஆளும் அமைப்பு இல்லை. இவை உறுதியின் போர்வையில் சந்தைப்படுத்தப்படும் சோதனை முயற்சிகளாகும். அவற்றின் தீர்ப்புகளை சட்டப்பூர்வ ஆதாரமாகவோ அல்லது கல்வி ரீதியான தண்டனைக்கான அடிப்படையாகவோ கருதுவது, ஒரு முழு பருவத்திற்கான பயிர் விளைச்சலைக் கணிக்க ஒரு கையடக்க வானிலை நிலையத்தைப் பயன்படுத்துவது போன்றது.
தவறான நேர்மறை சிக்கல் (The False Positive Problem)
கண்டறியும் கருவிகள் நேரடி ஆதாரங்களை விட புள்ளிவிவரத் தொடர்புகளைச் சார்ந்திருப்பதால், அவை மனித எழுத்துக்களைத் தவறாகச் செயற்கை எழுத்துக்களாக அடையாளம் காண்கின்றன. சில வகையான முறையான உரைநடைப் பகுதிகள் இதற்குப் பெரிதும் ஆளாகின்றன.
கல்விசார் ஆய்வுக் கட்டுரைகள் கடுமையான மரபுகளைப் பின்பற்றுகின்றன. செயப்பாட்டு வினை (passive voice), தெளிவற்ற சொற்றொடர்கள் (hedging phrases) மற்றும் தரப்படுத்தப்பட்ட தலைப்புகள் ஆகியவை AI மாதிரிகளின் பயிற்சித் தரத்தைப் பிரதிபலிக்கும் ஒரு சீரான புள்ளிவிவரத் தன்மையை உருவாக்குகின்றன. தொழில்நுட்ப கையேடுகளும் இதே சிக்கலை எதிர்கொள்கின்றன. அவை நிலையான கலைச்சொற்கள், குறுகிய விவரிப்பு வாக்கியங்கள் மற்றும் குறைந்தபட்ச உணர்ச்சி மாறுபாடுகளைப் பயன்படுத்துகின்றன; இவை அனைத்தும் முறை சார்ந்த சந்தேகத்தைத் தூண்டுகின்றன. சட்ட ஆவணங்கள் அடிப்படையில் கட்டமைக்கப்பட்ட வார்ப்புருக்கள் (templates), அவற்றின் மீண்டும் மீண்டும் வரும் துல்லியம் ஒரு வகைப்பாட்டிற்கு (classifier) அல்காரிதம் போன்ற தோற்றத்தைத் தருகிறது.
ஆங்கிலத்தைத் தாய்மொழியாகக் கொள்ளாதவர்கள் பெரும்பாலும் இலக்கண ரீதியாகச் சரியாக இருந்தாலும், தொடரியல் ரீதியாக (syntactically) எளிமையான எழுத்துக்களை உருவாக்குகிறார்கள். அவர்களின் கவனமான கட்டமைப்பு — ஒரு தாய்மொழி பேசுபவரின் மரபுத்தொடர் குழப்பங்களைத் தவிர்ப்பதால் — இயந்திரத் உரையின் அதே புள்ளிவிவர மண்டலத்திற்குள் வந்துவிடக்கூடும். ஒரு மாணவர் ஒரு கட்டுரையை உருவாக்க மணிக்கணக்கில் உழைத்தாலும், அவரது ஒழுங்குபடுத்தப்பட்ட, தெளிவான வாக்கியங்கள் கண்டறியும் கருவிக்கு மிகவும் சீராகத் தெரிவதால் அவர் தவறாகக் குற்றம் சாட்டப்படலாம்.
கண்டறியும் கருவிகள் உங்களை ஆதிக்கம் செலுத்த விடாமல் பயன்படுத்துதல்
இந்த கருவிகளை ஒரு ஜூரி தீர்ப்பாகக் கருதாமல், ஒரு ஆரம்பகட்ட வடிகட்டியாகக் கருதுவதே சிறந்த வழியாகும். நீங்கள் ஒரு ஆசிரியர், பதிப்பாளர் அல்லது பணியமர்த்தும் மேலாளராக இருந்தால், அதிக மதிப்பெண் என்பது ஒரு குற்றச்சாட்டாக இல்லாமல், ஒரு உரையாடலுக்கான தொடக்கமாக இருக்கட்டும். எழுத்தாளரிடம் அவரது எழுத்துப் பணியைப் பற்றி கேளுங்கள். ஒரு வரைவு அல்லது சுருக்கத்தைக் கேளுங்கள். உரைநடைக்கு அடியில் உள்ள அசல் சிந்தனையைத் தேடுங்கள்.
நீங்கள் ஒரு எழுத்தாளராக இருந்தால், ஒரு கண்டறியும் கருவியை ஏமாற்றுவதற்காக உங்கள் வேலையை மாற்றியமைக்காதீர்கள். நீங்கள் "அதிகம் மனிதத்தன்மையுடன்" தோன்றுவதற்காகத் தன்னிச்சையான எழுத்துப் பிழைகளைச் சேர்க்கும்போதோ, வாக்கியங்களைச் செயற்கையாகத் துண்டிக்கும்போதோ அல்லது துல்லியமான சொற்களுக்குப் பதிலாக விசித்திரமான ஒத்த சொற்களைப் பயன்படுத்தும்போதோ, தெளிவுக்காகப் பயத்தை (paranoia) நீங்கள் தியாகம் செய்கிறீர்கள். நீங்கள் இனி ஒரு வாசகருக்காக எழுதவில்லை; ஒரு அல்காரிதத்திற்காகச் செயல்படுகிறீர்கள்.
நீங்கள் சிந்திப்பதைப் போலவே எழுதுங்கள். உங்கள் நடையை இயல்பாக மாற்றுங்கள். உங்கள் துறையின் குறிப்பிட்ட கலைச்சொற்களைப் பயன்படுத்துங்கள். உங்களால் மட்டுமே செய்யக்கூடிய அவதானிப்புகளைச் சேருங்கள். அந்தத் தனித்துவமானத் தன்மைதான் எந்தவொரு கண்டறியும் கருவிக்கும் எதிரான உங்கள் சிறந்தத் தற்காப்பு, மேலும் மிக முக்கியமாக, அதுவே உங்கள் எழுத்தை வாசிக்கத் தகுதியுள்ளதாக மாற்றுகிறது.
உண்மையான முடிவு (The Real Takeaway)
AI கண்டறியும் கருவிகள் பகுப்பாய்வுத் துணைக்கருவிகளே தவிர, அவை ஓட்டுநர்கள் அல்ல. உரை புள்ளிவிவர ரீதியாகச் சீராகத் தோன்றும் போது அவை பரிந்துரைக்கலாம், ஆனால் அவை நுண்ணறிவு, படைப்பாற்றல் அல்லது அனுபவங்களை அளவிட முடியாது. ஒரு வாதம் அசல் தானா, ஒரு கதை உண்மையா அல்லது ஒரு தொழில்நுட்ப விளக்கம் துல்லியமானதா என்பதை ஒரு மதிப்பெண் சொல்ல முடியாது.
தெளிவில் கவனம் செலுத்துங்கள். திரையின் மறுபுறம் உள்ள மனிதனுக்கு முன்னுரிமை கொடுங்கள். அசல் கருத்துக்களுக்கு எந்தவொரு வகைப்பாட்டியாலும் முழுமையாகப் பிடிக்க முடியாத ஒரு தனித்துவமானத் தன்மை உண்டு, மேலும் எந்த ஒரு சதவீதமும் ஒரு கவனமான வாசகரின் தீர்ப்பை ஒருபோதும் மாற்ற முடியாது.
