செயற்கை நுண்ணறிவு நிறுவனங்கள் பதிப்புரிமை பெற்ற புத்தகங்களைக் கையாளும் விதம் குறித்த போராட்டத்தின் ஒரு முக்கிய அத்தியாயம் முடிவுக்கு வந்துள்ளது. Anthropic மற்றும் ஆசிரியர்களின் குழுவிற்கும் இடையே $1.5 பில்லியன் இழப்பீட்டுத் தொகையைத் தீர்மானிப்பதற்கான ஒப்பந்தத்திற்கு ஒரு கூட்டாட்சி நீதிபதி ஒப்புதல் அளித்துள்ளார். நீதிபதி Araceli Martínez-Olguín இந்த ஒப்பந்தத்தில் கையெழுத்திட்டுள்ளார், இது சட்ட வல்லுநர்கள் வரலாற்றிலேயே மிகப்பெரிய பதிப்புரிமை மீட்பு என்று அழைக்கப்படுவதை உறுதிப்படுத்தியுள்ளது. Andrea Bartz, Charles Graeber மற்றும் Kirk Wallace Johnson உள்ளிட்ட எழுத்தாளர்கள் முன்னெடுத்த 2024-ஆம் ஆண்டு வகுப்பு நடவடிக்கை (class-action) வழக்கிலிருந்து இந்தத் தொகை கிடைக்கிறது. அந்த நிறுவனம் தனது பெரிய மொழி மாதிரிகளை (large language models) பயிற்றுவிப்பதற்காக பதிப்புரிமை பெற்ற மில்லியன் கணக்கான படைப்புகளை உறிஞ்சி எடுத்ததாக அவர்கள் குற்றம் சாட்டினர். இணையத்தை ஒரு இலவச விருந்து போல நீண்டகாலமாகப் பயன்படுத்தி வந்த ஒரு தொழில்துறைக்கு, இப்போது செய்தி மிகத் தெளிவாக உள்ளது: அந்த யுகம் முடிந்துவிட்டது.

ஒரு சாதனை அளவிலான இழப்பீட்டின் கட்டமைப்பு

அங்கீகரிக்கப்பட்ட ஒப்பந்தத்தின் கீழ், Anthropic நிறுவனம் திருடியதாகக் கருதப்படும் ஒவ்வொரு புத்தகத்திற்கும் ஆசிரியர்கள் தோராயமாக $3,000 வசூலிக்க உள்ளனர். இந்தத் புகாரானது, நிறுவனத்தின் நடத்தையை மிகப்பெரிய அளவில் நடைபெறும் "Napster பாணியிலான பதிவிறக்கம்" (Napster-style downloading) என்று ஒப்பிட்டு ஒரு கடுமையான பிம்பத்தை வரைந்தது. ஒரு ராயல்டித் தொகையை இழப்பது என்பது ஒரு விஷயம்; ஆனால் ஒரு முழுமையான கையெழுத்துப் பிரதி, இப்போது மனித எழுத்தாளர்களுடன் கவனம் மற்றும் வணிகத்திற்காகப் போட்டியிடும் ஒரு மாதிரியில் (model) சேர்க்கப்பட்டுள்ளது என்பதை அறிவது முற்றிலும் வேறானது.

Anthropic பொது வழக்கறிஞர் Aparna Sridhar, இந்தத் தகராறிலிருந்து நிறுவனம் விரைவாக வெளியேற விரும்புகிறது என்று குறிப்பிட்டுள்ளார். தகுதியுள்ள ஆசிரியர்கள் மற்றும் பதிப்பகங்களில் 91 சதவீதத்திற்கும் அதிகமானோர் ஏற்கனவே தங்களுக்குரிய நிதியை கோரியுள்ளனர் என்று அவர் தெரிவித்தார். இந்த பங்கேற்பு விகிதம் முக்கியமானது. வகுப்பு நடவடிக்கைகள் (Class actions) பெரும்பாலும் பாதிக்கப்பட்ட தரப்பினரில் பாதியைக் கூட சென்றடைவதில் சிரமப்படுகின்றன, எனவே இவ்வளவு அதிகமானோர் இதில் பங்கேற்றுள்ளது, தனிப்பட்ட இழப்பீட்டுத் தொகைகள் குறிப்பிடத்தக்க அளவில் இருந்தன என்பதையோ அல்லது தனித்தனி விசாரணைக்காகக் காத்திருப்பதை விட இந்தத் தீர்வை ஏற்றுக்கொள்வதே சிறந்தது என்று எழுத்தாளர்கள் கருதினார்களோ என்பதையோ உணர்த்துகிறது.

$1.5 பில்லியன் என்ற தலைப்பு கவர்ச்சிகரமானது, ஆனால் புத்தகத்திற்கு ஒரு குறிப்பிட்ட தொகை சொல்லும் கதை வேறானது. ஒரு பயிற்சித் தொகுப்பில் (training corpus) சேர்க்கப்பட்ட ஒரு நடுத்தர நிலையில் உள்ள ஆசிரியருக்கு, $3,000 என்பது பல ஆண்டுகால டிஜிட்டல் ராயல்டித் தொகைக்குச் சமமாக இருக்கலாம். ஆனால் ஒரு சிறந்த விற்பனைத் தொடருக்கு (bestselling franchise), இது ஒரு வார விற்பனைத் தொகையை மட்டுமே ஈடுசெய்யும். இந்தத் தாக்கத்தில் உள்ள வேறுபாடே, இந்த ஒப்பந்தம் ஒரு முன்மாதிரியா அல்லது ஒரு உச்சவரசையா என்பதில் பதிப்பகத் துறை ஏன் பிளவுபட்டுள்ளது என்பதற்கான காரணமாகும்.

பகுதி வெற்றியிலிருந்து ஒரு முக்கியமான தீர்வு வரை

இந்தத் தீர்வு தானாகவே உருவாகவில்லை. ஓய்வு பெற்ற நீதிபதி William Alsup ஏற்கனவே தொடர்புடைய நடவடிக்கைகளில் Anthropic நிறுவனத்திற்கு ஒரு பகுதி வெற்றியைத் தந்துள்ளார், அதாவது எல்லா உரிமைகோரல்களும் கடுமையான ஆய்வில் টিকেلنாது என்று அவர் சுட்டிக்காட்டியிருந்தார். இருப்பினும், இந்த வகுப்பு நடவடிக்கை ஒப்பந்தத்தின் ஒப்புதல் ஒரு முக்கியமான முன்னுதாரணத்தை நிறுவுகிறது: இழப்பீடு இன்றி பதிப்புரிமை பெற்ற பொருட்களைப் பெருமளவில் பயன்படுத்துவது கடுமையான நிதி விளைவுகளை ஏற்படுத்தும், மேலும் டெவலப்பர்கள் இணையத்திலிருந்தோ அல்லது டிஜிட்டல் நூலகங்களிலிருந்தோ சட்ட ரீதியான சிக்கல்கள் இன்றி மிகப்பெரிய தரவுத் தொகுப்புகளை (datasets) அறுவடை செய்யலாம் என்று இனி கருத முடியாது.

என்ன மாறியது? அளவு மற்றும் தெளிவு. ஒரு தனி எழுத்தாளர் ஒரு சிறு பகுதியைப்பற்றிப் புகார் கூறும்போது, நீதிமன்றங்கள் 'நியாயமான பயன்பாடு' (fair use) குறித்துத் தீவிரமாக விவாதிக்கலாம். ஆனால் ஒரு வணிக ரீதியான தயாரிப்பை உருவாக்க மில்லியன் கணக்கான புத்தகங்கள் முழுமையாகப் பிரதியெடுக்கப்பட்டதாகக் கூறப்படும்போது, அதன் கணக்கீடு மாறுகிறது. பயிற்சித் தரவு (training data) என்பது அலட்சியப்படுத்தப்பட வேண்டிய ஒன்று அல்ல என்ற வாதத்தை இந்தத் தீர்வு உறுதிப்படுத்துகிறது. கணினித் தொகுப்புகள் (compute clusters) மற்றும் சர்வர் பண்ணைகளைப் போலவே, இதுவும் ஒரு விலைப்பட்டியல் கொண்ட உள்ளீடாகும் (input).

ஸ்கிராப் செய்யப்பட்ட (scraped) ஆவணங்களைக் கொண்டு இன்னும் மாதிரிகளைப் பயிற்றுவிக்கும் டெவலப்பர்களுக்கு, இந்த ஆபத்து இனி வெறும் தியரி மட்டுமல்ல; அது ஒரு பட்ஜெட் வரவு செலவுத் திட்டமாகும்.

முன்னோக்கிய பாதை: உரிமம், வழக்கு மற்றும் அமைதியற்ற போர் நிறுத்தங்கள்

Anthropic இன்னும் ஆபத்திலிருந்து தப்பவில்லை. Chicken Soup for the Soul பதிப்பகங்கள் உட்பட பல அமைப்புகள் அந்த நிறுவனத்திற்கு எதிராகத் தமக்கென தனித்தனி வழக்குகளைத் தொடர்கின்றன. அவர்களின் வாதம் அந்த $3,000 தொகையின் முக்கியத்துவத்தை கேள்விக்குள்ளாக்குகிறது. ஒரு புத்தகத்திற்கு நிலையான தொகையை வழங்குவது, அறிவுசார் சொத்தின் (intellectual property) நீண்டகால சந்தை மதிப்பையும், வணிக ரீதியான AI தயாரிப்புகள் அந்தப் படைப்புகளிலிருந்து பெறப்பட்ட பாணி, அமைப்பு மற்றும் நிபுணத்துவத்தை எவ்வாறு பணமாக்குகின்றன என்பதையும் புறக்கணிப்பதாக அவர்கள் வாதிடுகின்றனர்.

இந்தத் தனிப்பட்ட வழக்குகள் வகுப்புத் தீர்வை விட அதிக செலவு மிக்கதாக இருக்கலாம். ஒரு சொத்தின் தொடர்ச்சியான வணிகப் பயன்பாட்டிற்கு ஒரு நிலையான கட்டணம் குறைவானது என்று ஒரு ஜூரி (jury) ஒப்புக்கொண்டால், இழப்பீட்டு முறை ஒருமுறை வழங்கப்படும் தொகையிலிருந்து, ராயல்டி போன்ற ஒரு கட்டமைப்பிற்கோ அல்லது மாதிரி வருவாயுடன் இணைக்கப்பட்ட ஒரு மிகப்பெரிய மொத்தத் தொகையிலோ மாறக்கூடும். அந்தச் சாத்தியக்கூறு ஒவ்வொரு AI நிதித் குழுவையும் விழிப்படையச் செய்யும்.

We should expect a second wave of litigation. The Anthropic agreement gives authors a template. It establishes a number—$3,000 per book—that writers and publishers can cite in negotiation or in court. For smaller studios and independent authors who never joined the original class, the settlement is an invitation to file. For the broader AI landscape, the cost of high-quality, legally compliant training data will likely become a primary operational expense, not an afterthought.

Some companies will respond by striking licensing deals with publishers, similar to arrangements that platforms have pursued with media organizations. Others may invest heavily in synthetic data generation or opt for models trained only on explicitly public-domain corpora. None of these