നിങ്ങളുടെ Discord അക്കൗണ്ട് എന്നെന്നേക്കുമായി നഷ്ടപ്പെട്ടു എന്ന് അറിയിച്ചുകൊണ്ടുള്ള ഒരു ഇമെയിൽ കണ്ട് നിങ്ങൾ ഉണരുന്നു. കാരണം? നിങ്ങൾ ഒരു സ്പ്രെഡ്ഷീറ്റിന്റെ സ്ക്രീൻഷോട്ട് പങ്കുവെച്ചു, അല്ലെങ്കിൽ ഒരു ചെസ്സ് ബോർഡിന്റെ ചിത്രം പോസ്റ്റ് ചെയ്തു, അല്ലെങ്കിൽ സുതാര്യമായ (transparent) ബാക്ക്ഗ്രൗണ്ടുള്ള ഒരു അസറ്റ് അപ്‌ലോഡ് ചെയ്തു. മെയ് മാസം മുതൽ 8,000-ലധികം ആളുകളെ സംബന്ധിച്ചിടത്തോളം, ഇതൊരു പേടിസ്വപ്നമായിരുന്നില്ല, മറിച്ച് അവർ നേരിട്ട യഥാർത്ഥ യാഥാർത്ഥ്യമായിരുന്നു. ബാധിക്കപ്പെട്ട ഉപയോക്താക്കൾ സംശയിച്ചിരുന്ന കാര്യം Discord പിന്നീട് സ്ഥിരീകരിച്ചു: പ്ലാറ്റ്‌ഫോമിലെ ഓട്ടോമേറ്റഡ് സുരക്ഷാ സംവിധാനങ്ങളിലെ ഗുരുതരമായ ഒരു ബഗ്, തികച്ചും നിരുപദ്രവകാരികളായ ചിത്രങ്ങളെ നിയമവിരുദ്ധ ഉള്ളടക്കമായി തെറ്റായി തിരിച്ചറിയുകയും, അവ അപ്‌ലോഡ് ചെയ്തവരെ എന്നെന്നേക്കുമായി നിരോധിക്കുകയും (ban) ചെയ്തു.

ബഗ്ഗും വിട്ടുപോയ മനുഷ്യപരമായ പരിശോധനയും

വലിയ തോതിലുള്ള ഉള്ളടക്ക നിയന്ത്രണത്തിനായി (content moderation), അപ്‌ലോഡ് ചെയ്ത ചിത്രങ്ങളെ അറിയപ്പെടുന്ന ദോഷകരമായ ഉള്ളടക്കങ്ങളുടെ ഡാറ്റാബേസുമായി ഒത്തുനോക്കാൻ Discord ഓട്ടോമേറ്റഡ് സ്കാനിംഗിനെയാണ് ആശ്രയിക്കുന്നത്. സാധാരണ സാഹചര്യങ്ങളിൽ, സിസ്റ്റം ഒരു സാമ്യം കണ്ടെത്തുമ്പോൾ, കടുത്ത നടപടികൾ സ്വീകരിക്കുന്നതിന് മുമ്പ് ഒരു ഹ്യൂമൻ മോഡറേറ്റർ (human moderator) പരിശോധിക്കുന്നതിനായി അത് ഒരു മുന്നറിയിപ്പ് നൽകുന്നു. ഓട്ടോമേറ്റഡ് സംവിധാനങ്ങൾ തെറ്റുകൾ വരുത്താൻ സാധ്യതയുള്ളതുകൊണ്ടാണ് ആ മനുഷ്യപരമായ പരിശോധന നിലനിൽക്കുന്നത്. സന്ദർഭം (Context) വളരെ പ്രധാനമാണ്. ഒരു വിനാശകരമായ ചിത്രവും, ഉപരിപ്ലവമായ കാഴ്ചാ സാമ്യങ്ങൾ മാത്രം പങ്കുവെക്കുന്ന നിഷ്കളങ്കമായ ഒരു ഫയലും തമ്മിലുള്ള വ്യത്യാസം ഒരു യന്ത്രത്തിന് തിരിച്ചറിയാൻ കഴിയില്ല.

എന്നാൽ, സിസ്റ്റത്തിന്റെ ഘടനയിലെ (architecture) ഒരു ഗുരുതരമായ പിഴവ് ആ ശൃംഖലയെ തകർത്തു. അടയാളപ്പെടുത്തിയ ഉള്ളടക്കം മനുഷ്യ പരിശോധനയ്ക്കായി മാറ്റിവയ്ക്കുന്നതിന് പകരം, ആ ബഗ് ഓട്ടോമേഷൻ നേരിട്ട് അക്കൗണ്ട് സ്ഥിരമായി നിരോധിക്കുന്നതിലേക്ക് എത്തിച്ചു. രണ്ട് മാസത്തിലേറെക്കാലം ഈ പിഴവ് നിലനിന്നു, ഇത് 8,000-ലധികം അക്കൗണ്ടുകളെ ബാധിച്ചു. Discord-ന്റെ എഞ്ചിനീയറിംഗ് ടീം ഒടുവിൽ പ്രശ്നം കണ്ടെത്തി ഒരു പാച്ച് (patch) പുറത്തിറക്കുന്നതിന് മുമ്പ്, ഒരു വാരാന്ത്യത്തിൽ മാത്രം മറ്റ് 200 തെറ്റായ നിരോധനങ്ങൾ നടന്നു എന്ന നിലയിൽ പ്രശ്നം രൂക്ഷമായി. ബാധിക്കപ്പെട്ട എല്ലാ അക്കൗണ്ടുകളും പുനഃസ്ഥാപിക്കാനുള്ള നടപടികൾ കമ്പനി ഇപ്പോൾ സ്വീകരിക്കുന്നുണ്ടെങ്കിലും, പല ഉപയോക്താക്കളെയും സംബന്ധിച്ചിടത്തോളം വിശ്വാസ്യതയ്ക്ക് നേരത്തെ തന്നെ വലിയ ആഘാതം സംഭവിച്ചു കഴിഞ്ഞു.

ഇതിന്റെ പ്രവർത്തനം മനസ്സിലാക്കേണ്ടത് പ്രധാനമാണ്. ഇതൊരു AI തെറ്റായ ഒരു ഊഹം നടത്തുകയും ഒരു മനുഷ്യൻ അതിനോട് യോജിക്കുകയും ചെയ്ത ഒരു സംഭവമായിരുന്നില്ല. അവസാന പരിശോധനയ്ക്കായി ഉപയോഗിക്കുന്ന 'ഹ്യൂമൻ-ഇൻ-ദി-ലൂപ്പ്' (human-in-the-loop) പ്രോട്ടോക്കോൾ സാങ്കേതികമായ ഒരു പിഴവ് കാരണം പൂർണ്ണമായും ഒഴിവാക്കപ്പെട്ടു. ഈ വ്യത്യാസം വളരെ പ്രധാനമാണ്. സങ്കീർണ്ണമായ സാഹചര്യങ്ങൾ (edge cases) തിരിച്ചറിയാൻ മനുഷ്യരായ റിവ്യൂവർമാരുണ്ടെന്ന് ചൂണ്ടിക്കാട്ടി പ്ലാറ്റ്‌ഫോമുകൾ പലപ്പോഴും അഗ്രസീവ് ആയ ഓട്ടോമേഷനെ ന്യായീകരിക്കാറുണ്ട്. എന്നാൽ ആ സുരക്ഷാ സംവിധാനങ്ങൾ അവ നടപ്പിലാക്കുന്ന കോഡിന്റെ (code) വിശ്വാസ്യതയ്ക്ക് തുല്യമാണെന്ന് ഈ സംഭവം തെളിയിക്കുന്നു.

ഗ്രിഡുകൾ യന്ത്രത്തെ എങ്ങനെയെല്ലാമാണ് ആശയക്കുഴപ്പത്തിലാക്കിയത്

തെറ്റായ നിരോധനങ്ങൾക്കിടയിൽ ഒരു വിചിത്രമായ രീതി പ്രകടമായി. ചതുരാകൃതിയിലുള്ള ഗ്രിഡ് പാറ്റേണുകൾ (grid patterns) അടങ്ങിയ ചിത്രങ്ങൾ നിയമനടപടികൾക്ക് കാരണമാകുന്നുണ്ടെന്ന് X, Reddit എന്നിവകളിലെ ഉപയോക്താക്കൾ ആവർത്തിച്ച് റിപ്പോർട്ട് ചെയ്തു. ചെസ്സ് ബോർഡുകൾ, സ്പ്രെഡ്ഷീറ്റുകൾ, ഗെയിം ടെക്സ്ചറുകൾ, യൂസർ ഇന്റർഫേസ് ഘടകങ്ങൾ എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു. ഇവ വെറും യാദൃശ്ചികമായ പിഴവുകളല്ല, മറിച്ച് ഒരു പ്രത്യേക ഒളിച്ചുകളി തന്ത്രം (evasion tactic) തിരിച്ചറിയാൻ വേണ്ടി അമിതമായി ക്രമീകരിച്ച (tuned) ഒരു മോഡലിന്റെ ലക്ഷണമായിരുന്നു.

നിയമവിരുദ്ധ ഉള്ളടക്കങ്ങൾ കൈമാറുന്നവർ ഓട്ടോമേറ്റഡ് ഡിറ്റക്ഷൻ സംവിധാനങ്ങളെ കബളിപ്പിക്കാൻ കാലങ്ങളായി ശ്രമിക്കുന്നുണ്ട്. അൽഗോരിതങ്ങൾ ചിത്രങ്ങളെ കാണുന്ന രീതി മാറ്റുന്നതിനായി ദോഷകരമായ ചിത്രങ്ങൾക്ക് മുകളിൽ വിഷ്വൽ ഓവർലേകളോ, നോയിസോ (noise), അല്ലെങ്കിൽ ഗ്രിഡ് പോലുള്ള ടെക്സ്ചറുകളോ നൽകുന്നതാണ് ഇതിൽ ഒരു സാധാരണ രീതി. ഇതിനെ പ്രതിരോധിക്കാൻ പ്ലാറ്റ്‌ഫോമുകൾ സ്വാഭാവികമായും തങ്ങളുടെ മോഡലുകൾ കൂടുതൽ കർശനമാക്കുന്നു. Discord-ഉം ചെയ്തത് ഇതേ കാര്യമാണ്, എന്നാൽ അതിന്റെ സെൻസിറ്റിവിറ്റി പരിധി (sensitivity threshold) തെറ്റായ ഇടത്താണ് പതിഞ്ഞത്. സാധാരണ ഗ്രിഡ് പാറ്റേണുകളെ പോലും നിയമവിരുദ്ധ ഉള്ളടക്കത്തിന്റെ മറയാകാൻ സാധ്യതയുള്ളവയായി സിസ്റ്റം കാണാൻ തുടങ്ങി.

ഇതിന്റെ ഫലം ഒരുതരം ഡിജിറ്റൽ ഓട്ടോ ഇമ്മ്യൂൺ റെസ്പോൺസ് (digital autoimmune response) പോലെയായിരുന്നു. പ്ലാറ്റ്‌ഫോമിന്റെ പ്രതിരോധ സംവിധാനങ്ങൾ അമിതമായി കർശനമായതോടെ, സാധാരണ ഉപയോക്താക്കളുടെ നിയമപരമായ ഉള്ളടക്കങ്ങളെ തന്നെ അവ ആക്രമിക്കാൻ തുടങ്ങി. ഒരു ചെസ്സ് ബോർഡ് ഒരു ഒളിച്ചുകളി തന്ത്രമല്ല. വൃത്തിയായി ക്രമീകരിച്ച ഒരു Excel സ്ക്രീൻഷോട്ട് ഒരു ഭീഷണിയുമല്ല. എന്നിരുന്നാലും, അമിതമായി ക്രമീകരിച്ച ഒരു മാച്ചിംഗ് അൽഗോരിതത്തിന്, ആ കാഴ്ചാ ഘടന നിയമവിരുദ്ധമായവയുമായി സാമ്യമുള്ളതായി തോന്നി, അത് ഉടൻ തന്നെ മാറ്റാൻ കഴിയാത്ത ഒരു നിരോധനത്തിലേക്ക് നയിച്ചു. മോഡറേറ്റർമാരും കുറ്റവാളികളും തമ്മിലുള്ള ഈ പോരാട്ടം (arms race), ക്രമീകരണങ്ങളിൽ (calibration) നേരിയ വ്യതിയാനം സംഭവിച്ചാൽ പോലും നിരപരാധികളായവർക്ക് വലിയ ആഘാതം ഉണ്ടാക്കുമെന്ന് ഇത് വ്യക്തമാക്കുന്നു.

തെറ്റായ കണ്ടെത്തലുകളുടെ വില (False Positive)

ഒരു സോഷ്യൽ പ്ലാറ്റ്‌ഫോമിലെ തെറ്റായ നിരോധനം വെറുമൊരു അസൗകര്യമല്ല. വർദ്ധിച്ചുവരുന്ന ഒരു വിഭാഗം ആളുകളെ സംബന്ധിച്ചിടത്തോളം Discord ഒരു നിർണ്ണായക അടിസ്ഥാന സൗകര്യമാണ് (critical infrastructure). ഡെവലപ്പർമാർ അവരുടെ സപ്പോർട്ട് സെർവറുകൾ അവിടെ നടത്തുന്നു. ഇൻഡി ഗെയിം സ്റ്റുഡിയോകൾ തങ്ങളുടെ കമ്മ്യൂണിറ്റികളും ബീറ്റ ടെസ്റ്റിംഗും ഇതിലൂടെ നിയന്ത്രിക്കുന്നു. റിമോട്ട് ടീമുകൾ സ്വകാര്യ വർക്ക് സ്പേസുകളിൽ സഹകരിച്ച് പ്രവർത്തിക്കുന്നു. ഗെയിമർമാർ വർഷങ്ങളായി നിലനിൽക്കുന്ന സൗഹൃദങ്ങൾ ഇതിലൂടെ കാത്തുസൂക്ഷിക്കുന്നു. ഒരു അക്കൗണ്ട് നഷ്ടപ്പെടുക എന്നാൽ വെറുമൊരു ചാറ്റ് ഹിസ്റ്ററി നഷ്ടപ്പെടുക എന്നല്ല; അത് പ്രൊഫഷണൽ ബന്ധങ്ങൾ തകർക്കാനും, കമ്മ്യൂണിറ്റികളെ നശിപ്പിക്കാനും, Nitro സബ്‌സ്‌ക്രിപ്ഷനുകളിലൂടെയോ ഗെയിം പർച്ചേസുകളിലൂടെയോ വലിയ തുകയും സമയവും നിക്ഷേപിച്ച സേവനങ്ങളിൽ നിന്ന് ഉപയോക്താക്കളെ പുറത്താക്കാനും കാരണമാകും.

ഈ സംഭവം പ്ലാറ്റ്‌ഫോമുകളുടെ ഉത്തരവാദിത്തം എന്ന വിശാലമായ പശ്ചാത്തലത്തിലും ഉൾപ്പെടുന്നു. വിശദീകരിക്കാനാവാത്ത അക്കൗണ്ട് സസ്പെൻഷനുകളെച്ചൊല്ലി Meta നിരന്തരമായ പരിശോധന നേരിട്ടിട്ടുണ്ട്; ഓട്ടോമേറ്റഡ് തീരുമാനങ്ങൾ എങ്ങനെ എടുക്കുന്നുവെന്നും അവയ്‌ക്കെതിരെ എങ്ങനെ അപ്പീൽ നൽകാം എന്നതിനെക്കുറിച്ചും കൂടുതൽ സുതാര്യത വേണമെന്ന് അതിന്റെ തന്നെ Oversight Board ആവശ്യപ്പെടുന്നുണ്ട്. Discord-ന്റെ പരാജയം ആ വിവാദത്തെ ഒരു പ്രധാന രീതിയിൽ പ്രതിഫലിപ്പിക്കുന്നു: ഓട്ടോമേഷൻ തെറ്റായിപ്പോകുമ്പോൾ, ഉപയോക്താക്കൾ പലപ്പോഴും ശൂന്യതയിലേക്ക് നിലവിളിക്കുകയാണ് ചെയ്യുന്നത്; ഓട്ടോമേറ്റഡ് മറുപടികൾ മാത്രം നൽകുന്ന ഫോമുകളിലേക്ക് അപ്പീൽ നൽകുന്നു, എന്നാൽ പിശക് തിരുത്താൻ കഴിയുന്ന ഒരു മനുഷ്യനുമായി ബന്ധപ്പെടാൻ വ്യക്തമായ മാർഗ്ഗമില്ലാതെ അവർ അവശേഷിക്കുന്നു.

ഡെവലപ്പർമാർക്കും AI ഗവേഷകർക്കും ഇതിൽ നിന്നുള്ള പാഠം ആർക്കിടെക്ചറൽ (നിർമ്മാണരീതി സംബന്ധിച്ച) ആണ്. "Human-in-the-loop" എന്നത് ഒരു ബ്ലോഗ് പോസ്റ്റിൽ മാത്രം നൽകുന്ന നയപരമായ വാഗ്ദാനമാകരുത്. അത് ഒരു കർശനമായ സാങ്കേതിക നിയന്ത്രണമായിരിക്കണം. ഒരു മനുഷ്യന്റെ സ്ഥിരീകരണമില്ലാതെ സ്ഥിരമായ വിലക്ക് (permanent ban) ഏർപ്പെടുത്താൻ സിസ്റ്റത്തിന് സാങ്കേതികമായി കഴിയില്ലെന്ന് ഉറപ്പാക്കണം. ഒരു ബഗ് കാരണം ഓട്ടോമേഷന് ആ ചെക്ക്‌പോയിന്റ് മറികടക്കാൻ കോഡ് അനുവദിക്കുന്നുണ്ടെങ്കിൽ, അവിടെ സുരക്ഷാ സംവിധാനം യഥാർത്ഥത്തിൽ ഉണ്ടായിരുന്നില്ല എന്നാണ് അർത്ഥം. മാറിക്കൊണ്ടിരിക്കുന്ന ഭീഷണികൾക്കനുസരിച്ച് ഡിറ്റക്ഷൻ മോഡലുകൾ കൂടുതൽ ശക്തമാകുമ്പോൾ, ഡിറ്റക്ഷൻ ലെയറുകളെപ്പോലെ തന്നെ കരുത്തുറ്റ ഗവർണർ മെക്കാനിസങ്ങൾ പ്ലാറ്റ്‌ഫോമുകൾ നിർമ്മിക്കേണ്ടതുണ്ട്.

എന്താണ് മാറേണ്ടത്

പ്ലാറ്റ്‌ഫോമുകൾക്കും അവ ഉപയോഗിക്കുന്നവർക്കും ഇതിൽ പ്രായോഗികമായ പ്രത്യാഘാതങ്ങളുണ്ട്.

പ്ലാറ്റ്‌ഫോമുകളെ സംബന്ധിച്ചിടത്തോളം, അക്കൗണ്ട് വിലക്കുകളെ അർഹമായ ഗൗരവത്തോടെ കാണുന്ന ഫെയിൽ-സേഫ് സംവിധാനങ്ങൾ മോഡറേഷൻ പൈപ്പ്‌ലൈനുകൾക്ക് ആവശ്യമാണ്. സ്ഥിരമായ നീക്കം ചെയ്യലുകൾക്ക് ഒന്നിലധികം സ്വതന്ത്ര സിഗ്നലുകളോ അല്ലെങ്കിൽ സിസ്റ്റത്തിന് മറികടക്കാൻ കഴിയാത്ത നിർബന്ധിത മനുഷ്യ സാക്ഷ്യപ്പെടുത്തലോ (human sign-off) ആവശ്യമായിരിക്കണം. സുതാര്യതാ റിപ്പോർട്ടുകളിൽ എത്രത്തോളം ഉള്ളടക്കം നീക്കം ചെയ്തു എന്ന് മാത്രമല്ല, സാങ്കേതിക പിശകുകൾ കാരണം എത്ര നടപടികൾ പിൻവലിച്ചു എന്നതും ഉൾപ്പെടുത്തണം. മെഷീൻ ഒരു വ്യവസ്ഥാപിത പിശക് വരുത്തുമ്പോൾ അത് ഉപയോക്താക്കളെ അറിയിക്കേണ്ടതുണ്ട്, വെറുതെ അക്കൗണ്ട് പുനഃസ്ഥാപിച്ചതുകൊണ്ട് മാത്രം പോരാ.

ഉപയോക്താക്കളെ സംബന്ധിച്ചിടത്തോളം, നിങ്ങളുടെ തെറ്റല്ലെങ്കിൽ പോലും ഏതൊരു കേന്ദ്രീകൃത പ്ലാറ്റ്‌ഫോമും നിങ്ങളെ പുറത്താക്കിയേക്കാം എന്നതിന്റെ ഓർമ്മപ്പെടുത്തലാണിത്. നിങ്ങൾ ഒരു കമ്മ്യൂണിറ്റി നടത്തുകയോ പ്രൊഫഷണൽ ആവശ്യങ്ങൾക്കായി Discord-നെ ആശ്രയിക്കുകയോ ചെയ്യുന്നുണ്ടെങ്കിൽ, പ്രധാനപ്പെട്ട കോൺടാക്റ്റുകളും ഡാറ്റയും പ്ലാറ്റ്‌ഫോമിന് പുറത്ത് ബാക്കപ്പ് ചെയ്ത് സൂക്ഷിക്കുക. അപ്പീൽ നടപടികൾ ആവശ്യമായി വരുന്നതിന് മുമ്പ് തന്നെ അവയെക്കുറിച്ച് മനസ്സിലാക്കുക. പ്ലാറ്റ്‌ഫോമുകൾ പുതിയ AI അധിഷ്ഠിത സുരക്ഷാ ഉപകരണങ്ങൾ പ്രഖ്യാപിക്കുമ്പോൾ സംശയം പ്രകടിപ്പിക്കുന്നത് ഉചിതമാണ്. ഡിറ്റക്ഷൻ എത്രത്തോളം കൃത്യമാണ് എന്ന് മാത്രമല്ല, ആ ഓട്ടോമേഷൻ സ്വയം പ്രവർത്തിക്കുന്നത് തടയാൻ എന്ത് ഘടനാപരമായ തടസ്സങ്ങളാണ് ഉള്ളതെന്നും ചോദിക്കുക.

Discord ഈ പ്രത്യേക ബഗ് പരിഹരിക്കുകയും അക്കൗണ്ടുകൾ പുനഃസ്ഥാപിക്കുകയും ചെയ്യുന്നുണ്ടെങ്കിലും, അടിസ്ഥാനപരമായ പ്രശ്നം പരിഹരിക്കപ്പെട്ടിട്ടില്ല. ദോഷകരമായ ഉള്ളടക്കങ്ങൾ അപ്‌ലോഡ് ചെയ്യുന്ന വേഗതയിൽ തന്നെ തടയാൻ പ്ലാറ്റ്‌ഫോമുകൾക്ക് ന്യായമായ സമ്മർദ്ദമുണ്ട്, ആ സമ്മർദ്ദം ഓട്ടോമേഷനെ മോഡറേഷൻ പ്രക്രിയയിൽ കൂടുതൽ ഉൾപ്പെടുത്താൻ മാത്രമേ സഹായിക്കൂ. ആളുകൾ ദിവസവും പങ്കുവെക്കുന്ന സാധാരണ ഉള്ളടക്കങ്ങളെ ബാധിക്കുന്ന രീതിയിൽ ദുർബലമാകാതെ തന്നെ, ദുരുപയോഗത്തിനെതിരെ ശക്തമായി പ്രവർത്തിക്കുന്ന സംവിധാനങ്ങൾ നിർമ്മിക്കാൻ ഈ വ്യവസായത്തിന് കഴിയുമോ എന്നതാണ് ചോദ്യം. സാങ്കേതിക ഘടന ഒരു മനുഷ്യൻ എപ്പോഴും അന്തിമ തീരുമാനം എടുക്കുന്നുവെന്ന് ഉറപ്പാക്കുന്നത് വരെ, എത്ര മോഡൽ ട്യൂണിംഗ് നടത്തിയാലും അടുത്ത ബാൻ തരംഗങ്ങളെ തടയാൻ കഴിയില്ല.