ടെസ്റ്റ് പ്രോംപ്റ്റുകളോ മോഡൽ വെയ്റ്റുകളോ വെളിപ്പെടുത്താതെ തന്നെ Gemini Flash Lite മോഡലുകളെ വിലയിരുത്തുന്നതിനായി ക്രിപ്റ്റോഗ്രാഫിക് ഡബിൾ-ബ്ലൈൻഡ് ബെഞ്ച്മാർക്കിംഗ് ഉപയോഗിക്കുന്ന ഒരു പൈലറ്റ് പദ്ധതി Google DeepMind അവതരിപ്പിച്ചു. ഈ വിലയിരുത്തൽ Google Cloud-ന്റെ Confidential Space-നുള്ളിലാണ് നടക്കുന്നത്, അതിനാൽ വിലയിരുത്തുന്നയാൾക്ക് മോഡലിനെ കാണാൻ കഴിയില്ല, മോഡലിനും ചോദ്യങ്ങൾ കാണാൻ കഴിയില്ല—AI പ്രകടന റിപ്പോർട്ടുകളുടെ വിശ്വാസ്യത വീണ്ടെടുക്കാൻ സഹായിക്കുന്ന ഒരു രീതിയാണിത്.
ബെഞ്ച്മാർക്ക് കോൺറ്റമിനേഷൻ (contamination) എന്തുകൊണ്ട് പ്രധാനമാണ്
ഒരു ബെഞ്ച്മാർക്കിൽ പിന്നീട് പ്രത്യക്ഷപ്പെടുന്ന ഡാറ്റ ഉപയോഗിച്ചാണ് ഒരു മോഡൽ പരിശീലിപ്പിക്കപ്പെടുന്നതെങ്കിൽ, അതിന്റെ സ്കോർ യുക്തിചിന്തയെ (reasoning) അളക്കുന്നതിന് പകരം മനഃപാഠമാക്കലിനെ (memorization) അളക്കുന്നതായി മാറും. അതിനാൽ, കോൺറ്റമിനേഷൻ സംഭവിച്ച ഒരു ടെസ്റ്റിലെ മികച്ച ഫലം യഥാർത്ഥ കഴിവിനെക്കുറിച്ച് ഒന്നും വെളിപ്പെടുത്തില്ല. ഗവേഷകർ കാലങ്ങളായി ഒരു വൈരുദ്ധ്യം നേരിടുന്നുണ്ട്: ഒരു ബെഞ്ച്മാർക്ക് പരിശോധിച്ചുറപ്പിക്കാൻ അവർ മോഡൽ പ്രൊവൈഡർക്ക് ടെസ്റ്റ് ഡാറ്റ കൈമാറണം, ഇത് ഡാറ്റ നേരത്തെ തന്നെ വെളിപ്പെടാനുള്ള സാധ്യതയുണ്ടാക്കുന്നു; അല്ലെങ്കിൽ സ്വകാര്യ വെയ്റ്റുകൾ സംരക്ഷിക്കാൻ അവർ പുറത്തുനിന്നുള്ള ആക്സസ് നിഷേധിക്കണം, ഇത് ഓഡിറ്റ് പരിശോധന നടക്കാതെ പോകാൻ കാരണമാകും. Anthropic-ന്റെ Fable 5, ARC-AGI ബെഞ്ച്മാർക്കിൽ വിലയിരുത്തുന്നതിൽ അടുത്തിടെ ഉണ്ടായ കാലതാമസം, കർശനമായ ഡാറ്റാ-റിറ്റൻഷൻ നയങ്ങൾ എങ്ങനെ സ്വതന്ത്രമായ വിലയിരുത്തലുകളെ തടസ്സപ്പെടുത്തുന്നു എന്ന് കാണിക്കുന്നു.
ഒരു ക്രിപ്റ്റോഗ്രാഫിക് പരിഹാരം
ഈ പൈലറ്റ് പദ്ധതി നിയമപരമായ കരാറുകൾക്കും "സീറോ-ലോഗിംഗ്" വാഗ്ദാനങ്ങൾക്കും പകരം ഒരു സാങ്കേതിക സുരക്ഷാ മാർഗ്ഗം ഉപയോഗിക്കുന്നു. Gemini Flash Lite മോഡൽ പ്രവർത്തിപ്പിക്കുന്നതിനായി Confidential Space ഒരു ഹാർഡ്വെയർ ഐസൊലേറ്റഡ് എൻക്ലേവ് (hardware-isolated enclave) സൃഷ്ടിക്കുന്നു. വിലയിരുത്തുന്നയാൾ ടെസ്റ്റ് സ്യൂട്ട് അപ്ലോഡ് ചെയ്യുന്നു, ഇത് എൻക്ലേവ് ഒരു ക്രിപ്റ്റോഗ്രാഫിക് "ബോക്സിനുള്ളിൽ" സീൽ ചെയ്യുന്നു, ഇത് മോഡലിന് തുറക്കാൻ കഴിയില്ല. അതേസമയം, മോഡലിന്റെ വെയ്റ്റുകൾ എൻക്ലേവിനുള്ളിൽ എൻക്രിപ്റ്റ് ചെയ്ത നിലയിൽ തുടരുന്നു, ഇത് വിലയിരുത്തുന്നയാൾക്ക് കാണാൻ കഴിയില്ല. ഇൻഫറൻസ് സമയത്ത് മോഡൽ പ്രോംപ്റ്റുകൾ ഉപയോഗിച്ചില്ല എന്നതിന് എൻക്ലേവ് ഒരു ഗണിതശാസ്ത്രപരമായ തെളിവ് (mathematical proof) നൽകുന്നു. ഇതിന്റെ ഫലം യഥാർത്ഥമായ ഒരു ഡബിൾ-ബ്ലൈൻഡ് റണ്ണാണ്: രണ്ട് വശങ്ങളും അവരുടെ രഹസ്യങ്ങൾ സൂക്ഷിക്കുന്നു, അതേസമയം മൂന്നാം കക്ഷിക്ക് പരിശോധിക്കാവുന്ന ഒരു പ്രകടന മെട്രിക് ലഭിക്കുകയും ചെയ്യുന്നു.
ആർക്കൊക്കെ ഇതിന്റെ ഗുണം ലഭിക്കും
- റെഗുലേറ്റർമാർക്കും ഓഡിറ്റർമാർക്കും അവരുടെ വ്യാപാര രഹസ്യങ്ങൾ വെളിപ്പെടുത്താൻ പ്രൊവൈഡർമാരെ നിർബന്ധിക്കാതെ തന്നെ കഴിവിൻ്റെ തെളിവുകൾ ആവശ്യപ്പെടാം.
- സൈബർ സുരക്ഷ, പ്രതിരോധം അല്ലെങ്കിൽ രഹസ്യവിവരങ്ങൾ കൈകാര്യം ചെയ്യുന്ന മേഖലകളിലുള്ള സംരംഭങ്ങൾക്ക് ഡാറ്റാ ചോർച്ചയുടെ ഭീഷണിയില്ലാതെ തന്നെ AI ടൂളുകൾ പരിശോധിക്കാം.
- മോഡൽ ഡെവലപ്പർമാർക്ക് അവരുടെ മത്സരശേഷി നിലനിർത്താം; അവർക്ക് ഇനി തുറന്ന സമീപനവും സംരക്ഷണവും തമ്മിൽ തിരഞ്ഞെടുക്കേണ്ടി വരില്ല.
ഈ രീതി വിപുലീകരിക്കപ്പെട്ടാൽ, അത് അത്യാധുനിക മോഡലുകളെ (frontier models) സാക്ഷ്യപ്പെടുത്തുന്നതിനുള്ള ഡിഫോൾട്ട് രീതിയായി മാറിയേക്കാം, ഇത് വ്യവസായത്തെ വിശ്വാസത്തെ അടിസ്ഥാനമാക്കിയുള്ള ക്രമീകരണങ്ങളിൽ നിന്ന് ഗണിതശാസ്ത്രപരമായ ഉറപ്പുകളിലേക്ക് മാറ്റും.
ഉണ്ടായേക്കാവുന്ന തടസ്സങ്ങൾ
ഈ സിസ്റ്റം Google Cloud-ന്റെ കോൺഫിഡൻഷ്യൽ കമ്പ്യൂട്ടിംഗ് സ്റ്റാക്കിനെ ആശ്രയിച്ചാണ് പ്രവർത്തിക്കുന്നത്, അതിനാൽ മറ്റ് ക്ലൗഡ് പ്രൊവൈഡർമാരെ ഇഷ്ടപ്പെടുന്ന സ്ഥാപനങ്ങൾക്ക് ഇന്റഗ്രേഷൻ തടസ്സങ്ങൾ നേരിടേണ്ടി വന്നേക്കാം. ഒരു എൻക്ലേവിനുള്ളിൽ മോഡലുകൾ പ്രവർത്തിപ്പിക്കുന്നത് ലേറ്റൻസി (latency) വർദ്ധിപ്പിക്കുകയും ലഭ്യമായ ഹാർഡ്വെയർ ആക്സിലറേറ്ററുകളെ പരിമിതപ്പെടുത്തുകയും ചെയ്യുന്നു, ഇത് ബെഞ്ച്മാർക്ക് സ്കോറുകളെ ബാധിച്ചേക്കാം. കൂടാതെ, ക്രിപ്റ്റോഗ്രാഫിക് തെളിവ് മോഡൽ പ്രോംപ്റ്റുകൾ കണ്ടില്ലെന്ന് ഉറപ്പാക്കുന്നുണ്ടെങ്കിലും, ടെസ്റ്റ് ആരംഭിച്ചതിന് ശേഷം നടത്തുന്ന ഫൈൻ-ട്യൂണിംഗ് (fine-tuning) പോലുള്ള മറ്റ് കൃത്രിമത്വങ്ങളെ ഇത് തടയുന്നില്ല. ഈ പരിഹാരം വിപുലമായ റീപ്രൊഡ്യൂസിബിലിറ്റി പ്രശ്നത്തിന്റെ ഒരു ചെറിയ ഭാഗം മാത്രമേ പരിഹരിക്കുന്നുള്ളൂ എന്ന് വിമർശകർ വാദിച്ചേക്കാം.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- പൈലറ്റിന് അപ്പുറമുള്ള ഉപയോഗം – മറ്റ് AI ലാബുകളും ക്ലൗഡ് വെണ്ടർമാരും അനുയോജ്യമായ എൻക്ലേവുകൾ നിർമ്മിച്ചേക്കാം, ഇത് വിവിധ പ്ലാറ്റ്ഫോമുകളിൽ മോഡലുകൾ ഓഡിറ്റ് ചെയ്യാൻ കഴിയുമോ എന്ന് പരിശോധിക്കും.
- സ്റ്റാൻഡേർഡ് സെറ്റിംഗ് ബോഡികൾ – AI സുരക്ഷാ ഗ്രൂപ്പുകൾ ഡബിൾ-ബ്ലൈൻഡ് ക്രിപ്റ്റോഗ്രാഫിക് ഓഡിറ്റുകളെ സാക്ഷ്യപ്പെടുത്തൽ ചട്ടക്കൂടിന്റെ ഭാഗമായി ഉൾപ്പെടുത്തിയേക്കാം.
- പ്രകടനത്തിലെ മാറ്റങ്ങൾ (Performance trade-offs) – കോൺഫിഡൻഷ്യൽ എക്സിക്യൂഷന്റെ അധികഭാരം (overhead) വലിയ തോതിലുള്ള മോഡലുകൾക്ക് സ്വീകാര്യമാണോ എന്ന് യഥാർത്ഥ ലോകത്തെ ബെഞ്ച്മാർക്ക് റണ്ണുകൾ വെളിപ്പെടുത്തും.
ചുരുക്കത്തിൽ
ടെസ്റ്റ് ഡാറ്റയും മോഡലും പരസ്പരം കാണാൻ കഴിയാത്ത ഒരു ക്രിപ്റ്റോഗ്രാഫിക് അന്തരീക്ഷത്തിനുള്ളിൽ പൂട്ടിയിടുന്നതിലൂടെ, വിശ്വസനീയമായ AI ബെഞ്ച്മാർക്കിംഗിനായുള്ള ഒരു വ്യക്തമായ പാത Google DeepMind-ന്റെ പൈലറ്റ് പദ്ധതി വാഗ്ദാനം ചെയ്യുന്നു. ഈ രീതി എല്ലാ ഓഡിറ്റ് വെല്ലുവിളികളെയും ഇല്ലാതാക്കുന്നില്ല, എന്നാൽ ഇരുപക്ഷത്തെയും അവരുടെ ഏറ്റവും മൂല്യവത്തായ ആസ്തികൾ വിട്ടുകൊടുക്കാൻ നിർബന്ധിക്കാതെ തന്നെ, ബെഞ്ച്മാർക്ക് കോൺറ്റമിനേഷൻ എന്ന ഏറ്റവും വലിയ പക്ഷപാതത്തെ ഇത് നീക്കം ചെയ്യുന്നു. ഈ സാങ്കേതികവിദ്യ സമൂഹം സ്വീകരിച്ചാൽ, ഭാവിയിലെ AI പ്രോഗ്രസ് റിപ്പോർട്ടുകൾ ഒടുവിൽ നേരിട്ട് വിശ്വസനീയമായി കണക്കാക്കാൻ സാധിക്കും.
