ഒരു ഗവേഷണ സംഘം ഒരു കുറഞ്ഞ ചിലവുള്ള ലാംഗ്വേജ് മോഡലിന് ഒരു കോഡിംഗ് റിക്വസ്റ്റ് കൈകാര്യം ചെയ്യാൻ കഴിയുമോ എന്ന് തീരുമാനിക്കാൻ ഒരു റൂട്ടർ നിർമ്മിച്ചു, ഇൻഫറൻസ് ചിലവ് കുറയ്ക്കുക എന്നതായിരുന്നു അവരുടെ ലക്ഷ്യം. എന്നാൽ റൂട്ടറിന് ഒരു “never-escalate” (ഒരിക്കലും അടുത്ത ഘട്ടത്തിലേക്ക് മാറ്റാതിരിക്കുക) ബേസ്ലൈനിനെ മറികടക്കാൻ കഴിഞ്ഞില്ല. കൃത്യതയെ മാത്രം അടിസ്ഥാനമാക്കിയുള്ള അളവുകോലുകൾ (accuracy-centric metrics) എങ്ങനെയാണ് കാസ്കേഡുകളെ തെറ്റായ വഴിയിലേക്ക് നയിക്കുന്നത് എന്ന് ഈ പരാജയം കാണിക്കുന്നു, കൂടാതെ പ്രയാസത്തെ യഥാർത്ഥത്തിൽ തിരിച്ചറിയാൻ സഹായിക്കുന്ന സൂചനകളെക്കുറിച്ചും ഇത് സൂചിപ്പിക്കുന്നു.
റൂട്ടർ പ്രധാനപ്പെട്ടത് എന്തുകൊണ്ട്
മോഡൽ കാസ്കേഡുകൾ ഓരോ റിക്വസ്റ്റും ശരിയായി ഉത്തരം നൽകാൻ കഴിയുന്ന ഏറ്റവും ചെറിയ മോഡലിലേക്ക് അയക്കുന്നു. റൂട്ടർ ഒരു ലളിതമായ പ്രോംപ്റ്റ് ഒരു കുറഞ്ഞ ചിലവുള്ള മോഡലിലേക്ക് അയക്കുകയാണെങ്കിൽ, വലിയൊരു മോഡലിന് ആവശ്യമായ വലിയ കമ്പ്യൂട്ടിംഗ് ചിലവ് സിസ്റ്റം ഒഴിവാക്കുന്നു. 539 യഥാർത്ഥ കോഡിംഗ് ടാസ്ക്കുകളിൽ (428 എളുപ്പമുള്ളവയും 111 പ്രയാസമുള്ളവയും) ഉപയോഗിച്ച് ഗവേഷകർ ഒരു റൂട്ടർ പരിശീലിപ്പിച്ചു, കുറഞ്ഞ ചിലവുള്ള മോഡൽ എപ്പോൾ മതിയാകും എന്ന് അത് പഠിക്കുമെന്ന് അവർ പ്രതീക്ഷിച്ചു.
പ്രതീക്ഷിച്ച ഫലം ലഭിക്കാത്ത കണക്കുകൾ
- Held-out AUC (area under the ROC curve): 0.594
- 5-fold cross-validation പരിധി: 0.55 – 0.57
- മികച്ച ത്രെഷോൾഡ് (Best threshold): “never escalate” എന്ന നയത്തിന് തുല്യം
Held-out AUC 0.594 ആയിരുന്നു, കൂടാതെ cross-validation 0.55 മുതൽ 0.57 വരെയായിരുന്നു, ഇതിനർത്ഥം ക്ലാസിഫയർ എളുപ്പമുള്ളവയെ പ്രയാസമുള്ളവയിൽ നിന്ന് വേർതിരിച്ചറിയാൻ വളരെ കുറഞ്ഞ അളവിൽ മാത്രമേ സാധിക്കുന്നുള്ളൂ എന്നാണ്. ഏറ്റവും അനുയോജ്യമായ ത്രെഷോൾഡ് (optimal threshold) വലിയ മോഡൽ ഒരിക്കലും ഉപയോഗിക്കാത്ത ഒരു നയമാണ് നൽകുന്നതെങ്കിൽ, റൂട്ടർ കൊണ്ട് യാതൊരു പ്രയോജനവുമില്ല. അത് ഒരു തീരുമാനമെടുക്കുന്ന ഉപകരണത്തിന് പകരം ഒരു സ്ഥിരമായ പ്രെഡിക്റ്റർ (constant predictor) പോലെ പ്രവർത്തിക്കുന്നു.
പരീക്ഷണങ്ങൾ പരിശോധിച്ചത് എന്തൊക്കെയാണ്
ഗവേഷകർ മൂന്ന് ഫീച്ചർ സെറ്റുകൾ താരതമ്യം ചെയ്തു:
| ഫീച്ചർ സെറ്റ് | AUC |
|---|---|
| 11 ലളിതമായ സർഫസ് ഫീച്ചറുകൾ (ഉദാഹരണത്തിന്, ടോക്കൺ എണ്ണം, കീവേഡ് സാന്നിധ്യം) | 0.610 |
| 1024-ഡൈമൻഷണൽ പ്രോംപ്റ്റ് എംബെഡിംഗ് (semantic vector) | 0.552 |
| ഇവ രണ്ടും ചേർത്തത് | 0.609 |
അത്ഭുതകരമെന്നു പറയട്ടെ, ഭാരം കുറഞ്ഞ സർഫസ് ഫീച്ചറുകൾ ഉയർന്ന ഡൈമൻഷണൽ ആയ സെമാന്റിക് എംബെഡിംഗിനേക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെച്ചു. എംബെഡിംഗ് പ്രോംപ്റ്റിന്റെ വിഷയം തിരിച്ചറിഞ്ഞെങ്കിലും അതിന്റെ അന്തർലീനമായ പ്രയാസത്തെ തിരിച്ചറിഞ്ഞില്ല. കുറഞ്ഞ ചിലവുള്ള മോഡലിന്റെ ഡ്രാഫ്റ്റ് (draft) റൂട്ടറിലേക്ക് നൽകിയപ്പോൾ AUC 0.640 ആയി ഉയർന്നു, ഇത് പ്രോംപ്റ്റിൽ മാത്രം ഉള്ളതിനേക്കാൾ കൂടുതൽ വിവരങ്ങൾ ജനറേഷൻ സമയത്ത് ലഭിക്കുന്ന സൂചനകളിൽ അടങ്ങിയിരിക്കുന്നു എന്ന് സൂചിപ്പിക്കുന്നു.
രണ്ട് അടിസ്ഥാന പിഴവുകൾ
1. കൃത്യത (Accuracy) തെറ്റായ അളവുകോലാണ്
ഒരു റൂട്ടർ വെറുതെ ശരിയാണോ തെറ്റാണോ എന്ന് പ്രവചിക്കുക മാത്രമല്ല വേണ്ടത്, മറിച്ച് ഒരു സാധാരണ നയത്തെക്കാൾ (naïve policy) മികച്ച രീതിയിൽ ചിലവും കൃത്യതയും തമ്മിലുള്ള സന്തുലിതാവസ്ഥ (cost-accuracy trade-off) മെച്ചപ്പെടുത്തുകയും വേണം. "never escalate" എന്നതിനേക്കാൾ മികച്ച പ്രകടനം കാണിക്കാൻ കഴിഞ്ഞില്ലെങ്കിൽ, അതിന്റെ കൃത്യത എത്രയായാലും ചിലവ് കുറയ്ക്കാൻ അത് സഹായിക്കില്ല. AUC പോലുള്ള പരമ്പരാഗത അളവുകോലുകൾ കാസ്കേഡുകളുടെ സാമ്പത്തിക വശത്തെ അവഗണിക്കുന്നു.
2. “Always escalate” എന്നത് പരിധി (ceiling) അല്ല
വലിയ മോഡൽ ഒരിക്കലും തെറ്റില്ല എന്ന് കരുതിക്കൊണ്ടാണ് "എപ്പോഴും വലിയ മോഡൽ ഉപയോഗിക്കുക" എന്നത് ഒരു പരിധിയായി ഈ പരീക്ഷണം കണക്കാക്കിയത്. എന്നാൽ യഥാർത്ഥത്തിൽ, കുറഞ്ഞ ചിലവുള്ള മോഡൽ ശരിയായി നൽകിയ ഉത്തരങ്ങൾ വലിയ മോഡൽ തെറ്റായി നൽകുന്ന സാഹചര്യങ്ങൾ ഉണ്ടായിരുന്നു. എപ്പോൾ കുറഞ്ഞ ചിലവുള്ള മോഡലിൽ തന്നെ തുടരണമെന്ന് അറിയുന്ന ഒരു മികച്ച റൂട്ടറിന്, തിരഞ്ഞെടുത്ത കോസ്റ്റ് മെട്രിക് പ്രകാരം “always escalate” ബേസ്ലൈനിനേക്കാൾ ഏകദേശം 4.2 പോയിന്റ് മികച്ച പ്രകടനം കാഴ്ചവെക്കാൻ കഴിയും. വലിയ മോഡലിന്റെ പ്രകടനശേഷി കരുതിയിരിക്കുന്നതിനേക്കാൾ കുറവാണെന്ന് ഈ വ്യത്യാസം കാണിക്കുന്നു.
മികച്ച റൂട്ടിംഗ് സിഗ്നലുകൾ രൂപകൽപ്പന ചെയ്യുക
ഈ കണ്ടെത്തലുകൾ മൂന്ന് പ്രായോഗിക വഴികൾ നിർദ്ദേശിക്കുന്നു:
- ജനറേഷൻ സമയത്തെ സൂചനകൾ ഉൾപ്പെടുത്തുക. കുറഞ്ഞ ചിലവുള്ള മോഡലിന്റെ ഇടക്കാല ഔട്ട്പുട്ട് (അതിന്റെ ഡ്രാഫ്റ്റ്) റൂട്ടറിലേക്ക് നൽകുന്നത് പ്രോംപ്റ്റിൽ മാത്രം കാണാൻ കഴിയാത്ത പ്രയാസങ്ങളെ തിരിച്ചറിയാൻ സഹായിക്കുന്നു.
- ടാസ്ക്-സ്പെസിഫിക് സർഫസ് ഫീച്ചറുകൾക്ക് മുൻഗണന നൽകുക. നീളം, ചില ഓപ്പറേറ്ററുകളുടെ സാന്നിധ്യം അല്ലെങ്കിൽ കോഡ്-സ്റ്റൈൽ മാർക്കറുകൾ തുടങ്ങിയ ലളിതമായ അളവുകോലുകൾ പൊതുവായ സെമാന്റിക് എംബെഡിംഗുകളേക്കാൾ മികച്ച പ്രവചനശേഷി നൽകിയേക്കാം.
- ചിലവ് കണക്കിലെടുക്കുന്ന അളവുകോലുകൾ ഉപയോഗിച്ച് വിജയം അളക്കുക. വെറും കൃത്യതയോ AUC-യോ നോക്കുന്നതിന് പകരം, നിശ്ചിത ഗുണനിലവാരം നിലനിർത്തിക്കൊണ്ട് എത്രത്തോളം വലിയ മോഡലുകളുടെ ഉപയോഗം ഒഴിവാക്കാൻ സാധിച്ചു എന്ന് വിലയിരുത്തുക.
ചുരുക്കത്തിൽ: കൃത്യതയ്ക്ക് വേണ്ടി മാത്രം പ്രവർത്തിക്കുന്ന ഒരു റൂട്ടറിന് ചിലവ് കുറയ്ക്കാൻ ഗ്യാരണ്ടി നൽകാൻ കഴിയില്ല; ഫലപ്രദമായ റൂട്ടിംഗിന് ജനറേഷൻ സമയത്തെ തെളിവുകളും ചിലവ് കണക്കിലെടുക്കുന്ന വിലയിരുത്തലുകളും ആവശ്യമാണ്.
