Claude-ന്റെ പുതിയ Deep Research ടൂളിന് ഒറ്റത്തവണത്തെ ഒരു കോൾ വഴി 6.57 മില്യൺ ടോക്കണുകൾ വരെ കൈകാര്യം ചെയ്യാൻ കഴിയും—ഇതൊരു വലിയ കമ്പ്യൂട്ട് ബജറ്റ് ഉണ്ടെങ്കിൽ മാത്രമേ സാധ്യമാകൂ. ഈ സിസ്റ്റം ഒരു ഏകീകൃത (monolithic) ലാംഗ്വേജ് മോഡലല്ല; മറിച്ച് സെർച്ചുകൾ വിപുലീകരിക്കാനും (fan out), ഡാറ്റ ശേഖരിക്കാനും, അവകാശവാദങ്ങളെ മൂന്ന് സ്വതന്ത്ര വെരിഫയർമാരുമായി താരതമ്യം ചെയ്യാനും, തുടർന്ന് ഒരു റിപ്പോർട്ട് തയ്യാറാക്കാനും പ്രവർത്തിക്കുന്ന ഒരു കർശനമായ JavaScript map-reduce പൈപ്പ്‌ലൈൻ ആണ് ഇത്.

എന്തുകൊണ്ടാണ് ഈ ആർക്കിടെക്ചർ പ്രധാനമാകുന്നത്

മിക്ക AI അധിഷ്ഠിത റിസർച്ച് അസിസ്റ്റന്റുകളും ഒരു ലളിതമായ "ചോദിക്കുക-ഉത്തരം നൽകുക" (ask-and-answer) ഇന്റർഫേസ് ആണ് നൽകുന്നത്, ഇത് മോഡലിന് ഒരേസമയം ടെക്സ്റ്റും സൈറ്റേഷനുകളും നിർമ്മിക്കാൻ അനുവദിക്കുന്നു. എന്നാൽ Claude-ന്റെ Deep Research ഈ മാതൃകയെ പാടെ മാറ്റുന്നു. ഇത് ജോലിയെ വ്യത്യസ്തമായ ഘട്ടങ്ങളായി തിരിക്കുകയും മോഡൽ ഒരു സോഫ്റ്റ്‌വെയർ ഹാർനസിനെ (software harness) അനുസരിക്കാൻ നിർബന്ധിക്കുകയും ചെയ്യുന്നു. ഹാലൂസിനേഷനുകൾ (hallucinations) നിയന്ത്രിക്കാനും അതേസമയം കൃത്യമായ സ്രോതസ്സുകളുള്ള ഉത്തരങ്ങൾ നൽകാനും ഡിസൈനർമാർ ഇതിനെ രൂപകൽപ്പന ചെയ്തിരിക്കുന്നു. ഒരു ഓട്ടോമേറ്റഡ് ബഗ്-ഹണ്ടിംഗ് ഫ്രെയിംവർക്കിൽ നിന്നാണ് ഈ സമീപനം രൂപപ്പെട്ടത്, അവിടെ ഒരു ഹൈപ്പോത്തിസിസ് (hypothesis) രൂപീകരിക്കുകയും പിന്നീട് അത് തെറ്റാണെന്ന് തെളിയിക്കാൻ ബോധപൂർവ്വം ശ്രമിക്കുകയും ചെയ്യുന്നു. ഗവേഷണത്തിന്റെ ഭാഷയിൽ പറഞ്ഞാൽ, ഒരു അവകാശവാദം (claim) രൂപപ്പെടുന്നു, തുടർന്ന് അത് അവസാന സംയോജനത്തിൽ എത്തുന്നതിന് മുമ്പ് മൂന്ന് അഡ്വേഴ്സേറിയൽ ഏജന്റുകൾ (adversarial agents) അതിനെ തള്ളിക്കളയാൻ ശ്രമിക്കുന്നു.

മാപ്പ്-റിഡ്യൂസ് (map-reduce) പ്രവാഹം

  1. Fan-out search – ഓർക്കസ്ട്രേറ്റർ വിവിധ ഡാറ്റാ സ്രോതസ്സുകളിൽ നിന്ന് വിവരങ്ങൾ തേടുന്നതിനായി സമാന്തരമായി വർക്കർമാരെ (parallel workers) നിയോഗിക്കുന്നു.
  2. Fetch data – ഓരോ വർക്കറും വിവരങ്ങളുടെ ഭാഗങ്ങൾ (snippets), മെറ്റാഡാറ്റ, ലഭ്യമായ ഘടനാപരമായ വിവരങ്ങൾ എന്നിവ ശേഖരിക്കുന്നു.
  3. Adversarial verification – മൂന്ന് സ്വതന്ത്ര ഏജന്റുകൾ ഓരോ അവകാശവാദവും പരിശോധിക്കുന്നു, അവയിൽ ഓരോ ഏജന്റിനും ഉറപ്പില്ലാത്ത സാഹചര്യത്തിൽ അവകാശവാദം നിരാകരിക്കപ്പെട്ടതായി (refuted) കണക്കാക്കാൻ നിർദ്ദേശം നൽകിയിരിക്കുന്നു. ആവശ്യമായ അനുകൂല വോട്ടുകൾ ലഭിച്ചാൽ മാത്രമേ ആ അവകാശവാദം നിലനിൽക്കുകയുള്ളൂ.
  4. Synthesis – നിലനിൽക്കുന്ന അവകാശവാദങ്ങൾ ഒരു ഫൈനൽ JSON റിപ്പോർട്ടായി സംയോജിപ്പിക്കുന്നു, ഇത് ഉപയോക്താവിന് ഒരു വിവരണമായി (prose) കാണാൻ സാധിക്കും.

ഹാർനസിനുള്ളിൽ (Inside the harness)

ലാംഗ്വേജ് മോഡലിന് എന്ത് ചെയ്യാൻ കഴിയും എന്ന് നിർവചിക്കുന്ന കോഡിന്റെ ഒരു നേർത്ത പാളിയാണ് ഹാർനസ്. അതിന്റെ നിയമങ്ങൾ ഘടനാപരമായ ജോലികളായി കാണപ്പെടുന്നു:

  • SCOPE – ഗവേഷണ ചോദ്യത്തിന്റെ സംക്ഷിപ്തമായ വിവരണം മോഡലിന് ലഭിക്കുന്നു.
  • SEARCH – മോഡൽ സ്രോതസ്സുകളുടെ ഒരു പട്ടിക നൽകണം, സ്വതന്ത്രമായ ടെക്സ്റ്റ് നൽകാൻ പാടില്ല.
  • EXTRACT – ഓരോ സ്രോതസ്സിൽ നിന്നും, മോഡൽ ഒരു അവകാശവാദത്തെ പിന്തുണയ്ക്കുന്ന കൃത്യമായ ഉദ്ധരണി (verbatim quote) നൽകണം.
  • VERDICT – അവകാശവാദം, അതിനെ പിന്തുണയ്ക്കുന്ന ഉദ്ധരണി, കോൺഫിഡൻസ് സ്കോർ എന്നിവ അടങ്ങിയ ഒരു JSON ഒബ്‌ജക്റ്റ് ഇത് നിർമ്മിക്കുന്നു.
  • REPORT – അവസാന ഘട്ടത്തിൽ എല്ലാ വെരിഫൈ ചെയ്ത അവകാശവാദങ്ങളെയും ഒരു ഒറ്റപ്പെട്ട ഡോക്യുമെന്റായി മാറ്റുന്നു.

ഹാർനസ് എവിഡൻസ് ബൈൻഡിംഗ് (evidence binding) നടപ്പിലാക്കുന്നു: ഒരു കൃത്യമായ ഉദ്ധരണി ഇല്ലാത്ത അവകാശവാദങ്ങൾ സ്വയമേവ ഒഴിവാക്കപ്പെടുന്നു. കോഡ് മാറ്റാതെ തന്നെ ക്രമീകരിക്കാൻ കഴിയുന്ന പോളിസി കോൺസ്റ്റന്റുകളും (policy constants) ഇത് നൽകുന്നു—ഒരു അവകാശവാദത്തിന് എത്ര അനുകൂല വോട്ടുകൾ വേണം, സിസ്റ്റത്തിന് എത്ര സ്രോതസ്സുകൾ വായിക്കാം, അല്ലെങ്കിൽ വെരിഫിക്കേഷനിലേക്ക് എത്ര അവകാശവാദങ്ങൾ കടന്നുപോകണം തുടങ്ങിയവ ഇതിൽ ഉൾപ്പെടുന്നു.

എക്സ്ട്രാക്ഷനും വെരിഫിക്കേഷനും ഇടയിൽ ഒരു ട്രയാജ് (triage) ഘട്ടമുണ്ട്. എല്ലാ അവകാശവാദങ്ങളെയും ചെലവേറിയ അഡ്വേഴ്സേറിയൽ ഏജന്റുകളിലേക്ക് അയക്കുന്നതിന് പകരം, സിസ്റ്റം അവയുടെ പ്രാധാന്യവും സ്രോതസ്സിന്റെ ഗുണനിലവാരവും അനുസരിച്ച് റാങ്ക് ചെയ്യുന്നു, തുടർന്ന് ഏറ്റവും മികച്ച 25 എണ്ണത്തിനെ മാത്രം മുന്നോട്ട് അയക്കുന്നു. ഈ രീതി ടോക്കൺ ഉപയോഗവും കമ്പ്യൂട്ട് ചിലവും നിയന്ത്രിക്കാൻ സഹായിക്കുന്നു.

പ്രായോഗികമായ അഡ്വേഴ്സേറിയൽ വെരിഫിക്കേഷൻ (Adversarial verification in practice)

വെരിഫിക്കേഷൻ ഘട്ടം ബോധപൂർവ്വം കഠിനമാണ്. മൂന്ന് ഏജന്റുകൾക്കും ഒരേ അവകാശവാദവും അതിന്റെ സ്രോതസ്സ് ഉദ്ധരണിയും ലഭിക്കുന്നു, തുടർന്ന് കൃത്യമായ തെളിവ് ലഭിക്കാത്ത പക്ഷം അവകാശവാദം തെറ്റാണെന്ന് കരുതാൻ അവരോട് നിർദ്ദേശിക്കുന്നു. ഏതെങ്കിലും ഏജന്റിന് സംശയമുണ്ടെങ്കിൽ, അവർ നിരാകരിച്ചു (refuted) എന്ന് വോട്ട് ചെയ്യുന്നു. ഒരു അവകാശവാദം നിലനിൽക്കണമെങ്കിൽ നിശ്ചിത എണ്ണം അംഗീകാര (affirmed) വോട്ടുകൾ ലഭിക്കണം.

അനൗദ്യോഗികമായ പരിശോധനയ്ക്കിടെ, ഒരു അഗ്രഗേറ്റ് മെട്രിക് (aggregate metric) ഒരു പ്രത്യേക പ്രിസിഷൻ സ്കോറായി (precision score) തെറ്റായി വായിച്ച ഒരു അവകാശവാദത്തെ അഡ്വേഴ്സേറിയൽ ലെയർ കണ്ടെത്തി. മോഡൽ പ്രിസിഷനെക്കുറിച്ച് ആത്മവിശ്വാസത്തോടെ ഒരു പ്രസ്താവന നടത്തിയിരുന്നു, എന്നാൽ സ്രോതസ്സ് ഒരു അഗ്രഗേറ്റ് മെട്രിക് മാത്രമാണ് റിപ്പോർട്ട് ചെയ്തിരുന്നത്.

AI സിസ്റ്റം നിർമ്മാണത്തെക്കുറിച്ച് ഈ ഡിസൈൻ വെളിപ്പെടുത്തുന്നത് എന്താണ്

  1. നിയന്ത്രണത്തെയും യുക്തിചിന്തയെയും വേർതിരിക്കുക – മോഡൽ ഇൻഫറൻസിനായി (inference) ഉത്തരവാദിത്തപ്പെട്ടതാകുന്നു; ഹാർനസ് പ്രക്രിയയുടെ അച്ചടക്കം ഉറപ്പാക്കുന്നു.
  2. Typed interfaces ഹാലൂസിനേഷൻ കുറയ്ക്കുന്നു – JSON ഔട്ട്പുട്ടും കൃത്യമായ ഉദ്ധരണികളും ആവശ്യപ്പെടുന്നതിലൂടെ സിസ്റ്റം അനാവശ്യമായ വ്യതിയാനങ്ങൾ ഒഴിവാക്കുന്നു.
  3. ചെലവേറിയ വെരിഫിക്കേഷൻ ഘട്ടത്തിന് മുമ്പ് അവകാശവാദങ്ങൾ ഫിൽട്ടർ ചെയ്യുന്നത് ടോക്കൺ ഉപയോഗവും കമ്പ്യൂട്ട് ചിലവും കുറയ്ക്കുന്നു.
  4. പുറത്തുനിന്നുള്ള ഇൻപുട്ടുകളെ വിശ്വസിക്കാൻ പാടില്ലാത്തവയായി കാണുക – ഓരോ സ്രോതസ്സ് ഉദ്ധരണിയും സ്വതന്ത്ര ഏജന്റുകൾ വീണ്ടും പരിശോധിക്കുന്നു, ഇത് ഒരു തെറ്റായ ഡോക്യുമെന്റ് ഉത്തരം തെറ്റാകുന്നത് തടയുന്നു.

ഈ തത്വങ്ങൾ "മോഡലിന് പുറത്തുള്ള മോഡൽ" (model-outside-the-model) ആർക്കിടെക്ചറുകളിലേക്കുള്ള വലിയൊരു മാറ്റത്തെ സൂചിപ്പിക്കുന്നു, അവിടെ പ്രോബബിലിസ്റ്റിക് ആയ ലാംഗ്വേജ് മോഡലിന് പകരം ഡിറ്റർമിനിസ്റ്റിക് കോഡ് ഓർക്കസ്ട്രേഷൻ, വാലിഡേഷൻ, റിസോഴ്സ് അലോക്കേഷൻ എന്നിവ കൈകാര്യം ചെയ്യുന്നു.

സാധ്യമായ പോരായ്മകളും തുറന്ന ചോദ്യങ്ങളും

പൈപ്പ്‌ലൈനിന്റെ കരുത്ത്—അതിന്റെ കൃത്യത—ചില വെല്ലുവിളികളും ഉയർത്തുന്നു.

മറ്റൊരു തർക്കവിഷയം വാക്കുകൾ അതേപടി ഉപയോഗിക്കുന്നതിലുള്ള ആശ്രയമാണ്. എല്ലാ അറിവുകളും കൃത്യമായ പദപ്രയോഗങ്ങളിൽ മാത്രം ഒതുങ്ങുന്നില്ല; ഒന്നിലധികം രേഖകൾ സംയോജിപ്പിച്ചുകൊണ്ട് മാത്രം ചില ഉൾക്കാഴ്ചകൾ രൂപപ്പെടുന്നു.

അടുത്തതായി ശ്രദ്ധിക്കേണ്ടവ

Claude’s Deep Research ഇപ്പോഴും ഗവേഷണ ഘട്ടത്തിലാണ്, എന്നാൽ അതിന്റെ ഘടന സൂചിപ്പിക്കുന്നത് ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ സ്വയം നിയന്ത്രിക്കാൻ വിടുന്നതിന് പകരം കർശനമായി നിയന്ത്രിക്കപ്പെട്ട പൈപ്പ്‌ലൈനുകളിൽ ഉൾപ്പെടുത്തുന്ന ഒരു ഭാവിയിലേക്കാണ്. നിരീക്ഷിക്കേണ്ട പ്രധാന സൂചകങ്ങൾ ഇവയാണ്:

  • Token-efficiency metrics – ഹാർനസ് കൂടുതൽ സെലക്റ്റീവ് ട്രയാജ് ലോജിക് (selective triage logic) കൈവരിക്കുമ്പോൾ 6.57 M ടോക്കൺ ബേസ്‌ലൈൻ കുറയുമോ?
  • Latency trends – മൂന്ന് വെരിഫിക്കേഷൻ ഏജന്റുകൾ (verification agents) ഉൾപ്പെടുമ്പോൾ സിസ്റ്റത്തിന് എത്ര വേഗത്തിൽ ഒരു പൂർണ്ണമായ റിപ്പോർട്ട് നൽകാൻ കഴിയും?

പ്രധാന പാഠം

ഒരു ലാംഗ്വേജ് മോഡലിനെ അച്ചടക്കമുള്ള, ബഹുതല പൈപ്പ്‌ലൈനിലേക്ക് പരിമിതപ്പെടുത്തിയാൽ, വിശ്വസനീയവും സ്രോതസ്സുകളെ അടിസ്ഥാനമാക്കിയുള്ളതുമായ ഉത്തരങ്ങൾ നൽകാൻ കഴിയുമെന്ന് Claude’s Deep Research കാണിച്ചുതരുന്നു. യഥാർത്ഥ മുന്നേറ്റം മോഡലിന്റെ വലിപ്പമല്ല; മറിച്ച് ഓരോ അവകാശവാദവും തെളിയിക്കാനും, കമ്പ്യൂട്ട് ഉപയോഗിക്കുന്നതിന് മുമ്പ് തെളിവുകൾ ക്രമീകരിക്കാനും, മൂന്ന് ഏജന്റുകൾ അംഗീകരിക്കുന്നത് വരെ ഓരോ ബാഹ്യമായ ഭാഗത്തെയും സംശയാസ്പദമായി കാണാനും മോഡലിനെ നിർബന്ധിക്കുന്ന ചുറ്റുമുള്ള സോഫ്റ്റ്‌വെയറാണ്. AI അധിഷ്ഠിത ടൂളുകൾ നിർമ്മിക്കുന്നവർക്ക് പാഠം വ്യക്തമാണ്: മോഡലിനെ ചിന്തിക്കാൻ അനുവദിക്കുക, എന്നാൽ അത് എന്ത് പറയണം എന്ന് തീരുമാനിക്കാൻ കോഡിനെ അനുവദിക്കുക.