Snowflake-ന്റെ പുതിയ Ontology Stack Builder, നോളജ്-ഗ്രാഫ് അധിഷ്ഠിതമായ (knowledge-graph-backed) ഒരു ഡാറ്റാ മോഡൽ നിർമ്മിക്കാനുള്ള സമയം മാസങ്ങളിൽ നിന്ന് ഏകദേശം ഒരു മണിക്കൂറായി കുറയ്ക്കുന്നു. ഇത് ലാർജ് ലാംഗ്വേജ് മോഡലുകൾക്ക് (LLMs) ചോദ്യങ്ങൾക്ക് കൃത്യമായി ഉത്തരം നൽകാൻ ആവശ്യമായ ബിസിനസ്സ് സന്ദർഭങ്ങൾ (business context) നൽകുന്നു.

തങ്ങളുടെ ഡാറ്റാ വെയർഹൗസുകളിൽ ജനറേറ്റീവ് AI ഉപയോഗിക്കാൻ ശ്രമിക്കുന്ന സംരംഭങ്ങൾ പലപ്പോഴും ഒരു തടസ്സത്തിൽ അകപ്പെടുന്നു: മോഡലുകൾ കാണുന്നത് വരികളും (rows) കോളങ്ങളും (columns) മാത്രമാണ്, അല്ലാതെ തീരുമാനങ്ങൾ എടുക്കാൻ സഹായിക്കുന്ന യഥാർത്ഥ ലോകത്തിലെ വസ്തുതകളല്ല (entities)—ആളുകൾ, ടീമുകൾ, കരാറുകൾ എന്നിവയല്ല. ഒരു സെമാന്റിക് പാലം (semantic bridge) ഇല്ലാതെ, AI നിർമ്മിക്കുന്ന SQL തെറ്റായ വിവരങ്ങൾ നൽകാനും ലോജിക് പിശകുകൾ സംഭവിക്കാനും കാരണമാകുന്നു, ഇത് വിശ്വാസ്യത കുറയ്ക്കുന്നു.

എന്തുകൊണ്ടാണ് റോ ഡാറ്റാ ടേബിളുകൾ (raw tables) LLM-കളെ ആശയക്കുഴപ്പത്തിലാക്കുന്നത്

ഒരു സാധാരണ ഡാറ്റാ വെയർഹൗസ് വിവരങ്ങൾ ഫോറിൻ കീകളാൽ (foreign keys) ബന്ധിപ്പിച്ചിട്ടുള്ള നോർമലൈസ്ഡ് ടേബിളുകളിലാണ് സൂക്ഷിക്കുന്നത്. കോളത്തിന്റെ പേരുകൾ പലപ്പോഴും ചുരുക്കരൂപങ്ങളോ ആഭ്യന്തര സാങ്കേതിക പദങ്ങളോ (internal jargon) ആയിരിക്കും. വെബ് ടെക്സ്റ്റുകളിൽ നിന്ന് പരിശീലനം നേടിയ ഒരു LLM ബിസിനസ്സ് സാഹചര്യത്തിൽ “EMP_ID” അല്ലെങ്കിൽ “CNTRCT_AMT” എന്നിവ കണ്ടിട്ടുണ്ടാകില്ല. അതിനാൽ, “കഴിഞ്ഞ പാദത്തിൽ ഏറ്റവും വലിയ ഡീലുകൾ ക്ലോസ് ചെയ്ത സെയിൽസ് പ്രതിനിധികൾ ആരെല്ലാം?” എന്ന് ചോദിക്കുമ്പോൾ, ഓരോ ഫീൽഡിന്റെയും അർത്ഥം ആദ്യം മനസ്സിലാക്കിയ ശേഷം പല ടേബിളുകൾക്കിടയിൽ ശരിയായ ജോയിൻ (join) നിർമ്മിക്കേണ്ടി വരുന്നു. ഇതിന്റെ ഫലമായി, ശരിയാണെന്ന് തോന്നുമെങ്കിലും തെറ്റായ ഉത്തരങ്ങൾ ലഭിക്കാൻ സാധ്യതയുള്ള ഊഹങ്ങൾ മാത്രമാണ് ലഭിക്കുന്നത്.

ഒരു ബ്ലൂപ്രിന്റായി ഓന്റോളജി (Ontology)

ഒരു ഓന്റോളജി ക്ലാസുകളെയും (ഉദാഹരണത്തിന്: Person, Organization, Contract) അവ തമ്മിലുള്ള ബന്ധങ്ങളെയും (Person works for Organization) നിർവചിക്കുന്നു. ആ ഓന്റോളജിയിൽ നിന്ന് നിർമ്മിച്ച നോളജ് ഗ്രാഫ് കൃത്യമായ വസ്തുതകൾ സൂക്ഷിക്കുന്നു—ഉദാഹരണത്തിന്, John Doe Acme Inc.-ൽ ജോലി ചെയ്യുന്നു, ഒരു കരാർ Acme Inc.-ന്റേതാണ്—ഇത് AI-യെ വെറും കോളങ്ങൾ ഉപയോഗിക്കുന്നതിന് പകരം ഉയർന്ന തലത്തിലുള്ള ആശയങ്ങൾ (higher-level concepts) ഉപയോഗിച്ച് ചിന്തിക്കാൻ സഹായിക്കുന്നു.

Snowflake-ന്റെ അഞ്ച് പാളികളുള്ള സമീപനം

ഒരു വെയർഹൗസിനെ ഓന്റോളജി അധിഷ്ഠിത സംവിധാനമാക്കി മാറ്റുന്നതിനുള്ള Snowflake-ന്റെ ആർക്കിടെക്ചർ അഞ്ച് പാളികളായി ക്രമീകരിച്ചിരിക്കുന്നു:

  • Layer 1: Physical storage – രണ്ട് പ്രധാന ടേബിളുകൾ നോഡുകളെയും (entities) എഡ്ജുകളെയും (relationships) സൂക്ഷിക്കുന്നു. പുതിയൊരു എൻ്റിറ്റി ടൈപ്പ് ചേർക്കാൻ സ്കീമയിൽ മാറ്റം വരുത്തേണ്ടതില്ല, പുതിയ വരികൾ (rows) മാത്രം ചേർത്താൽ മതി.
  • Layer 2: Metadata configuration – ബന്ധങ്ങൾ കോഡ് ചെയ്ത SQL വഴിയല്ല, മറിച്ച് കോൺഫിഗറേഷൻ ഫയലുകൾ വഴിയാണ് പ്രഖ്യാപിക്കുന്നത്. ഇത് മോഡലിനെ എളുപ്പത്തിൽ കൈകാര്യം ചെയ്യാനും മാറ്റങ്ങൾ വരുത്താനും സഹായിക്കുന്നു.
  • Layer 3: Automatic compiler – കംപൈലർ മെറ്റാഡാറ്റ വായിക്കുകയും ടേബിളുകളെ അബ്സ്ട്രാക്റ്റ് ആശയങ്ങളുമായി (abstract concepts) ബന്ധിപ്പിക്കുന്ന യൂണിഫൈഡ് വ്യൂകൾ (unified views) നിർമ്മിക്കുകയും ചെയ്യുന്നു.
  • Layer 4: Purpose-built models – ഒരു മോഡൽ വേഗത്തിലുള്ള വിവരശേഖരണത്തിനായി (fact retrieval) ഉപയോഗിക്കുമ്പോൾ, മറ്റൊന്ന് ഗ്രാഫിലൂടെയുള്ള യുക്തിപരമായ ചിന്തയ്ക്കും (abstract reasoning), മൂന്നാമത്തേത് ഗവേണൻസിനും പെർമിഷനുകൾക്കും വേണ്ടി ഉപയോഗിക്കുന്നു.
  • Layer 5: Cortex agent layer – ഉപയോക്താവിന്റെ ഉദ്ദേശ്യം (intent) മനസ്സിലാക്കി ഏത് മോഡലിൽ നിന്നാണ് വിവരങ്ങൾ ചോദിക്കേണ്ടതെന്ന് തീരുമാനിക്കുന്ന ഒരു ഇന്റലിജന്റ് റൂട്ടിംഗ് എൻജിൻ.

ഈ പാളികൾ കൈകൊണ്ട് നിർമ്മിക്കുന്നത് ഡാറ്റാ മോഡലിംഗ്, സ്കീമ വിശകലനം, കസ്റ്റം കോഡ് എന്നിവ ഉൾപ്പെടെ മാസങ്ങൾ നീണ്ടുനിൽക്കുന്ന ജോലിയാണ്. Snowflake-ന്റെ Ontology Stack Builder ഈ ജോലിയുടെ ഭൂരിഭാഗവും ഓട്ടോമേറ്റ് ചെയ്യുന്നു.

Stack Builder എങ്ങനെ പ്രവർത്തിക്കുന്നു

നിലവിലുള്ള Snowflake സ്കീമ പരിശോധിക്കുകയും, സാധ്യമായ എൻ്റിറ്റി ടൈപ്പുകളും ബന്ധങ്ങളും നിർദ്ദേശിക്കുകയും ചെയ്യുന്ന ഒരു ഇന്ററാക്ടീവ് വർക്ക്ഫ്ലോ ആണ് ഈ ടൂൾ നൽകുന്നത്. അനലിസ്റ്റുകൾക്ക് ഒരു വിഷ്വൽ എഡിറ്റർ ഉപയോഗിച്ച് ഇവ സ്ഥിരീകരിക്കാനോ മാറ്റം വരുത്താനോ കഴിയും. ഓന്റോളജി നിർവചിച്ചു കഴിഞ്ഞാൽ, Builder നോഡ്/എഡ്ജ് ടേബിളുകൾ നിർമ്മിക്കുകയും, മെറ്റാഡാറ്റ പൂരിപ്പിക്കുകയും, യൂണിഫൈഡ് വ്യൂകൾ നിർമ്മിക്കുന്നതിനായി ഓട്ടോമാറ്റിക് കംപൈലർ പ്രവർത്തിപ്പിക്കുകയും ചെയ്യുന്നു. ഒരു മിതമായി വലുപ്പമുള്ള വെയർഹൗസിനായി ഒരു മണിക്കൂറിനുള്ളിൽ ഈ പ്രക്രിയ പൂർത്തിയാക്കാം.

സംരംഭങ്ങൾക്ക് ലഭിക്കുന്ന നേട്ടങ്ങൾ

  • Faster AI integration – ഡാറ്റാ വെയർഹൗസിലെ റോ SQL നിർമ്മാണത്തിനായി കഷ്ടപ്പെടുന്നതിന് പകരം, ടീമുകൾക്ക് LLM-കളെ സെമാന്റിക് ആയി സമ്പന്നമായ ഒരു പാളിയിലേക്ക് നേരിട്ട് ബന്ധിപ്പിക്കാം.
  • Reduced maintenance – പുതിയൊരു ഡാറ്റാ സോഴ്സ് ചേർക്കാൻ നോഡ്/എഡ്ജ് ടേബിളുകളിൽ പുതിയ വരികൾ ചേർക്കുന്നത് മാത്രം മതി; മെറ്റാഡാറ്റയും കംപൈൽ ചെയ്ത വ്യൂകളും തനിയെ അപ്‌ഡേറ്റ് ചെയ്യപ്പെടും.
  • Governance baked in – നിയന്ത്രിത വ്യവസായങ്ങൾക്ക് (regulated industries) അത്യാവശ്യമായ ഒന്നായ, ആർക്കൊക്കെ ഏതെല്ലാം എൻ്റിറ്റികൾ കാണാം എന്ന് തീരുമാനിക്കുന്ന പെർമിഷൻ മോഡൽ ഇതിൽ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്.

ചുരുക്കത്തിൽ

മാസങ്ങൾ നീണ്ടുനിൽക്കുന്ന കഠിനമായ മോഡലിംഗ് ജോലിയെ ഒരു മണിക്കൂർ വർക്ക്ഫ്ലോയാക്കി മാറ്റുന്നതിലൂടെ, LLM-കൾക്ക് ആവശ്യമായ ബിസിനസ്സ് സെമാന്റിക്സ് നൽകാൻ Snowflake സംരംഭങ്ങൾക്ക് പ്രായോഗികമായ ഒരു വഴി കാണിച്ചുതരുന്നു. ഇതിന്റെ ഫലം, ഉപയോക്താവിന്റെ ഉദ്ദേശ്യം മനസ്സിലാക്കാൻ കഴിയുന്ന ഒരു AI ആണ്.