DeepSeek തങ്ങളുടെ V4 Pro general-availability (GA) മോഡൽ പുറത്തിറക്കി. പ്രിവ്യൂ ബിൽഡിനെ (preview build) അപേക്ഷിച്ച് ഇത് reasoning-token ഉപയോഗം 18% മുതൽ 62% വരെ കുറയ്ക്കുന്നതായി ആദ്യകാല അളവെടുപ്പുകൾ കാണിക്കുന്നു. ഓരോ ടോക്കണിനും പണം നൽകുന്നവർക്ക് ഇത് വളരെ പ്രധാനമാണ്: ഒരേ പ്രോംപ്റ്റുകൾക്ക് ഇപ്പോൾ കുറഞ്ഞ ചിലവ് മാത്രം മതിയാകും, അതേസമയം സമാനമായ ഔട്ട്പുട്ട് തന്നെ ലഭിക്കുകയും ചെയ്യും.
എന്തുകൊണ്ടാണ് ഈ താരതമ്യം ഉണ്ടായത്
ഒരു ബ്ലോഗ് പോസ്റ്റോ ചേഞ്ച്ലോഗോ (changelog) ഇല്ലാതെയാണ് GA റിലീസ് വന്നത്, അതിനാൽ ഡെവലപ്പർമാർക്ക് വ്യത്യാസങ്ങൾ സ്വയം കണ്ടെത്തേണ്ടി വന്നു. ഒരു കമ്മ്യൂണിറ്റി ടെസ്റ്റ് രണ്ട് പതിപ്പുകളിലും ഒരേ ജോലികൾ ചെയ്യിച്ചപ്പോൾ ഏറ്റവും വലിയ മാറ്റം കണ്ടെത്തി—മറുപടി നൽകുന്നതിന് മുമ്പ് മോഡൽ "ചിന്തിക്കാൻ" (thinking) ഉപയോഗിക്കുന്ന ടോക്കണുകളിൽ വലിയ കുറവുണ്ടായി. ലളിതമായ കാര്യങ്ങൾ തിരയുമ്പോൾ (trivial look-ups) GA മോഡൽ 62% കുറഞ്ഞ reasoning ടോക്കണുകൾ ഉപയോഗിച്ചു; കൂടുതൽ സങ്കീർണ്ണമായ ചോദ്യങ്ങളിൽ ഈ കുറവ് 18% ആയിരുന്നു.
ടോക്കൺ കാര്യക്ഷമതയും അതിന്റെ സ്വാധീനവും
ഒരു സാധാരണ എക്സ്ട്രാക്ഷൻ വർക്ക്ഫ്ലോയിൽ (extraction workflow), ഒരു പ്രോംപ്റ്റിൽ നിന്ന് ഏതാനും ഫീൽഡുകൾ വേർതിരിച്ചെടുക്കാൻ പ്രിവ്യൂ ബിൽഡ് 159 reasoning ടോക്കണുകൾ ഉപയോഗിച്ചിരുന്നു. "thinking" ഫീച്ചർ ഡിസേബിൾ ചെയ്തുകൊണ്ട് GA ബിൽഡിലേക്ക് മാറുമ്പോൾ ആ എണ്ണം 40 ടോക്കണുകളായി കുറയുന്നു. മീറ്റർ ചെയ്ത പ്ലാനുകൾ (metered plans) ഉപയോഗിക്കുന്നവർക്ക്, പ്രത്യേകിച്ച് വലിയ തോതിൽ ഉപയോഗിക്കുമ്പോൾ, ഈ ലാഭം നേരിട്ട് കുറഞ്ഞ ബില്ലുകളായി മാറുന്നു.
JSON എക്സ്ട്രാക്ഷൻ: ഒളിഞ്ഞിരിക്കുന്ന തടസ്സം
"thinking" മോഡ് ഓൺ ആയിരിക്കുമ്പോൾ രണ്ട് ബിൽഡുകളും പരാജയപ്പെടുന്നു: അവ JSON സ്കീമ പരിശോധനയിൽ വിജയിക്കുമെങ്കിലും തെറ്റായ സംഖ്യാ മൂല്യങ്ങൾ (numeric values) നൽകുന്നു. "thinking" ഓഫ് ചെയ്യുമ്പോൾ GA പതിപ്പ് മാത്രമേ ശരിയായ JSON നൽകുന്നുള്ളൂ. സ്ട്രക്ചേർഡ് ഔട്ട്പുട്ട് (structured output) ആവശ്യമുള്ള ടീമുകൾ എക്സ്ട്രാക്ഷൻ ജോലികൾക്കായി thinking flag ഡിസേബിൾ ചെയ്യണം, അല്ലെങ്കിൽ അവർക്ക് വ്യാകരണപരമായി ശരിയായതും എന്നാൽ സംഖ്യാപരമായി തെറ്റായതുമായ ഡാറ്റ ലഭിക്കും.
റിഫ്യൂസൽ ഹാൻഡ്ലിംഗ് രീതി മാറുന്നു
പ്രിവ്യൂ മോഡലിന് ഉത്തരം നൽകാൻ കഴിയില്ലെന്ന് തോന്നുന്ന ചോദ്യങ്ങൾ "I do not know" എന്ന് മറുപടി നൽകി നിരസിക്കാൻ കഴിയുമായിരുന്നു. GA മോഡൽ ഇനി ഇത് ചെയ്യില്ല. പകരം, മറുപടി നൽകാതെ തന്നെ ടോക്കൺ ബജറ്റ് തീർന്നുപോകുകയോ അല്ലെങ്കിൽ തെറ്റായ മറുപടി (fabricates a response) നിർമ്മിക്കുകയോ ചെയ്യുന്നു. ഈ മാറ്റം ടോക്കൺ കാര്യക്ഷമത വർദ്ധിപ്പിക്കുന്നുണ്ടെങ്കിലും, അറിയപ്പെടാത്ത വിഷയങ്ങളിൽ മോഡൽ തെറ്റായ വിവരങ്ങൾ നൽകുന്നത് (hallucinating) തടയാൻ സഹായിച്ചിരുന്ന ഒരു സുരക്ഷാ കവചം ഇത് ഇല്ലാതാക്കുന്നു.
വിശ്വാസ്യതയിലെ വർദ്ധനവ്
പ്രിവ്യൂ ബിൽഡിലെ ഒരു അപകടകരമായ ലൂപ്പ്—ചെറിയൊരു "thinking" ബജറ്റ് കാരണം സംഭവിക്കുന്നത്—8,192 ടോക്കൺ വിൻഡോ നിറയുന്നത് വരെ ഒരേ ടെക്സ്റ്റ് തന്നെ ആവർത്തിക്കാൻ മോഡലിനെ പ്രേരിപ്പിക്കുമായിരുന്നു. GA റിലീസ് ഈ ബഗ് പരിഹരിക്കുന്നു, ഇത് മുമ്പ് റിക്വസ്റ്റ് വിൻഡോ തീർക്കാനും ചിലവ് വർദ്ധിപ്പിക്കാനും കാരണമായ ആവർത്തനങ്ങൾ അവസാനിപ്പിക്കുന്നു.
ഉപയോക്താക്കൾ ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- കുറഞ്ഞ ടോക്കൺ ഉപയോഗത്തിനായി GA ബിൽഡ് ഉപയോഗിക്കുക. ജോലിയുടെ സങ്കീർണ്ണത പരിഗണിക്കാതെ തന്നെ ടോക്കൺ ഉപയോഗത്തിൽ കുറവ് കാണപ്പെടുന്നു.
- JSON അല്ലെങ്കിൽ സ്ട്രക്ചേർഡ് ഡാറ്റ എക്സ്ട്രാക്ഷൻ ചെയ്യുമ്പോൾ “thinking” ഓഫ് ചെയ്യുക. ഇത് ശരിയായ മൂല്യങ്ങൾ നൽകുകയും ടോക്കൺ ഉപയോഗം കുറയ്ക്കുകയും ചെയ്യുന്നു.
- മോഡൽ ചോദ്യങ്ങൾ നിരസിക്കുമെന്ന് പ്രതീക്ഷിക്കരുത്. ഒരു പ്രോംപ്റ്റ് പരിശോധിക്കാൻ കഴിയാത്ത വിവരങ്ങൾ ചോദിക്കുകയാണെങ്കിൽ പോലും GA മോഡൽ ഒരു ഉത്തരം നൽകിയേക്കാം, അതിനാൽ ഡാറ്റ പരിശോധന (validation) അത്യാവശ്യമാണ്.
- പീക്ക് സമയങ്ങളിലെ ബില്ലിംഗ് ശ്രദ്ധിക്കുക. പുതിയ നിരക്ക് നിയമങ്ങൾ അനുസരിച്ച്, തിരക്കുള്ള സമയങ്ങളിലെ ടോക്കൺ ഉപയോഗം മൊത്തം ചിലവിനെ മുമ്പത്തേക്കാൾ വേഗത്തിൽ ബാധിച്ചേക്കാം.
ചുരുക്കത്തിൽ
DeepSeek-ന്റെ V4 Pro GA മോഡൽ 62% വരെ കുറഞ്ഞ reasoning ടോക്കണുകൾ നൽകിക്കൊണ്ട് കാര്യക്ഷമതയിൽ വലിയ നേട്ടം നൽകുന്നു കൂടാതെ ഒരു പ്രധാനപ്പെട്ട ആവർത്തന ബഗ്ഗും പരിഹരിക്കുന്നു. എന്നിരുന്നാലും, വ്യക്തമായ റിഫ്യൂസൽ മറുപടികളുടെ അഭാവവും കൃത്യമായ JSON ഔട്ട്പുട്ടിനായി thinking ഓഫ് ചെയ്യേണ്ടി വരുന്നതും പുതിയ വെല്ലുവിളികളാണ്. തങ്ങളുടെ പൈപ്പ്ലൈനുകൾ (pipelines) അനുയോജ്യമായ രീതിയിൽ മാറ്റം വരുത്തുന്ന ടീമുകൾക്ക് പ്രവർത്തനക്ഷമത കുറയ്ക്കാതെ തന്നെ ചിലവ് കുറയ്ക്കാൻ സാധിക്കും.
Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
