ചൊവ്വാഴ്ച ഗൂഗിൾ Gemini 3.5 Transcribe പുറത്തിറക്കി. ഈ speech-to-text മോഡൽ സംസാരത്തിനിടയിലെ അനാവശ്യ വാക്കുകൾ (filler words) ഒഴിവാക്കുകയും, ഉപയോക്താക്കൾ നൽകുന്ന പദാവലികൾ (vocabularies) കൃത്യമായി ഉപയോഗിക്കുകയും, ഒരൊറ്റ റെക്കോർഡിംഗിൽ മൂന്ന് പേർ വരെയുള്ളവരെ തിരിച്ചറിയുകയും ചെയ്യുന്നു. ഒരു മനുഷ്യന്റെ സഹായമില്ലാതെ തന്നെ പച്ചയായ ഓഡിയോയെ മിനുക്കിയെടുത്തതും ഘടനാപരമായതുമായ ടെക്സ്റ്റാക്കി മാറ്റുന്നതിലൂടെ, മീറ്റിംഗ് നോട്ടുകൾ, നിയമപരമായ രേഖകൾ എന്നിവയ്ക്കായി ട്രാൻസ്ക്രിപ്റ്റുകൾ വൃത്തിയാക്കാൻ ഡെവലപ്പർമാർ ചെലവഴിക്കുന്ന സമയം ഈ സേവനം കുറയ്ക്കുന്നു.
എന്തുകൊണ്ടാണ് ഗൂഗിൾ ഇപ്പോൾ ഇത് അവതരിപ്പിക്കുന്നത്
ഗൂഗിളിന്റെ ഓഡിയോ പ്രോസസ്സിംഗ് സാങ്കേതികവിദ്യ വർഷങ്ങളായി വികസിച്ചുകൊണ്ടിരിക്കുകയാണ്, എങ്കിലും അതിന്റെ മുൻപത്തെ മോഡലായ Chirp 3, സംസാരത്തിനിടയിലെ ഇടവേളകൾ, സാങ്കേതിക പദങ്ങൾ, സംസാരിക്കുന്നവർ മാറുന്നത് എന്നിവ കൈകാര്യം ചെയ്യുന്നതിൽ പാകപ്പിഴകൾ വരുത്തിയിരുന്നു. റിമോട്ട് വർക്കും പോഡ്കാസ്റ്റിംഗും ട്രാൻസ്ക്രിപ്ഷൻ വിപണിയെ വളർത്തിയിട്ടുണ്ടെങ്കിലും, പല കമ്പനികളും ഇപ്പോഴും മാനുവൽ പ്രോസസ്സിംഗിനെയോ അല്ലെങ്കിൽ വലിയ തുക ഈടാക്കുന്ന പ്രത്യേക സേവനദാതാക്കളെയോ ആണ് ആശ്രയിക്കുന്നത്. Gemini 3.5 Transcribe ആ പ്രശ്നത്തിന് പരിഹാരം നൽകുന്നു: സംസാരം തിരിച്ചറിയുക മാത്രമല്ല, അത് തത്സമയം എഡിറ്റ് ചെയ്യുകയും ചെയ്യുന്ന ഒരു മോഡലാണിത്.
പുതിയ മോഡൽ യഥാർത്ഥത്തിൽ എന്താണ് ചെയ്യുന്നത്
- ഓട്ടോമാറ്റിക് ഫില്ലർ വേർഡ് റിമൂവൽ – ട്രാൻസ്ക്രിപ്റ്റ് തയ്യാറാക്കുമ്പോൾ തന്നെ “um”, “uh” തുടങ്ങിയ അനാവശ്യ വാക്കുകൾ ഒഴിവാക്കപ്പെടുന്നു, ഇത് കൂടുതൽ വ്യക്തതയുള്ള വായന നൽകുന്നു.
- കസ്റ്റം പദാവലികൾ (Custom vocabularies) – ഉപയോക്താക്കൾക്ക് പ്രത്യേക മേഖലകളിലെ പദങ്ങളുടെ പട്ടിക അപ്ലോഡ് ചെയ്യാം, ഇത് മോഡൽ ആ പദങ്ങളെ സാധാരണ വാക്കുകളായി തെറ്റായി മാറ്റുന്നത് തടയുന്നു. ചുരുക്കപ്പേരുകൾ (acronyms), ഉൽപ്പന്ന നാമങ്ങൾ അല്ലെങ്കിൽ വിദേശ ഭാഷാ സ്പെല്ലിംഗുകൾ എന്നിവ കൂടുതലായുള്ള മേഖലകളിൽ ഇത് വളരെ പ്രധാനമാണ്.
- സ്പീക്കർ അറ്റ്രിബ്യൂഷൻ (Speaker attribution) – സിസ്റ്റം മൂന്ന് വ്യത്യസ്ത ശബ്ദങ്ങൾ വരെ തിരിച്ചറിയുകയും, ഓരോ വാചകത്തിനും ഒരു സ്പീക്കർ ലേബൽ നൽകുകയും, ഓരോ വാക്കിനും ടൈംസ്റ്റാമ്പ് ചേർക്കുകയും ചെയ്യുന്നു. നിയമവിദഗ്ധർക്കും, മെഡിക്കൽ സ്ക്രൈബ്സിനും, മാധ്യമപ്രവർത്തകർക്കും സോഴ്സ് ഫയലിൽ നിന്ന് നേരിട്ട് ടൈം-കോഡഡ് റെക്കോർഡുകൾ തയ്യാറാക്കാൻ ഇത് സഹായിക്കുന്നു.
- ബഹുഭാഷാ പിന്തുണ – മുൻപത്തെ മോഡലിനേക്കാൾ മികച്ച രീതിയിൽ 85-ലധികം ഭാഷകളിൽ കൃത്യത വർദ്ധിപ്പിച്ചതായി ഗൂഗിൾ അവകാശപ്പെടുന്നു.
ഈ സവിശേഷതകളെല്ലാം ഡെവലപ്പർമാരെ ലക്ഷ്യമിട്ടുള്ള ഒരു API വഴിയാണ് ലഭ്യമാകുന്നത്. ആപ്പുകൾ ഒരു ട്രാൻസ്ക്രിപ്റ്റിനായി അഭ്യർത്ഥിക്കുമ്പോൾ, വൃത്തിയാക്കിയ ടെക്സ്റ്റ്, സ്പീക്കർ ടാഗുകൾ, ടൈംസ്റ്റാമ്പുകൾ എന്നിവ അടങ്ങിയ ഒരു JSON പേലോഡ് അവയ്ക്ക് ലഭിക്കുന്നു.
വിപുലമായ Gemini ഓഡിയോ റോളൗട്ട്
Gemini 3.5 Transcribe എന്നത് വിപുലമായ ഓഡിയോ മോഡലുകളുടെ ഒരു കുടുംബത്തിന്റെ ഭാഗമാണ്:
- Gemini 3.5 Live – തത്സമയ സംഭാഷണങ്ങൾക്കായി രൂപകൽപ്പന ചെയ്ത ഇത്, മുൻപത്തെ ലൈവ് മോഡലുകളെ അപേക്ഷിച്ച് സംസാരത്തിനിടയിലുള്ള തടസ്സങ്ങൾ കൂടുതൽ നന്നായി കൈകാര്യം ചെയ്യുന്നു.
- Gemini 3.5 Live Experimental – സങ്കീർണ്ണമായ ജോലികൾ ചെയ്യുമ്പോൾ അതിന്റെ ചിന്താപ്രക്രിയ ഓരോ ഘട്ടമായി വിവരിക്കുന്ന ഉയർന്ന തലത്തിലുള്ള ഒരു വേരിയന്റാണിത്.
ഈ രണ്ട് ലൈവ് മോഡലുകളും നിലവിൽ macOS Gemini ആപ്പിലും, ചില പ്രദേശങ്ങളിൽ ആൻഡ്രോയിഡിലെ Rambler ഡിക്റ്റേഷൻ ഫീച്ചറിലൂടെയും ഇംഗ്ലീഷിൽ ലഭ്യമാണ്.
ആർക്കൊക്കെ ഇതിന്റെ ഗുണം ലഭിക്കും
ഡെവലപ്പർമാർക്ക് കൊളാബറേഷൻ ടൂളുകളിലും, കണ്ടന്റ് ക്രിയേഷൻ പ്ലാറ്റ്ഫോമുകളിലും, വോയ്സ് അസിസ്റ്റന്റുകളിലും "സംസാരിക്കുമ്പോൾ തന്നെ വൃത്തിയാക്കുന്ന" (clean-as-you-speak) രീതി ഉൾപ്പെടുത്താം. കമ്പനികൾക്ക് നേരിട്ട് പ്രസിദ്ധീകരിക്കാൻ പാകത്തിലുള്ള ട്രാൻസ്ക്രിപ്റ്റുകൾ തയ്യാറാക്കാം; ഇത് മിനിറ്റുകൾക്ക് അനുസരിച്ച് പണം ഈടാക്കുന്നതും കർശനമായ ഡാറ്റാ കൈകാര്യം ചെയ്യൽ നിബന്ധനകളുള്ളതുമായ തേർഡ് പാർട്ടി സേവനങ്ങളെ ആശ്രയിക്കുന്നത് കുറയ്ക്കുന്നു. കണ്ടന്റ് ക്രിയേറ്റർമാർക്ക് പ്രത്യേകം എഡിറ്റിംഗ് ഇല്ലാതെ തന്നെ മികച്ച ക്യാപ്ഷനുകൾ പ്രസിദ്ധീകരിക്കാം, ഇത് വീഡിയോകളുടെയും പോഡ്കാസ്റ്റുകളുടെയും നിർമ്മാണ വേഗത വർദ്ധിപ്പിക്കുന്നു.
ആർക്കൊക്കെ ഇത് വെല്ലുവിളിയായേക്കാം
സ്പീക്കർ തിരിച്ചറിയുന്നതിനും (speaker diarization) സാങ്കേതിക പദങ്ങൾ കൈകാര്യം ചെയ്യുന്നതിനും ഉയർന്ന നിരക്ക് ഈടാക്കുന്ന സ്പെഷ്യലിസ്റ്റ് ട്രാൻസ്ക്രിപ്ഷൻ കമ്പനികളുടെ ഡിമാൻഡ് കുറഞ്ഞേക്കാം, പ്രത്യേകിച്ച് ചെലവ് കുറഞ്ഞ സ്റ്റാർട്ടപ്പുകൾക്കിടയിൽ. ഈ മോഡലിന്റെ മൂന്ന് സ്പീക്കർ പരിധി, ഒരൊറ്റ കോളിൽ കൂടുതൽ ആളുകളെ പിന്തുണയ്ക്കുന്ന മറ്റ് സൊല്യൂഷനുകളിലേക്ക് വലിയ സ്ഥാപനങ്ങളെ ആകർഷിച്ചേക്കാം.
പരിമിതികളും അവശേഷിക്കുന്ന ചോദ്യങ്ങളും
- സ്പീക്കർ എണ്ണം – ഒരു ഫയലിൽ മൂന്ന് സ്പീക്കർമാരെ മാത്രമേ തിരിച്ചറിയാൻ കഴിയൂ; കൂടുതൽ ആളുകളുള്ള മീറ്റിംഗുകൾക്ക് ഇപ്പോഴും മറ്റ് ടൂളുകൾ ആവശ്യമായി വരും.
- ഭാഷാപരമായ ലഭ്യത – ബഹുഭാഷാ പിന്തുണ പ്രഖ്യാപിച്ചിട്ടുണ്ടെങ്കിലും, ലൈവ് മോഡലുകൾ നിലവിൽ ഇംഗ്ലീഷിൽ മാത്രമാണ് ലഭ്യമാകുന്നത്. ഇത് ഇംഗ്ലീഷല്ലാത്ത ഭാഷകൾ ഉപയോഗിക്കുന്നവർക്ക് പൂർണ്ണമായ സേവനം ലഭിക്കാൻ കാത്തിരിക്കേണ്ടി വരും.
- സ്വകാര്യത – മറ്റേതൊരു ക്ലൗഡ് അധിഷ്ഠിത സ്പീച്ച് സർവീസിനെയും പോലെ, ഗൂഗിളിന്റെ ഇൻഫ്രാസ്ട്രക്ചർ നൽകുന്ന സൗകര്യവും സെൻസിറ്റീവ് ആയ ഓഡിയോകൾ എക്സ്റ്റേണൽ സെർവറുകളിൽ നിന്ന് അകറ്റി നിർത്തേണ്ട ആവശ്യകതയും കമ്പനികൾ താരതമ്യം ചെയ്യേണ്ടതുണ്ട്. ഗൂഗിളിന്റെ നിബന്ധനകൾ പ്രകാരം ചില ഉപഭോക്താക്കൾക്ക് ഓൺ-പ്രെമിസ് ഡിപ്ലോയ്മെന്റ് അനുവദനീയമാണ്, എന്നാൽ ആ ഓപ്ഷൻ ഇതുവരെ പൊതുജനങ്ങൾക്ക് ലഭ്യമായിട്ടില്ല.
ഇനി എന്താണ് ശ്രദ്ധിക്കേണ്ടത്
സ്പീക്കർ എണ്ണം വർദ്ധിപ്പിക്കാനും ലൈവ് മോഡലുകൾ കൂടുതൽ ഭാഷകളിലേക്ക് വ്യാപിപ്പിക്കാനും ഭാവിയിൽ അപ്ഡേറ്റുകൾ വരുത്തുമെന്ന് ഗൂഗിൾ സൂചിപ്പിച്ചിട്ടുണ്ട്. API-യുടെ പ്രൈസിംഗ് നിരക്കുകൾ ശ്രദ്ധിക്കേണ്ടതും പ്രധാനമാണ്; മിനിറ്റുകൾക്ക് വലിയ തുക ഈടാക്കുന്നത് കൂടുതൽ ഉപയോഗിക്കുന്നവർക്ക് ഉൽപ്പാദനക്ഷമത കുറയാൻ കാരണമായേക്കാം. അവസാനമായി, ഡെവലപ്പർമാർക്കിടയിലെ ഉപയോഗം പരിശോധിച്ചാൽ മാത്രമേ, ഓട്ടോമാറ്റിക് ഫില്ലർ റിമൂവൽ നൽകുന്ന സൗകര്യം സാങ്കേതിക പദങ്ങളിലെ പിശകുകളെക്കാൾ വലുതാണോ എന്ന് വ്യക്തമാകൂ.
ചുരുക്കത്തിൽ: സംസാരരൂപത്തിലുള്ള റെക്കോർഡിംഗുകൾ പരിഷ്കരിക്കുന്നതിനായുള്ള വിരസമായ ജോലിയെ Gemini 3.5 Transcribe ഒരു സിംഗിൾ API call മാത്രമാക്കി മാറ്റുന്നു, ഇത് ഡെവലപ്പർമാർക്ക് വൃത്തിയുള്ളതും സ്പീക്കർ ടാഗ് ചെയ്തതുമായ ടെക്സ്റ്റുകൾക്കായി ഒരു റെഡിമെയ്ഡ് ടൂൾ നൽകുന്നു. Google എത്ര വേഗത്തിൽ ഭാഷാ പിന്തുണ വ്യാപിപ്പിക്കുന്നു, സ്പീക്കർ പരിധി ഉയർത്തുന്നു, കൂടാതെ എന്റർപ്രൈസ് സ്വകാര്യതാ ആശങ്കകൾ പരിഹരിക്കുന്നു എന്നതിനെ ആശ്രയിച്ചിരിക്കും ഇതിന്റെ വിജയം.
