گوگل روز سه‌شنبه Gemini 3.5 Transcribe را عرضه کرد. این مدل تبدیل گفتار به متن، کلمات پرکننده (filler words) را حذف می‌کند، به واژگان ارائه‌شده توسط کاربر احترام می‌گذارد و تا سه گوینده را در یک ضبط واحد برچسب‌گذاری می‌کند. این سرویس با تبدیل صوت خام به متن صیقل‌خورده و ساختاریافته بدون نیاز به ویرایشگر انسانی، زمان صرف‌شده توسط توسعه‌دهندگان برای پاکسازی متن‌های پیاده‌سازی‌شده جهت یادداشت‌های جلسات، پرونده‌های حقوقی و موارد دیگر را کاهش می‌دهد.

چرا گوگل اکنون این اقدام را انجام داد

پشته پردازش صوتی گوگل سال‌هاست که در حال تکامل است، اما محصول قبلی آن، Chirp 3، همچنان در مواجهه با مکث‌ها، اصطلاحات فنی و تغییر گوینده دچار مشکل بود. دورکاری و پادکست‌سازی بازار پیاده‌سازی متن (transcription) را گسترش داده‌اند، با این حال بسیاری از شرکت‌ها هنوز به پردازش دستی پس از ضبط یا فروشندگان گران‌قیمت و تخصصی متکی هستند. Gemini 3.5 Transcribe به این نقطه اصطکاک پاسخ می‌دهد: مدلی که نه تنها گفتار را تشخیص می‌دهد، بلکه آن را در لحظه ویرایش نیز می‌کند.

مدل جدید دقیقاً چه کاری انجام می‌دهد

  • حذف خودکار کلمات پرکننده – کلماتی مانند "um" و "uh" و تپق‌های مشابه همزمان با تولید متن حذف می‌شوند و خروجی تمیزتری باقی می‌ماند.
  • واژگان سفارشی – کاربران فهرستی از کلمات تخصصی حوزه خود را آپلود می‌کنند تا از «اصلاح» آن‌ها توسط مدل به اصطلاحات عمومی جلوگیری شود. این موضوع برای حوزه‌هایی که پر از مخفف‌ها، نام محصولات یا املای‌های خارجی هستند، اهمیت زیادی دارد.
  • تشخیص گوینده – سیستم تا سه صدای متمایز را شناسایی کرده، به هر گفته یک برچسب گوینده اختصاص می‌دهد و یک برچسب زمانی در سطح کلمه اضافه می‌کند. تیم‌های حقوقی، کاتب‌های پزشکی و روزنامه‌نگاران می‌توانند سوابق دارای کد زمانی را مستقیماً از فایل اصلی تهیه کنند.
  • پوشش چندزبانه – گوگل مدعی بهبود دقت در بیش از ۸۵ زبان است که گامی رو به جلو نسبت به مجموعه محدودتر نسل قبلی محسوب می‌شود.

تمام این قابلیت‌ها در قالب یک API با تمرکز بر توسعه‌دهندگان ارائه شده‌اند. اپلیکیشن‌ها درخواست متن می‌کنند و یک JSON payload دریافت می‌کنند که از قبل شامل متن پاکسازی‌شده، برچسب‌های گوینده و برچسب‌های زمانی است.

عرضه گسترده‌تر صوتی Gemini

Gemini 3.5 Transcribe متعلق به خانواده گسترده‌تری از مدل‌های صوتی است:

  • Gemini 3.5 Live – بهینه‌سازی شده برای تعامل در لحظه، این مدل وقفه‌های میان جمله را بهتر از مدل‌های زنده قبلی مدیریت می‌کند.
  • Gemini 3.5 Live Experimental – یک نسخه با سطح استدلال بالاتر که هنگام حل وظایف پیچیده، مراحل تفکر گام‌به‌گام خود را روایت می‌کند.

هر دو مدل زنده در حال حاضر به زبان انگلیسی در اپلیکیشن Gemini برای macOS و از طریق ویژگی دیکته Rambler در اندروید در مناطق محدودی در دسترس هستند.

چه کسانی سود خواهند برد

توسعه‌دهندگان می‌توانند یک خط لوله (pipeline) «پاکسازی همزمان با صحبت کردن» را در ابزارهای همکاری، پلتفرم‌های تولید محتوا و دستیارهای صوتی بگنجانند. شرکت‌ها می‌توانند متن‌های آماده برای انتشار تولید کنند و وابستگی خود را به خدمات شخص ثالث که بر اساس دقیقه هزینه دریافت می‌کنند و بندهای سختگیرانه‌ای برای مدیریت داده‌ها دارند، کاهش دهند. تولیدکنندگان محتوا می‌توانند زیرنویس‌های صیقل‌خورده را بدون نیاز به مرحله ویرایش جداگانه منتشر کنند و سرعت تولید ویدیو و پادکست را افزایش دهند.

چه کسانی ممکن است آسیب ببینند

فروشندگان تخصصی پیاده‌سازی متن که برای تشخیص گوینده (speaker diarization) و مدیریت اصطلاحات تخصصی نرخ‌های بالایی دریافت می‌کنند، ممکن است با کاهش تقاضا مواجه شوند، به‌ویژه در میان استارت‌آپ‌های حساس به هزینه. محدودیت سه گوینده در این مدل همچنین ممکن است سازمان‌های بزرگتر را به سمت راهکارهای اختصاصی که از شرکت‌کنندگان بیشتری در یک تماس واحد پشتیبانی می‌کنند، سوق دهد.

محدودیت‌ها و پرسش‌های بی‌پاسخ

  • تعداد گویندگان – در هر فایل تنها سه گوینده قابل تشخیص است؛ جلساتی با پنل‌های بزرگتر همچنان به ابزارهای خارجی نیاز خواهند داشت.
  • عرضه زبانی – پشتیبانی چندزبانه اعلام شده است، اما مدل‌های زنده همچنان فقط انگلیسی هستند و کاربران غیرانگلیسی‌زبان باید منتظر عملکرد کامل بمانند.
  • حریم خصوصی – مانند هر سرویس گفتاری مبتنی بر ابری، شرکت‌ها باید راحتی زیرساخت گوگل را در مقابل نیاز به دور نگه داشتن صداهای حساس از سرورهای خارجی بسنجند. شرایط گوگل اجازه استقرار در محل (on-premise) را برای مشتریان خاصی می‌دهد، اما این گزینه هنوز عمومی نشده است.

آنچه باید در آینده زیر نظر داشت

گوگل به به‌روزرسانی‌های آینده اشاره کرده است که سقف تعداد گویندگان را افزایش داده و پوشش مدل‌های زنده را به زبان‌های بیشتری گسترش می‌دهد. زیر نظر گرفتن سطوح قیمت‌گذاری API نیز ضروری خواهد بود؛ هزینه بالای هر دقیقه می‌تواند سود حاصل از بهره‌وری را برای کاربران با حجم بالا از بین ببرد. در نهایت، منحنی پذیرش در میان توسعه‌دهندگان مشخص خواهد کرد که آیا راحتیِ حذف خودکار کلمات پرکننده بر خطاهای باقی‌مانده در واژگان تخصصی غلبه می‌کند یا خیر.

نکته کلیدی: Gemini 3.5 Transcribe کار خسته‌کننده اصلاح ضبط‌های صوتی را به یک فراخوانی واحد API تبدیل می‌کند و ابزاری آماده برای دستیابی به متنی تمیز و دارای برچسب گوینده در اختیار توسعه‌دهندگان قرار می‌دهد. موفقیت آن به این بستگی دارد که گوگل با چه سرعتی پشتیبانی از زبان‌ها را گسترش دهد، محدودیت تعداد گویندگان را افزایش دهد و به نگرانی‌های مربوط به حریم خصوصی در سطح سازمانی رسیدگی کند.