OpenAI đã chính thức mở rộng khả năng chuyển đổi giọng nói thành văn bản với việc phát hành GPT Transcribe và GPT Live Transcribe. Các mô hình dựa trên API mới này nhằm cung cấp khả năng chuyển soạn tốc độ cao, tiết kiệm chi phí cho cả xử lý theo lô (batch processing) và các ứng dụng phát trực tuyến thời gian thực (real-time streaming).

Tốc độ, Độ chính xác và Cải thiện về Giá cả

Bản phát hành mới giới thiệu hai quy trình làm việc riêng biệt: GPT Transcribe, được thiết kế để xử lý các tệp âm thanh đã ghi âm sẵn, và GPT Live Transcribe, được tối ưu hóa cho việc phát trực tuyến thời gian thực với độ trễ thấp. Một thành tựu kỹ thuật nổi bật là tốc độ của GPT Transcribe, có thể xử lý các tệp âm thanh nhanh hơn khoảng 34 lần so với thời gian thực.

Về độ chính xác, OpenAI đã có những bước tiến đáng kể. Theo tiêu chuẩn AA-WER của Artificial Analysis, GPT Transcribe đạt tỷ lệ lỗi từ (Word Error Rate - WER) là 3,31%. Điều này thể hiện mức cải thiện 0,7 điểm phần trăm so với phiên bản tiền nhiệm, GPT-4o Transcribe. Đi kèm với bước nhảy vọt về độ chính xác này là mức giảm giá 25%, với mức giá mới được ấn định là 0,0045 USD mỗi phút âm thanh. Để tăng cường độ chính xác theo ngữ cảnh, cả hai mô hình đều hỗ trợ đưa vào ngữ cảnh văn bản, các từ khóa cụ thể và nhiều ngôn ngữ đầu vào.

Bối cảnh Cạnh tranh: OpenAI đối đầu với các "Gã khổng lồ"

Mặc dù có những cải tiến, OpenAI vẫn đang trong một cuộc đua gay gắt để giành vị thế thống trị về giọng nói, hiện đang tụt lại phía sau các đơn vị dẫn đầu chuyên biệt về độ chính xác thuần túy. Bảng xếp hạng AA-WER cho thấy tỷ lệ lỗi 3,31% của OpenAI hiện đang bị vượt qua bởi một số đối thủ cạnh tranh chính:

  • ElevenLabs: Dẫn đầu ngành với mô hình Scribe v2, sở hữu tỷ lệ lỗi vượt trội 2,3%.
  • Google: Mô hình Gemini 3 Pro theo sát với tỷ lệ lỗi 2,9%.
  • Mistral: Mô hình Voxtral Small giữ vị trí vững chắc với tỷ lệ lỗi 3%.

Ngoài độ chính xác, chiến trường cũng đang chuyển dịch sang cạnh tranh về giá. Mistral gần đây đã thực hiện chiến lược cạnh tranh bằng mức giá thấp hơn trên thị trường với Voxtral Transcribe V2, có mức giá khởi điểm cực kỳ hấp dẫn là 0,003 USD mỗi phút.

Tích hợp với Hệ sinh thái OpenAI

Các mô hình chuyển soạn này không phải là các công cụ độc lập; chúng là những thành phần không thể thiếu trong chiến lược đa phương thức (multimodal) rộng lớn hơn của OpenAI. Chúng được thiết kế để bổ trợ cho thế hệ mô hình Realtime vừa được công bố gần đây, bao gồm mô hình GPT-Realtime-Whisper. Bằng cách cung cấp cả khả năng chuyển soạn theo lô tốc độ cao và phát trực tuyến thời gian thực với độ trễ thấp, OpenAI đang định vị mình để phục vụ một lượng lớn các nhà phát triển—từ những người xây dựng trợ lý cuộc họp tự động đến những người tạo ra các dịch vụ dịch thuật thời gian thực.

Đối với bức tranh AI rộng lớn hơn, sự phát triển này báo hiệu một sự chuyển dịch từ "độ chính xác bằng mọi giá" sang sự tối ưu hóa cân bằng hơn giữa tốc độ, chi phí và độ chính xác. Mặc dù OpenAI có thể không nắm giữ danh hiệu có tỷ lệ lỗi thấp nhất, nhưng khả năng mang lại hiệu quả đáng kể giúp họ trở thành một đối thủ đáng gờm trong thị trường AI cấp độ sản xuất (production-grade).

Những điểm chính cần lưu ý

  • Cải thiện hiệu suất: GPT Transcribe giảm tỷ lệ lỗi từ (WER) xuống còn 3,31% và xử lý âm thanh nhanh hơn 34 lần so với thời gian thực.
  • Hiệu quả chi phí: OpenAI đã cắt giảm giá chuyển soạn xuống 25%, đưa chi phí xuống còn 0,0045 USD mỗi phút.
  • Áp lực cạnh tranh: OpenAI vẫn tụt lại sau ElevenLabs (WER 2,3%) và Google (WER 2,9%) về độ chính xác, trong khi Mistral dẫn đầu về giá.

OpenAI đã triển khai hai API speech-to-text mới—GPT Transcribe cho các tệp theo lô và GPT Live Transcribe cho phát trực tuyến—hứa hẹn tốc độ xử lý nhanh hơn 34 lần và mức giảm giá 25%, đưa chi phí xuống còn 0,0045 USD mỗi phút.

Việc ra mắt diễn ra trong bối cảnh các nhà phát triển đang ráo riết tìm kiếm các dịch vụ chuyển soạn có thể theo kịp các tập dữ liệu âm thanh ngày càng lớn trong khi vẫn phải duy trì biên lợi nhuận mỏng.

Tại sao bản nâng cấp này lại quan trọng

GPT Live Transcribe bổ sung tính năng phát trực tuyến với độ trễ thấp, nghĩa là các nhà phát triển có thể đưa nguồn âm thanh trực tiếp từ micro vào API và nhận văn bản gần như ngay lập tức. Cả hai mô hình đều chấp nhận ngữ cảnh văn bản bổ sung, các gợi ý từ khóa và đầu vào đa ngôn ngữ, giúp hệ thống theo dõi được các thuật ngữ chuyên ngành.

Độ chính xác cũng được cải thiện. Tiêu chuẩn AA-WER từ Artificial Analysis ghi nhận tỷ lệ lỗi từ (WER) là 3,31% cho GPT Transcribe, giảm 0,7 điểm so với mô hình GPT-4o Transcribe

  • ElevenLabs’ Scribe v2 at 2.3 percent
  • Google’s Gemini 3 Pro at 2.9 percent
  • Mistral’s Voxtral Small at 3 percent

Mistral’s recent Voxtral Transcribe V2 even undercuts OpenAI on price, offering transcription at $0.003 per minute. Those numbers create a clear trade-off: developers must decide whether they value the cheapest per-minute rate, the smallest error margin, or the integration convenience that OpenAI’s broader ecosystem provides.

What developers gain – and what they lose

Speed and cost are the headline benefits. A batch job that previously required a full hour of compute now finishes much faster, freeing up GPU time for other workloads. The $0.0045-per-minute rate also reduces the cost of a ten-hour transcription compared with previous pricing, a modest but tangible saving when scaled to thousands of hours.

Ecosystem synergy is another selling point. The new models sit alongside OpenAI’s multimodal offerings, including the recently announced Realtime model generation and GPT-Realtime-Whisper. A single API key can therefore power image generation, chat, and now fast transcription without stitching together disparate providers. For teams already embedded in the OpenAI stack, that uniformity reduces authentication overhead and simplifies billing.

Accuracy trade-offs remain the primary concern. A 3.31 percent WER still translates to roughly one mistake every thirty words in noisy or domain-specific audio. Applications like medical dictation or legal transcription, where errors carry higher risk, may still favor ElevenLabs or Google despite higher costs. The ability to feed custom keywords and context mitigates the gap, but it requires extra engineering effort.

The broader market shift

OpenAI’s pricing move signals a pivot from “accuracy at any cost” toward a more balanced formula of speed, cost and precision. The speech-to-text market has traditionally been split: boutique firms chase the lowest error rates, cloud giants compete on scale, and newer entrants fight on price. By compressing the price axis while delivering a respectable error rate and extreme throughput, OpenAI forces rivals to reconsider their own pricing structures.

Mistral’s aggressive $0.003-per-minute offering already pressures OpenAI to keep its rates competitive. ElevenLabs and Google, with larger research budgets, may respond by tightening integration hooks or bundling transcription with other premium services. The next few quarters could see a wave of “pay-as-you-go” tiers, volume discounts, or developer-friendly SDKs aimed at locking in long-term usage.

Counter-point: when the cheapest isn’t enough

The headline numbers hide a nuance that matters to real-world deployments. A 0.7-point WER improvement over GPT-4o is meaningful, but the absolute error rate still lags behind the top three competitors. For developers building products where transcription errors directly affect user trust—such as live subtitles for broadcast or compliance-critical logs—choosing the lowest-error model may outweigh any cost savings.

Moreover, the speed advantage hinges on the ability to feed audio to the API at a high rate. Projects limited by network bandwidth or constrained by edge-device processing may not realize the full 34× speed gain, diluting the cost benefit. In those scenarios, a locally hosted model with comparable accuracy could be more practical, even if the per-minute price appears higher on paper.

What to watch next

  • Pricing elasticity: Will Mistral’s sub-$0.003 rate trigger a price war, or will OpenAI hold steady at $0.0045?
  • Developer adoption metrics: Early usage data from the API marketplace will reveal whether speed or price drives most of the traffic.
  • Regulatory scrutiny: As transcription becomes more ubiquitous, data-privacy rules could affect which providers are viable for sensitive industries.

Takeaway

OpenAI’s GPT Transcribe and GPT Live Transcribe deliver a rare combination of ultra-fast processing and a noticeable price cut, positioning the company as a cost-effective alternative for developers who value speed and ecosystem cohesion over the absolute lowest error rate.