Sự thay đổi giá API hiếm khi gây ra sự chú ý. Không có cảnh báo trên trang trạng thái, không có thông báo ngừng hỗ trợ, và thường cũng không có email thông báo hàng loạt. Các con số trên trang giá của nhà cung cấp chỉ đơn giản là thay đổi, và lần tới khi tác vụ xử lý hàng loạt của bạn hoàn tất, hóa đơn sẽ trông khác hẳn. Đó chính xác là những gì đã xảy ra với Novita và StreamLake. Cả hai nền tảng đều đã cập nhật bảng giá LLM của họ, và nếu bạn đang chạy các khối lượng công việc suy luận (inference workloads) trên bất kỳ dịch vụ nào trong số này, bạn cần xem xét lại các con số mới trước khi bắt đầu tác vụ tiếp theo.
Mối đe dọa thầm lặng từ việc thay đổi mục tiêu giá cả
Hầu hết các đội ngũ kỹ sư đều giám sát thời gian hoạt động (uptime), độ trễ (latency) và độ chính xác của token với sự tập trung cao độ. Tuy nhiên, chi phí trên mỗi nghìn token thường chỉ được liếc qua một lần trong quá trình bắt đầu dự án rồi sau đó dần bị lãng quên. Đó là một sai lầm. Trong các ứng dụng có lưu lượng lớn—như chatbot hỗ trợ khách hàng, quy trình tóm tắt tài liệu, công cụ tạo mã—sự thay đổi dù chỉ một phần nhỏ của một cent cho mỗi token cũng sẽ tích tụ thành áp lực ngân sách đáng kể vào cuối tháng.
Khác với việc ngừng hỗ trợ một tính năng vốn buộc phải thay đổi mã nguồn ngay lập tức, một bản cập nhật giá cả sẽ không làm ảnh hưởng đến việc tích hợp của bạn. Các yêu cầu của bạn vẫn trả về mã trạng thái 200. Các payload JSON của bạn vẫn trông chính xác. Sự khác biệt duy nhất nằm ở hóa đơn. Vào thời điểm bộ phận tài chính phát hiện ra sự sai lệch, bạn có thể đã tiêu hết ngân sách suy luận của cả một sprint. Cả Novita và StreamLake đều vừa thay đổi cấu trúc giá gần đây, điều đó có nghĩa là bất kỳ quy trình tự động, bài kiểm tra staging hoặc khối lượng công việc production nào đang truy cập vào các endpoint của họ đều có thể đang tốn kém hơn, hoặc ít hơn, so với dự kiến của bạn. Đoán mò không phải là một chiến lược.
Những gì chúng ta biết về các bản cập nhật mới nhất
Các bảng giá đã công bố của Novita và StreamLake đều đã thay đổi. Mặc dù mức chênh lệch chính xác sẽ khác nhau tùy theo cấp độ mô hình và loại token, nhưng thông điệp cốt lõi là giống nhau: những giả định bạn đưa ra vào tháng trước về chi phí suy luận có thể không còn đúng nữa. Novita, đơn vị cung cấp hàng loạt API mô hình ngôn ngữ lớn cùng với các dịch vụ đám mây GPU, đã điều chỉnh cách tính phí truy cập mô hình. StreamLake, hoạt động như một nhà cung cấp hạ tầng AI và đám mây rộng lớn hơn, cũng đã sửa đổi lịch trình giá LLM tương tự.
Vì các nền tảng này cấu trúc chi phí khác nhau—một số tách biệt token đầu vào và đầu ra, một số gộp chúng lại, một số cộng thêm phí phụ thu cho cửa sổ ngữ cảnh dài hoặc các endpoint có thông lượng cao—bạn không thể áp dụng một cách an toàn các ước tính cũ cho một tác vụ mới. Một quy trình làm việc vốn tiết kiệm vào thứ Hai có thể vượt quá ngưỡng chịu đựng vào thứ Tư nếu hệ số nhân token đầu ra thay đổi hoặc nếu một cấp độ giảm giá được cấu trúc lại. Chi tiết về các thay đổi tỷ lệ cụ thể được ghi lại trong báo cáo dành cho nhà phát triển gốc. Bạn nên coi báo cáo đó là nguồn sự thật duy nhất, chứ không phải là bản tóm tắt từ bên thứ ba.
Cách đọc bảng giá LLM
Trước khi bạn có thể so sánh chi phí cũ với chi phí mới, bạn cần biết chính xác mình đang xem cái gì. Hầu hết các nhà cung cấp chia giá thành một vài đòn bẩy riêng biệt, và Novita cùng StreamLake cũng không ngoại lệ.
Thứ nhất, hãy tách biệt token đầu vào (input tokens) và token đầu ra (output tokens). Đầu vào là những gì bạn gửi đến mô hình; đầu ra là những gì mô hình tạo ra. Trong nhiều hệ thống production, khối lượng đầu ra vượt quá khối lượng đầu vào, đặc biệt là trong các tác vụ tóm tắt chat hoặc viết lách sáng tạo. Một nhà cung cấp giảm chi phí đầu vào nhưng tăng chi phí đầu ra thực tế có thể làm tăng tổng hóa đơn của bạn.
Thứ hai, hãy chú ý đến giá theo cửa sổ ngữ cảnh (context-window pricing). Các mô hình ngữ cảnh dài, những mô hình xử lý hàng chục hoặc hàng trăm nghìn token trong một lượt duy nhất, đôi khi đi kèm với mức phí phụ thu không tăng theo tỷ lệ tuyến tính. Nếu ứng dụng của bạn gửi toàn bộ mã nguồn hoặc các tài liệu pháp lý dài dưới dạng prompt, một sự tăng nhẹ trên mỗi token ở cấp độ ngữ cảnh dài sẽ gây tác động mạnh hơn so với một đợt tăng giá chung.
Thứ ba, hãy tìm hiểu các quy tắc về thông lượng (throughput) và tính đồng thời (concurrency). Một số bảng giá cung cấp mức giá thấp hơn cho suy luận theo lô (batched) hoặc ngoại tuyến (offline) nhưng tính phí cao hơn cho truyền phát thời gian thực (real-time streaming). Nếu ứng dụng hướng tới người dùng của bạn dựa trên các phản hồi có độ trễ thấp, bạn có thể bị buộc phải sử dụng cấp độ cao cấp bất kể khối lượng token là bao nhiêu.
Cuối cùng, hãy kiểm tra các chi phí phụ trợ ẩn. Các quy trình tạo tăng cường truy xuất (RAG) thường phải chạm đến các endpoint embedding, kho lưu trữ vector và các API reranking trước khi thực sự chạm đến chính LLM. Mặc dù Novita và StreamLake có thể đã cập nhật giá LLM, nhưng các dịch vụ liền kề trên cùng một hóa đơn cũng có thể đã thay đổi. Hãy đọc toàn bộ trang, đừng chỉ đọc mỗi mức giá trên mỗi triệu token ở tiêu đề.
Tính toán các con số trước khi triển khai lần tới
Once you have the fresh rate card, do not estimate. Measure. Pull your last seven to thirty days of request logs and calculate what that identical workload would cost under the new structure. If you are using a centralized logging tool or an observability dashboard, filter by the provider endpoint and export token counts. Most APIs return usage metadata in the response payload, so you can script this in a few lines of Python.
Start with a representative sample. Pick your busiest day from the previous billing cycle. Multiply the input tokens by the new input rate and the output tokens by the new output rate. Add any context-window or throughput surcharges that apply to your model tier. Compare that synthetic bill against what you actually paid. If the delta crosses your tolerance threshold—say, ten or twenty percent—you have a decision to make.
That decision does not always mean migrating providers. Sometimes it means switching model tiers within the same platform, trimming prompt length, enabling response caching, or throttling non-critical batch jobs to off-peak hours. The point is to make that decision with data rather than discovering the change on the next invoice.
You should also set hard spend caps or budget alerts if the platform supports them. Many API dashboards allow you to configure notification thresholds at the project or key level. Place them conservatively. If Novita or StreamLake push another rate change in the future, you want a financial circuit breaker, not a surprise four-figure overage.
The bigger picture: infrastructure costs are never static
These updates from Novita and StreamLake are reminders that the foundation-model market is still settling. Pricing is not an accident; it reflects compute availability, licensing deals, and competitive positioning. A provider might cut rates to attract volume, then raise them once a user base is locked in. Alternatively, a provider might raise rates to cover the cost of newer, more capable models while grandfathering older ones. Either way, relying on a single provider’s rate card as a constant is poor operational hygiene.
Teams who treat inference as a commodity layer already run multi-provider setups. They route simple queries to the cheapest endpoint that meets a quality bar and reserve expensive models for hard tasks. That architecture requires more upfront wiring, but it insulates you from exactly this kind of quiet price shift. Even if you are not ready to deploy a full routing layer, keeping a secondary provider warm and benchmarked gives you leverage when the primary one moves its prices.
Where to find the exact figures
The granular breakdown of what changed—model by model, token type by token type—is available in the original report. You can read the full details at the source link that tracked these updates. For ongoing discussions about infrastructure pricing, model releases, and cost optimization tactics, the GyaanSetu learning community is active on Telegram.
The takeaway
Do not let a pricing update become a post-mortem. Before you queue up your next training run, batch inference job, or production deployment against Novita or StreamLake, open their current pricing pages and rerun your last week’s numbers against the new rates. If the math still works, proceed with confidence. If it does not, you have the data to renegotiate your pipeline before the meter starts running again. Your future invoice will thank you.
