Hóa đơn hạ tầng LLM hiếm khi gây sốc đột ngột. Chúng tích tụ dần dần—thêm vài đô la cho mỗi nghìn yêu cầu, một sự gia tăng nhẹ trong tỷ lệ token đầu ra, hoặc một sự điều chỉnh cửa sổ ngữ cảnh (context window) làm tăng âm thầm chi phí cho các cuộc hội thoại dài. Đến khi bạn nhận thấy sự thay đổi là thực tế, bạn đã xây dựng xong các quy trình làm việc, các cam kết với khách hàng và dự báo ngân sách dựa trên những con số không còn tồn tại nữa.

Đó là lý do tại sao những đợt điều chỉnh giá mới nhất từ Mancer 2, Novita và StreamLake xứng đáng được bạn chú ý ngay bây giờ thay vì đợi đến quý sau. Không có nền tảng nào trong số này gây chấn động với mức tăng đột ngột gấp mười lần, nhưng những thay đổi nhỏ lẻ từ nhiều nhà cung cấp khác nhau sẽ cộng dồn rất nhanh. Nếu bạn đang vận hành các khối lượng công việc thực tế (production workloads), tinh chỉnh (fine-tune) thường xuyên hoặc điều hướng lưu lượng qua nhiều API, ngay cả một sự điều chỉnh tỷ giá khiêm tốn cũng có thể làm thay đổi hiệu quả kinh tế trên từng đơn vị (unit economics) của bạn.

Tại sao những thay đổi giá nhỏ lại quan trọng ở quy mô lớn

Hầu hết các đội ngũ kỹ thuật chọn API mô hình ngôn ngữ lớn dựa trên các tiêu chuẩn chất lượng và độ trễ. Chi phí có được nhắc đến, nhưng thường chỉ được coi là một ghi chú phụ tĩnh. Trong thực tế, giá cả là một trong những biến số năng động nhất trong hệ thống (stack) của bạn. Việc tính phí dựa trên token có nghĩa là chi phí của bạn tăng tỉ lệ thuận với mức độ sử dụng, nhưng chúng cũng tăng theo hành vi. Các câu lệnh hệ thống (system prompts) dài hơn, các lược đồ đầu ra JSON phức tạp hơn và việc lưu trữ lịch sử trò chuyện đều làm tăng số lượng token. Khi một nhà cung cấp thay đổi biểu giá, tác động không phải là một khoản phí cố định tăng lên. Đó là một hệ số nhân cho mọi tương tác trong tương lai.

Mancer 2, Novita và StreamLake mỗi bên chiếm giữ một phân khúc khác nhau trong thị trường suy luận (inference market), và những điều chỉnh gần đây đối với cả ba có nghĩa là các nhà phát triển—những người từng chỉ dựa vào một bảng tính đơn giản để quản lý chi tiêu API—giờ đây cần một chiến lược giám sát chủ động hơn. Nếu bạn coi những cập nhật này chỉ là những ghi chú hành chính nhỏ nhặt, bạn có nguy cơ chỉ nhận ra tác động sau khi hóa đơn hàng tháng đã gửi đến.

Những gì đã thay đổi và cần tìm hiểu ở đâu

Cập nhật từ Mancer 2

Mancer 2 đã triển khai các thay đổi về giá ảnh hưởng đến cách bạn lập ngân sách cho các điểm cuối (endpoints) của nó. Nếu bạn đang sử dụng Mancer 2 cho lưu lượng thực tế, điều đầu tiên cần xác minh là liệu bản cập nhật ảnh hưởng đến token đầu vào, token đầu ra, hay cả hai. Một số nhà cung cấp chỉ điều chỉnh giá ở phía tạo (generation-side), điều này gây bất lợi cho các ứng dụng trả về đầu ra có cấu trúc và dài. Những nhà cung cấp khác lại tăng chi phí ở phía câu lệnh (prompt side), gây bất lợi cho việc sử dụng kỹ thuật few-shot phức tạp hoặc chèn ngữ cảnh lớn. Nếu không đọc bảng phân tích chi tiết, bạn không thể giả định rằng tác động là đồng nhất. Hãy kiểm tra dữ liệu nhật ký (logging data) của chính bạn với biểu giá mới để xem trường hợp sử dụng nào của bạn trở nên đắt đỏ hơn.

Sự thay đổi giá của Novita

Novita cũng đã thay đổi mức giá của mình. Đối với các đội ngũ sử dụng Novita như một giải pháp thay thế tối ưu hóa chi phí so với các API đám mây lớn hơn, ngay cả một thay đổi nhỏ ở mức một phần nhỏ của cent trên mỗi nghìn token cũng có ý nghĩa khi khối lượng vượt quá hàng triệu. Hạ tầng của Novita thường thu hút các dự án cần thông lượng (throughput) cao mà không muốn chịu thêm phí quản lý nền tảng. Khi phép tính đó thay đổi, bạn cần chạy lại các mô hình chi phí trên mỗi yêu cầu. Hãy đặc biệt chú ý xem liệu Novita có áp dụng giá theo tầng (tiered pricing), điều chỉnh chiết khấu suy luận hàng loạt (bulk-inference discounts), hay cấu trúc lại các giới hạn của gói miễn phí hay không. Bất kỳ đòn bẩy nào trong số đó cũng có thể biến một khối lượng công việc từ "lựa chọn rẻ nhất" thành "mức trung bình" mà không có cảnh báo trước.

Các điều chỉnh của StreamLake

StreamLake hoàn thiện bộ ba với các điều chỉnh riêng của mình. Nếu StreamLake xử lý bất kỳ khối lượng công việc nào liên quan đến đa phương tiện hoặc ngữ cảnh dài, hãy so sánh mức giá mới với độ dài phiên trung bình trong lịch sử của bạn. Các nhà cung cấp chuyên về ngữ cảnh dài đôi khi thay đổi cách họ tính phí cho các chuỗi mở rộng, điều đó có nghĩa là các yêu cầu đắt nhất của bạn có thể là những yêu cầu bị ảnh hưởng nhiều nhất. Đừng giả định rằng một thay đổi phần trăm được công bố trên tiêu đề đã phản ánh hết mức độ rủi ro thực tế của bạn. Hãy lấy một mẫu đại diện từ các yêu cầu trong tháng trước và tính toán lại chúng theo lược đồ mới.

Bạn có thể xem bảng so sánh biểu giá đầy đủ và lộ trình cập nhật trong bản phân tích chi tiết của Narev trên Dev.to. Hãy sử dụng nó như một tài liệu tham khảo thay vì thay thế cho các phép tính của chính bạn.

Cách đọc một bản cập nhật giá mà không bị nhiễu thông tin

Khi một nhà cung cấp API công bố mức giá mới, ngôn ngữ marketing thường nhấn mạnh vào khả năng tiếp cận và hiệu suất. Hãy bỏ qua điều đó. Hãy tập trung vào ba câu hỏi cụ thể.

First, does the update change input pricing, output pricing, or ancillary fees like embedding or fine-tuning? Split your own telemetry along those same axes. If 80 percent of your spend is on output generation and the provider only raised input costs, you might feel little pain. If you run summarization pipelines that emit short outputs from huge inputs, the opposite is true.

Second, have the rate limits or throughput tiers changed? Sometimes a provider keeps per-token pricing flat but lowers the free concurrency tier or introduces new queueing charges. That translates directly into latency and infrastructure cost.

Third, are there new cost-control tools? A pricing hike paired with a prompt-caching discount or batch-inference markdown might actually help you if you restructure your calls. The headline number never tells the whole story.

Keeping your stack predictable while costs shift

You cannot freeze provider pricing, but you can build systems that absorb change without rewriting code every quarter.

Start with request routing. If Mancer 2, Novita, and StreamLake each serve different workloads in your architecture, codify the cost-performance trade-off so you can swap traffic quickly. A fallback model that cost 20 percent more six months ago might now be the cheaper option after the latest round of updates. Without a router that considers live pricing, you leave money on the table.

Next, compress your context. Pricing changes hurt most when you are sending thousands of tokens per request out of habit. Audit your prompts for redundant system instructions, overly verbose schemas, and uncompressed chat history. Reducing input length by 30 percent neutralizes a 30 percent price increase. That is often faster than switching providers.

Cache aggressively. Many teams re-send identical or near-identical prompts because it is simpler than maintaining a cache layer. Once pricing moves, that laziness becomes expensive. Store recent completions and embeddings when your use case allows it, especially for analytical or repetitive workloads running through StreamLake or Novita endpoints.

Finally, assign someone to own the API bill review. It does not need to be a full-time role, but it needs to be a recurring calendar event. Once a month, reconcile predicted spend against actual spend, flag any provider whose rate slipped, and rerun the cost comparison against alternatives. Without ownership, pricing drift becomes architectural debt.

Make pricing hygiene part of your process

Infrastructure teams already review security patches and dependency updates on a schedule. Pricing should sit on that same checklist. The recent adjustments from Mancer 2, Novita, and StreamLake are not anomalies. They are evidence that the inference market is still finding its equilibrium. New hardware, optimized inference engines, and shifting demand will keep rate cards in motion for the foreseeable future.

The teams that manage this well do not predict every change. They simply maintain visibility. They know which endpoints cost what, which workloads are elastic, and where to move traffic when the math shifts. That discipline turns an otherwise disruptive update into a routine configuration tweak.

If you want a space to compare notes with other builders navigating the same set of changes, the GyaanSetu learning community is open. You can find us on Telegram.

The bottom line: Pricing on Mancer 2, Novita, and StreamLake has changed. Do not rely on memory or old documentation. Pull your logs, match them against the new rates, and decide whether your current routing still makes financial sense. The cheapest model last month is not guaranteed to be the cheapest model today.