Giá cả LLM là một mục tiêu luôn biến động. Có tháng ngân sách inference của bạn hoạt động chính xác như dự báo; nhưng tháng tiếp theo, một nhà cung cấp điều chỉnh mức giá trên mỗi token và chi tiêu hàng tháng của bạn thay đổi mà không cần thêm bất kỳ yêu cầu nào được gửi đi. Đó chính xác là những gì vừa xảy ra. GMICloud, Novita và StreamLake đều đã cập nhật giá mô hình của họ, và nếu bạn đang vận hành các khối lượng công việc sản xuất (production workloads)—hay thậm chí là các pipeline thử nghiệm—những đợt điều chỉnh này xứng đáng được xem xét kỹ lưỡng. Không phải vì thị trường đang sụp đổ, mà vì những khác biệt nhỏ trong kinh tế học token sẽ cộng dồn một cách khủng khiếp khi bạn xử lý hàng triệu token mỗi ngày.
Những nhà cung cấp này là ai
GMICloud, Novita và StreamLake mỗi bên đóng một vai trò riêng biệt trong ngăn xếp hạ tầng AI, nhưng hiện tại họ đang cạnh tranh trực tiếp về chi phí vận hành các mô hình ngôn ngữ lớn.
GMICloud vận hành một nền tảng đám mây GPU hiệu suất cao và cung cấp danh mục các LLM được lưu trữ ngày càng tăng cho các nhà phát triển muốn truy cập API mà không cần tự quản lý các cụm máy chủ (clusters) của riêng mình. Novita xây dựng danh tiếng xoay quanh việc cho thuê GPU giá rẻ và cung cấp mô hình (model serving), thu hút các kỹ sư ưu tiên các mô hình trọng số mở (open-weight models) với mức giá ưu đãi hơn so với mức phí cao ngất ngưởng của các nhà cung cấp đám mây khổng lồ (hyperscalers). StreamLake, vốn phát triển từ hệ sinh thái đám mây và truyền thông của ByteDance, mang chuyên môn về hạ tầng video vào cuộc đua inference và cung cấp các mô hình thông qua một nền tảng cũng xử lý các khối lượng công việc xử lý media nặng.
Không ai trong số họ là những cái tên phổ biến rộng rãi như OpenAI hay Anthropic. Đó chính xác là lý do tại sao những thay đổi về giá của họ lại quan trọng. Họ nằm ở phân khúc tầm trung đầy cạnh tranh của thị trường, nơi biên lợi nhuận mỏng, các chương trình giảm giá phổ biến và cuộc đua thu hút nhà phát triển diễn ra liên tục. Khi ba nền tảng trong phân khúc này thay đổi bảng giá vào cùng một thời điểm, họ đã cùng nhau thiết lập lại tiêu chuẩn cho chi phí vận hành các mô hình mã nguồn mở hoặc mô hình đã được tinh chỉnh (fine-tuned).
Điều gì đã thay đổi
Các bản cập nhật đã ảnh hưởng đến giá sử dụng LLM trên cả ba dịch vụ. Naren, viết dưới tên narevbot trên Dev.to, đã ghi lại các chi tiết cụ thể trong một bài viết phân tích các điều chỉnh chính xác cho từng mô hình của GMICloud, Novita và StreamLake. Bạn có thể đọc bản so sánh đầy đủ tại đây.
Thay vì liệt kê những con số lẻ từng cent trên mỗi token vốn có thể thay đổi lần nữa trước khi bạn đọc xong đoạn này, điểm mấu chốt là những thay đổi này mang tính cấu trúc. Mỗi nhà cung cấp đã tái cân bằng cách tính phí token, và trong một số trường hợp, các đợt điều chỉnh này làm thay đổi việc mô hình nào là rẻ nhất cho một khối lượng công việc nhất định. Đây hiếm khi là một sự tăng hoặc giảm đồng loạt đơn giản. Một nhà cung cấp có thể giảm giá input trong khi tăng giá output. Một nhà cung cấp khác có thể giữ nguyên giá cho các mô hình tham số nhỏ nhưng lại tăng giá cho các endpoint có ngữ cảnh dài (long-context). Vì cả ba đều hỗ trợ các sự kết hợp khác nhau của Llama, Qwen, Mistral và các kiến trúc khác, nên lợi ích hay thiệt hại phụ thuộc hoàn toàn vào việc bạn đang điều hướng mô hình nào qua API nào.
Tại sao hóa đơn của bạn vẫn thay đổi ngay cả khi lưu lượng truy cập không đổi
Để hiểu được tác động, hãy xem cách tính hóa đơn LLM thực tế hoạt động. Bạn hầu như luôn bị tính phí riêng biệt cho token đầu vào (input tokens) và token đầu ra (output tokens), và tỷ lệ giữa chúng sẽ quyết định chi phí thực tế của bạn. Một bot hỗ trợ khách hàng xử lý mười nghìn cuộc hội thoại mỗi ngày có thể tiêu thụ trung bình hai nghìn token đầu vào và bốn trăm token đầu ra cho mỗi lượt chat. Với mức giá hỗn hợp là ba đô la cho mỗi triệu token, chi phí đó rơi vào khoảng tám mươi tư đô la một ngày. Nếu một nhà cung cấp tăng giá output chỉ 20%, chi phí hàng ngày sẽ vọt lên quá chín mươi đô la. Trong một quý, đó là gần một nghìn đô la chi tiêu thêm cho cùng một lượng lưu lượng truy cập như cũ.
Hãy nhân quy mô đó lên với một pipeline tạo nội dung hoặc một hệ thống tạo phản hồi tăng cường tra cứu (RAG) xử lý hàng triệu token mỗi giờ, và nhà cung cấp bạn chọn sẽ trở thành một khoản mục chi phí cực kỳ nghiêm trọng. GMICloud, Novita và StreamLake hiểu rõ điều này. Những thay đổi về giá của họ là những bước đi định vị có tính toán nhằm vào các trường hợp sử dụng cụ thể: các tác vụ xử lý hàng loạt (batch jobs) khối lượng lớn, các ứng dụng chat độ trễ thấp, hoặc các tác vụ tóm tắt ngữ cảnh dài.
Sự phức tạp còn tạo thêm một lớp khác. Một số nền tảng áp dụng phí tối thiểu cho mỗi yêu cầu, phí chờ (idle fees) cho băng thông được cấp phát (provisioned throughput), hoặc phụ phí cho việc tăng đột biến giới hạn tốc độ (rate-limit bursts). Một thay đổi về phí yêu cầu tối thiểu sẽ gây thiệt hại cho những người dùng có lưu lượng thấp nhiều hơn so với những người dùng có lưu lượng cao. Một sự thay đổi trong chiết khấu inference hàng loạt có thể làm giảm chi phí tạo báo cáo hàng đêm của bạn trong khi vẫn giữ nguyên hóa đơn API thời gian thực. Chỉ đọc tiêu đề "cập nhật giá" là chưa đủ. Bạn phải đọc kỹ bảng ma trận chi phí.
Cách ứng phó mà không phản ứng thái quá
Khi các mức giá biến động, hầu hết các đội ngũ kỹ thuật đều mắc một trong hai sai lầm. Họ hoặc là phớt lờ sự thay đổi và âm thầm gánh chịu việc vượt ngân sách, hoặc là họ hoảng loạn.
