AI không nhất thiết phải luôn nằm trên đám mây. Trong năm qua, sự chuyển dịch thú vị nhất trong lĩnh vực này không phải là một mô hình lớn hơn hay một chatbot hào nhoáng hơn. Đó là sự di chuyển âm thầm của các khối lượng công việc nặng nề lên các phần cứng thông thường đặt ngay dưới bàn làm việc của bạn, và nhận thức ngày càng tăng rằng việc đổ tiền vào các API cao cấp thường là không cần thiết. Ba bước phát triển gần đây giúp điều này trở nên khả thi ngay bây giờ: một công cụ lượng tử hóa mới giúp thu nhỏ các mô hình tạo hình ảnh mà không làm hỏng kết quả đầu ra, một tác nhân máy tính để bàn giúp giữ dữ liệu của bạn trên máy, và một chiến lược cắt giảm chi phí cực kỳ đơn giản mà quá nhiều đội ngũ đang bỏ qua.

Diffusion lượng tử hóa chạy ngay trên máy của bạn

Hugging Face đã phát hành Nunchaku, một phương pháp lượng tử hóa 4-bit được xây dựng dành riêng cho các mô hình diffusion. Nó kết nối trực tiếp với thư viện Diffusers phổ biến, nghĩa là bạn có thể đưa nó vào các thiết lập hiện có mà không cần phải xây dựng lại quy trình (pipeline) của mình từ đầu.

Lượng tử hóa 4-bit thực sự có nghĩa là gì? Nói một cách đơn giản, nó nén độ chính xác số học của các trọng số (weights) trong mô hình. Thay vì lưu trữ mỗi tham số ở độ chính xác đầy đủ 32-bit hoặc 16-bit, Nunchaku cắt giảm dữ liệu thừa xuống còn bốn bit cho mỗi trọng số. Mô hình chiếm một phần nhỏ không gian đĩa so với ban đầu và, quan trọng hơn, yêu cầu ít VRAM hơn nhiều sau khi được tải lên. Đối với những người dùng có GPU phổ thông sở hữu 8 GB hoặc 12 GB VRAM, đây chính là sự khác biệt giữa việc nhìn thanh tiến trình chạy chậm chạp và việc thực sự tạo ra một hình ảnh.

Tác động thực tế là rất đáng kể. Bạn có thể chạy các mô hình diffusion lớn trên các phần cứng mà trước đây được coi là không đủ sức mạnh cho tác vụ này. Một card đồ họa tầm trung từ vài thế hệ trước đột nhiên trở nên khả thi cho việc tổng hợp hình ảnh độ phân giải cao. Và vì Nunchaku được thiết kế để bảo toàn độ trung thực về mặt hình ảnh, kết quả đầu ra không bị biến thành một mớ hỗn độn nhòe nhoẹt. Các hình ảnh vẫn đủ sắc nét để sử dụng thực tế, cho dù bạn đang tạo nguyên mẫu tài sản trò chơi (game assets), tạo bản mô phỏng sản phẩm (product mocks) hay xử lý hàng loạt các hình minh họa.

Cũng có một khía cạnh về quyền riêng tư. Chạy diffusion cục bộ có nghĩa là các câu lệnh (prompts) và hình ảnh được tạo ra sẽ không bao giờ rời khỏi máy của bạn. Bạn không phải tải các bản vẽ phác thảo ý tưởng (concept art) nhạy cảm hoặc các thiết kế độc quyền lên một máy chủ từ xa. Mọi thứ đều nằm trên đĩa cứng của bạn, đằng sau tường lửa của bạn. Đối với các studio xử lý sở hữu trí tuệ (IP) bảo mật hoặc các nhà sáng tạo làm việc trong các ngành nghề bị kiểm soát chặt chẽ, sự cô lập đó không phải là một thứ xa xỉ. Đó là một yêu cầu bắt buộc.

Các tác nhân máy tính để bàn thực sự hoạt động ngoại tuyến

Các API đám mây không phải là cách duy nhất để tự động hóa máy tính để bàn của bạn. Claude Cowork, một khung làm việc (framework) cho tác nhân AI, hiện đã có thể chạy gốc trên Windows và Linux. Việc thiết lập đủ đơn giản để bạn có thể lưu trữ tác nhân này cục bộ thay vì điều hướng mọi hành động qua một điểm cuối (endpoint) bên ngoài.

Sau khi chạy, Claude Cowork xử lý những công việc văn phòng nhàm chán thường ngày. Nó soạn thảo các tệp, sắp xếp hóa đơn và di chuyển dữ liệu giữa các thư mục dựa trên các chỉ dẫn bằng ngôn ngữ tự nhiên. Logic ứng dụng được thực thi trên máy của bạn, điều này làm thay đổi bản chất của công việc hàng ngày. Thay vì sao chép văn bản vào một tab trình duyệt và chờ đợi phản hồi từ máy chủ, bạn đưa ra các lệnh theo cách tương tự như khi bạn nói chuyện với một shell script, ngoại trừ việc sử dụng tiếng Anh thông thường.

Việc giữ cho tác nhân hoạt động cục bộ có ý nghĩa quan trọng hơn cả tốc độ thuần túy. Các tệp, tên tệp và cấu trúc thư mục của bạn sẽ không nằm trên đám mây của bất kỳ ai khác. Sự kiểm soát đó rất khó để nói hết tầm quan trọng nếu bạn quản lý hồ sơ tài chính, tài liệu pháp lý hoặc bất cứ thứ gì bị ràng buộc bởi các quy định về lưu trú dữ liệu. Một tác nhân máy tính để bàn không gửi danh sách thư mục của bạn về máy chủ trung tâm. Nó không huấn luyện dựa trên các bảng tính thuế của bạn.

Việc đưa AI đến gần hơn với quy trình làm việc cũng giúp loại bỏ sự cản trở. Bạn sẽ ngừng nghĩ về các token hay khóa API. Bạn sẽ ngừng lo lắng liệu một sự cố dịch vụ ở Bờ Tây có làm đóng băng quá trình tự động hóa của mình vào giữa trưa hay không. Công cụ này trở thành một phần của hệ điều hành thay vì là một nhân viên từ xa được thuê ngoài.

Đừng giao những tác vụ đơn giản cho các mô hình đắt đỏ

Đây là một thói quen làm tiêu tốn ngân sách một cách vô lý: gọi Claude Opus cho mọi công việc. Nhiều nhà phát triển mặc định sử dụng mô hình lớn nhất, đắt nhất hiện có, với giả định rằng khả năng suy luận cao cấp luôn xứng đáng với giá tiền. Thực tế không phải vậy.

Khoảng 60% đến 70% các tác vụ AI là đọc tệp đơn giản, trích xuất văn bản, khớp mẫu hoặc điều hướng lệnh cơ bản. Những công việc này không cần khả năng suy luận ở cấp độ tiên phong (frontier-level). Chúng cần sự thực thi thành thạo và nhanh chóng. Việc đưa một tác vụ quét thư mục nhẹ nhàng vào một mô hình hàng đầu giống như việc thuê một kiến trúc sư trưởng chỉ để treo một chiếc bảng trắng. Công việc vẫn được hoàn thành, nhưng bạn đã phải trả tiền cho một chuyên môn mà bạn chưa bao giờ sử dụng đến.

Cách tiếp cận phân tầng sẽ giải quyết vấn đề này. Điều hướng các tác vụ nhỏ đến các mô hình cục bộ hoặc các điểm cuối đám mây nhỏ hơn. Sử dụng mô hình 7 tỷ tham số chạy trên phần cứng của riêng bạn để phân loại, tóm tắt và định dạng. Giữ lại các mô hình hạng nặng, bao gồm cả Claude Opus, cho các tác vụ thực sự cần logic phức tạp, lập kế hoạch đa bước hoặc suy luận chuyên sâu về lĩnh vực.

Điều này giúp cắt giảm chi phí đáng kể, đồng thời cũng đẩy nhanh quy trình của bạn. Các mô hình nhỏ hơn phản hồi ngay lập tức. Chúng không phải xếp hàng chờ sau lưu lượng truy cập của doanh nghiệp trên một API dùng chung. Bạn nhận được câu trả lời nhanh hơn và hóa đơn hàng tháng của bạn sẽ giảm xuống. Chiến lược này không phải là đánh đổi chất lượng; mà là việc điều chỉnh sức mạnh sao cho phù hợp với lộ trình.

Bài học thực tế

Điểm chung ở đây là sự độc lập. Nunchaku cho phép bạn tạo hình ảnh mà không cần thuê một cụm máy chủ. Claude Cowork giữ cho quá trình tự động hóa của bạn chạy trên phần cứng riêng. Chiến lược mô hình phân tầng giúp bạn tránh việc phải thuê một động cơ hạng sang chỉ để đi làm hàng ngày. Cùng với nhau, chúng hướng tới một cách làm việc với AI rẻ hơn, nhanh hơn và riêng tư hơn. Hãy bắt đầu với một thử nghiệm trong tuần này. Cài đặt Nunchaku trên GPU hiện tại của bạn, thử nghiệm một agent cục bộ cho một tác vụ lưu trữ hồ sơ nhàm chán, hoặc kiểm tra nhật ký API của bạn để xem có bao nhiêu yêu cầu thực sự cần đến một mô hình hàng đầu. Các công cụ đã sẵn sàng. Sự tiết kiệm là có thật.

Nguồn: Bài viết gốc trên Dev.to

Cộng đồng học tập tùy chọn: GyaanSetu AI trên Telegram