DeepSeek đã ra mắt V4-Flash-Vision-Exp, một mô hình đa phương thức thử nghiệm mà họ cho biết có hiệu suất trên các bài kiểm tra agent nội bộ gần như tương đương với Opus 4.8 của Anthropic, trong khi vẫn giữ chi phí token cho mỗi hình ảnh ở mức tối đa là 384. Sự ra mắt này mang đến cho các nhà phát triển một lựa chọn thay thế nhanh chóng cho các tác vụ AI thị giác, hứa hẹn tốc độ của dòng V4-Flash của DeepSeek cùng khả năng suy luận dựa trên hình ảnh.

Tại sao thông báo này lại quan trọng

Các agent đa phương thức—những hệ thống có thể nhìn, đọc và hành động—hiện đang nằm ở trung tâm của việc phát triển công cụ tự hành. Các đội ngũ sử dụng chúng cho các bot hỗ trợ khách hàng có khả năng đọc ảnh chụp màn hình và các trợ lý nghiên cứu có khả năng phân tích sơ đồ. Opus 4.8 của Anthropic đã thiết lập một tiêu chuẩn cao, nhưng giá cả và độ trễ của nó đã khiến nhiều người phải dè chừng. Tuyên bố của DeepSeek về hiệu suất gần như tương đương với một phần nhỏ chi phí token có thể thay đổi tính toán về chi phí-lợi ích cho bất kỳ ai đang cân nhắc đưa thị giác vào quy trình làm việc của mình.

Cách DeepSeek xây dựng mô hình

Mô hình mới mở rộng kiến trúc V4-Flash hiện có của DeepSeek, vốn đã được tinh chỉnh để suy luận văn bản nhanh chóng và tiêu thụ ít token. Bằng cách tích hợp một front-end xử lý hình ảnh vào lõi đó, DeepSeek đã bảo tồn được thế mạnh về kiến thức thế giới và khả năng suy luận của mô hình gốc trong khi bổ sung thêm khả năng hiểu thị giác.

Các lựa chọn kỹ thuật chính bao gồm:

  • Tự động phát hiện định dạng – mô hình đọc nội dung nhị phân của hình ảnh để quyết định xem đó là JPEG, PNG, GIF hay WebP, giúp tránh các lỗi do đặt tên tệp sai.
  • Thay đổi kích thước thích ứng – các hình ảnh đầu vào được chuẩn hóa về khoảng 800 × 800 pixel. Các nhà phát triển có thể yêu cầu chế độ độ chi tiết thấp hơn để ép về kích thước 512 × 512, giúp cắt giảm thêm mức sử dụng token.
  • Giới hạn token – bất kể độ phân giải gốc, mô hình không bao giờ tính phí quá 384 token cho mỗi hình ảnh, giúp việc lập ngân sách trở nên dễ dự đoán.

DeepSeek cũng đã phát hành phiên bản 0.1.1 của framework Harness, bao gồm mô hình mới và cung cấp các bộ chuyển đổi (adapters) có sẵn cho các OpenAI Chat Completions và Responses APIs cũng như endpoint Messages của Anthropic. Các đội ngũ có thể đưa mô hình vào các cơ sở mã nguồn hiện có chỉ với một vài thay đổi cấu hình.

Những gì nhà phát triển nhận được

  • Hỗ trợ hình ảnh rộng rãi – JPEG, PNG, GIF và WebP đều được chấp nhận, và mô hình có thể tiếp nhận dữ liệu thông qua chuỗi Base64, URL công khai (lên đến 32 MiB), hoặc Files API miễn phí của DeepSeek. Files API lưu trữ một lần tải lên lên đến 64 MiB và cho phép bạn tham chiếu bằng ID qua nhiều lượt hội thoại, giúp giảm việc tải lên lặp lại trong các cuộc trò chuyện dài.
  • Ngữ cảnh khối lượng lớn – một yêu cầu duy nhất có thể mang theo tới 600 hình ảnh. Chiều dài cạnh tối đa cho mỗi hình ảnh là 8.192 pixel, giảm xuống còn 4.096 pixel khi một yêu cầu chứa từ 15 hình ảnh trở lên, giúp kiểm soát thời gian xử lý.
  • Các tác vụ sẵn sàng cho agent – mô hình được tinh chỉnh cho các khối lượng công việc mang tính "agentic": mô tả các cảnh phức tạp, trích xuất văn bản từ ảnh chụp màn hình và phân tích các sơ đồ phức tạp. Vì nó giữ được tốc độ suy luận của V4-Flash, nó có thể lồng ghép các manh mối thị giác vào các chuỗi suy nghĩ (chains of thought) rộng hơn mà không trở thành nút thắt cổ chai.

Những tính năng này giải quyết các vấn đề nan giải thường gặp của nhà phát triển: xử lý nhiều hình ảnh trong một phiên, tránh việc bùng nổ chi phí token và tích hợp thị giác mà không cần viết lại các lệnh gọi API.

Các giới hạn tiềm ẩn

Tuyên bố về hiệu suất của DeepSeek dựa trên các bài kiểm tra agent đa phương thức nội bộ. Những thử nghiệm đó có thể bỏ lỡ sự biến đổi trong thế giới thực—như ảnh bị nhiễu, điều kiện ánh sáng yếu hoặc các định dạng tệp lạ. Nhãn "thử nghiệm" cũng ám chỉ rằng mô hình có thể vẫn đang trong quá trình khắc phục các vấn đề về độ ổn định và khả năng mở rộng.

Các thiết kế ưu tiên tốc độ như V4-Flash thường hy sinh độ sâu của sự biểu diễn mà các mô hình lớn hơn, chậm hơn đạt được. Giới hạn token giúp giữ chi phí thấp nhưng lại hạn chế chi tiết thị giác, điều này có thể gây khó khăn cho các tác vụ cần phân tích tinh vi (ví dụ: đọc phông chữ cực nhỏ hoặc phát hiện các khác biệt nhỏ về kết cấu).

Cuối cùng, sự phụ thuộc vào hệ sinh thái (lock-in) vẫn là một yếu tố cần cân nhắc. Mặc dù DeepSeek mô phỏng cấu trúc API của OpenAI và Anthropic, các nhà phát triển vẫn phải quản lý một nhà cung cấp riêng biệt, việc xác thực của họ và các thay đổi về giá cả có thể xảy ra trong tương lai. Các đội ngũ đã đầu tư mạnh vào một nhà cung cấp duy nhất có thể sẽ phải cân nhắc giữa nỗ lực tích hợp và mức tiết kiệm dự kiến.

Những điều cần theo dõi

  • Các đánh giá độc lập – các bài kiểm tra chuẩn (benchmarks) từ bên thứ ba sẽ là bài kiểm tra thực tế đầu tiên cho tuyên bố “gần bằng Opus 4.8”. Hãy chú ý đến kết quả trên các bộ dữ liệu công khai như VQAv2 hoặc CLEVR, vốn nhấn mạnh cả khả năng lập luận và độ trung thực về mặt hình ảnh.
  • Cập nhật về giá cả – DeepSeek nhấn mạnh vào hiệu quả token, nhưng chi phí thực tế cho mỗi hình ảnh 384 token sẽ quyết định liệu mô hình này có thực sự có giá thấp hơn các đối thủ cạnh tranh hay không.
  • Triển khai các tính năng mới – các bản phát hành Harness trong tương lai có thể bổ sung xử lý hàng loạt (batch processing), đầu ra dạng luồng (streaming outputs), hoặc tích hợp chặt chẽ hơn với các công cụ điều phối tác nhân (agent orchestration tools) phổ biến, từ đó mở rộng tính hữu dụng của mô hình.
  • Sự đón nhận của cộng đồng – tốc độ các nhà phát triển phát hành plugin, wrapper hoặc các nghiên cứu điển hình (case studies) sẽ cho thấy liệu khả năng tương thích API của mô hình có chuyển hóa thành việc ứng dụng thực tế hay không.

Kết luận

V4-Flash-Vision-Exp của DeepSeek đưa ra thị trường một tác nhân đa phương thức (multimodal agent) nhanh chóng và tiết kiệm token, với tuyên bố hiệu suất gần tương đương với Opus 4.8 của Anthropic. Nếu các kết quả benchmark nội bộ được chứng minh là chính xác, nó có thể trở thành lựa chọn hàng đầu cho các nhà phát triển cần khả năng thị giác mà không phải trả mức giá đắt đỏ của các mô hình quy mô hàng đầu (frontier-scale models), trong khi vẫn phải đối mặt với những sự đánh đổi thường thấy của các AI thử nghiệm tập trung vào tốc độ.