Kimi K3 đã đuối sức trong khi GPT-5.6-SOL về đích thành công với ba câu lệnh (prompt) nặng ký—một bài toán xác suất, một kịch bản ròng rọc-quán tính và một đoạn mã Python phức tạp về bài toán xếp đồ vào ba lô. Khoảng cách này cho thấy lý do tại sao việc quản lý ngân sách token và độ trễ lại quan trọng khi bạn cần một mô hình có thể suy luận qua các bước toán học, vật lý và mã nguồn mà không bị đình trệ.
Tại sao bài kiểm tra này lại quan trọng
Các nhà phát triển và nghiên cứu thường chọn một LLM dựa trên các điểm số quảng cáo, chứ không phải dựa trên cách nó hoạt động dưới áp lực thực tế. Trong bài kiểm tra so sánh trực tiếp này, mỗi mô hình phải giải quyết một vấn đề đòi hỏi một chuỗi suy luận dài. GPT-5.6-SOL đã đưa ra câu trả lời đầy đủ và chính xác trong cả ba lĩnh vực; trong khi đó, Kimi K3 đã cạn kiệt ngân sách token hoặc hết thời gian chờ (timeout) trước khi đưa ra được bất kỳ kết quả nào có thể sử dụng được.
Thiết lập bài kiểm tra
- Toán học – một câu hỏi xác suất yêu cầu tính toán xác suất chồng lấp mẫu, cùng với cả kỳ vọng và phương sai (mô-men bậc hai).
- Vật lý – mô hình hóa quán tính của một ròng rọc và sự mất mát năng lượng khi một dây cáp căng bằng lò xo bị chùng.
- Lập trình – viết một giải pháp Python cho bài toán xếp đồ vào ba lô với các phụ thuộc phức tạp và quy tắc phân xử (tie-break), sau đó kiểm tra kết quả đầu ra với sáu trường hợp kiểm thử độc lập.
Những con số biết nói
GPT-5.6-SOL
- Toán học – đưa ra lời giải đầy đủ, chính xác với giá trị kỳ vọng và phương sai được trình bày rõ ràng.
- Vật lý – xây dựng chính xác mô hình quán tính và tính toán được sự mất mát năng lượng, khớp với đáp án phân tích.
- Lập trình – tạo ra mã nguồn có thể biên dịch, chạy được và vượt qua tất cả sáu bước kiểm tra bên ngoài. Một khẳng định kiểm thử (assertion) nội bộ đã bị sai, nhắc nhở chúng ta rằng các bài kiểm thử do mô hình tạo ra không phải là không thể sai sót.
Kimi K3
- Toán học – chạm ngưỡng giới hạn token (lần đầu ở mức 6.500 token, sau đó là 10.000 token) và dừng lại mà không đưa ra bất kỳ câu trả lời nào.
- Vật lý – hết token trước khi có bất kỳ đầu ra nào hiển thị.
- Lập trình – hết thời gian chờ sau 245 giây, không đưa ra được gì để đánh giá.
Hiệu suất suy luận so với sức mạnh thô
Hàm ý dành cho bất kỳ ai đang xây dựng các quy trình vận hành (production pipelines) là rất rõ ràng: một mô hình tiêu tốn token nhanh chóng mà không đưa ra được kết quả có thể làm đình trệ các quy trình hạ nguồn, tăng chi phí và gây thất vọng cho người dùng.
Độ tin cậy và chi phí ẩn của mã nguồn "hoàn hảo"
Ngay cả mô hình chiến thắng cũng mắc lỗi: trường hợp kiểm thử do chính GPT-5.6-SOL tạo ra chứa một khẳng định sai. Điều này cho thấy việc xác thực do mô hình tạo ra không thể thay thế cho việc kiểm tra của con người. Khi một mô hình viết mã, bạn vẫn cần phải chạy các bước kiểm tra độc lập.
Những điều cần theo dõi tiếp theo
- Theo dõi lý do kết thúc (Finish reason tracking) – ghi lại xem một phản hồi kết thúc vì chạm giới hạn token, hết thời gian chờ hay dừng lại một cách tự nhiên.
- Số lượng token suy luận – so sánh số lượng token mà mỗi mô hình dành cho quá trình suy nghĩ nội bộ so với đầu ra cuối cùng.
- Giám sát độ trễ – đo lường thời gian thực tế cho mỗi bước; một mô hình mất vài phút cho mỗi truy vấn có thể không phù hợp cho các ứng dụng tương tác.
Các nhà phát triển nên coi các chỉ số này là những tín hiệu quan trọng hàng đầu, chứ không chỉ là câu trả lời cuối cùng.
Kết luận
GPT-5.6-SOL vượt trội hơn Kimi K3 về tính hoàn thiện. Bài kiểm tra cũng nhắc nhở chúng ta rằng ngay cả một mô hình "làm đúng" vẫn có thể tạo ra các bước kiểm tra nội bộ sai sót, vì vậy sự giám sát của con người vẫn là thiết yếu. Việc theo dõi lý do kết thúc, mức sử dụng token và độ trễ sẽ giúp bạn chọn đúng công cụ cho công việc mà không bị rơi vào tình trạng hết thời gian chờ trong im lặng.
