OpenAI đã thông báo rằng mô hình GPT-5.6 Sol của họ đạt mức điểm 38,3% trên thang đo logic ARC-AGI-3, vượt qua Claude Opus 5 của Anthropic với 30,2%. Tuyên bố này đã ngay lập tức gây ra một cuộc tranh chấp kỹ thuật vì chính mô hình đó chỉ đạt 7,8% khi chạy qua bộ công cụ kiểm thử (test harness) chính thức của thang đo này.

Tại sao điểm số ARC-AGI-3 lại quan trọng

ARC-AGI-3 kiểm tra khả năng giải quyết các vấn đề mới hoàn toàn và đòi hỏi tư duy logic cao của một mô hình, thay vì dựa vào các khuôn mẫu đã được ghi nhớ. Các nhà nghiên cứu coi các điểm số này là thước đo cho sự tiến bộ của "trí tuệ tổng quát" (general-intelligence), vì vậy khoảng cách dẫn trước mười điểm trông giống như một bước tiến đáng kể hướng tới khả năng giải quyết vấn đề như con người. Chỉ riêng điều này đã giải thích tại sao tiêu đề này lại gây xôn xao trong cộng đồng AI.

Đòn bẩy ẩn giấu: Retained Reasoning và Compaction

OpenAI đã không đánh giá GPT-5.6 Sol bằng bộ công cụ kiểm thử công khai. Thay vào đó, họ đã sử dụng Responses API của riêng mình với hai tùy chọn độc quyền:

  • Retained Reasoning – giữ cho chuỗi suy luận (chain of thought) của mô hình luôn hoạt động qua nhiều bước, ngăn chặn việc mất đi các logic trung gian vốn xảy ra khi mỗi bước được xử lý riêng biệt.
  • Compaction – nén ngữ cảnh trước đó thay vì cắt bỏ nó, cho phép mô hình tham chiếu đến một lịch sử tóm tắt dài hơn.

Khi các thiết lập đó được kích hoạt, mô hình sẽ kết nối các lập luận dài hơn và tái sử dụng các suy luận trước đó, làm tăng hiệu suất trong các tác vụ đa bước. Trong bộ công cụ chính thức, vốn loại bỏ suy luận sau mỗi hành động, điểm số của cùng một mô hình này tụt xuống còn 7,8%, đặt nó thấp hơn nhiều so với Claude Opus 5.

OpenAI lập luận rằng một thang đo nên đo lường toàn bộ quy trình suy luận (inference pipeline), chứ không chỉ các trọng số thần kinh (neural weights) thô. Từ góc độ đó, phần "vỏ bọc" (wrapper) – logic API giúp bảo tồn và nén ngữ cảnh – thuộc về hệ thống đang được đánh giá.

Cuộc tranh luận về tính công bằng

François Chollet, đồng sáng lập ARC Prize – đơn vị tài trợ cho thang đo này, đã đưa ra ý kiến. Ông phân biệt giữa các bộ công cụ tùy chỉnh được xây dựng để "giải quyết" một thang đo và các thiết lập API đa năng mà bất kỳ người dùng nào cũng có thể kích hoạt. Chollet lưu ý rằng môi trường thử nghiệm gốc của ARC Prize đã sử dụng một completions API kiểu OpenAI cũ hơn, vốn thiếu các tính năng tiên tiến hiện có trong Claude API của Anthropic. Sự không tương thích đó có thể đã gây bất lợi cho OpenAI trong các vòng trước.

Ông không khẳng định rằng sự so sánh này là vô giá trị. Chollet cho biết một tuyên bố đối đầu trực tiếp vẫn có thể chấp nhận được nếu các thiết lập chính xác và bất kỳ chi phí liên quan nào được tiết lộ. Ông lập luận rằng sự minh bạch sẽ cho phép cộng đồng đánh giá xem khoảng cách đó đến từ kiến trúc mô hình, các thủ thuật kỹ thuật, hay cả hai.

Ai thắng, ai thua

Nếu điểm số cao hơn được chấp nhận nguyên trạng, OpenAI sẽ có được sự gia tăng về nhận thức công chúng và vị thế thương lượng mạnh mẽ hơn trong các cuộc đàm phán cấp phép doanh nghiệp. Đội ngũ của Claude có thể chỉ ra hiệu suất mô hình thô trên bộ công cụ tiêu chuẩn hóa như một bằng chứng cho thấy kiến trúc của họ hiệu quả hơn khi được lược bỏ các lớp kỹ thuật bổ sung.

Các nhà nghiên cứu và nhà phát triển, những người dựa vào bảng xếp hạng thang đo để định hướng đầu tư, có thể cảm thấy sự việc này gây bất an. Trường hợp này cho thấy khi các mô hình ngày càng lớn hơn, phần mềm điều phối quá trình suy luận của chúng có thể trở thành yếu tố quyết định. Các công ty cung cấp các ngăn xếp suy luận (inference stacks) tinh vi với chi phí biên thấp có thể thống trị các điểm số tiêu đề mà không cần một mô hình nền tảng vượt trội.

Điều gì sẽ xảy ra tiếp theo với ARC-AGI-3 và các thang đo khác

Cuộc tranh chấp có khả năng sẽ thúc đẩy các nhà tổ chức ARC Prize hướng tới các quy tắc chặt chẽ hơn về các cấu hình suy luận được cho phép. Các phản ứng khả thi bao gồm:

  • Công bố một điểm số "cơ sở" (baseline) phản ánh hiệu suất chỉ với bộ công cụ chính thức.
  • Yêu cầu những người tham gia nộp bản phân tích chi phí của bất kỳ thiết lập bổ sung nào, để điểm số cao có thể được cân nhắc so với chi phí tính toán hoặc chi phí kỹ thuật bổ sung.
  • Thêm một hạng mục "cấp hệ thống" (system-level) riêng biệt để khen thưởng việc sử dụng thông minh các tính năng quản lý ngữ cảnh.

Những động thái như vậy sẽ buộc phải có sự phân tách rõ ràng hơn giữa khả năng mô hình thô và tối ưu hóa kỹ thuật, giúp các tuyên bố trong tương lai dễ dàng so sánh hơn.

Đối lập: Các thang đo nên phản ánh việc sử dụng trong thế giới thực

Một bên lập luận rằng quan điểm "chỉ mô hình thô" một cách khắt khe là không thực tế. Trong môi trường thực tế (production), các nhà phát triển thường xuyên áp dụng các lớp bộ nhớ đệm (caching), tóm tắt ngữ cảnh và các thủ thuật khác lên các mô hình ngôn ngữ. Nếu một thang đo nhằm mục đích dự đoán tiện ích thực tế, nó nên cho phép – hoặc thậm chí khuyến khích – những sự tối ưu hóa đó. Từ góc độ đó, Retained Reasoning và Compaction của OpenAI là những công cụ hợp lệ mà bất kỳ đối thủ cạnh tranh nào cũng có thể áp dụng, miễn là chúng được tài liệu hóa công khai.

Các nhà phê bình phản bác rằng nếu không có một điểm chuẩn chung, các điểm số sẽ trở thành một mục tiêu biến động, làm xói mòn vai trò của bộ tiêu chuẩn như một thước đo khách quan. Sự căng thẳng giữa tính hợp lệ sinh thái (phản ánh các triển khai thực tế) và tính thuần khiết về phương pháp luận (cô lập mô hình) đang thổi bùng cuộc tranh luận hiện nay.

Bài học rút ra

Tuyên bố về GPT-5.6 Sol làm nổi bật sự chia rẽ ngày càng lớn trong việc đánh giá AI: tài năng thô của mô hình đối lập với hệ sinh thái kỹ thuật giúp khai thác tài năng đó. Chừng nào cộng đồng còn yêu cầu công khai đầy đủ các thiết lập suy luận và chi phí của chúng, cuộc tranh luận sẽ càng trở nên gay gắt hơn thay vì làm mờ đi tầm nhìn của chúng ta về tiến trình hướng tới trí tuệ nhân tạo tổng quát.