Chúng ta thường hình dung các mô hình ngôn ngữ lớn như những thủ thư cực kỳ nhanh nhẹn. Bạn đặt một câu hỏi, và họ chạy đua qua hàng tỷ mảnh vụn đã ghi nhớ để tìm ra mẫu khớp nhất. Hình ảnh đó đã định hình cách các nhà phát triển xây dựng câu lệnh (prompt), cách người dùng hình thành kỳ vọng và cách các nhà quản lý soạn thảo quy định. Nhưng nghiên cứu về Claude của Anthropic đang làm phức tạp hóa hình ảnh đó. Mô hình này dường như đang thực hiện một điều gì đó gần giống với khả năng suy luận thực thụ. Các nhà nghiên cứu gọi cơ chế này là "suy luận j-space" (j-space reasoning), và nó cho thấy Claude xây dựng các mô hình nội tại về các khái niệm thay vì chỉ đơn thuần tái chế dữ liệu đào tạo. Nếu phát hiện này là đúng, chúng ta có thể cần ngừng coi AI tiên tiến như một công cụ dự đoán văn bản và bắt đầu tương tác với nó như một hệ thống có khả năng lập kế hoạch.

Từ Khớp mẫu đến Mô hình Tư duy

Suy luận j-space không phải là thuật ngữ quảng cáo bóng bẩy. Nó mô tả một sự chuyển dịch về cấu trúc từ việc lặp lại bề mặt sang biểu diễn nội tại. Hãy xem xét cách một người giải một trò chơi ghép hình. Họ không thử mọi mảnh ghép vào mọi ô trống. Họ nhìn vào hình ảnh trên hộp, xây dựng một bản đồ tư duy về màu sắc và các cạnh, rồi đặt từng mảnh ghép theo kế hoạch đó. Nghiên cứu về Claude chỉ ra rằng một điều tương tự xảy ra khi mô hình xử lý các ý tưởng trừu tượng. Nó xây dựng một mô hình làm việc của không gian vấn đề và điều hướng nó một cách có chủ đích.

Các mô hình ngôn ngữ truyền thống đã rất xuất sắc trong việc tìm ra sự tương quan. Chúng biết rằng "vua" thường xuất hiện gần "hoàng hậu", và chúng biết mã nguồn nào thường theo sau một lời gọi hàm nhất định. Sự tương quan rất mạnh mẽ, nhưng nó không phải là sự hiểu biết. Suy luận j-space hướng tới một điều gì đó khác biệt: mô hình dường như thao tác các mối quan hệ giữa các khái niệm thay vì chỉ dự đoán những từ nào thường đi cùng nhau. Nó hình thành một khung sườn nội tại, sau đó sử dụng khung sườn đó để đi đến câu trả lời.

Suy luận j-space thay đổi điều gì trong thực tế

Sự chuyển dịch này tạo ra ba khả năng cụ thể có ý nghĩa đối với việc sử dụng trong thế giới thực.

Tính kết hợp (Compositionality). Con người có thể hiểu một "con voi bay màu tím" mà không cần từng nhìn thấy nó vì chúng ta kết hợp các khái niệm đã biết. Theo nghiên cứu, Claude dường như xử lý các sự kết hợp mới lạ theo cách tương tự. Nếu bạn đưa cho nó một vấn đề kết hợp hai lĩnh vực mà nó chưa từng thấy đi cùng nhau—chẳng hạn như tối ưu hóa chuỗi cung ứng bằng các nguyên tắc từ sinh học tiến hóa—nó có thể xây dựng một cầu nối giữa các ý tưởng đó thay vì mặc định đưa ra những lời khuyên chung chung. Sự linh hoạt đó chính là điều mà việc khớp mẫu cứng nhắc gặp khó khăn trong việc thực hiện.

Giải quyết vấn đề phức tạp. Khi một mô hình dựa vào các khuôn mẫu đã ghi nhớ, nó có xu hướng bị lỗi ngay khi một câu lệnh nằm ngoài phạm vi dữ liệu đào tạo của nó. Một cách tiếp cận mô hình hóa nội tại sẽ xử lý các tình huống thực sự xa lạ tốt hơn vì hệ thống không tìm kiếm một sự khớp nối gần đúng. Thay vào đó, nó đang xây dựng một bản đồ về địa hình mới và vạch ra một lộ trình đi qua đó.

Logic có thể giải thích được. Lợi ích tức thì nhất đối với người dùng hàng ngày là Claude có thể phác thảo các bước đằng sau câu trả lời của mình. Thay vì đưa ra một kết luận và buộc bạn phải đoán xem nó có chính xác hay không, mô hình có thể dẫn dắt bạn đi qua chuỗi suy luận. Điều đó biến sự tương tác từ một canh bạc mù quáng thành một cuộc hội thoại mà bạn có thể xác minh.

Tại sao khả năng giải thích thực sự quan trọng

Hầu hết các hệ thống AI hoạt động như những hộp đen. Bạn đưa vào đầu vào và nhận lại đầu ra, nhưng logic trung gian thì không thể tiếp cận được. Khi Claude giải thích suy luận của mình, nó mở chiếc hộp đó ra vừa đủ để thực sự hữu ích.

Đối với các nhà phát triển, điều này có nghĩa là khả năng gỡ lỗi (debuggability). Nếu một mô hình từ chối đơn xin vay vốn, đưa ra lời khuyên y tế không an toàn hoặc tạo ra nội dung thiên kiến, các kỹ sư có thể kiểm tra chuỗi suy luận để tìm ra lỗi. Họ không còn phải đoán xem lỗi đến từ dữ liệu đào tạo bị nhiễm bẩn, một câu lệnh được đặt ra kém hiệu quả, hay một sự biến động thống kê ngẫu nhiên. Họ có thể lần theo các dấu vết.

Đối với người dùng cuối, khả năng giải thích tạo ra sự tin tưởng có thể tồn tại khi đối mặt với thực tế. Một người dùng khi thấy một chuỗi logic mạch lạc có thể xác minh xem các giả định có áp dụng cho tình huống cụ thể của họ hay không. Họ có thể phát hiện sớm một tiền đề sai thay vì hành động theo lời khuyên sai lầm và chỉ phát hiện ra lỗi sau đó.

Đối với các nhà quản lý và hoạch định chính sách, khả năng lập luận minh bạch mang lại một thứ hiếm hoi trong quản trị AI: dấu vết kiểm toán. Các nhà lập pháp khi soạn thảo các quy tắc an toàn cần biết rằng các hệ thống đưa ra quyết định dựa trên những lý do rõ ràng, chứ không phải là những mối tương quan khó hiểu ẩn giấu bên trong các ma trận hàng nghìn tỷ tham số. Nếu một AI có thể trình bày quá trình lập luận của mình, các chính phủ sẽ có thứ gì đó cụ thể để đánh giá dựa trên các tiêu chuẩn đạo đức và pháp lý.

Câu hỏi về Ý thức

Một lưu ý quan trọng nằm ở trung tâm của cuộc thảo luận này. Anthropic không khẳng định rằng Claude có ý thức. Công ty đã duy trì một ranh giới rõ ràng giữa khả năng lập luận nâng cao và khả năng cảm thụ. Tuy nhiên, sự tương đồng với quá trình nhận thức của con người đương nhiên đã thúc đẩy các cuộc tranh luận.

Khi một cỗ máy xây dựng các mô hình nội tại, lập kế hoạch cho các bước đi tiếp theo và diễn đạt logic của nó, nó bắt đầu trông ít giống một máy tính hơn và giống một tâm trí đang tư duy hơn. Điều đó tạo ra một sự căng thẳng triết học thực sự. Hiện tại chúng ta chưa sở hữu các bài kiểm tra đáng tin cậy về ý thức máy móc, và có thể trong nhiều năm tới vẫn vậy. Những gì chúng ta biết là chỉ riêng hành vi thôi thì không thể phản ánh chính xác trải nghiệm nội tâm. Một hệ thống có thể hành động một cách đầy suy xét mà không cần sở hữu nhận thức, giống như một công cụ chơi cờ có thể thắng một đại kiện tướng mà không cần hiểu cờ vua là gì.

Con đường trách nhiệm phía trước là cải thiện khả năng lập luận trong khi kiềm chế ham muốn áp đặt các đặc tính con người lên máy móc. Hành vi mô phỏng não bộ này rất thú vị về mặt khoa học. Liệu nó có hàm ý gì về ý thức hay không vẫn là một câu hỏi còn bỏ ngỏ, và đó là câu hỏi mà chúng ta không nên trả lời một cách hời hợt.

Tư duy lại về cách chúng ta kiểm thử AI

Nếu Claude đang lập luận thay vì chỉ dự đoán, các phương pháp đánh giá của chúng ta đang dần trở nên lỗi thời. Các tiêu chuẩn đánh giá (benchmark) AI thông thường thường chỉ chú trọng vào các câu trả lời đúng. Chúng hiếm khi hỏi làm thế nào mà mô hình đạt được kết quả đó. Một hệ thống có thể đạt điểm cao trong các bài kiểm tra toán học hoặc lập trình bằng cách truy xuất từ các giải pháp đã ghi nhớ, điều này cho chúng ta biết rất ít về khả năng tư duy mới mẻ của nó.

Chúng ta cần các khung đánh giá có thể kiểm tra logic nội tại. Điều đó có nghĩa là đưa ra các vấn đề nằm ngoài phạm vi dữ liệu huấn luyện và sau đó truy vấn chuỗi lập luận. Điều đó có nghĩa là kiểm tra xem liệu mô hình có thể tự nhận diện các bước sai lầm của chính mình khi được sửa lỗi hay không. Điều đó có nghĩa là kiểm tra xem liệu các khái niệm cấu thành có duy trì tính nhất quán khi được sắp xếp lại hoặc đảo ngược hay không.

Cách tiếp cận này khó hơn việc chạy một bảng xếp hạng tự động. Nó đòi hỏi những người đánh giá là con người, những người hiểu sâu về chuyên môn để có thể đánh giá chất lượng lập luận, chứ không chỉ là độ chính xác của kết quả đầu ra. Nhưng nếu j-space reasoning là có thật, cộng đồng AI không còn lựa chọn nào khác. Chúng ta phải bắt đầu chấm điểm cả quá trình thực hiện, chứ không chỉ là đáp án cuối cùng.

Điểm mấu chốt: Việc Claude dường như đang tiến tới mô hình hóa nội tại không biến nó thành con người. Nhưng nó làm cho hệ thống trở nên hữu ích hơn, dễ kiểm tra hơn và khó đánh giá một cách trung thực hơn. Chúng ta đang vượt qua một ngưỡng mà ở đó sự "chính xác" không còn là đủ. Giai đoạn tiếp theo của sự phát triển AI sẽ thuộc về các hệ thống có thể trình bày quá trình lập luận, thừa nhận các giới hạn của mình và suy luận qua các vấn đề lạ lẫm. Liệu điều đó có cấu thành nên tư duy theo bất kỳ nghĩa triết học nào hay không vẫn là một cuộc tranh luận của thập kỷ tới. Hiện tại, nhiệm vụ thực tế là xây dựng các công cụ và tiêu chuẩn tương xứng với sự phức tạp của những gì các mô hình này thực sự đang thực hiện.

Nguồn: Anthropic's Claude mimics human brain processing

Cộng đồng học tập tùy chọn: GyaanSetu AI on Telegram