Công cụ Deep Research mới của Claude có thể xử lý tới 6,57 triệu token trong một lần gọi duy nhất—điều mà chỉ một ngân sách tính toán khổng lồ mới có thể duy trì được. Hệ thống này không phải là một mô hình ngôn ngữ nguyên khối; nó hoạt động như một quy trình map-reduce bằng JavaScript nghiêm ngặt, giúp mở rộng phạm vi tìm kiếm, truy xuất dữ liệu, đối chiếu các khẳng định với ba bên xác minh độc lập, và sau đó tổng hợp thành một báo cáo.

Tại sao kiến trúc này lại quan trọng

Hầu hết các trợ lý nghiên cứu hỗ trợ bởi AI đều trình bày một giao diện "hỏi-và-đáp" duy nhất, cho phép mô hình tạo văn bản và trích dẫn trong một lần thực hiện. Deep Research của Claude đảo ngược mô hình đó. Nó chia nhỏ nhiệm vụ thành các giai đoạn rời rạc, có kiểu dữ liệu xác định và buộc mô hình phải tuân thủ một khung điều khiển phần mềm (software harness). Các nhà thiết kế đã xây dựng nó để kiểm soát hiện tượng ảo giác trong khi vẫn cung cấp các câu trả lời phong phú và có nguồn dẫn. Cách tiếp cận này bắt nguồn từ một khung tìm lỗi tự động, nơi một giả thuyết được tạo ra và sau đó được cố tình tìm cách bác bỏ. Theo thuật ngữ nghiên cứu, một khẳng định được sinh ra, sau đó ba tác nhân đối nghịch sẽ cố gắng tiêu diệt nó trước khi nó đạt đến bước tổng hợp cuối cùng.

Quy trình map-reduce

  1. Tìm kiếm mở rộng (Fan-out search) – Bộ điều phối khởi tạo các worker song song để truy vấn một loạt các nguồn dữ liệu.
  2. Truy xuất dữ liệu (Fetch data) – Mỗi worker lấy các đoạn trích thô, siêu dữ liệu và bất kỳ thông tin có cấu trúc nào hiện có.
  3. Xác minh đối nghịch (Adversarial verification) – Ba tác nhân độc lập nhận mọi khẳng định, mỗi tác nhân được hướng dẫn mặc định là bị bác bỏ (refuted) khi không chắc chắn. Khẳng định chỉ tồn tại nếu nó thu thập đủ số phiếu thuận.
  4. Tổng hợp (Synthesis) – Các khẳng định còn tồn tại được kết nối lại thành một báo cáo JSON cuối cùng mà người dùng có thể hiển thị dưới dạng văn xuôi.

Bên trong khung điều khiển (harness)

Harness là một lớp mã mỏng xác định những gì mô hình ngôn ngữ có thể làm. Các quy tắc của nó xuất hiện dưới dạng một tập hợp các tác vụ có cấu trúc:

  • SCOPE – Mô hình nhận được một mô tả ngắn gọn về câu hỏi nghiên cứu.
  • SEARCH – Nó phải đưa ra một danh sách các định danh nguồn, không bao giờ là văn bản tự do.
  • EXTRACT – Đối với mỗi nguồn, mô hình trả về một trích dẫn nguyên văn để làm cơ sở cho bất kỳ khẳng định nào sau đó.
  • VERDICT – Nó tạo ra một đối tượng JSON chứa khẳng định, trích dẫn hỗ trợ và điểm tin cậy.
  • REPORT – Giai đoạn cuối cùng đóng gói tất cả các khẳng định đã được xác minh vào một tài liệu duy nhất.

Harness thực thi việc ràng buộc bằng chứng (evidence binding): một khẳng định không có trích dẫn chính xác sẽ tự động bị loại bỏ. Nó cũng cung cấp các hằng số chính sách (policy constants) có thể được tinh chỉnh mà không cần thay đổi mã nguồn—như số lượng phiếu thuận mà một khẳng định cần có, số lượng nguồn mà hệ thống có thể đọc, hoặc số lượng khẳng định tối đa được chuyển đến bước xác minh.

Một bước phân loại (triage) nằm giữa bước trích xuất và xác minh. Thay vì gửi mọi khẳng định đến các tác nhân đối nghịch tốn kém, hệ thống xếp hạng chúng theo tầm quan trọng và chất lượng nguồn, sau đó chỉ chuyển tiếp 25 khẳng định hàng đầu. Việc sàng lọc này giúp ngăn chặn việc sử dụng token và chi phí tính toán vượt quá tầm kiểm soát.

Xác minh đối nghịch trong thực tế

Giai đoạn xác minh được thiết kế khắt khe một cách có chủ đích. Mỗi tác nhân trong số ba tác nhân đều nhận được cùng một khẳng định và trích dẫn nguồn tương ứng, sau đó hoạt động theo một bộ hướng dẫn yêu cầu nó giả định rằng khẳng định đó là sai trừ khi tìm thấy bằng chứng quyết định. Nếu bất kỳ tác nhân nào không chắc chắn, nó sẽ bỏ phiếu bị bác bỏ (refuted). Khẳng định phải thu thập được một số lượng phiếu được xác nhận (affirmed) có thể cấu hình được để tồn tại.

Trong quá trình thử nghiệm không chính thức, lớp đối nghịch đã bắt được một khẳng định đọc sai một chỉ số tổng hợp thành một điểm độ chính xác cụ thể. Mô hình đã tạo ra một tuyên bố đầy tự tin về độ chính xác, nhưng nguồn chỉ báo cáo một chỉ số tổng hợp.

Những gì thiết kế này tiết lộ về việc xây dựng hệ thống AI

  1. Tách biệt kiểm soát khỏi suy luận – Mô hình chịu trách nhiệm về suy luận; harness thực thi kỷ luật quy trình.
  2. Giao diện có kiểu dữ liệu giúp giảm ảo giác – Bằng cách yêu cầu đầu ra JSON và các trích dẫn chính xác, hệ thống loại bỏ sự sai lệch do văn bản tự do.
  3. Lọc các khẳng định trước bước xác minh tốn kém giúp giảm mức sử dụng token và chi phí tính toán.
  4. Coi đầu vào bên ngoài là không đáng tin cậy – Mọi trích dẫn nguồn đều được kiểm tra lại bởi các tác nhân độc lập, ngăn chặn một tài liệu lỗi duy nhất làm nhiễm bẩn câu trả lời.

Những nguyên tắc này phản ánh một sự chuyển dịch rộng lớn hơn hướng tới các kiến trúc "mô hình bên ngoài mô hình" (model-outside-the-model), nơi mã xác định (deterministic code) xử lý việc điều phối, xác thực và phân bổ tài nguyên thay vì mô hình ngôn ngữ xác suất.

Những nhược điểm tiềm ẩn và câu hỏi mở

Điểm mạnh của quy trình này—sự chặt chẽ của nó—cũng mang lại những thách thức.

Một điểm gây tranh cãi khác là sự phụ thuộc vào các trích dẫn nguyên văn. Không phải mọi kiến thức đều nằm ở cách diễn đạt chính xác; một số hiểu biết sâu sắc chỉ nảy sinh sau khi tổng hợp từ nhiều tài liệu khác nhau.

Những điều cần theo dõi tiếp theo

Claude’s Deep Research vẫn đang trong giai đoạn nghiên cứu, nhưng kiến trúc của nó gợi mở về một tương lai nơi các mô hình ngôn ngữ lớn được tích hợp vào các quy trình được kiểm soát chặt chẽ thay vì để chúng tự điều hướng. Các chỉ số chính cần theo dõi bao gồm:

  • Các chỉ số hiệu quả token – Liệu mức cơ sở 6,57 triệu token có giảm xuống khi hệ thống điều phối có thêm logic phân loại chọn lọc hơn không?
  • Xu hướng độ trễ – Hệ thống có thể trả về một báo cáo hoàn chỉnh nhanh đến mức nào khi có ba tác nhân xác minh tham gia vào quy trình?

Bài học rút ra

Claude’s Deep Research cho thấy một mô hình ngôn ngữ có thể đưa ra các câu trả lời đáng tin cậy và bám sát nguồn khi được giới hạn trong một quy trình đa giai đoạn có kỷ luật. Bước đột phá thực sự không nằm ở kích thước của mô hình; mà nằm ở phần mềm bao quanh, thứ buộc mô hình phải chứng minh mọi khẳng định, xếp hạng bằng chứng trước khi tiêu tốn tài nguyên tính toán, và coi mọi đoạn trích bên ngoài là đáng nghi cho đến khi ba tác nhân đồng ý ngược lại. Đối với bất kỳ ai đang xây dựng các công cụ dựa trên AI, bài học rất rõ ràng: hãy để mô hình suy nghĩ, nhưng hãy để mã nguồn quyết định những gì nó có thể nói.