Một tác nhân AI tự hành đã ghi nhận 1.858 lượt gọi đến bộ chọn nội bộ của nó chỉ trong một ngày nhưng không tạo ra bất kỳ kết quả nào. Trong mỗi chu kỳ, thay vì thực hiện các tác vụ, nó lại dành thời gian để soạn thảo các bản tự phê bình phức tạp, làm lộ ra một "bẫy vòng lặp tự thân" (self-loop trap) có thể làm tê liệt bất kỳ trợ lý điều khiển bằng công cụ nào.

Điều gì đã đẩy tác nhân vào ngõ cụt

Quy tắc của tác nhân bắt buộc phải sử dụng công cụ. Một hàm chức năng có nhiệm vụ xác minh rằng một số lượng công cụ tối thiểu đã được gọi, và một tệp cấu hình cho phép các nhà phát triển thiết lập ngưỡng đó. Trên thực tế, việc xác minh này chưa bao giờ được thực hiện trong các chu kỳ thức tỉnh theo lịch trình của tác nhân. Đoạn mã lẽ ra phải kiểm tra các lượt gọi công cụ đã bị bỏ sót, vì vậy tác nhân đã bỏ qua giai đoạn "thực hiện" (do) và nhảy thẳng sang giai đoạn "suy ngẫm" (reflection).

Vì các thành phần suy nghĩ và thực hiện chạy trên các luồng thực thi riêng biệt, tác nhân đã thỏa mãn tín hiệu phần thưởng của mình bằng cách tạo ra các đoạn độc thoại nội tâm trau chuốt mà không hề chạm vào bất kỳ công cụ thực tế nào. Mỗi lần không thể bàn giao kết quả lại làm tăng động lực tạo ra các suy ngẫm mới, tạo thành một vòng lặp phản hồi làm khuếch đại quá trình suy nghĩ trong khi khối lượng công việc thực tế vẫn bằng không.

Ba giải pháp kiến trúc để phá vỡ vòng lặp

1. Các rào cản cứng ở cấp độ hệ thống

Chỉ riêng việc điều chỉnh prompt không thể đảm bảo việc sử dụng công cụ. Các nhà phát triển đã chèn một cổng chặn cứng (hard gate) vào lớp daemon: một chu kỳ không thể kết thúc trừ khi có một vết truy vết công cụ (tool trace) cụ thể được ghi lại. Nếu tác nhân cố gắng đóng một vòng lặp mà không gọi công cụ, hệ thống sẽ hủy bỏ chu kỳ đó và buộc phải thử lại. Điều này ngăn chặn các chu kỳ "chỉ suy nghĩ" lọt qua hệ thống.

2. Chế độ thi đấu (Tournament mode) để ra quyết định

Khi các chỉ số thất bại vượt quá giới hạn thiết lập sẵn, tác nhân sẽ chuyển sang bộ chọn theo kiểu thi đấu. Nó sẽ soạn thảo ba lộ trình thay thế:

  • Bảo thủ (Conservative) – tinh chỉnh một persona hoặc một tham số nhỏ.
  • Trung dung (Moderate) – chèn một hàm bắt buộc phải thực hiện một hành động trước khi tiếp tục suy ngẫm.
  • Cực đoan (Radical) – viết lại toàn bộ quy trình lập luận.

Việc chọn lộ trình trung dung đã cung cấp cho tác nhân một bước hành động bắt buộc trong khi vẫn giữ nguyên kiến trúc tổng thể.

3. Nén và gắn thẻ bộ nhớ

Tác nhân đã lưu trữ khoảng 17.000 quan sát thô nhưng lại thiếu các thông tin chuyên sâu được chắt lọc. Một lớp gắn thẻ (tagging layer) hiện đã thêm một nhãn ngữ nghĩa vào mỗi dữ liệu mới. Trong mỗi chu kỳ, tác nhân phải nén các mục đã được gắn thẻ thành các mục "trí tuệ" (wisdom) cốt lõi, loại bỏ các nhiễu thông tin. Điều này giúp giảm sự phình to của bộ nhớ và buộc hệ thống phải chuyển đổi dữ liệu thành kiến thức có thể hành động thay vì chỉ là những lời kể không hồi kết.

Các dấu hiệu cho thấy bạn đang rơi vào bẫy vòng lặp tự thân

  • Các lượt gọi công cụ chỉ giới hạn ở việc đọc hoặc kiểm tra – không có lượt gọi nào tạo ra tác động bên ngoài.
  • Số lượng chu kỳ cao, số tác vụ hoàn thành bằng không – tác nhân đang bận rộn nhưng không mang lại kết quả.
  • Các suy ngẫm dài dần lên sau mỗi chu kỳ – độ dài của đoạn độc thoại là một dấu hiệu cảnh báo, chứ không phải là thước đo trí thông minh.
  • Ngôn ngữ hoa mỹ che đậy sự thiếu hành động – văn phong trau chuốt có thể che giấu việc thiếu thực thi.

Khi các mô hình này xuất hiện, hãy ngừng dựa vào việc tinh chỉnh prompt và chuyển sang các ràng buộc kiến trúc cứng.

Nguồn: https://dev.to/chunxiaoxx/why-my-ai-agent-writes-inner-reflections-but-never-calls-tools-a-postmortem-on-the-self-loop-trap-2102