ابزار جدید Deep Research کلاود (Claude) می‌تواند در یک فراخوانی، ۶.۵۷ میلیون توکن را پردازش کند—چیزی که تنها با یک بودجه محاسباتی عظیم امکان‌پذیر است. این سیستم یک مدل زبانی یکپارچه نیست؛ بلکه به عنوان یک خط لوله (pipeline) دقیق map-reduce در جاوااسکریپت عمل می‌کند که جستجوها را گسترش می‌دهد، داده‌ها را فراخوانی می‌کند، ادعاها را در برابر سه تأییدکننده مستقل قرار می‌دهد و سپس یک گزارش را تلفیق می‌کند.

چرا این معماری اهمیت دارد

بسیاری از دستیاران پژوهشی مبتنی بر هوش مصنوعی، یک رابط کاربری ساده‌ی «پرسش و پاسخ» ارائه می‌دهند که به مدل اجازه می‌دهد متن و ارجاعات را در یک مرحله تولید کند. Deep Research کلاود این مدل را کاملاً دگرگون می‌کند. این ابزار وظیفه را به مراحل مجزا و نوع‌بندی‌شده (typed) تقسیم کرده و مدل را مجبور می‌کند از یک چارچوب نرم‌افزاری (harness) پیروی کند. طراحان آن را به‌گونه‌ای ساخته‌اند که ضمن ارائه پاسخ‌های غنی و مستند، توهمات (hallucinations) را نیز کنترل کند. این رویکرد از یک چارچوب خودکارِ یافتن باگ (bug-hunting) نشأت گرفته است، جایی که ابتدا یک فرضیه ایجاد شده و سپس به‌طور عمدی برای رد کردن آن تلاش می‌شود. در اصطلاح پژوهشی، ابتدا یک ادعا متولد می‌شود و سپس سه عامل متخاصم (adversarial agents) سعی می‌کنند پیش از رسیدن به مرحله تلفیق نهایی، آن را از بین ببرند.

جریان map-reduce

  1. جستجوی گسترده (Fan-out search) – هماهنگ‌کننده، کارگران موازی را برای پرس‌وجو از طیف وسیعی از منابع داده ایجاد می‌کند.
  2. دریافت داده‌ها (Fetch data) – هر کارگر، قطعات خام، متادیتا و هرگونه اطلاعات ساختاریافته‌ی موجود را استخراج می‌کند.
  3. تأیید متخاصم (Adversarial verification) – سه عامل مستقل هر ادعا را دریافت می‌کنند و به هر یک دستور داده شده که در صورت عدم اطمینان، حالت پیش‌فرض را رد شده (refuted) در نظر بگیرند. یک ادعا تنها در صورتی باقی می‌ماند که آرای مثبت کافی جمع‌آوری کند.
  4. تلفیق (Synthesis) – ادعاهای باقی‌مانده در قالب یک گزارش JSON نهایی به هم متصل می‌شوند که کاربر می‌تواند آن را به صورت متن (prose) نمایش دهد.

درون چارچوب (harness)

این چارچوب، لایه نازکی از کد است که تعیین می‌کند مدل زبانی چه کارهایی می‌تواند انجام دهد. قوانین آن به صورت مجموعه‌ای از وظایف ساختاریافته ظاهر می‌شوند:

  • SCOPE – مدل توصیف کوتاهی از سؤال پژوهش را دریافت می‌کند.
  • SEARCH – مدل باید فهرستی از شناسه‌های منبع را صادر کند، نه متن آزاد.
  • EXTRACT – برای هر منبع، مدل یک نقل‌قول مستقیم (verbatim) برمی‌گرداند که از هر ادعای بعدی پشتیبانی می‌کند.
  • VERDICT – یک شیء JSON تولید می‌کند که شامل ادعا، نقل‌قول پشتیبان و امتیاز اطمینان است.
  • REPORT – مرحله نهایی، تمام ادعاهای تأیید شده را در یک سند واحد بسته‌بندی می‌کند.

این چارچوب، اتصال به شواهد (evidence binding) را اعمال می‌کند: هر ادعایی که نقل‌قول دقیق نداشته باشد، به‌طور خودکار حذف می‌شود. همچنین ثابت‌های سیاست‌گذاری (policy constants) را ارائه می‌دهد که می‌توان بدون تغییر در کد، آن‌ها را تنظیم کرد—مانند اینکه یک ادعا به چند رأی مثبت نیاز دارد، سیستم مجاز به خواندن چند منبع است، یا حداکثر تعداد ادعایی که به مرحله تأیید می‌رسند.

یک مرحله اولویت‌بندی (triage) بین استخراج و تأیید قرار دارد. سیستم به جای ارسال هر ادعا به عوامل متخاصمِ پرهزینه، آن‌ها را بر اساس اهمیت و کیفیت منبع رتبه‌بندی کرده و تنها ۲۵ مورد برتر را ارسال می‌کند. این غربالگری مانع از خارج شدن مصرف توکن و هزینه‌های محاسباتی از کنترل می‌شود.

تأیید متخاصم در عمل

مرحله تأیید به‌طور عامدانه سخت‌گیرانه است. هر یک از سه عامل، همان ادعا و نقل‌قول منبع را دریافت می‌کنند و سپس تحت مجموعه‌ای از دستورالعمل‌ها عمل می‌کنند که به آن‌ها می‌گوید تا زمانی که مدرک قاطعی پیدا نکرده‌اند، فرض را بر نادرست بودن ادعا بگذارند. اگر هر عاملی مردد باشد، رأی به رد شده (refuted) می‌دهد. ادعا باید تعداد مشخصی از آرای تأیید شده (affirmed) را برای بقا جمع‌آوری کند.

در طول آزمایش‌های غیررسمی، لایه متخاصم ادعایی را شناسایی کرد که یک معیار تجمیعی (aggregate metric) را به اشتباه به عنوان یک امتیاز دقت (precision score) خاص تفسیر کرده بود. مدل یک بیانیه مطمئن درباره دقت تولید کرده بود، اما منبع تنها یک معیار تجمیعی را گزارش کرده بود.

آنچه این طراحی درباره ساخت سیستم‌های هوش مصنوعی آشکار می‌کند

  1. جداسازی کنترل از استدلال – مدل مسئول استنتاج باقی می‌ماند؛ چارچوب، انضباط فرآیند را اعمال می‌کند.
  2. رابط‌های نوع‌بندی‌شده توهم را کاهش می‌دهند – با الزام به خروجی JSON و نقل‌قول‌های دقیق، سیستم از انحراف متن‌های آزاد جلوگیری می‌کند.
  3. فیلتر کردن ادعاها پیش از مرحله پرهزینه تأیید، مصرف توکن و هزینه‌های محاسباتی را کاهش می‌دهد.
  4. برخورد با ورودی‌های خارجی به عنوان ورودی غیرقابل اعتماد – هر نقل‌قول از منبع توسط عوامل مستقل مجدداً بررسی می‌شود تا از آلوده شدن پاسخ توسط یک سند معیوب جلوگیری شود.

این اصول بازتاب‌دهنده یک تغییر گسترده‌تر به سمت معماری‌های «مدل خارج از مدل» (model-outside-the-model) است، جایی که به جای مدل زبانی احتمالی، کدهای قطعی (deterministic) مدیریت هماهنگی، اعتبارسنجی و تخصیص منابع را بر عهده دارند.

نقاط ضعف احتمالی و پرسش‌های بی‌پاسخ

قدرت این خط لوله — یعنی دقت و سخت‌گیری آن — چالش‌هایی را نیز به همراه دارد.

نکته بحث‌برانگیز دیگر، اتکا به نقل‌قول‌های کلمه به کلمه است. همه دانش‌ها در قالب عبارات دقیق نهفته نیستند؛ برخی از بینش‌ها تنها پس از ترکیب اطلاعات از چندین سند مختلف پدیدار می‌شوند.

آنچه باید در ادامه زیر نظر داشت

Claude’s Deep Research هنوز در مرحله تحقیقاتی است، اما معماری آن نویدبخش آینده‌ای است که در آن مدل‌های زبانی بزرگ، به جای اینکه رها شوند تا خودشان هدایت شوند، در پایپ‌لاین‌های تحت کنترل دقیق قرار می‌گیرند. شاخص‌های کلیدی برای نظارت عبارتند از:

  • معیارهای کارایی توکن – آیا با دستیابی چارچوب به منطق اولویت‌بندی انتخابی بیشتر، خط پایه 6.57 میلیون توکن کاهش خواهد یافت؟
  • روندهای تأخیر – وقتی سه ایجنت تأییدکننده در فرآیند حضور دارند، سیستم با چه سرعتی می‌تواند یک گزارش کامل ارائه دهد؟

نتیجه‌گیری

Claude’s Deep Research نشان می‌دهد که یک مدل زبانی زمانی که در یک پایپ‌لاین منضبط و چند مرحله‌ای محدود شود، می‌تواند پاسخ‌های قابل اعتماد و مبتنی بر منبع ارائه دهد. تحول واقعی در اندازه مدل نیست؛ بلکه در نرم‌افزار پیرامونی است که مدل را مجبور می‌کند هر ادعا را اثبات کند، شواهد را پیش از صرف منابع محاسباتی رتبه‌بندی کند و با هر قطعه متن خارجی به عنوان مورد مشکوک برخورد کند تا زمانی که سه ایجنت بر خلاف آن توافق کنند. برای هر کسی که در حال ساخت ابزارهای مبتنی بر هوش مصنوعی است، درس روشن است: اجازه دهید مدل فکر کند، اما اجازه دهید کد تصمیم بگیرد که مدل چه چیزی می‌تواند بگوید.