Kimi K3، جدیدترین مدل با وزن‌های باز از تیم Kimi، با یک معماری اصلی Mixture-of-Experts (MoE) با ۲.۸ تریلیون پارامتر و پنجره زمینه (context window) ۱ میلیون توکنی عرضه شده است که بلافاصله قابلیت‌های اجرای محلی برای توسعه‌دهندگان را بدون وابستگی به APIهای بسته گسترش می‌دهد.

طراحی MoE تعداد پارامترهای فعال را در ۱۰۴ میلیارد محدود می‌کند و در عین حال که سرعت را ثابت نگه می‌دارد، قدرت استدلال یک مدل چند تریلیونی را ارائه می‌دهد. این کارایی باعث افزایش ۲.۵ برابری نسبت به نسخه قبلی Kimi K2 شده است؛ جهشی بزرگ برای هر کسی که با محدودیت‌های محاسباتی یا تأخیر (latency) در مدل‌های باز موجود مواجه شده است.

چرا این ارتقا در حال حاضر اهمیت دارد

مدل‌های با وزن‌های باز به‌طور سنتی در مقیاس و طول زمینه از سیستم‌های انحصاری عقب مانده بودند. Kimi K3 با ترکیب اندازه عظیم با پنجره زمینه‌ای که یک میلیون توکن کامل را در خود جای می‌دهد، بازی را تغییر می‌دهد؛ این مقدار برای دریافت یک مخزن کد کامل یا یک مقاله پژوهشی طولانی در یک مرحله کافی است. برای توسعه‌دهندگانی که در حال ساخت خط‌لوله‌های تولید تقویت‌شده با بازیابی (RAG)، دستیاران متنی طولانی یا ابزارهای عیب‌یابی خودکار هستند، این زمینه اضافی نیاز به استراتژی‌های تکه‌تکه کردن (chunking) را کاهش می‌دهد.

زیرساخت‌های فنی

  • مسیریابی Stable LatentMoE: توکن‌ها بین ۸۹۶ متخصص توزیع می‌شوند و برای هر توکن ۱۶ متخصص فعال می‌گردند. این فعال‌سازی پراکنده (sparse activation)، ردپای حافظه را کاهش می‌دهد در حالی که همچنان از مخزن عظیمی از دانش بهره می‌برد.
  • Kimi Delta Attention (KDA): یک گونه جدید از مکانیزم توجه (attention) که جریان اطلاعات را در شبکه‌های عمیق تثبیت می‌کند و خطر ناپایداری گرادیان را که می‌تواند گریبان‌گیر مدل‌های بسیار بزرگ شود، کاهش می‌دهد.
  • آموزش موازی با متخصصان (Expert-parallel training): تیم محاسبات را به‌گونه‌ای تنظیم کرده است که هر متخصص روی بخش مجزایی از سخت‌افزار اجرا شود و از گلوگاه‌هایی که هنگام رقابت متخصصان زیاد برای منابع یکسان ایجاد می‌شوند، جلوگیری کند.
  • مدیریت پیشرفته حافظه: استراتژی‌های تخصصی تخصیص حافظه به مدل اجازه می‌دهد تا آموزش عامل‌های مبتنی بر یادگیری تقویتی را بدون مصرف تمام حافظه GPU پشتیبانی کند.

آنچه وزن‌های باز امکان‌پذیر می‌کنند

از آنجایی که وزن‌ها عمومی هستند، کاربران می‌توانند بازنمایی‌های داخلی مدل را بازرسی کنند، سوگیری‌ها را شناسایی کنند یا آن را برای حوزه‌های تخصصی شخصی‌سازی کنند. تنظیم دقیق (Fine-tuning) روی داده‌های اختصاصی دیگر نیازی به قراردادهای ابری ندارد؛ کل خط‌لوله می‌تواند روی سخت‌افزار محلی (on-prem) که الزامات آموزش موازی متخصصان تیم را برآورده می‌کند، اجرا شود.

موارد استفاده فوری برای توسعه‌دهندگان

  • سیستم‌های تولید تقویت‌شده با بازیابی (RAG) که از مخازن اسناد عظیم در یک پرامپت واحد استفاده می‌کنند.
  • دستیاران کدنویسی متنی طولانی که کل زمینه پروژه را در حافظه نگه می‌دارند.
  • ابزارهای تحلیل کد در سطح مخزن که میلیون‌ها خط کد را بدون شکستن محدودیت پرامپت اسکن می‌کنند.
  • عامل‌های عیب‌یابی خودکار که در حین استدلال برای اصلاحات، یک ردپای کامل از اجرا (execution trace) را حفظ می‌کنند.