آیا Kimi K3 محصول تقطیر (Distillation) است؟ کارشناسان اتهامات را به چالش می‌کشند

تنش‌های ژئوپلیتیک پیرامون هوش مصنوعی، در حالی که مقامات ایالات متحده شرکت‌های چینی را به جاسوسی صنعتی متهم می‌کنند، به نقطه جوش رسیده است. در حالی که ادعاها حاکی از آن است که Moonshot AI از مدل Fable شرکت Anthropic برای آموزش مدل Kimi K3 خود استفاده کرده است، پژوهشگران پیشرو در حوزه هوش مصنوعی استدلال می‌کنند که واقعیت فنی توسعه مدل‌های زبانی بزرگ (LLM) داستان بسیار پیچیده‌تری را روایت می‌کند.

اتهامات مربوط به تقطیر مدل و سرقت مالکیت فکری (IP)

مایکل کراتسیوس، مشاور علمی کاخ سفید، اتهامات جدی را علیه Moonshot، شرکت سازنده Kimi K3 (که در حال حاضر بزرگترین LLM با وزن‌های باز (open-weight) موجود است)، مطرح کرده است. کراتسیوس مدعی است که Moonshot برای سرقت فناوری‌های انحصاری ایالات متحده، به «تقطیر صنعتی گسترده و پنهانی» دست زده است. این ادعا توسط اسکات بسنت، وزیر خزانه‌داری، تأیید شده است؛ وی خاطرنشان کرد که «واتر‌مارک‌های» (watermarks) مدل‌های زبانی بزرگ ایالات متحده در مدل‌های چینی مشاهده شده است.

تقطیر (Distillation) فرآیندی است که در آن یک مدل کوچک‌تر از طریق پرس‌وجو از یک مدل بزرگ‌تر و «پیشرو» (frontier)، برای استخراج توانایی‌های استدلالی و دانش آن آموزش می‌بیند. این فرآیند اغلب شامل تنظیم دقیق نظارت‌شده (SFT) است که در آن از پرامپت‌ها و پاسخ‌های یک مدل هدف برای آموزش مدل جدید استفاده می‌شود؛ امری که گاهی باعث می‌شود مدل جدید «رفتارها» یا ویژگی‌های گفتاری خاص مدل اصلی را تقلید کند.

چرا کارشناسان به نظریه تقطیر شک دارند

علی‌رغم وزن سیاسی این ادعاها، جامعه پژوهشی هوش مصنوعی همچنان نسبت به آن‌ها تردید دارد. برادن هنکاک، پژوهشگر موسسه Laude و یکی از بنیان‌گذاران Snorkel AI، به یک مشکل زمانی قابل توجه اشاره می‌کند: مدل Fable شرکت Anthropic تنها از اول جولای در دسترس عموم قرار گرفته است. هنکاک خاطرنشان کرد: «شما نمی‌توانید این حجم از داده‌ها را تقطیر کنید، یک مدل را آموزش دهید و تنها در دو هفته آن را منتشر کنید.»

علاوه بر این، ناتان لمبرت از موسسه هوش مصنوعی آلن (Allen Institute for AI) استدلال می‌کند که با حرکت مدل‌ها به سمت مرزهای پیشرفته (frontier)، تقطیر از طریق SFT کارایی کمتری پیدا می‌کند. برای دستیابی به سطح عملکرد مشاهده شده در Kimi K3، یک مدل احتمالاً به دورهای عظیم یادگیری تقویتی (RL) نیاز دارد. این فرآیند مستلزم آن است که ده‌ها میلیون عامل (agent) به پاسخ‌ها امتیاز دهند؛ وظیفه‌ای که اگر از طریق API یک رقیب انجام شود، بسیار هزینه‌بر و کند خواهد بود.

نقش سخت‌افزار و تخصص فنی

این جنجال تنها به نرم‌افزار محدود نمی‌شود. کراتسیوس همچنین ادعا کرد که Moonshot برای دسترسی به سخت‌افزارهای پیشرفته Nvidia، کنترل‌های صادراتی را دور زده است و به‌طور مشخص به تراشه‌های Grace Blackwell 300 و سرورهای مجهز به GB300 اشاره کرد. در حالی که صادرات این تراشه‌ها به چین ممنوع است، کارشناسانی مانند سام برسنیک از دانشگاه جورج‌تاون معتقدند که بازارهای سیاه و زنجیره‌های تأمین پیچیده جهانی، نظارت بر این جریان‌های سخت‌افزاری را بسیار دشوار می‌کند.

با این حال، بسیاری از پژوهشگران استدلال می‌کنند که تمرکز بر تقطیر، مشروعیت فنی تیم‌های هوش مصنوعی چینی را زیر سوال می‌برد. با توجه به اینکه بنیان‌گذاران این شرکت از موسسات نخبندی مانند دانشگاه کارنگی ملون برخاسته‌اند، کارشناسان معتقدند Moonshot قادر به انجام تحقیقات اصیل است و صرفاً به دنبال «سواری گرفتن بر موج موفقیت دیگران» نیست.

پیامدها برای رقابت جهانی هوش مصنوعی

این اختلاف، شکاف رو به گسترش میان روایت‌های سیاسی و واقعیت‌های فنی را برجسته می‌کند. همان‌طور که این صنعت به سمت یادگیری تقویتی پیچیده و نیازهای محاسباتی عظیم حرکت می‌کند، بحث در مورد اینکه آیا شرکت‌ها در حال «سرقت» هوش هستند یا صرفاً از طریق مهندسی برتر در حال پیشرفت‌اند، همچنان به سیاست‌های تجارت بین‌الملل و مقررات هوش مصنوعی شکل خواهد داد.

نکات کلیدی

  • تردید فنی: کارشناسان استدلال می‌کنند که انتشار سریع Kimi K3 از نظر ریاضی این احتمال را که صرفاً از طریق تقطیر مدل Fable شرکت Anthropic ساخته شده باشد، بسیار کم می‌کند.
  • فراتر از تنظیم دقیق: اگرچه تقطیر از طریق تنظیم دقیق نظارت‌شده (SFT) وجود دارد، اما دستیابی به عملکرد در سطح پیشرو (frontier) احتمالاً مستلزم یادگیری تقویتی پیشرفته‌ای است که نمی‌توان آن را به راحتی «کپی» کرد.
  • نگرانی‌های سخت‌افزاری: اتهامات مربوط به دسترسی غیرقانونی به تراشه‌های ممنوعه Nvidia Blackwell، لایه‌ای از پیچیدگی‌های ژئوپلیتیک را به بحث در مورد پیشرفت هوش مصنوعی چین می‌افزاید.