چرا مدل‌های با وزن باز (open-weight) اکنون اهمیت یافته‌اند

رهبران هوش مصنوعی آمریکا مانند OpenAI، Google و Anthropic قدرتمندترین مدل‌های خود را به صورت کدبسته (closed-source) نگه می‌دارند. کاربران از طریق APIهای ابری به آن‌ها دسترسی دارند، که این امر به ارائه‌دهندگان اجازه می‌دهد نرم‌افزار، داده‌های عبوری و درآمد حاصل از هر پرس‌وجو را کنترل کنند. استارتاپ‌های چینی — DeepSeek، Qwen و Moonshot — برعکس عمل می‌کنند. آن‌ها وزن‌های خام را منتشر می‌کنند و اجازه می‌دهند هر کسی فایل‌ها را دانلود، آن‌ها را بازتنظیم (fine-tune) و استنتاج (inference) را روی سخت‌افزارهای محلی خود انجام دهد.

برای کشوری که نمی‌تواند جدیدترین GPUها را وارد کند، ارائه مدل به جای توان محاسباتی (compute)، آن را کاربردی نگه می‌دارد. یک کاربر در سنگال، یک شرکت متوسط در برزیل یا یک دانشگاه در هند می‌تواند با هر سخت‌افزاری که به دست می‌آورد، یک سرور را راه‌اندازی کرده و مدل چینی را بدون تماس با سرویس‌های ابری ایالات متحده اجرا کند. داده‌ها هرگز از حوزه قضایی کاربر خارج نمی‌شوند، که این یک نقطه قوت برای دولت‌هایی است که نسبت به قوانین دسترسی داده‌های آمریکا بدبین هستند.

زاویه دیپلماتیک

پکن هوش مصنوعی را به عنوان «خرد جمعی بشریت» معرفی می‌کند تا خود را به عنوان یک جایگزین همکاری‌جو در مقابل آنچه «انحصار استثنایی» ایالات متحده می‌نامد، جلوه دهد. این روایت ادعا می‌کند که غرب قدرتمندترین مدل‌های خود را پشت استدلال‌های امنیت ملی پنهان می‌کند، در حالی که چین یک منبع باز و مشترک ارائه می‌دهد. اگر توسعه‌دهندگان کافی در سراسر جهان مدل‌های چینی را بپذیرند، یک اکوسیستم موازی می‌تواند شکل بگیرد — اکوسیستمی که بر پایه معماری، زنجیره ابزار (toolchains) و خروجی‌های تحقیقاتی با منشأ چینی بنا شده است.

آن اکوسیستم به پکن قدرت نرمی بسیار فراتر از پروژه‌های معمول تجاری یا زیرساختی خواهد بخشید. کشورهایی که پشته‌های (stacks) هوش مصنوعی خود را بر پایه مدل‌های چینی می‌سازند، ممکن است با استانداردهای چینی در زمینه حکمرانی داده، امنیت سایبری و ژئوپلیتیک همسویی بیشتری پیدا کنند.

حقیقت تلخ: توان محاسباتی همچنان یک گلوگاه است

استراتژی وزن باز، شکاف سخت‌افزاری را از بین نمی‌برد. آموزش یک مدل زبانی بزرگ یک هزینه یک‌باره است. برای مثال، مدل V3 شرکت DeepSeek روی تقریباً ۲,۰۰۰ پردازنده گرافیکی H800 آموزش دیده است — کلاستر قابل توجه اما قابل مدیریت برای یک آزمایشگاه با بودجه مناسب. اما سرویس‌دهی به مدل — یعنی مدیریت میلیاردها درخواست استنتاج در روز — نیازمند ناوگانی از GPUها است که به‌طور مداوم در حال گسترش باشد.

شرکت‌های آمریکایی از هم‌اکنون طرح‌هایی برای استقرار بیش از یک میلیون GPU دارند. این اعداد نشان‌دهنده مقیاسی است که برای پاسخگو نگه داشتن یک مدل برای میلیون‌ها کاربر در سراسر جهان لازم است. شرکت‌های چینی نمی‌توانند با این مقیاس رقابت کنند، زیرا ممنوعیت‌های صادراتی که جریان GPUهای پیشرفته را متوقف کرده، تولیدکنندگان داخلی مانند SMIC را نیز محدود کرده است؛ شرکت‌هایی که هنوز از پیشرفته‌ترین گره‌های فرآیند (process nodes) عقب هستند.

شرکت‌های چینی با انتشار وزن‌های مدل، بار محاسباتی را به دوش کاربران می‌اندازند. کاربران سخت‌افزار را تامین می‌کنند، هزینه برق را می‌پردازند و هزینه‌های عملیاتی را مدیریت می‌کنند. در تئوری، این کار از کمبود داخلی تراشه عبور می‌کند؛ اما در عمل، خدمات هوش مصنوعی چین را از حالت «به‌عنوان-سرویس» (as-a-service) به حالت «به‌عنوان-دانلود» (as-a-download) تبدیل می‌کند. این معامله شفاف است: مدل در دسترس می‌ماند، اما عملکرد و تأخیر (latency) به سخت‌افزار کاربر نهایی بستگی دارد که اغلب بسیار ضعیف‌تر از کلاسترهای ابری است که ChatGPT شرکت OpenAI یا Gemini گوگل را تغذیه می‌کنند.

آنچه این استراتژی نادیده می‌گیرد

  • نگرانی‌های امنیتی – توزیع باز، کار را برای عوامل مخرب آسان‌تر می‌کند تا قابلیت‌های پنهان را بگنجانند یا مدل را بر روی داده‌های سوگیرانه بازتنظیم کنند. بدون یک مرجع مرکزی برای اعمال به‌روزرسانی‌های امنیتی، آسیب‌پذیری‌ها می‌توانند باقی بمانند.

دیدگاه هند

هند در دوراهی‌ای قرار دارد که در آن رویکرد وزن باز چین هم فرصت و هم هشدار محسوب می‌شود.

  • خودمختاری استراتژیک – توسعه‌دهندگان هندی می‌توانند بدون پرداخت هزینه به ازای هر توکن (per-token) به ارائه‌دهندگان آمریکایی، با مدل‌های باکیفیت آزمایش کنند؛ این امر هزینه ساخت چت‌بات‌های سفارشی، ابزارهای ترجمه و دستیارهای تخصصی را کاهش می‌دهد.
  • فوریت سخت‌افزاری – تجربه چین بر نیاز به یک زنجیره تأمین نیمه‌هادی بومی تأکید می‌کند. بدون ظرفیت تولید داخلی (fab) برای GPUهای پیشرفته یا شتاب‌دهنده‌های هوش مصنوعی، هند ممکن است به وارداتی وابسته شود که در اختلافات ژئوپلیتیک آینده می‌تواند محدود شود.
  • مدیریت ریسک – مدل‌های باز، نانی رایگان نیستند. سیاست‌گذاران باید منشأ داده‌های آموزشی و احتمال وجود درهای پشتی (backdoors) پنهان را ارزیابی کنند. فرآیند حسابرسی شفاف و تخصص محلی در تأیید مدل‌ها به امری ضروری تبدیل می‌شود.

استدلال متقابل: باز بودن می‌تواند یک نقطه قوت باشد

موافقان استدلال می‌کنند که باز بودن، نوآوری را سریع‌تر از پلتفرم‌های بسته هر شرکت واحدی تحریک می‌کند. اجازه دادن به هر کسی برای تغییر مدل، باعث ظهور کاربردهای خاصی می‌شود که ارائه‌دهندگان بزرگ هرگز آن‌ها را در اولویت قرار نمی‌دهند. یک مدل محاسباتی توزیع‌شده نیز می‌تواند تاب‌آورتر باشد؛ یک شبکه جهانی از سرورهای مستقل می‌تواند یک سرویس را حتی اگر مرکز داده‌ی یکی از ارائه‌دهندگان از دسترس خارج شود، زنده نگه دارد.

نقطه ضعف این است که سقف عملکرد همچنان به سخت‌افزاری که هر کاربر قادر به تهیه آن است، وابسته می‌ماند. شرکت‌هایی که به زمان پاسخ‌گویی زیر یک ثانیه در مقیاس بسیار بزرگ نیاز دارند، همچنان از مدل ابری بهره می‌برند.

آنچه باید در ادامه زیر نظر داشت

  • تغییرات سیاست‌های صادراتی – هرگونه تسهیل یا تشدید کنترل‌های صادرات تراشه ایالات متحده، مستقیماً بر توانایی چین در آموزش مدل‌های جدیدتر تأثیر می‌گذارد و می‌تواند باعث بازگشت به سمت محصولات بسته‌تر شود.

نتیجه‌گیری

تلاش چین برای مدل‌های هوش مصنوعی با وزن باز (open-weight)، یک راهکار عمل‌گرایانه برای رفع کمبود سخت‌افزاری است که بر اثر ممنوعیت‌های صادراتی ایجاد شده است. این اقدام، حسن نیت دیپلماتیک را نشان می‌دهد و نقطه ورود کم‌هزینه‌ای را برای توسعه‌دهندگان جهانی فراهم می‌کند، اما مشکل اصلی کمبود توان محاسباتی را حل نمی‌کند. برای کشورهایی مانند هند، این استراتژی هم الگویی برای ایجاد استقلال در حوزه هوش مصنوعی است و هم یک درس عبرت درباره وابستگی به زنجیره‌های تأمین نیمه‌هادی خارجی. چند ماه آینده مشخص خواهد کرد که آیا مدل‌های با وزن باز به ستونی ماندگار در اکوسیستم هوش مصنوعی تبدیل می‌شوند یا صرفاً یک راهکار موقت تا زمان کاهش شکاف تراشه‌ای باقی می‌مانند.