Alibaba Qwen3.8-Max'i Tanıttı: Yapay Zeka Ajanları İçin 2,4 Trilyon Parametreli Bir Dev
Alibaba'nın Qwen ekibi, basit sohbet istemlerinin ötesine geçerek uzun vadeli (long-horizon) otonom akıl yürütmeye odaklanan, 2,4 trilyon parametreli devasa amiral gemisi modeli Qwen3.8-Max'i duyurdu. Çok günlük iş akışlarına ve karmaşık görev yürütmelerine odaklanan bu model, reaktif LLM'lerden proaktif yapay zeka ajanlarına doğru önemli bir değişimi temsil ediyor.
Otonom Zeka İçin Parametre Ölçeklendirme
Qwen3.8-Max, sorgu başına 95 milyar aktif parametre ile toplam 2,4 trilyon parametre kullanan teknik bir güç merkezidir. Qwen3.5 mimarisi üzerine inşa edilen model, yapay zekanın günler hatta haftalar boyunca bağımsız olarak çalışmasını gerektiren karmaşık hedefler olan "uzun vadeli" (long-horizon) görevler için özel olarak optimize edilmiştir.
Açık kaynak topluluğu için önemli bir adım olan Alibaba, Qwen-Max sınıfı için ağırlıkların (weights) önümüzdeki hafta halka açılacağını doğrulayarak GPT ve Claude gibi sınır modellerin (frontier models) kapalı kapılar ardındaki hakimiyetine meydan okuyor.
Kodlama ve Araştırma Yoluyla Otonomiyi Kanıtlama
Ajan yeteneklerini sergilemek için Alibaba, modelin insan müdahalesi olmadan çalıştığı birkaç kritik vaka çalışması sundu:
- Yazılım Mühendisliği: 16 günlük bir süre boyunca Qwen3.8-Max,
oh-my-clikomut satırı aracını otonom olarak geliştirdi. Kendi GitHub sorunlarını (issues) yönetti, kod yazdı, testler çalıştırdı, 265 commit ve 127 pull request gerçekleştirdi. - Bilimsel Yeniden Üretim: "Unified Data Selection for LLM Reasoning" makalesinin sonuçlarını yeniden üretmekle görevlendirilen model, 7.600 satır kod yazmak için 125 saatlik hesaplama süresi harcadı. Sadece orijinal araştırmayı kopyalamakla kalmadı, aynı zamanda AIME24 matematik kıyaslama (benchmark) skorunu 2,7 puan artırdı.
- Rekabetçi Veri Bilimi: WWW2025 Multimodal Dialogue Intent Recognition Challenge kapsamında model, 526 insan ekibinden 458'ini geride bırakarak doğruluğunu 24 saat içinde 0,60'tan 0,853'e çıkardı.
Yazılımın Ötesinde: Çip Tasarımı ve Mali Simülasyon
Qwen3.8-Max'in akıl yürütme yeteneği donanım ve ekonomiye de uzanıyor. Bir kriptografik devre tasarımı görevinde model, "şişkin" bir tasarımı yinelemeli olarak 8.298 mantık kapısından sadece 678 kapıya düşürdü. OpenROAD aracının kullanılmasıyla bu, fiziksel çip alanında %81'lik bir azalma sağladı.
E-Commerce-Bench adlı karmaşık bir perakende simülasyonunda model, simüle edilmiş bir mali yıl boyunca birden fazla çevrimiçi mağazayı yönetti. 100.000 yuan ile başlayarak tedarikçi müzakerelerini yürüttü, 152 dolandırıcıyı tespit etti ve tedarik zinciri aksamalarını yöneterek 416.252 yuan ile bitirdi; böylece başlangıç sermayesini dört katına çıkardı ve ikinci olan GLM 5.2'yi önemli ölçüde geride bıraktı.
Multimodal Sınırlar ve Kıyaslama Hakimiyeti
Model ayrıca, 200 sayfalık belgeleri ve 100 saati aşan videoları işleyebilme yeteneğiyle multimodal işlemenin sınırlarını zorluyor. Alibaba ayrıca, bir ajanın çalışan uygulamaları (Windows, macOS, Android vb.) kaynak koduna erişimi olmadan, yalnızca görsel ve klavye etkileşimi yoluyla yeniden yapılandırma yeteneğini test eden bir kıyaslama olan RecreationBench'i tanıtıyor.
Dahili kıyaslamalara göre Qwen3.8-Max, PaperBench'te 93 gibi lider bir skor dahil olmak üzere çeşitli kategorilerde Claude Opus 4.8 ve GPT-5.6 Sol'un yakınında veya üzerinde yer alarak üst düzey modellerle doğrudan rekabet ediyor.
Önemli Çıkarımlar
- Devasa Ölçek: Qwen3.8-Max, çok günlük otonom iş akışları için optimize edilmiş 2,4 trilyon toplam parametre ve 95 milyar aktif parametreye sahiptir.
- Ajan Yetkinliği: Model; karmaşık yazılım mühendisliği, çip tasarımı optimizasyonu ve tam ölçekli mali yönetimi otonom olarak yürütme yeteneğini kanıtlamıştır.
- Açık Ağırlık Etkisi: Birçok sınır modelin aksine Alibaba, Qwen-Max sınıfı için ağırlıkları yayınlamayı planlayarak geliştiricilere üst düzey ajan zekasına benzer görülmemiş bir erişim imkanı sunuyor.
