Bulut API'leri, kullanışlı olmaktan çıkana kadar kullanışlıdır. Aylık faturanız sinsice artar. Bir fiyat değişikliği bütçenizi altüst eder. Ve bir yerlerde, o küçük puntolu metinlerde, size özel verileriniz bir başkasının modelini eğitiyordur. Bu sürtünme, daha fazla geliştiriciyi yerel yapay zeka iş istasyonları kurmaya itiyor. Donanımı bir kez satın alırsınız, tüm yığını tamamen sahiplenirsiniz ve makinenizden tam olarak hangi verinin çıkacağına siz karar verirsiniz.

Bu hafta, bu geçişi daha pratik hale getiren üç somut gelişme yaşandı: finansal verilerinizi evde tutan Docker tabanlı bir ticaret asistanı, NVIDIA GPU'ları kendi kontrolünüz altına almanızı sağlayacak doğrudan bir kılavuz ve robotik öğrenmeyi bir tüketici masaüstüne yaklaştıran Hugging Face'ten yeni bir sürüm.

Ticaret Verilerinizi Docker ile Yerel Tutun

Bir geliştirici, özellikle ticaret iş akışları için oluşturulmuş yerel bir yapay zeka araştırma asistanı olan TradingSpy'ı yayınladı. Piyasa verilerini ve kişisel izleme listelerini uzak bir uç noktaya (endpoint) göndermek yerine, her şeyi kendi donanımınızdaki bir Docker konteyneri içinde çalıştırırsınız.

Finansal veriler olabilecek en hassas verilerdir. Portföy bileşiminiz, ticaret notlarınız ve geçmiş pozisyonlarınız, eğer kaçınabiliyorsanız üçüncü taraf bir API üzerinden geçmemelidir. Modeli yerel olarak çalıştırmak bu riski tamamen ortadan kaldırır. Konteyner çıkarımı (inference) gerçekleştirir ve ham aracı kurum verilerinizin kutunun dışına çıkmasına asla gerek kalmaz.

Docker ayrıca Python makine öğrenmesi projelerinin belini büken karmaşık bağımlılık sorununu da çözer. Ticaret yığınları (stacks) genellikle pandas gibi veri kütüphanelerini, teknik analiz araç kitlerini ve GPU hızlandırmalı çıkarım motorlarını karıştırır. İzolasyon olmazsa, bir proje CUDA 11.8 talep ederken diğeri 12.1 ister ve temel sisteminiz çakışan ortam değişkenlerinin mezarlığına dönüşür. Docker, her bağımlılık grafiğini kendi imajına kilitler. Bir kez oluşturursunuz ve bu imaj; bir headless Ubuntu sunucuda, WSL2 yüklü bir Windows 11 masaüstünde veya küçük bir ev laboratuvarı NAS cihazında aynı şekilde çalışır. Hatta yerel veri dizinlerinizi konteynere bind-mount yaparak, yürütme ortamı temiz kalırken dosyalarınızın dosya sisteminizde kalmasını sağlayabilirsiniz.

Burada bir maliyet argümanı da var. Bulut LLM API'leri token başına ücret alır. Yüzlerce sembol (ticker) üzerinde piyasa öncesi tarama yapıyor, fiyat hareketlerini, haber özetlerini ve teknik göstergeleri bir modele besliyorsanız, bu çağrılar hızla katlanır. Yerel bir modelde çalışan bir sayaç yoktur. Bir GPU'nun başlangıç maliyeti bir kez can yakar; API faturası ise her ay can yakar.

NVIDIA GPU Ortamlarını Anlamak

Bulut API'lerinden yerel bir NVIDIA karta geçmek, PyTorch yükleyip .to('cuda') çağırmak kadar basit değildir. Gerçek bir öğrenme eğrisi vardır ve bunu anlamak, bir hobi betiği ile güvenilir bir iş istasyonu arasındaki farkı belirler.

Bulut API'leri donanımı gizler. JSON gönderirsiniz, JSON alırsınız. Yerelde ise sistem yöneticisi sizsinizdir. Doğru sürücüye, uyumlu bir CUDA toolkit'ine ve GPU mimariniz için derlenmiş bir PyTorch sürümüne ihtiyacınız vardır. Ardından, bunu çalışma zamanınıza (runtime) bağlamanız gerekir; bu, konteynerler için nvidia-docker çalışma zamanını yapılandırmak veya bare metal üzerinde LD_LIBRARY_PATH'i yönetmek anlamına gelebilir. Her katmanın eşleşmesi gereken bir sürüm demeti (version tuple) vardır ve eşleşmediğinde, eksik kütüphaneler veya başlatılmamış cihazlar hakkında anlaşılması güç hatalar alırsınız.

Bunun karşılığı doğrudan donanım kontrolüdür. GPU belleğinin katı bir sınır olduğunu öğrenirsiniz. İşletim sisteminin takas (swap) ve sayfalama (paging) yapabildiği sistem RAM'inin aksine, VRAM'in tükenmesi genellikle çöken bir eğitim işi veya anında başarısız olan bir çıkarım grubu (inference batch) anlamına gelir. Bu kısıtlama sizi toplu işlem boyutu (batch sizing), karma hassasiyetli eğitim (mixed-precision training) ve bellek profilleme üzerine düşünmeye zorlar. Hesaplamayı sonsuz bir hizmet olarak görmeyi bırakıp, yönettiğiniz sınırlı bir kaynak olarak görmeye başlarsınız.

Bu hafta dolaşımda olan yararlı bir kılavuz, kurumsal ve tüketici sınıfı GPU'ları aynı tür olarak ele alıyor. İster veri merkezi sınıfı bir A100, ister tüketici sınıfı bir RTX 4070 kullanın, temeller değişmez. Her ikisi de aynı CUDA programlama modeline dayanır. Her ikisi de tensörleri açıkça cihaza taşımanızı gerektirir. Her ikisi de on iki gigabaytlık bir karta on dört gigabaytlık bir model atamaya çalışırsanız sizi aynı şekilde cezalandırır. Bu dersler aktarılabilir niteliktedir. Masaüstünüzdeki kart üzerinde prototip oluşturabilir ve daha sonra daha büyük donanımlara ölçeklendiğinizde tam olarak aynı optimizasyon yaklaşımını uygulayabilirsiniz.

LeRobot v0.6.0 Robotik Çalışmalarını Masanıza Getiriyor

Hugging Face, sohbet botlarının ve görüntü oluşturucuların arkasındaki Transformers ve Diffusers kütüphanelerini çok farklı bir görev için yeniden amaçlandıran bir çerçeve olan LeRobot'un 0.6.0 sürümünü yayınladı: robot öğrenimi. Model, bir sonraki kelimeyi veya pikseli tahmin etmek yerine, bir kamera görüntüsü ve bir dil talimatı verildiğinde bir sonraki motor eylemini tahmin eder.

Robotik, uzun süredir hareket yakalama odalarına ve endüstriyel GPU kümelerine erişimi olan, iyi finanse edilmiş laboratuvarlara ayrılmış bir disiplin gibi görünüyordu. LeRobot bu engeli aşındırıyor. 0.6.0 sürümü; robotik politikaları nasıl tasarladığınızı, eğittiğinizi ve değerlendirdiğinizi basitleştiriyor. Simülasyonda prototip oluşturabilir, politika mimarisi üzerinde yinelemeler yapabilir ve ardından binlerce satır düşük seviyeli kontrol kodu yazmadan gerçek bir kola veya mobil tabana aktarabilirsiniz.

Bu sürümü dikkat çekici kılan şey, tüketici GPU'larını hedeflemesidir. Deney yapmak için bir sunucu rafına ihtiyacınız yok. Tek bir üst düzey tüketici kartı, gerçek tutuculara ve kollara genellenebilen politikalar eğitebilir. Bu, açık ağırlıklı modellerin buluttan çıkıp fiziksel donanıma sızdığının açık bir işaretidir. Ağırlıklar sürücünüzde yaşar. Robot, bir API'ye ağ üzerinden gidip gelmeye gerek kalmadan komutları alır. Gerçek dünyada hareket eden bir şeyi kontrol ederken, gecikme ve gizlilik avantajlarını görmezden gelmek zordur.

Bu durum aynı zamanda yazılım ve donanım arasındaki sınır hakkındaki düşüncelerinizi de değiştiriyor. Robotik politikalar eskiden makalelerde yaşardı. Şimdi ise klonlayabileceğiniz, kendi hareket verilerinizle ince ayar yapabileceğiniz ve sahip olduğunuz donanımlarda dağıtabileceğiniz depolarda yaşıyorlar.

Asıl Kazanç Kontroldür

Yerel bir yapay zeka yığını oluşturmak, prensip gereği bulutu reddetmekle ilgili değildir. Bu, neye değer verdiğinize bağlı olarak hesaplamanızın nerede gerçekleşeceğini seçmekle ilgilidir. Modelleri yerel olarak çalıştırdığınızda, verileriniz sürücülerinizde kalır. Maliyetleriniz, öngörülemeyen aylık bir ölçümden sabit bir donanım yatırımına dönüşür. Ve sadece bir API tüketicisi değil, bir sistem mühendisi olmanızı sağlayacak beceriler—CUDA hata ayıklama, VRAM profilleme, iş akışlarını konteynerleştirme—kazanırsınız.

Araçlar hazır. Modeller tüketici kartlarına sığacak kadar küçük. Geriye kalan tek soru, yığını kendinize mi ait etmek istediğiniz yoksa kiralamaya devam mı etmek istediğinizdir.