Açık ağırlık barındırmak egemenlik değildir. Egemenlik GPU’ların, ağ yolunun, ağırlıkların ve destek sözleşmesinin kontrolüdür. LMXAI’nin kullandığı dağıtım şekli ve her tedarikçiye sorduğumuz sorular budur.
Bir egemen vLLM dağıtımı, kontrol ettiğiniz GPU’larda işlettiğiniz, bir prompt’u yanıtlamak için ABD API’sini aramak zorunda olmayan bir ağda OpenAI uyumlu bir çıkarım hizmetidir. vLLM size sürekli batching, prefix caching ve tensör paralelliği verir. Egemenlik tasarımın geri kalanıdır: düğümler nerede yaşar, kim SSH yapabilir, loglar nereye gider ve başka bir yargı bölgesindeki bir destek mühendisi çekirdek dökümü çekebilir mi.
LMXAI bu kalıbı kurumsal çalışma alanları ve iç ajanlar için teslim eder. Serving katmanı, egemen AI platformu ve önünde duran mdGPT gateway ile aynı ailedendir.
| Sorun | Geçer | Başarısız |
|---|---|---|
| GPU’lar fiziksel olarak nerede durur? | Adlandırılmış AB metropolü / sizin rafınız | Söylenmeyen çoğaltmayla “AB bölgesi” |
| Prompt’lar için veri işleyen kim? | Siz veya DPA’lı adlandırılmış bir AB tüzel kişisi | Belirsiz alt işlemciler, varsayılan ABD ana şirket |
| Çıkarım egress kapalıyken çalışabilir mi? | Evet, belgelenmiş | Lisans kontrolü veya telemetri eve telefon etmeli |
| Ağırlıkları kim tutar? | Sizin nesne deponuz / PVC | Tedarikçi ağırlıkları istek başına çözer |
| Destek erişimi | Acil cam, loglanmış, AB personeli isteğe bağlı | Birlik dışından sürekli yönetici |
| Çıkış | Ağırlıkları, izleri ve IaC’yi siz tutarsınız | Model veya indeks onların kontrol düzleminde sıkışır |
| Sözleşmenin yargı yeri | AB üye devleti | Yalnızca California ToS |
Geçebilecek AB ev sahipleri: kendi raflarınız; hesabı siz sahibiyseniz ve gereksiz ekstraları kapatırsanız AB bare metal (örneğin OVHcloud, Hetzner, Scaleway); yazılı zorunlu egress’siz tasarımlı düzenlemeye tabi bir özel bulut. Hyperscaler “AB bölgesi” bir tasarımın parçası olabilir ama otomatik olarak egemen değildir — alt işlemcileri ve ayrıcalıklı erişim hikâyesini okuyun.
Fatura token değildir. Fatura boşta GPU süresi, bağlam uzunluğu, eşzamanlı oturumlar ve bir derlemi ne sıklıkla yeniden gömdüğünüzdür. Yüksek bellekli bir GPU çiftinde 32B AWQ modeli, %15 kullanımda oturan bir 70B’den çoğu zaman daha iyidir. LMXAI bunu bir trafik taslağı ve bir gecikme SLO’sundan boyutlandırır, ardından spekülatif decoding veya uzman offload’u yalnızca sayılar karmaşıklığı haklı çıkardığında ekler.
Çalışan bir vLLM hizmeti, kimlik doğrulama ve izleri olan bir gateway, ağırlık güncellemeleri için bir runbook ve kutuları kim barındırıyorsa tamamlanmış tedarikçi kontrol listesi. Uygulamayı yeniden yazmadan GPU tedarikçisini daha sonra değiştirebilmelisiniz.
Sonraki adım. Karar buysa LMXAI sistemi kapsamlar — workshop dizisi değil.