Tüm içgörüler
Inference · Yerinde & özel bulut

Egemen vLLM dağıtımı — ve tedarikçi kontrol listesi

Açık ağırlık barındırmak egemenlik değildir. Egemenlik GPU’ların, ağ yolunun, ağırlıkların ve destek sözleşmesinin kontrolüdür. LMXAI’nin kullandığı dağıtım şekli ve her tedarikçiye sorduğumuz sorular budur.

Çalışma zamanı
Kubernetes üzerinde vLLM
Varsayılan
Zorunlu egress yok
Donanım
A100 sınıfı / eşdeğeri
Bölge
AB, sizin sözleşmeniz altında

English version  ·  Nederlandse versie

“Egemen vLLM” ne anlama gelir

Bir egemen vLLM dağıtımı, kontrol ettiğiniz GPU’larda işlettiğiniz, bir prompt’u yanıtlamak için ABD API’sini aramak zorunda olmayan bir ağda OpenAI uyumlu bir çıkarım hizmetidir. vLLM size sürekli batching, prefix caching ve tensör paralelliği verir. Egemenlik tasarımın geri kalanıdır: düğümler nerede yaşar, kim SSH yapabilir, loglar nereye gider ve başka bir yargı bölgesindeki bir destek mühendisi çekirdek dökümü çekebilir mi.

LMXAI bu kalıbı kurumsal çalışma alanları ve iç ajanlar için teslim eder. Serving katmanı, egemen AI platformu ve önünde duran mdGPT gateway ile aynı ailedendir.

Referans şekil

  • Küme: Veri merkezinizde veya sahip olduğunuz bir AB bare-metal/özel bulut hesabında Kubernetes.
  • Serving: Dahili bir gateway arkasında vLLM (isteğe bağlı AWQ/INT4) — FastAPI, SSE, ad alanı başına anahtarlar.
  • Ağ: varsayılan-reddet egress. Görüntüleri kontrol ettiğiniz bir aynadan çekin. İstek anında model tedarikçisine geri arama yok.
  • Durum: ağırlıklar sizin biriminizde; KV-cache GPU düğümlerinde; uygulama logları sizin toplayıcınızda (OpenTelemetry).
  • Operasyon: bir tedarikçinin kota sayfasında değil, kuyruk derinliğinde otomatik ölçekleme.

Tedarikçi kontrol listesi (satın almada bunu kullanın)

SorunGeçerBaşarısız
GPU’lar fiziksel olarak nerede durur?Adlandırılmış AB metropolü / sizin rafınızSöylenmeyen çoğaltmayla “AB bölgesi”
Prompt’lar için veri işleyen kim?Siz veya DPA’lı adlandırılmış bir AB tüzel kişisiBelirsiz alt işlemciler, varsayılan ABD ana şirket
Çıkarım egress kapalıyken çalışabilir mi?Evet, belgelenmişLisans kontrolü veya telemetri eve telefon etmeli
Ağırlıkları kim tutar?Sizin nesne deponuz / PVCTedarikçi ağırlıkları istek başına çözer
Destek erişimiAcil cam, loglanmış, AB personeli isteğe bağlıBirlik dışından sürekli yönetici
ÇıkışAğırlıkları, izleri ve IaC’yi siz tutarsınızModel veya indeks onların kontrol düzleminde sıkışır
Sözleşmenin yargı yeriAB üye devletiYalnızca California ToS

Geçebilecek AB ev sahipleri: kendi raflarınız; hesabı siz sahibiyseniz ve gereksiz ekstraları kapatırsanız AB bare metal (örneğin OVHcloud, Hetzner, Scaleway); yazılı zorunlu egress’siz tasarımlı düzenlemeye tabi bir özel bulut. Hyperscaler “AB bölgesi” bir tasarımın parçası olabilir ama otomatik olarak egemen değildir — alt işlemcileri ve ayrıcalıklı erişim hikâyesini okuyun.

GPU satın almadan önce modellemeniz gereken maliyet sürücüleri

Fatura token değildir. Fatura boşta GPU süresi, bağlam uzunluğu, eşzamanlı oturumlar ve bir derlemi ne sıklıkla yeniden gömdüğünüzdür. Yüksek bellekli bir GPU çiftinde 32B AWQ modeli, %15 kullanımda oturan bir 70B’den çoğu zaman daha iyidir. LMXAI bunu bir trafik taslağı ve bir gecikme SLO’sundan boyutlandırır, ardından spekülatif decoding veya uzman offload’u yalnızca sayılar karmaşıklığı haklı çıkardığında ekler.

LMXAI ne teslim eder

Çalışan bir vLLM hizmeti, kimlik doğrulama ve izleri olan bir gateway, ağırlık güncellemeleri için bir runbook ve kutuları kim barındırıyorsa tamamlanmış tedarikçi kontrol listesi. Uygulamayı yeniden yazmadan GPU tedarikçisini daha sonra değiştirebilmelisiniz.

Sonraki adım. Karar buysa LMXAI sistemi kapsamlar — workshop dizisi değil.

Proje başlat