İşlere dön
Model · İnce ayar

mdAgent-Hermes-32B

Qwen3-VL-32B’nin güvenilir işlev çağırma ve belge anlama için optimize edilmiş çok kipli tool-use LoRA ince ayarı — tek bir on-prem GPU düğümünde çalışacak şekilde kuantize edildi.

Temel model
Qwen3-VL-32B
Yöntem
LoRA · çok kipli
Kuantizasyon
AWQ · INT4
Dahili eval
%82,3 BFCL-v3 tek tur

Genel bakış

Raftan alınan modeller, üretim ajanları için araç kullanımında nadiren yeterince güvenilirdir — argüman uydurur, şemaları kaçırır ve çok kipli girdide kırılır. mdAgent-Hermes-32B, 32B görü-dil modelini doğru aracı doğru argümanlarla çağırmada güvenilir kılan hedefli bir ince ayardır.

Küratörlenmiş çok kipli tool-use verisi üzerinde LoRA ile eğitilip ardından verimli serving için kuantize edilen model, gerçekçi bir on-prem donanım bütçesine sığarken güçlü işlev çağırma doğruluğunu korur.

LMXAI’nin dahili BFCL-v3 tek tur işlev çağırma eval’inde (evalscope) mdAgent-Hermes-32B %82,3 başarıya ulaştı. Bu, Berkeley Function-Calling Leaderboard v3 tek tur paketinin bizim koşumumuzdur — yayımlanmış üçüncü taraf bir sıralama değildir.

Yaklaşım

  • Qwen3-VL-32B’nin çok kipli tool-use izleri üzerinde LoRA ince ayarı.
  • Düşük bellek, yüksek throughput inference için kuantizasyon (AWQ, INT4).
  • İşlev çağırma ve muhakeme paketlerinde evalscope ile sıkı değerlendirme.
  • A100 kümesinde üretim dağıtımı için vLLM serving.

Değerlendirme

%82,3Dahili BFCL-v3 tek tur
evalscopeBFCL-v3 · HumanEval · GSM8K
HumanEvalKod muhakemesi
GSM8KMatematik muhakemesi

Yığın

PyTorchLoRAQwen3-VL-32BAWQINT4vLLMevalscopeA100
Tüm işler Sonraki: mdGPT Gateway