İşlere dön
Araştırma · NLP

Derinlemesine NLP Analizi

Ham terim sıklığından ve kelime dağılımından LDA ile gizli konu keşfine uzanan derlem düzeyinde bir dil analizi hattı — Learning Matrix’in retrieval ve içerik anlama katmanını beslemek üzere kuruldu.

Yöntem
LDA konu modellemesi
Araçlar
pyLDAvis · NLTK · gensim
Çıktı
20+ keşfedilen konu
Uygulandığı yer
Learning Matrix

Genel bakış

Öğrencilerin gerçekte ne sorduğunu — ve bu soruların nasıl kümelendiğini — anlamak, güvenilir bir eğitim AI’sının temelidir. Bu analiz teknik bir S&C derlemini alır, sinyale indirger ve gizli konu yapısını modeller; böylece retrieval katmanı yanıtları anlamsal farkındalıkla getirebilir, sıralayabilir ve açıklayabilir.

Hat üç aşamada çalışır: terim dağılımını anlamak için derlem istatistikleri, gizli temaları keşfetmek için LDA konu modellemesi ve modeli üretim retrieval’ına bağlamadan önce konu tutarlılığını doğrulamak için etkileşimli keşif.

Adım 01

Derlem İstatistikleri

Ham terim sıklığı ve sözcük dağarcığı dağılımı — hangi tokenların sinyal taşıdığını ve modellemeden önce hangilerinin süzülmesi gerektiğini belirler.

Kelime sayıları — derlemde en sık 15 terim

Şekil 1. Kelime sayıları — en sık 15 terim. model, typing ve extensions baskın; standart stopword’ler çıkarılmış.

Kelime bulutu — sıklığa göre ağırlıklandırılmış tam sözcük dağarcığı

Şekil 2. Kelime bulutu — terim sıklığına göre ağırlıklandırılmış sözcük dağarcığı. Baskın terimler: model, classifier, type, one, sequence, embedding, document, feature.

Baskın terim
model

Sıklık: 36 — her konu kümesini bağlayan çekirdek kavram.

Sözcük dağarcığı sinyali
ML / NLP

Derlem teknik olarak yoğundur: embedding, classifier, sequence, feature ölçekte birlikte geçer.

Ön işleme
Lemmatize

Stopword’ler çıkarıldı, tokenlar küçük harfe alındı ve LDA girişinden önce lemmatize edildi.

Adım 02

LDA Konu Modellemesi

Temizlenmiş derlem üzerinde Latent Dirichlet Allocation — 20+ tutarlı konu keşfi; ayrışma ve terim saliency’si pyLDAvis ile görselleştirildi.

pyLDAvis — marjinal konu dağılımıyla Konular Arası Mesafe Haritası

Şekil 3. Konular Arası Mesafe Haritası (PC1/PC2 üzerine çok boyutlu ölçekleme). Daire boyutu = marjinal konu olasılığı. Konular 1–4 büyük, iyi ayrışmış kümelerdir; Konular 5–20 daha küçük, sıkı paketlenmiş niş temalardır. λ = 1 her konu içindeki ham terim sıklığını gösterir.

pyLDAvis — 'model' terimi verildiğinde koşullu konu dağılımı

Şekil 4. "model" terimi verildiğinde koşullu konu dağılımı. Vurgu, "model" teriminin hangi konulara yüklendiğini gösterir — başlıca Konular 2, 4 ve 6; model-merkezli söylemin birden fazla ayrı alt temaya yayıldığını doğrular.

Keşfedilen konular
20+

Derlemden çıkarılan ayrı gizli temalar.

Konu ayrışması
İyi

Konular 1–4 büyük ve örtüşmez; Konular 9–20’de daha sıkı kümeler.

İlgi metriği (λ)
Ayarlanabilir

λ = 0 konuya özgü terimleri öne çıkarır; λ = 1 genel sıklığı ağırlıklar.

Yığın ve yöntemler

PythongensimNLTKLDApyLDAvismatplotlibWordCloudElasticsearchRAG
Tüm işler Tüm işlere dön