Ham terim sıklığından ve kelime dağılımından LDA ile gizli konu keşfine uzanan derlem düzeyinde bir dil analizi hattı — Learning Matrix’in retrieval ve içerik anlama katmanını beslemek üzere kuruldu.
Öğrencilerin gerçekte ne sorduğunu — ve bu soruların nasıl kümelendiğini — anlamak, güvenilir bir eğitim AI’sının temelidir. Bu analiz teknik bir S&C derlemini alır, sinyale indirger ve gizli konu yapısını modeller; böylece retrieval katmanı yanıtları anlamsal farkındalıkla getirebilir, sıralayabilir ve açıklayabilir.
Hat üç aşamada çalışır: terim dağılımını anlamak için derlem istatistikleri, gizli temaları keşfetmek için LDA konu modellemesi ve modeli üretim retrieval’ına bağlamadan önce konu tutarlılığını doğrulamak için etkileşimli keşif.
Ham terim sıklığı ve sözcük dağarcığı dağılımı — hangi tokenların sinyal taşıdığını ve modellemeden önce hangilerinin süzülmesi gerektiğini belirler.
Şekil 1. Kelime sayıları — en sık 15 terim. model, typing ve extensions baskın; standart stopword’ler çıkarılmış.
Şekil 2. Kelime bulutu — terim sıklığına göre ağırlıklandırılmış sözcük dağarcığı. Baskın terimler: model, classifier, type, one, sequence, embedding, document, feature.
Sıklık: 36 — her konu kümesini bağlayan çekirdek kavram.
Derlem teknik olarak yoğundur: embedding, classifier, sequence, feature ölçekte birlikte geçer.
Stopword’ler çıkarıldı, tokenlar küçük harfe alındı ve LDA girişinden önce lemmatize edildi.
Temizlenmiş derlem üzerinde Latent Dirichlet Allocation — 20+ tutarlı konu keşfi; ayrışma ve terim saliency’si pyLDAvis ile görselleştirildi.
Şekil 3. Konular Arası Mesafe Haritası (PC1/PC2 üzerine çok boyutlu ölçekleme). Daire boyutu = marjinal konu olasılığı. Konular 1–4 büyük, iyi ayrışmış kümelerdir; Konular 5–20 daha küçük, sıkı paketlenmiş niş temalardır. λ = 1 her konu içindeki ham terim sıklığını gösterir.
Şekil 4. "model" terimi verildiğinde koşullu konu dağılımı. Vurgu, "model" teriminin hangi konulara yüklendiğini gösterir — başlıca Konular 2, 4 ve 6; model-merkezli söylemin birden fazla ayrı alt temaya yayıldığını doğrular.
Derlemden çıkarılan ayrı gizli temalar.
Konular 1–4 büyük ve örtüşmez; Konular 9–20’de daha sıkı kümeler.
λ = 0 konuya özgü terimleri öne çıkarır; λ = 1 genel sıklığı ağırlıklar.