科研速览 · Science Skim继续刷下去 · Keep skimming →
◆ Frontiers in big data2026-01-01

Fine-tuning multilingual sentence transformers for low-resource skill-concept matching across Kazakh, Russian, and English.

Sandugash Serikbayeva, Madina Sambetbayeva, Valiya Ramazanova, Aigerim Yerimbetova, Zhanar Lamasheva, Zhanna Sadirmekova, Ardak Batyrkhanov, Yersaiyn Mailybayev

一句话结论 · In one sentence

Fine-tuning preserved English performance while improving Russian and Kazakh similarity quality. Russian cosine Pearson correlation increased from 0.8125 to 0.8221, while Kazakh cosine Pearson increased from 0.5989 to 0.6050 and Kazakh dot-product Pearson from 0.4487 to 0.4912. Agglomerative clustering improved mean silhouette from 0.27126 to 0.2851 and reduced erroneous clusters from 19.74% to 13.97%.

原始摘要(英文原文)· Original abstract
INTRODUCTION: Matching short, specialized skill expressions across English, Russian, and Kazakh is challenging because general-domain multilingual encoders underperform on terse, code-mixed, domain-specific phrases, particularly in the low-resource Kazakh setting. METHODS: We fine-tuned a multilingual Sentence Transformer using a staged Multiple Negatives Ranking objective on a trilingual paraphrase corpus, including Russian augmentation pairs. We evaluated skill matching and semantic similarity across languages and assessed the resulting embeddings through downstream skill-taxonomy clustering. RESULTS: Fine-tuning preserved English performance while improving Russian and Kazakh similarity quality. Russian cosine Pearson correlation increased from 0.8125 to 0.8221, while Kazakh cosine Pearson increased from 0.5989 to 0.6050 and Kazakh dot-product Pearson from 0.4487 to 0.4912. Agglomerative clustering improved mean silhouette from 0.27126 to 0.2851 and reduced erroneous clusters from 19.74% to 13.97%. DISCUSSION: The results provide evidence consistent with cross-lingual transfer as an important mechanism of improvement for Kazakh. They also motivate language-specific threshold calibration and demonstrate that intrinsic similarity improvements translate into a cleaner downstream skill taxonomy.
读原文 · Read the paper ↗

AI 追问PRO

登录后使用 AI 追问

讨论区

登录后参与讨论

相关论文 · Related

Fine-tuning multilingual sentence transformers for low-resource skill-concept matching across Kazakh, Russian, and English. — 科研速览 Science Skim