ネモトロンにギリシャ語を教える:専門分野横断的な現代ギリシャ語のためのコーパス採掘、検索の適応、生成のグラウンディング
Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
August 5, 2026
著者: Ayoub Kirouane, Christos Petrocheilos
cs.AI
要旨
現代ギリシャ語は、法務、エネルギー、金融、医療アプリケーションにおける検索拡張生成(RAG)にとって重要であるにもかかわらず、NVIDIAのNemotron検索モデルや主要な多言語検索ベンチマークには含まれていません。本稿では、コーパスマイニング、合成教師データ、検索モデルのトレーニング、リランカーの適応、リーダーのファインチューニング、およびHERAと呼ばれる新しいベンチマークを含む、現代ギリシャ語向けNemotron検索スタックのエンドツーエンド適応を提示します。本研究は、パラメータフリーのBM25ベースラインが、専門分野のギリシャ語コーパスにおいて、いくつかの既製の多言語高密度検索モデルを上回ることを示しています。65,773件のギリシャ語検索ペアでファインチューニングした後、Nemotron 1BエンベッダーはnDCG@10を0.362から0.835に改善し、未適応のモデルを大幅に上回ります。学習された言語能力は一般領域のギリシャ語にも転移しますが、BM25に対する優位性は依然としてドメイン依存です。さらに、クロスエンコーダーリランカーを適応し、専門分野全体で一貫した改善を示します。最後に、根拠に基づく生成のためにNemotron 30B-A3B混合エキスパートリーダーをLoRAチューニングし、判定された回答の正確性を29.4%から66.9%に向上させるとともに、忠実性と引用品質を大幅に改善します。また、検索拡張生成のための初の大規模ギリシャ語ベンチマークであるHERAを導入し、ギリシャ語RAGシステムの今後の研究を支援するために、適応したモデルとベンチマークを公開します。
English
Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major multilingual retrieval benchmarks, despite being important for retrieval-augmented generation (RAG) in legal, energy, financial, and medical applications. We present an end-to-end adaptation of the Nemotron retrieval stack for Modern Greek, including corpus mining, synthetic supervision, retrieval model training, reranker adaptation, reader fine-tuning, and a new benchmark called HERA. Our study shows that a parameter-free BM25 baseline outperforms several off-the-shelf multilingual dense retrieval models on specialist Greek corpora. After fine-tuning on 65,773 Greek retrieval pairs, a Nemotron 1B embedder improves nDCG@10 from 0.362 to 0.835 and substantially outperforms its unadapted counterpart. The learned language competence transfers to general-domain Greek, although the advantage over BM25 remains domain-dependent. We further adapt a cross-encoder reranker and demonstrate consistent improvements across specialist domains. Finally, we LoRA-tune a Nemotron 30B-A3B mixture-of-experts reader for grounded generation, increasing judged answer correctness from 29.4% to 66.9% while significantly improving faithfulness and citation quality. We also introduce HERA, the first large-scale Greek benchmark for retrieval-augmented generation, and release our adapted models and benchmark to support future research on Greek-language RAG systems.