dorsal/arxiv
View SchemaFine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge
| Authors | Zhuoyi Yang, Yurun Song, Iftekhar Ahmed, Ian Harris |
|---|---|
| Categories | |
| ArXiv ID | 2601.07054vv1 |
| URL | https://arxiv.org/abs/2601.07054 |
| License | http://arxiv.org/licenses/nonexclusive-distrib/1.0/ |
Abstract
Multi-hop question answering is widely used to evaluate the reasoning capabilities of large language models (LLMs), as it requires integrating multiple pieces of supporting knowledge to arrive at a correct answer. While prior work has explored different mechanisms for providing knowledge to LLMs, such as finetuning and retrieval-augmented generation (RAG), their relative effectiveness for multi-hop question answering remains insufficiently understood, particularly when the required knowledge is temporally novel. In this paper, we systematically compare parametric and non-parametric knowledge injection methods for open-domain multi-hop question answering. We evaluate unsupervised fine-tuning (continual pretraining), supervised fine-tuning, and retrieval-augmented generation across three 7B-parameter open-source LLMs. Experiments are conducted on two benchmarks: QASC, a standard multi-hop science question answering dataset, and a newly constructed dataset of over 10,000 multi-hop questions derived from Wikipedia events in 2024, designed to test knowledge beyond the models' pretraining cutoff. Our results show that unsupervised fine-tuning provides only limited gains over base models, suggesting that continual pretraining alone is insufficient for improving multi-hop reasoning accuracy. In contrast, retrieval-augmented generation yields substantial and consistent improvements, particularly when answering questions that rely on temporally novel information. Supervised fine-tuning achieves the highest overall accuracy across models and datasets. These findings highlight fundamental differences in how knowledge injection mechanisms support multi-hop question answering and underscore the importance of retrieval-based methods when external or compositional knowledge is required.
{
"annotation_id": "4cbc0361-978c-45c3-a07e-45e7069ccf66",
"date_created": "2026-02-17T05:53:08.878000Z",
"date_modified": "2026-02-17T05:53:08.878000Z",
"file_hash": "23ed6c51e2ef9e787efcf1fb6440e28c7ea8dcd2d42f14cbdca4b52a06a3b07c",
"private": false,
"record": {
"abstract": "Multi-hop question answering is widely used to evaluate the reasoning capabilities of large language models (LLMs), as it requires integrating multiple pieces of supporting knowledge to arrive at a correct answer. While prior work has explored different mechanisms for providing knowledge to LLMs, such as finetuning and retrieval-augmented generation (RAG), their relative effectiveness for multi-hop question answering remains insufficiently understood, particularly when the required knowledge is temporally novel.\n In this paper, we systematically compare parametric and non-parametric knowledge injection methods for open-domain multi-hop question answering. We evaluate unsupervised fine-tuning (continual pretraining), supervised fine-tuning, and retrieval-augmented generation across three 7B-parameter open-source LLMs. Experiments are conducted on two benchmarks: QASC, a standard multi-hop science question answering dataset, and a newly constructed dataset of over 10,000 multi-hop questions derived from Wikipedia events in 2024, designed to test knowledge beyond the models\u0027 pretraining cutoff.\n Our results show that unsupervised fine-tuning provides only limited gains over base models, suggesting that continual pretraining alone is insufficient for improving multi-hop reasoning accuracy. In contrast, retrieval-augmented generation yields substantial and consistent improvements, particularly when answering questions that rely on temporally novel information. Supervised fine-tuning achieves the highest overall accuracy across models and datasets. These findings highlight fundamental differences in how knowledge injection mechanisms support multi-hop question answering and underscore the importance of retrieval-based methods when external or compositional knowledge is required.",
"arxiv_id": "2601.07054",
"authors": [
"Zhuoyi Yang",
"Yurun Song",
"Iftekhar Ahmed",
"Ian Harris"
],
"categories": [
"cs.CL",
"cs.LG"
],
"license": "http://arxiv.org/licenses/nonexclusive-distrib/1.0/",
"title": "Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge",
"url": "https://arxiv.org/abs/2601.07054",
"version": "v1"
},
"schema_id": "dorsal/arxiv",
"source": {
"execution_id": "a9505da7-e45d-4a7e-894a-4ddf81d610c1",
"id": "arXiv Dataset",
"type": "Model",
"variant": "snapshot-2026-01-17",
"version": "0.1.0"
},
"user_id": 1000002
}