Skip to main navigation menu Skip to main content Skip to site footer

Evidence-Grounded Retrieval-Augmented Generation for Reliable Clinical Question Answering under Conflicting Medical Evidence

Abstract

Large language models have demonstrated considerable potential in clinical question answering, yet their practical reliability remains limited by unsupported medical statements, conflicting evidence, and inadequate uncertainty awareness. This study proposes an evidence-grounded retrieval-augmented generation framework designed to improve the factual consistency and reliability of medical question answering. The framework incorporates hybrid medical knowledge retrieval, evidence relevance scoring, contradiction-aware verification, and confidence-calibrated response generation. Unlike conventional retrieval-augmented generation approaches that directly incorporate retrieved passages into model prompts, the proposed method evaluates the consistency of retrieved evidence before generating final responses. The framework is designed for evaluation using 12,000 medical question-answering instances sampled from publicly available medical QA benchmarks, supplemented with controlled evidence-conflict scenarios. Comparative experiments will examine standard prompting, chain-of-thought prompting, conventional RAG, and evidence-verification-based generation. Evaluation metrics will include answer accuracy, evidence attribution precision, hallucination rate, and selective prediction performance. The proposed framework will also investigate how retrieval quality and evidence inconsistency affect model reliability across different medical question categories. This research aims to establish a more transparent and verifiable approach to medical language model deployment in clinical decision-support applications.