[论文笔记] ReDeEP: Detecting Hallucination in Retrieval-Augmented Generation via Mechanistic Interpretability (2025.01)
要解决的问题:RAG模型有时在检索到正确且相关的知识时,依然会产生错误回答
→ 分析:内部知识与外部知识的冲突,FFN强调内部知识,而copying head强调外部知识
→ 贡献:提出了redeep,可以解耦内外部知识来进行幻觉检测;以及AARF,通过调节内外部知识的贡献来进行幻觉缓解。