[论文笔记] Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders (2026.02)

RAG幻觉检测的发展

RAG可以基于外部知识源进行回答,增强了知识密集型问题的可靠性

→ 但仍然受到忠实性错误的影响 → 所以需要幻觉检测和缓解方法

→ 人们开始探索微调检测器,但是需要大量高质量数据进行训练

→ 后来使用LLM进行基于prompt的幻觉检测,但成本高、prompt敏感,而且无法反映决策过程

→ 最近的研究开始转向利用LLM内部表示进行幻觉检测

→ 挑战:神经元语义和隐藏状态不透明,限制了高质量特征的提取

→ 稀疏自编码器SAE可以解释LLM隐藏表征中的语义特征,能学习到可解释的人类概念

稀疏自编码器

SAE可以将LLM隐藏层中的复杂状态,拆解为一组稀疏且具有可解释性的特征。

具体来说,对于隐藏层状态 x,SAE要求其编码为向量 z,再进行重建

相比于一半的AE而言,还具有稀疏性要求,即激活的隐藏状态尽可能少:

z=ReLU(Wencx+b)L=xx^2+λz1z=\mathrm{ReLU}(W_\mathrm{enc}x+b) \\ \mathcal{L}=\|x-\hat{x}\|^2+\lambda\|z\|_1

稀疏自编码器学习到通常对应于人类可解释概念(如句法角色、实体或事实属性)

方法设定

对于生成的序列 y1:Ty_{1:T},提取出每个token在第L层对应的隐藏状态 ht (t=1..T)h_t~(t=1..T)

再通过SAE转化为稀疏特征 zt=E(ht)z_t=E(h_t)

由于幻觉与否的标签是样本层级的,所以RAGLens先对SAE特征沿着token维度做maxpooling,得到整个回答的稀疏特征表示 $\bar z=(\bar z_1,\ldots,\bar z_K) $

然后分别计算每个特征与幻觉标签的互信息 $I(\bar z_k;l) $,然后取出前K个特征。

预测时,作者采用广义加性模型对幻觉标签进行预测:

$g\bigl(\mathbb E[l\mid\tilde{\bar z}]\bigr)=
\beta_0+\sum_{j=1}^{K'}f_j(\tilde{\bar z}_j) $

RAGLens的应用

局部幻觉解释

由于预测标签是逐token可加的,所以可以把幻觉预测归因于信号最强的token,从而获得token级别的幻觉反馈,从而定位幻觉发生所在的位置

全局的幻觉机制解释

发现SAE特征与幻觉之间的关联性,包括正向和负向关联。

image.png

幻觉缓解

将检测结果送回大模型,使其重新考虑或者修正可能存在幻觉的内容。

实验结果及复现

幻觉检测

AUC Acc F1
ReDeEP 0.7458 0.6822 0.7190
RAGLens 0.8413 0.7576 0.7636
复现 0.8397 0.7577 0.7576

幻觉检测-分任务

image.png

复现 Acc AUROC
Summary 0.677907 0.813268
QA 0.776605 0.885507
Data2txt 0.766129 0.846265

幻觉缓解

Original + Instance-level + Token-level
deepseek-v4-flash (复现) 57.33% 54.00% 51.11%
Paper: Llama3.3-70B 43.78% 42.22% 39.11%
Paper: GPT-4o 37.78% 36.44% 34.22%
Paper: GPT-o3 64.44% 60.44% 58.88%
Paper: Human 71.11% 62.22% 55.56%