[论文笔记] Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders (2026.02)
RAG幻觉检测的发展
RAG可以基于外部知识源进行回答,增强了知识密集型问题的可靠性
→ 但仍然受到忠实性错误的影响 → 所以需要幻觉检测和缓解方法
→ 人们开始探索微调检测器,但是需要大量高质量数据进行训练
→ 后来使用LLM进行基于prompt的幻觉检测,但成本高、prompt敏感,而且无法反映决策过程
→ 最近的研究开始转向利用LLM内部表示进行幻觉检测
→ 挑战:神经元语义和隐藏状态不透明,限制了高质量特征的提取
→ 稀疏自编码器SAE可以解释LLM隐藏表征中的语义特征,能学习到可解释的人类概念
稀疏自编码器
SAE可以将LLM隐藏层中的复杂状态,拆解为一组稀疏且具有可解释性的特征。
具体来说,对于隐藏层状态 x,SAE要求其编码为向量 z,再进行重建
相比于一半的AE而言,还具有稀疏性要求,即激活的隐藏状态尽可能少:
稀疏自编码器学习到通常对应于人类可解释概念(如句法角色、实体或事实属性)
方法设定
对于生成的序列 ,提取出每个token在第L层对应的隐藏状态
再通过SAE转化为稀疏特征
由于幻觉与否的标签是样本层级的,所以RAGLens先对SAE特征沿着token维度做maxpooling,得到整个回答的稀疏特征表示 $\bar z=(\bar z_1,\ldots,\bar z_K) $
然后分别计算每个特征与幻觉标签的互信息 $I(\bar z_k;l) $,然后取出前K个特征。
预测时,作者采用广义加性模型对幻觉标签进行预测:
$g\bigl(\mathbb E[l\mid\tilde{\bar z}]\bigr)=
\beta_0+\sum_{j=1}^{K'}f_j(\tilde{\bar z}_j) $
RAGLens的应用
局部幻觉解释
由于预测标签是逐token可加的,所以可以把幻觉预测归因于信号最强的token,从而获得token级别的幻觉反馈,从而定位幻觉发生所在的位置
全局的幻觉机制解释
发现SAE特征与幻觉之间的关联性,包括正向和负向关联。

幻觉缓解
将检测结果送回大模型,使其重新考虑或者修正可能存在幻觉的内容。
实验结果及复现
幻觉检测
| AUC | Acc | F1 | |
|---|---|---|---|
| ReDeEP | 0.7458 | 0.6822 | 0.7190 |
| RAGLens | 0.8413 | 0.7576 | 0.7636 |
| 复现 | 0.8397 | 0.7577 | 0.7576 |
幻觉检测-分任务

| 复现 | Acc | AUROC |
|---|---|---|
| Summary | 0.677907 | 0.813268 |
| QA | 0.776605 | 0.885507 |
| Data2txt | 0.766129 | 0.846265 |
幻觉缓解
| Original | + Instance-level | + Token-level | |
|---|---|---|---|
| deepseek-v4-flash (复现) | 57.33% | 54.00% | 51.11% |
| Paper: Llama3.3-70B | 43.78% | 42.22% | 39.11% |
| Paper: GPT-4o | 37.78% | 36.44% | 34.22% |
| Paper: GPT-o3 | 64.44% | 60.44% | 58.88% |
| Paper: Human | 71.11% | 62.22% | 55.56% |