7-9月Paper Reading
放点觉得有意思的部分和没意思的部分。
SAE用于AI搜索的可解释性
2026-06-08
先放上最近看到的有趣的一篇:https://arxiv.org/abs/2605.29507
AI搜的可解释性一直是疑难杂症问题,纵然有多向量归因、cite等做法,使用起来场景限制也很大。这篇文章把SAE用到了AI搜上还是令人挺新奇的。
大体上就是,取embedder的SAE将稠密特征变成稀疏特征,然后对某个SAE特征f,在文档集合里面选f激活比较高的,LLM总结得到f的可解释释义。
可能觉得这样novelty太低或者做不work,所以文章花了很大力气在讲一个米奇妙妙设计:在做SAE之前,先做一次特征增强。大体上是把embedding任务分成三类——一类QA,一类意图,一类总结,用LLM产出这三类的带COT的文档,重新生成嵌入,这样先在大方向上分离的再进行SAE抽小特征。
不做这样的特征增强几乎完全没训出来。
由于不太懂可解释性,感觉是有趣的做法,就是不知道那个可疑的图带来了多大的性能提升。但反正我尝试把SAE直接用到我的工作里面的时候直接和random差不多,所以这个trick应该还是重要的。
Socratic-SWE:自进化Coding Agent的深度解剖
接下来评这篇,前两天刚出的,感觉要得罪人了,又是本校网红组的paper:
Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills https://arxiv.org/abs/2606.07412
方法云山雾罩的,绕一大堆公式,看起来非常promising但细究下来可疑的地方很多,慢慢细讲。
文章target很直接,自进化通过写更好的skill的方式提升端到端性能。采用的是Qwen3.5-9B同时做出题员Generator和解题者Solver,在SWE Smith上训,然后在SWE-bench系列测,标准操作。
但它用了几个让我觉得非常奇怪的做法:
- skill自进化是没有品味的,做烂的topic,我直接开地图炮,我觉得这方面现有的文章几乎都是rubbish
- 非常常见的Generator看错误轨迹对应出题,然后Solver解题的self play做法,虽然我非常质疑这样出出来的题目就是overfit,9B的模型既要改代码又要写测试还要设计query,设计出来的肯定是没法看的
- 为了让2看起来Promising,文章采用了一个很难以证伪的做法:让LLM和skill一起被更新——我又更新Generator,又更新Solver,又更新skill,最后说端到端性能提升协同进化。消融只做了1.不更新skill 2.换LLM RL的算法,并没有做固定LLM frozen的消融,这是非常奇怪的。你既然claim skill被更新了是主要收益,那原始模型+skill不应该有明显提升吗?感觉上,让LLM和skill一起动像是在让LLM过拟合system prompt
- 文中大量的神秘超参数。首先上来就是一个0.5/0.3/0.2的lambda加权,又是Generator Reward里面有一个神秘的梯度cosine,claim说这是为了让Generator出的题真的对Solver LLM的更新有帮助。我真的懒得喷梯度cosine,高维向量几乎均为处处正交是不知道的,要么show给我原始的log证明不是0,要么就是代码实现都错了
经典图画一堆公式一堆概念一堆绕来绕去,细究满头问号。核心novelty就是那个疑惑的RL操作。
关于自进化这个方向,我不是很想做。我觉得一万个人有一万个自进化,另一个是我觉得现在的自进化完全是在工程的基础上套概念拼novelty,非常空的说法。不如老实把长文能力、IF能力之类做好。
自进化中唯一有意思的
看到的自进化相关的只有一个HL engineering比较有意思,LLM用规则进行自进化,很严格的限制了自进化的范围,并用标准的RL gym局限了任务类型:
https://trinkle23897.github.io/learning-beyond-gradients/#zh
另外一个可以看的是翁家翌做的,挺有意思——不是规则限定自进化,而是自进化的方式是写规则而不是写skill这种黑盒叠黑盒。
说白了这就像是自动生成证明或者AutoML,屎山可解释性总比模型强,控制好屎山的出入口就行直接当黑盒优化。