Wenxuan Wang · Zenodo (CERN European Organization for Nuclear Research) 2026 · 2026
DOI: 10.5281/zenodo.23186107
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
在一个受控的合成算术任务、单一骨干(Qwen2.5-1.5B)、固定干预协议下,本文检查语言模型隐空间中隐性前提的两件事:能不能被读出来(H1:线性探针),以及能不能被推动(H2:激活干预)。结果清晰且一致。第一,H1处处成立:在全部三个任务、两种模型权重上,线性探针都能以1.000的准确率读出前提,且明显高过「只用题面表面特征」的基线(典型+0.487~+0.517)。第二,H2只在最简单的情形下成立:只有在单步、单任务的模型(ft_zce)上,沿一条方向注入能把答案干净翻转(减组翻0.80~1.00,junk 0.00,同格随机方向flip 0.00)。第三,一旦答案与前提解耦,H2全线为零,而且不是工具不行:在两步任务上,把前提100%分开的那条轴(held-out 1维投影准确率=1.000)推不动任何东西,而同一层、同一强度的随机方向反而能把答案打坏约43%。本文把「工具不行」这一解释逐个排除(七项替代解释,七项排除),并做了归属实验:失效不是「多任务混合训练」所致,而是「答案不再由前提直接决定」这个结构本身。一句话:在本研究的受控条件下,隐空间的可读性不构成可用性的充分证据。
No comments yet — start the discussion below.