2026.08.27 · 周四工具
←返回首页话题 · Topic
#机制可解释性
共 9 条相关资讯
2026.08.16 · 周日研究论文
安全对齐会压制 LLM 的心灵归因:arXiv 论文揭示机制层面的纠缠
2026.08.15 · 周六研究论文
至知研究院拆权重做可解释性:数据成本不到传统路线 1%
2026.08.12 · 周三研究论文
研究发现:长篇良性上下文可被动削弱 RLHF 对齐
2026.08.12 · 周三研究论文
HyperSAE:引入双曲几何的稀疏自编码器方案
2026.08.11 · 周二研究论文
arXiv 研究:线性探针能识别上下文篡改,却难以预测大模型最终是否出错
2026.07.30 · 周四工具
社区开源工具 Cortex 上线:简化大模型机制可解释性
2026.07.27 · 周一研究论文
新研究在 Transformer 中发现「硬决策层」
2026.07.24 · 周五研究论文
