Entropic Scree:用信息论方法绕过 PCA 的本征秩上限
开发者发布 Entropic Scree v1.0.0,采用信息论 Jaccard 相似度压缩非线性展开,绕过样本秩上限…
一位独立开发者近日发布名为「Entropic Scree」的开源框架与预印本,提出一种基于信息论的非参数、模型无关的本征维数诊断方法,用于克服标准 PCA、核 PCA 与欧氏邻域估计器在复杂表格数据场景下的结构性失效。该项目代码以 v1.0.0 形式托管在 GitHub,预印本同步发布在 Zenodo。
方法提出的背景
在估计高维数据的本征秩时,业界通常依赖 PCA、核 PCA 或 TWO-NN、基于 MLE 的拓扑估计器。然而,当数据集中存在混合类型、强烈非线性、生成根相互纠缠,或特征数大于样本数(m > N)时,这些基线方法不再只是精度下降,而是发生结构性失效:
- 标准 PCA 只度量线性协方差,会将 X₁X₂ 这类非线性交互视为完全独立的变量,被迫「伪造」正交维来容纳它们,造成维度膨胀。
- 核 PCA(RBF)投影到无穷维 Hilbert 空间后,会把偶阶多项式折叠进独立坐标轴;在稀疏组合噪声存在时,频谱尾部被抹平,无法定位结构拐点;一旦生成根出现轻度纠缠,就完全丧失拐点,即结构性坍塌。
- 基于欧氏距离的拓扑估计器在 m > N 的不对称、高维环境中,距离集中效应使最近-最远邻居比趋近于 1,邻域估计退化为无效值。
Entropic Scree 的核心思路
Entropic Scree 完全放弃线性方差与空间方差,改用纯概率质量进行评估。关键设计包括:
- 度量空间:以归一化互信息与 Variation of Information(信息论 Jaccard 相似度)衡量成对依赖,对边际分布形状变化不敏感,可直接处理连续波形与二元标志混合的数据。
- 绕过样本秩上限:传统 PCA 在代数上以 N-1 为上限,作者转向双中心化的拓扑信息空间,使重叠冗余可被直接映射,绕开样本量天花板。
- 流形压缩:算法作为二元过滤器,内在地把非线性组合的概率质量回压到「本征生成秩」,剪掉特有的协同方差,剩余部分形成有界的「扩展信号尾」,从而清晰区分真正的驱动变量与未被结构化的「特异性信息方差」。
框架还引入了「信息引力」(AIG/FSIG)概念,将残差方差重新打包为「变量当量」级别的可解释足迹,使抽象矩阵性质转化为可操作的规模指标。
合成压测结果
作者构建了一个高度纠缠的合成数据集:用 20 个纯净的生成根扩展到 5 阶组合,共 20 000 个代理变量,但仅有 10 000 个样本,刻意制造 m > N 的稀疏条件,并注入大量特异性结构噪声与测量误差。测试结果如下:
- 标准 PCA 触碰到代数秩上限,把展开式线性化拆分,错误地估计出约 5 700 维。
- 核 PCA(RBF)与 Spearman 秩相关发生结构性折叠,对真实秩的高估达到 100%;一旦引入生成根纠缠,二者完全失去频谱拐点。
- Entropic Scree 准确识别出本征秩为 20,并在海量噪声中分离出仅 1.45% 的活跃共享信号,余下 98.55% 是未被结构化的特异性信息方差;其残差形成的扩展信号尾也与全局超几何设计空间的确定性边界良好对齐。
- 通过 FSIG(因子级信息引力)反向推断隐藏拓扑时,主成分维度约 74.5 个变量当量,与原设计中由全局组合信号驱动的网络主结构吻合。
适用场景与局限
作者强调,Entropic Scree 并非取代 PCA 的常规升级,而是面向「下游非参数流形提取器(如自编码器)瓶颈尺寸」的诊断工具:先得到真正的本征秩,再据此显式设定神经网络的瓶颈宽度。除此之外,它还可作为探索性绘图工具,将彼此无关的变量簇分开,帮助识别解耦的子网络。需要指出的是,目前结果仅基于作者自行设计的合成压测,尚未在独立第三方基准上复现,泛化能力有待进一步验证。
