📖 Blogs of machine-learning
高维非凸优化的「鞍点主导」
高维空间中的局部极小值极为罕见——因为一个真正的局部极小值要求所有方向都向上弯曲,也就是 Hessian 矩阵的所有特征值都必须为正。而高维空间里,随机的临界点几乎总有某个方向可以向下走,也就是鞍点。这正是为什么神经网络训练更像是「逃离鞍点」的游戏,而不是「跳出局部最优」的游戏。
研究关系的三种视角
研究「关系」有三种互补视角:几何,拓扑和因果。分别关注测量、连通和约束。它们不是并列的学科,而是看待「存在」的三个层层递进的维度。三者共同构成智能系统理解世界的先验地基。
大语言模型中的表征流形
将 LLM 的表征流形形式化:以度量空间定义特征,证明余弦相似度编码了特征之间的测地距离,并在颜色、日期与年份三类数据上实证验证了同胚性与等距性。
涌现是幻象吗?
Schaeffer 等人表明,LLM 的「涌现能力」往往只是不连续的指标掩盖了平滑的能力增长。但 grokking、归纳头以及居里点式的转变都证明,真实的相变确实存在。
最大似然估计视角下的神经网络
从统计学习的视角看,现代神经网络确实可以理解为一个大规模的最大似然估计(MLE)过程。具体而言,神经网络是一个参数化函数,而最常见的训练方式正是在数据上做最大似然估计。