word2vec 究竟学到了什么?伯克利提出可定量预测的学习理论
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于未微调基线,并减少了模型幻觉出的无效类别名。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优,数据集划分为 8,000 训练样本和 2,000 测试样本。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开 Mistral Large 2 的环境足迹:截至 2025 年 1 月,训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281000 立方米水、660 kg Sb eq 资源消耗。