word2vec は何を学ぶか、Berkeley が定量予測できる学習理論
Berkeley の AI 研究チームは word2vec の学習過程を定量予測する初の理論を提案した。現実の訓練条件で非加重最小二乗の行列分解に帰着でき、勾配流の閉形式解があり、最終表現は目標行列 M* の PCA に等しい。小さな初期値では直交線形部分空間を離散段階ごとに学び、埋め込みのランクを上げ損失を減らす。その特徴は M* の上位固有ベクトルで、コーパス統計とハイパーパラメーターから事前計算できる。
Berkeley の AI 研究チームは word2vec の学習過程を定量予測する初の理論を提案した。現実の訓練条件で非加重最小二乗の行列分解に帰着でき、勾配流の閉形式解があり、最終表現は目標行列 M* の PCA に等しい。小さな初期値では直交線形部分空間を離散段階ごとに学び、埋め込みのランクを上げ損失を減らす。その特徴は M* の上位固有ベクトルで、コーパス統計とハイパーパラメーターから事前計算できる。
MistralはLoRAでPixtral-12Bを微調整し、Aerial Image Dataset(AID)の衛星画像分類で未調整の基準を大きく上回り、幻覚による無効な分類名を減らした。Mistralの微調整APIかLaPlateforme UIを使い、大規模なハイパーパラメーター調整は不要だ。学習8000、テスト2000に分割した。
Mistral AIはCarbone 4と仏ADEMEと初のモデル全ライフサイクル分析を行った。2025年1月時点でLarge 2の学習と18か月の利用は20.4 ktCO₂e、水281000立方メートル、資源660 kg Sb eqを消費した。