Google Research の科学者が Empirical Research Assistance を使う四つの方法
Google Research は、科学者が Empirical Research Assistance(ERA)で研究を進める方法を紹介した。感染症予測、宇宙論、炭素監視、神経科学の四分野を扱う。
Google Research は、科学者が Empirical Research Assistance(ERA)で研究を進める方法を紹介した。感染症予測、宇宙論、炭素監視、神経科学の四分野を扱う。
Google DeepMind は Decoupled DiLoCo の論文を公開した。大規模訓練を分離した計算の島々に分け、非同期データストリームで通信し、局所的なハードウェア障害を隔離する。
Google は推論優先の合成データ基盤 Simula を提案した。データセット構築を機構設計問題として捉え直し、全体の多様化、局所の多様化、複雑化、二つの批評役による品質確認の四段階で、種データなしにゼロから作成する。
Google ResearchはPointInfinity点群フローマッチングで合成ニューロン形態を作るMoGen(Neuronal Morphology Generation)を提案した。PATHFINDER再構築モデルの学習データを補い、検証用のマウス軸索で誤り率を4.4%減らした。主に誤った結合の減少による。
Google Research は『Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation』で評価項目数と項目ごとの注釈者数を比較した。一般的な1人、3人、5人では足りないことが多く、人の意見の違いを反映するには10人超が必要な場合が多い。
S2VecはS2 Geometryによる区画とラスタライズで建物・道路を多層画像へ変え、マスク付き自己符号化(MAE)で汎用埋め込みを学ぶ。米国人口密度や所得中央値など、未見地域のゼロショット社会経済予測でSATCLIP、GEOCLIPを上回るが、樹木被覆や標高では改善が必要だ。
Mistral AI は独自知識に基づく最先端級 AI モデル構築システム Forge を公開した。事前訓練、事後訓練、強化学習に対応し、dense と MoE の構造を扱う。必要に応じてマルチモーダル入力にも対応し、企業内の基盤でモデルの訓練とガバナンスを行える。
Mistral AIはNVIDIA Nemotron Coalitionの創設メンバーとなった。共同で最先端オープンAIモデルを開発する計画で、Mistralは構造、マルチモーダル能力、微調整ツール、NVIDIAは計算資源、開発ツール、合成データパイプラインを提供する。
Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。
Google は Flood Hub で都市の鉄砲水予報を公開した。新しい AI 手法により、都市部で最大24時間先の鉄砲水リスクを予測できる。
Google ResearchはGeminiで世界のニュースから過去の災害の構造化データを抽出するGroundsourceを公開した。最初のオープンデータは都市の鉄砲水260万件を収め、150か国以上、2000年から現在までを対象とする。
Google Researchは大規模な公開音声データセットWAXALを公開した。初期版は1億人超が使うサハラ以南アフリカの27言語を対象とし、CC-BY-4.0で提供する。
Berkeley AI Researchは相互情報量で画像システムを評価・最適化する枠組みを提案した。雑音付き測定と雑音モデルだけで情報量を測る。NeurIPS 2025でカラー写真、電波天文、レンズなし撮像、顕微鏡の復号器性能を予測した。設計は最先端の全工程学習に匹敵し、メモリーと計算量が少なく、課題別の復号器設計を要しない。
Berkeley の AI 研究チームは word2vec の学習過程を定量予測する初の理論を提案した。現実の訓練条件で非加重最小二乗の行列分解に帰着でき、勾配流の閉形式解があり、最終表現は目標行列 M* の PCA に等しい。小さな初期値では直交線形部分空間を離散段階ごとに学び、埋め込みのランクを上げ損失を減らす。その特徴は M* の上位固有ベクトルで、コーパス統計とハイパーパラメーターから事前計算できる。
MistralはLoRAでPixtral-12Bを微調整し、Aerial Image Dataset(AID)の衛星画像分類で未調整の基準を大きく上回り、幻覚による無効な分類名を減らした。Mistralの微調整APIかLaPlateforme UIを使い、大規模なハイパーパラメーター調整は不要だ。学習8000、テスト2000に分割した。
Mistral AIはCarbone 4と仏ADEMEと初のモデル全ライフサイクル分析を行った。2025年1月時点でLarge 2の学習と18か月の利用は20.4 ktCO₂e、水281000立方メートル、資源660 kg Sb eqを消費した。