本文へ移動

#データ・学習

今日 2 件

8月12日

水曜日
  1. Microsoft Research、臨床向け放射線VLM CARE-Xを公開、補助監督・報酬学習・ツール測定を統合

    Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。

8月10日

月曜日

8月6日

木曜日

7月31日

金曜日

7月30日

木曜日

7月26日

日曜日
  1. Berkeley AI Research、信念状態の教師付けで長い対話を効率化する ABBEL

    Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。

7月22日

水曜日

7月16日

木曜日
  1. DharmaOCR、ブラジル Portuguese OCR 評価で Mistral OCR4 と Unlimited-OCR を上回る

    DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。

7月9日

木曜日
  1. Google、ウェアラブル健康データの汎用基盤モデルSensorFMを公開

    Google ResearchとGoogle DeepMindは、ラベルなしのウェアラブルデータから直接学習する大型センサー基盤モデルSensorFMを提案した。500万人の同意済み参加者による1兆分超のマルチモーダル信号で事前学習し、100か国以上、20機種以上のFitbitとPixel Watchを対象とする。

7月7日

火曜日
  1. 知能が無料になった後、エージェント向け・エージェント運用・エージェント構築のデータシステム

    推論費用が2023年初めの GPT-4 級の100万トークン約30ドルから、現在は1ドル未満、一部企業では0.10ドル未満に下がるなか、UC Berkeley の Aditya G. Parameswaran らはエージェント時代のデータシステムに For Agents、Of Agents、By Agents の三方向を提案した。

7月6日

月曜日
  1. PRX第4部:データ戦略

    Hugging FaceはPRXシリーズ第4部でデータ戦略を詳述した。公開・内部データを混ぜ、VLMで画像の長い説明を再生成し、ストリーミング学習用に変換する。Lanceで構築・選別、MDSでストリーミング学習を行う。Qwen3-VLへの変更後は学習中に文字のlatentを計算し、実測の処理量低下は約3~4%で、30日の学習が約1日延びる。

7月1日

水曜日

6月30日

火曜日

6月17日

水曜日
  1. Google Earth AI、英国農地の細かな生態特性を描くベクトルデータを公開

    Google ResearchはFarmscapes 2020の高解像度ラスターマップを、生け垣、石垣、低木林の扱いやすい一覧に変えたベクトルデータを公開した。英国の13万平方キロメートル超を対象とする。世界の衛星画像3億枚超で事前学習したRSF Vision-Transformerを約247平方キロメートルの注釈で微調整し、Polsby–Popperコンパクト性スコアで森林、木の集まり、生け垣を区別する。線状特性の閾値は0.5未満だ。

6月8日

月曜日

6月4日

木曜日
  1. Google、洪水予測の水文モデリング枠組みをオープンソース公開

    Google Researchは水文モデリング枠組みをGitHubでApache 2.0として公開した。各国の気象・水文機関がAI洪水予測を業務に組み込める。PyTorchを使うPythonパッケージで、LSTMを採用し、Caravanデータで学習・微調整できる。対話型のチュートリアルnotebookと動画も付属する。

5月27日

水曜日
  1. Mistral、産業エンジニアリングを加速する物理 AI 基盤を公開

    Mistral は Emmi AI を統合後、AI ネイティブ産業設計向けの物理 AI 基盤を公開した。ASML、Airbus、Safran、Siemens Energy が協力する。形状と境界条件から物理場を直接予測し、単一 GPU の1回の順伝播で数秒で終える。従来の CFD/FEM は設計ごとに数時間から数週間かかる。設計反復を速める用途で、検証や特殊条件には従来ソルバーを残す。

5月23日

土曜日
  1. Mistral、Physics AI 企業 Emmi AI を買収

    Mistral AI は今週、産業企業の AI 転換支援を強化するため Physics AI の先駆者 Emmi AI を買収する最終契約に署名した。Austria で設立された Emmi AI は30人超の研究者・技術者を擁し、大規模エンジニアリングモデルで数日かかる計算をリアルタイムシミュレーションに置き換え、デジタルツインを構築する。共同創業者とチームは5月に Mistral の Science と Applied AI チームに加わる。

5月20日

水曜日

5月16日

土曜日
  1. CambridgeのClare Bryant、Google Co-Scientistで種間感染の分子スイッチを探索

    Cambridge教授Clare BryantはGoogle Co-Scientistで、インフルエンザなどの種間伝播で敗血症を起こす分子機構を研究する。生成・順位付けされた仮説で未注目のタンパク質を特定し、具体的なアミノ酸部位まで絞った。チームは変異を持つ細胞株で検証しており、2~3年の実験を6か月で完了できる見込みだ。

5月2日

土曜日
  1. Google Research、世界の連携と公開資源で科学への影響を広げる方法

    Google Research は、公開ツールとデータが世界の25万超の研究者・開発者を支えているとした。DeepVariant、DeepConsensus、DeepPolisher は250万人のエクソームと全ゲノムの処理を支援し、医療基盤モデル MedGemma は480万回超ダウンロードされた。Open Health Stack は10超の国に導入され、6,500万人超をカバーする。

4月30日

木曜日

4月22日

水曜日

4月16日

木曜日

4月1日

水曜日

3月25日

水曜日

3月18日

水曜日
  1. Mistral AI、企業の独自知識で最先端モデルを訓練する Forge を公開

    Mistral AI は独自知識に基づく最先端級 AI モデル構築システム Forge を公開した。事前訓練、事後訓練、強化学習に対応し、dense と MoE の構造を扱う。必要に応じてマルチモーダル入力にも対応し、企業内の基盤でモデルの訓練とガバナンスを行える。

3月17日

火曜日

3月13日

金曜日
  1. Berkeley AI Research、LLM の重要な相互作用を大規模に特定する SPEX と ProxySPEX

    Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。

3月12日

木曜日

3月7日

土曜日

1月10日

土曜日
  1. Berkeley、情報駆動の画像システム設計で4分野の性能を予測

    Berkeley AI Researchは相互情報量で画像システムを評価・最適化する枠組みを提案した。雑音付き測定と雑音モデルだけで情報量を測る。NeurIPS 2025でカラー写真、電波天文、レンズなし撮像、顕微鏡の復号器性能を予測した。設計は最先端の全工程学習に匹敵し、メモリーと計算量が少なく、課題別の復号器設計を要しない。