本文へ移動

#マルチモーダル

今日 1 件

10月1日

木曜日今日1 件
  1. Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表

    Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。

9月29日

火曜日
  1. Microsoft Research、Quineを公開:生物学の複雑さを扱うAI研究システム

    Microsoft Researchは生物学の複雑さを扱うAI研究システムQuineを公開した。配列、構造、機能、細胞状態、画像などのマルチモーダルデータで学習した生物世界モデルと、モデル、科学ツール、文献、実験担当者をつなぐ対話型ハーネスから構成される。

  2. Microsoft Research Asiaシンガポール研究所、設立1年で先端AI研究と人材育成を推進

    Microsoft初の東南アジア研究所であるMSRA – Singaporeは、設立以来1年間、次世代AIモデルとエージェントシステム、分野別AI、AIネイティブな研究実践、人材のエコシステムの4分野に注力した。シンガポールの医療関係者とマルチモーダル医療AIや自己進化する診断エージェントを研究し、EDBと2026年2月に物流・交通AIの幹部円卓会議を開催した。

9月26日

土曜日

9月25日

金曜日

9月24日

木曜日

9月23日

水曜日

9月3日

木曜日

9月2日

水曜日

8月28日

金曜日

8月26日

水曜日
  1. Google、XRエージェントの会話に空間的ジェスチャーを加えるAgentHandsを公開

    GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。

8月17日

月曜日

8月13日

木曜日
  1. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

8月12日

水曜日
  1. Microsoft Research、臨床向け放射線VLM CARE-Xを公開、補助監督・報酬学習・ツール測定を統合

    Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。

8月11日

火曜日
  1. NVIDIA、12言語対応のオープンウェイト音声モデルMagpie TTS Multilingualを公開

    NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。

8月10日

月曜日

8月4日

火曜日
  1. Mistral AI、3Bのオープンなマルチモーダル安全分類器Shieldstralを公開

    Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。

7月30日

木曜日

7月28日

火曜日

7月27日

月曜日

7月23日

木曜日

7月21日

火曜日

7月16日

木曜日
  1. DharmaOCR、ブラジル Portuguese OCR 評価で Mistral OCR4 と Unlimited-OCR を上回る

    DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。

7月15日

水曜日

7月8日

水曜日
  1. Mistral AI、具身ナビゲーションモデル Robostral Navigate を公開

    Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。

7月1日

水曜日

6月23日

火曜日
  1. Mistral、文書解析モデル OCR 4 を公開

    Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。

6月17日

水曜日
  1. Google Earth AI、英国農地の細かな生態特性を描くベクトルデータを公開

    Google ResearchはFarmscapes 2020の高解像度ラスターマップを、生け垣、石垣、低木林の扱いやすい一覧に変えたベクトルデータを公開した。英国の13万平方キロメートル超を対象とする。世界の衛星画像3億枚超で事前学習したRSF Vision-Transformerを約247平方キロメートルの注釈で微調整し、Polsby–Popperコンパクト性スコアで森林、木の集まり、生け垣を区別する。線状特性の閾値は0.5未満だ。

6月13日

土曜日
  1. Google、AI が皮膚の問題の理解を助ける方法を研究

    Google は二つの研究を公表した。2,345人の調査では、AI を使った参加者の62%超が皮膚の状態の名前を挙げようとし、対照群は41%だった。正解率は23%で、対照群の8%の約3倍。もう一つの混合手法研究は、自分の皮膚の問題にツールを使う方法、理解の変化、医師との対話の違いを調べた。一方、次の受診行動を判断する支援は限定的だった。

6月9日

火曜日

6月5日

金曜日