本文へ移動

#マルチモーダル

今日 2 件

10月1日

木曜日今日2 件
  1. Google、Gemini 4 Argon を発表 これまでで最強のモデルと主張

    Google の親会社 Alphabet は Gemini 4 Argon を発表し、コーディングや調査、執筆などのタスクを処理できると説明した。特に防御的サイバーセキュリティ向けに訓練されており、重要なソフトウェア脆弱性を自律的に発見・検証・修正できるという。

  2. Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表

    Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。

9月29日

火曜日
  1. Microsoft Research、Quineを公開:生物学の複雑さを扱うAI研究システム

    Microsoft Researchは生物学の複雑さを扱うAI研究システムQuineを公開した。配列、構造、機能、細胞状態、画像などのマルチモーダルデータで学習した生物世界モデルと、モデル、科学ツール、文献、実験担当者をつなぐ対話型ハーネスから構成される。

  2. AMDがWorld Labsを82億ドルで買収、Atlasが疎な再構成の問題を解決

    AMDがWorld Labsを82億ドルで買収する。World Labsは2024年の設立以来、画像、動画、空間再構成のモデル学習チームを構築し、SceniX買収を通じてロボットシミュレーション能力を強化した。最近公開したAtlasは、2D画像から新しい視点を予測するomniモデル構造である。生成モデルと多視点幾何を組み合わせ、コンピュータービジョンで長年課題だった疎な再構成を解決し、ロボット、設計、工学、科学などに直接応用できる。

  3. AMD、約82億ドルの全額株式交換でWorld Labsを買収

    AMDは李飛飛が共同設立したAI研究所World Labsを約82億ドルの全額株式交換で買収すると発表した。年末までに完了する見込みだ。World Labsは2024年に設立され、数か月で評価額10億ドルに達した。2025年には初の商用製品Marbleを公開し、プロンプトから操作可能な3D世界を生成できる。

  4. Microsoft Research Asiaシンガポール研究所、設立1年で先端AI研究と人材育成を推進

    Microsoft初の東南アジア研究所であるMSRA – Singaporeは、設立以来1年間、次世代AIモデルとエージェントシステム、分野別AI、AIネイティブな研究実践、人材のエコシステムの4分野に注力した。シンガポールの医療関係者とマルチモーダル医療AIや自己進化する診断エージェントを研究し、EDBと2026年2月に物流・交通AIの幹部円卓会議を開催した。

9月26日

土曜日

9月25日

金曜日

9月24日

木曜日
  1. Meta Connect 2026:Muse エージェント、眼鏡ハードウェア、リアルタイム音声

    Meta は Connect 2026 で Muse を個人エージェントとして位置付け、その周辺のハードウェアと機能を更新した。音声とリアルタイム動画に対応し、バックグラウンドで作業を実行し、すべての Meta 眼鏡に導入される。各 Muse は独立したメールアドレスを持ち、Mac 版は computer use に対応し、コネクタープラットフォームには1,500超のアプリがある。

9月23日

水曜日

9月22日

火曜日

9月3日

木曜日

9月2日

水曜日

8月28日

金曜日

8月26日

水曜日
  1. Google、XRエージェントの会話に空間的ジェスチャーを加えるAgentHandsを公開

    GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。

8月17日

月曜日

8月13日

木曜日
  1. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

8月12日

水曜日
  1. Microsoft Research、臨床向け放射線VLM CARE-Xを公開、補助監督・報酬学習・ツール測定を統合

    Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。

8月11日

火曜日
  1. NVIDIA、12言語対応のオープンウェイト音声モデルMagpie TTS Multilingualを公開

    NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。

8月10日

月曜日

8月4日

火曜日
  1. Mistral AI、3Bのオープンなマルチモーダル安全分類器Shieldstralを公開

    Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。

7月30日

木曜日

7月28日

火曜日

7月27日

月曜日

7月23日

木曜日

7月21日

火曜日

7月16日

木曜日
  1. DharmaOCR、ブラジル Portuguese OCR 評価で Mistral OCR4 と Unlimited-OCR を上回る

    DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。

7月15日

水曜日