本文へ移動

マルチモーダル

テキスト以外の能力:画像理解、画像とテキストの混在、音声と動画の入出力に関するモデルとプロダクト。

精選 47件関連トピック画像生成AI 動画音声・オーディオ

最新の精選

1–20 件目 · 全 47 件

10月1日

木曜日今日
  1. Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表

    Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。

9月29日

火曜日
  1. Microsoft Research、Quineを公開:生物学の複雑さを扱うAI研究システム

    Microsoft Researchは生物学の複雑さを扱うAI研究システムQuineを公開した。配列、構造、機能、細胞状態、画像などのマルチモーダルデータで学習した生物世界モデルと、モデル、科学ツール、文献、実験担当者をつなぐ対話型ハーネスから構成される。

  2. AMD、約82億ドルの全額株式交換でWorld Labsを買収

    AMDは李飛飛が共同設立したAI研究所World Labsを約82億ドルの全額株式交換で買収すると発表した。年末までに完了する見込みだ。World Labsは2024年に設立され、数か月で評価額10億ドルに達した。2025年には初の商用製品Marbleを公開し、プロンプトから操作可能な3D世界を生成できる。

9月25日

金曜日

9月24日

木曜日
  1. Meta Connect 2026:Muse エージェント、眼鏡ハードウェア、リアルタイム音声

    Meta は Connect 2026 で Muse を個人エージェントとして位置付け、その周辺のハードウェアと機能を更新した。音声とリアルタイム動画に対応し、バックグラウンドで作業を実行し、すべての Meta 眼鏡に導入される。各 Muse は独立したメールアドレスを持ち、Mac 版は computer use に対応し、コネクタープラットフォームには1,500超のアプリがある。

9月23日

水曜日

9月22日

火曜日

9月3日

木曜日

9月2日

水曜日

8月28日

金曜日

8月17日

月曜日

8月12日

水曜日

8月11日

火曜日
  1. NVIDIA、12言語対応のオープンウェイト音声モデルMagpie TTS Multilingualを公開

    NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。

8月10日

月曜日

8月4日

火曜日
  1. Mistral AI、3Bのオープンなマルチモーダル安全分類器Shieldstralを公開

    Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。

7月30日

木曜日

7月28日

火曜日