本文へ移動

マルチモーダル

テキスト以外の能力:画像理解、画像とテキストの混在、音声と動画の入出力に関するモデルとプロダクト。

精選 47件関連トピック画像生成AI 動画音声・オーディオ

最新の精選

21–40 件目 · 全 47 件

7月23日

木曜日

7月21日

火曜日

7月15日

水曜日

7月8日

水曜日
  1. Mistral AI、具身ナビゲーションモデル Robostral Navigate を公開

    Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。

7月1日

水曜日

6月23日

火曜日
  1. Mistral、文書解析モデル OCR 4 を公開

    Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。

6月9日

火曜日

6月5日

金曜日

5月18日

月曜日

5月17日

日曜日
  1. Google、SynthIDとC2PAのコンテンツ検証を検索、Gemini、Chromeへ拡大

    Googleはコンテンツの透明性・検証ツールをSearch、Gemini、Chrome、Pixel、Cloudへ拡大すると発表した。SynthIDは1000億超の画像と動画、6万年分の音声に透かしを付けた。Geminiアプリ内のSynthID検証は5000万回利用され、今後数週間でSearchとChromeにも導入される。

5月16日

土曜日

4月30日

木曜日
  1. Google DeepMind、医療研究計画AI co-clinicianを発表

    Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。

4月16日

木曜日

4月13日

月曜日

4月3日

金曜日

3月25日

水曜日

3月18日

水曜日