本文へ移動

#モデル発表

今日 6 件

7月30日

木曜日
  1. Google DeepMind、Flow MusicでLyria 3.5音楽生成モデルを公開

    Google DeepMindは新世代の音楽生成モデルLyria 3.5を公開し、Google Flow Musicで提供を開始した。音楽性、歌詞、歌声、創作の制御の4分野を改善したという。より複雑で自然な旋律構造、指示への追従と構造理解を改善した歌詞、感情表現と発音を改善した歌声、出力のリズムと長さの操作性向上を含む。

7月28日

火曜日

7月27日

月曜日

7月21日

火曜日

7月17日

金曜日

7月15日

水曜日

7月8日

水曜日
  1. Mistral AI、具身ナビゲーションモデル Robostral Navigate を公開

    Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。

7月2日

木曜日

7月1日

水曜日

6月30日

火曜日

6月23日

火曜日
  1. Mistral、文書解析モデル OCR 4 を公開

    Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。

6月11日

木曜日

6月9日

火曜日

5月22日

金曜日

5月18日

月曜日

5月16日

土曜日

4月16日

木曜日

4月13日

月曜日

4月3日

金曜日

3月24日

火曜日
  1. Mistral AI、音声合成モデルVoxtral TTSを公開

    Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。

3月17日

火曜日

2月5日

木曜日

12月17日

水曜日

12月9日

火曜日

12月3日

水曜日

7月15日

火曜日
  1. Mistral AI、音声理解 Voxtral、24B と3Bの二版を公開

    Mistral AI は Voxtral を24B と3Bの二版で公開し、いずれも Apache 2.0 で自社 API でも提供した。32k トークンのコンテキストを持ち、最大30分の音声転写または40分の音声理解を扱う。質問応答・要約、多言語の自動検出、音声による関数呼び出しを内蔵し、文字の能力は Mistral Small 3.1 を継承する。

7月11日

金曜日

6月10日

火曜日

5月28日

水曜日

5月21日

水曜日

5月7日

水曜日

3月17日

月曜日