本文へ移動

音声・オーディオ

AI の音声とオーディオの進展:音声合成、リアルタイム対話、音楽生成、音声理解のモデルとプロダクト。

最新の精選

1–20 件目 · 全 21 件

9月25日

金曜日

9月24日

木曜日
  1. Meta Connect 2026:Muse エージェント、眼鏡ハードウェア、リアルタイム音声

    Meta は Connect 2026 で Muse を個人エージェントとして位置付け、その周辺のハードウェアと機能を更新した。音声とリアルタイム動画に対応し、バックグラウンドで作業を実行し、すべての Meta 眼鏡に導入される。各 Muse は独立したメールアドレスを持ち、Mac 版は computer use に対応し、コネクタープラットフォームには1,500超のアプリがある。

9月23日

水曜日

9月16日

水曜日

9月10日

木曜日

8月28日

金曜日

8月27日

木曜日

8月21日

金曜日
  1. Hugging Face 研究、音声認識のベンチマーク最適化をどう測るか

    Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。

8月12日

水曜日

8月11日

火曜日
  1. NVIDIA、12言語対応のオープンウェイト音声モデルMagpie TTS Multilingualを公開

    NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。

7月30日

木曜日
  1. Google DeepMind、Flow MusicでLyria 3.5音楽生成モデルを公開

    Google DeepMindは新世代の音楽生成モデルLyria 3.5を公開し、Google Flow Musicで提供を開始した。音楽性、歌詞、歌声、創作の制御の4分野を改善したという。より複雑で自然な旋律構造、指示への追従と構造理解を改善した歌詞、感情表現と発音を改善した歌声、出力のリズムと長さの操作性向上を含む。

7月15日

水曜日

7月1日

水曜日

6月9日

火曜日

4月30日

木曜日
  1. Google DeepMind、医療研究計画AI co-clinicianを発表

    Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。

4月16日

木曜日

3月24日

火曜日
  1. Mistral AI、音声合成モデルVoxtral TTSを公開

    Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。

3月7日

土曜日

2月5日

木曜日

7月17日

木曜日