本文へ移動

#音声

今日 0 件

9月30日

水曜日
  1. Hugging Face、多言語 TTS と音声クローンの拡張可能な評価基盤 Open TTS Leaderboard を公開

    Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。

9月29日

火曜日

9月26日

土曜日

9月25日

金曜日

9月23日

水曜日

9月16日

水曜日

9月10日

木曜日

8月28日

金曜日

8月27日

木曜日

8月21日

金曜日
  1. Hugging Face 研究、音声認識のベンチマーク最適化をどう測るか

    Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。

8月12日

水曜日

8月11日

火曜日
  1. NVIDIA、12言語対応のオープンウェイト音声モデルMagpie TTS Multilingualを公開

    NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。

7月30日

木曜日
  1. Google DeepMind、Flow MusicでLyria 3.5音楽生成モデルを公開

    Google DeepMindは新世代の音楽生成モデルLyria 3.5を公開し、Google Flow Musicで提供を開始した。音楽性、歌詞、歌声、創作の制御の4分野を改善したという。より複雑で自然な旋律構造、指示への追従と構造理解を改善した歌詞、感情表現と発音を改善した歌声、出力のリズムと長さの操作性向上を含む。

7月15日

水曜日

7月1日

水曜日

6月9日

火曜日

4月30日

木曜日
  1. Google DeepMind、医療研究計画AI co-clinicianを発表

    Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。

4月16日

木曜日

3月24日

火曜日
  1. Mistral AI、音声合成モデルVoxtral TTSを公開

    Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。

3月7日

土曜日

2月5日

木曜日

7月17日

木曜日

7月15日

火曜日
  1. Mistral AI、音声理解 Voxtral、24B と3Bの二版を公開

    Mistral AI は Voxtral を24B と3Bの二版で公開し、いずれも Apache 2.0 で自社 API でも提供した。32k トークンのコンテキストを持ち、最大30分の音声転写または40分の音声理解を扱う。質問応答・要約、多言語の自動検出、音声による関数呼び出しを内蔵し、文字の能力は Mistral Small 3.1 を継承する。