Hugging Face、多言語 TTS と音声クローンの拡張可能な評価基盤 Open TTS Leaderboard を公開
Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。
Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。
AWSはSageMaker AIにQwen3-TTSを配置できるvLLM-Omni DLCを公開した。持続的な双方向接続1本で文字を入力しながら音声を出力し、生成が完了する前から再生を始められる。
Alibaba Cloud Qwenチームが公開したQwen3-TTS-12Hz-1.7B-BaseがAmazon SageMaker JumpStartで利用可能になった。フルマネージドのリアルタイム推論エンドポイントへ配置でき、数秒の参照音声と対応する文字だけで、再学習なしに声を複製する。
Google DeepMindはGemini 3.8 Live with Live Avatarを公開した。ネイティブなリアルタイム対話モデルにほぼリアルタイムの動画生成を加え、聞く、見る、話すことのできる動的な視覚アバターを実現し、本日からGemini Enterpriseで提供する。
AWSはOpenAI Whisperにバッチ推論、wav2vec2の強制アラインメントによる単語単位の時刻、話者分離を追加したWhisperX Deep Learning Containerを公開した。自作イメージなしで、Amazon SageMaker AIのリアルタイムまたは非同期エンドポイントへ配置できる。
Google DeepMindは音声生成モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。前者はキャラクター設計と行ごとの演技指示、後者は同時処理数の多い吹き替えと音声エージェント向けである。
Ringg の GPT-5.6 に基づく多言語 AI エージェントは、音声、チャット、WhatsApp、ウェブを通じて顧客の電話の最大65%を解決する。費用は GPT-4.1 より90%低い。
Google DeepMindはリアルタイム対話モデルGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを公開した。前者は規模と費用効率、後者は複雑な課題と多段階推論向けである。
OpenAIはAPIでGPT-Live-1を提供し、自然な全二重音声対話と、強化された指示追従、カスタム音声、電話への対応を実現する。
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
Google DeepMindはGemini 3.5 Transcribeを公開し、現在最も正確な音声文字起こしモデルと説明した。生の音声を直接、正確で整形済みの文字に変換する。
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
Google DeepMindは新世代の音楽生成モデルLyria 3.5を公開し、Google Flow Musicで提供を開始した。音楽性、歌詞、歌声、創作の制御の4分野を改善したという。より複雑で自然な旋律構造、指示への追従と構造理解を改善した歌詞、感情表現と発音を改善した歌声、出力のリズムと長さの操作性向上を含む。
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
Hugging Face と Cerebras はリアルタイム音声対音声パイプラインを共同で実演した。Cerebras で Gemma 4 31B の推論を加速し、Nvidia Parakeet の音声認識と Alibaba Qwen3TTS の音声合成をつなぐ。
Google DeepMind は Gemini 3.5 Live Translate を公開した。70超の言語に対応するほぼリアルタイムの音声対音声翻訳モデルで、言語を自動検出し、話者の抑揚、リズム、声の高さを保つ。
Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。
Google DeepMind は新しいテキスト音声変換モデル Gemini 3.1 Flash TTS を公開し、制御性、表現力、音質の向上を打ち出した。本日から開発者は Gemini API と Google AI Studio、企業は Vertex AI でプレビューでき、Workspace ユーザーは Google Vids で利用できる。
Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。
Google Researchは大規模な公開音声データセットWAXALを公開した。初期版は1億人超が使うサハラ以南アフリカの27言語を対象とし、CC-BY-4.0で提供する。
MistralはVoxtral Transcribe 2を公開した。バッチ文字起こし向けVoxtral Mini Transcribe V2と、リアルタイム向けVoxtral Realtimeの2モデルからなる。
MistralはLe Chatに、プレビューのDeep Research、Voxtralによる音声モード、Magistralによる多言語推論、会話を整理するProjects、Black Forest Labsと協力した画像編集などを追加した。
Mistral AI は Voxtral を24B と3Bの二版で公開し、いずれも Apache 2.0 で自社 API でも提供した。32k トークンのコンテキストを持ち、最大30分の音声転写または40分の音声理解を扱う。質問応答・要約、多言語の自動検出、音声による関数呼び出しを内蔵し、文字の能力は Mistral Small 3.1 を継承する。