Google DeepMind·· 2026-08-27
Google DeepMind、音声文字起こしモデルGemini 3.5 Transcribeを公開
Intelligent transcription with Gemini 3.5 Transcribe
AI による要約
Google DeepMindはGemini 3.5 Transcribeを公開し、現在最も正確な音声文字起こしモデルと説明した。生の音声を直接、正確で整形済みの文字に変換する。
入選の記録
基準 60公式・一次情報1 回目 742 回目 71
入選二回の合計 145 ≥ 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:Google发布Gemini语音转文字模型
- 推薦理由
- WER、遅延、多言語対応などの定量指標と2種類のAPI接続方法は、音声処理構成の選定に役立つ。
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Google DeepMind · deepmind.google