Google DeepMind、音声文字起こしモデルGemini 3.5 Transcribeを公開
Google DeepMindはGemini 3.5 Transcribeを公開し、現在最も正確な音声文字起こしモデルと説明した。生の音声を直接、正確で整形済みの文字に変換する。
Google DeepMindはGemini 3.5 Transcribeを公開し、現在最も正確な音声文字起こしモデルと説明した。生の音声を直接、正確で整形済みの文字に変換する。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Liquid AIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けDSparkドラフトモデルのチェックポイントを公開した。投機的デコーディングで出力品質を変えずに復号速度を上げ、GPUの処理量を最大3.18倍、端末上で最大2.87倍にした。
Google DeepMind は Gemini 3.7 Flash を公開し、コーディングとエージェント向けの最強の主力モデルと位置付けた。Gemini 3.6 Flash 公開からわずか3週間だ。
Google DeepMind は多言語手話からテキストへのモデル SL2T を公開し、初めて消費者製品に導入した。Pixel 11 の Gboard と Live Transcribe で米国手話(ASL)を英語テキストに変換し、今後さらに多くの端末と言語へ拡大する。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
Google DeepMind は WeatherNext AI モデルを公開した。サイクロンの進路、強度、風の構造の予報で最先端性能に達し、平均で警報を1日早く出せる。気象分野の約10年分の進歩に相当する。
Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。
Google DeepMind は Gemini Robotics ER 2 を公開した。ロボットの高位の頭脳として、動画理解、複数段階の作業計画、複数ロボットの協働に対応し、動作実行を下位の VLA モデルへ任せられる。
Google DeepMindは新世代の音楽生成モデルLyria 3.5を公開し、Google Flow Musicで提供を開始した。音楽性、歌詞、歌声、創作の制御の4分野を改善したという。より複雑で自然な旋律構造、指示への追従と構造理解を改善した歌詞、感情表現と発音を改善した歌声、出力のリズムと長さの操作性向上を含む。
Google DeepMind は次世代ロボット知能層 Gemini Robotics 2 を公開した。初めて人型ロボット全体の全身制御を実現し、両手とグリッパーの精密操作に対応する。
NVIDIAは手術ロボット向けの動作条件付きリアルタイム生成シミュレーターCosmos-H-Dreamsを公開した。FlashDreams推論ライブラリーでRTX PRO 6000 GPU1枚で動き、人と方策による閉ループの操作に対応する。
Google DeepMindはGemini 3.6 Flash、3.5 Flash-Lite、サイバーセキュリティー向け3.5 Flash Cyberの3モデルを公開した。
Google DeepMindは3.5 Flashを微調整した軽量サイバーセキュリティモデルGemini 3.5 Flash Cyberを公開した。脆弱性を素早く発見、検証、修正し、CyberGymなどでは複数回の呼び出しにより大規模モデルに近い成績を示す。
DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。
MistralはApache-2.0のLeanstral 1.5を公開した。総パラメーター119B、稼働パラメーター6Bで形式検証を大幅強化した。miniF2Fで100%、PutnamBenchの672問中587問を解き、FATE-Hで87%、FATE-Xで34%の現時点の最高成績を達成した。
Google DeepMindはNano Banana 2 Lite(gemini-3.1-flash-lite-image)とGemini Omni Flash(gemini-omni-flash-preview)の2モデルを公開した。
Google Researchは表データの分類と回帰向けTabFMを公開した。予測を文脈内学習として捉え直し、手動学習、ハイパーパラメーター調整、特徴量設計なしで、1回の順伝播で予測する。
Google Research は、凍結した Gemini Nano v3 に複数トークン予測(MTP)ヘッドを接続する新構造を公開した。本体のウェイトを変えずに端末上の推論を加速し、Pixel 9 と10シリーズで提供済みだ。
Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。
Google DeepMindは実験的オープンソースモデルDiffusionGemmaを公開した。テキスト拡散で文章の塊を並列生成し、専用GPUで推論速度を最大4倍に高める。
Google DeepMind は Gemini 3.5 Live Translate を公開した。70超の言語に対応するほぼリアルタイムの音声対音声翻訳モデルで、言語を自動検出し、話者の抑揚、リズム、声の高さを保つ。
Google DeepMindはノートパソコンでのローカル実行向けマルチモーダルモデルGemma 4 12Bを公開した。エッジ向けE4Bと26B MoEの中間に位置し、エンコーダーを使わない統一構造で、視覚・音声入力をLLMの本体へ直接渡す。
Mistralは指示への追従、推論、コーディングを初めて統合した128Bの稠密モデルMistral Medium 3.5を公開した。修正版MITライセンスで重みを公開し、256kコンテキストに対応する。GPU4基以上で自社ホスティングが可能だ。
Google DeepMind は Gemini Omni シリーズ最初のモデル Gemini Omni Flash を公開した。画像、音声、動画、テキストを組み合わせて高品質の動画を生成し、自然言語の会話で段階的に編集できる。
Google DeepMind は Gemini 3.5 シリーズの最初のモデル3.5 Flash を公開した。エージェントとコーディングを重視し、本日から Gemini app、Google Search の AI Mode、Google Antigravity、Gemini API、Gemini Enterprise で提供する。
Google DeepMind は新しいテキスト音声変換モデル Gemini 3.1 Flash TTS を公開し、制御性、表現力、音質の向上を打ち出した。本日から開発者は Gemini API と Google AI Studio、企業は Vertex AI でプレビューでき、Workspace ユーザーは Google Vids で利用できる。
Google DeepMindはロボット向けの推論重視モデルGemini Robotics-ER 1.6を公開した。空間推論と複数視点の理解を強化し、円形圧力計、液面表示器、デジタル表示を読む計器読み取り能力を追加した。
Google DeepMindはGemma 4モデル群を公開した。E2B、E4B、26B MoE、31B Denseの4サイズを用意し、Apache 2.0ライセンスを採用する。
Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。
Mistral AIはMistral Smallシリーズの次の主要版Mistral Small 4を公開した。Magistralの推論、Pixtralのマルチモーダル、Devstralのエージェント型コーディングを初めて単一モデルに統合し、Apache 2.0を採用する。
Mistral AIはLean 4向け初のオープンソースコーディングエージェントLeanstralを公開した。6Bの有効パラメーターを持つ疎な構造を採用し、重みはApache 2.0で公開した。Mistral vibeと無料APIエンドポイントlabs-leanstral-2603に接続されている。
MistralはVoxtral Transcribe 2を公開した。バッチ文字起こし向けVoxtral Mini Transcribe V2と、リアルタイム向けVoxtral Realtimeの2モデルからなる。
Mistral AIはMistral OCR 3を公開した。帳票、スキャン、複雑な表、手書き内容でMistral OCR 2に対する全体の勝率は74%で、企業向け文書処理やAIネイティブOCRより高い精度だという。
Mistral AIは次世代コーディングモデルDevstral 2を公開した。123BのDevstral 2は修正版MIT、24BのDevstral Small 2はApache 2.0で、どちらもオープンソースだ。
Mistral は Mistral 3 シリーズを公開した。14B、8B、3B の小型 dense モデルと、過去最強の Mistral Large 3 を含む。後者は稼働41B・総675Bの疎な MoE で、すべて Apache 2.0 で公開する。
Mistral AI は Voxtral を24B と3Bの二版で公開し、いずれも Apache 2.0 で自社 API でも提供した。32k トークンのコンテキストを持ち、最大30分の音声転写または40分の音声理解を扱う。質問応答・要約、多言語の自動検出、音声による関数呼び出しを内蔵し、文字の能力は Mistral Small 3.1 を継承する。