Google DeepMind、具身推論モデル Gemini Robotics ER 2 を公開
Google DeepMind は Gemini Robotics ER 2 を公開した。ロボットの高位の頭脳として、動画理解、複数段階の作業計画、複数ロボットの協働に対応し、動作実行を下位の VLA モデルへ任せられる。
Google DeepMind は Gemini Robotics ER 2 を公開した。ロボットの高位の頭脳として、動画理解、複数段階の作業計画、複数ロボットの協働に対応し、動作実行を下位の VLA モデルへ任せられる。
Google DeepMindは新世代の音楽生成モデルLyria 3.5を公開し、Google Flow Musicで提供を開始した。音楽性、歌詞、歌声、創作の制御の4分野を改善したという。より複雑で自然な旋律構造、指示への追従と構造理解を改善した歌詞、感情表現と発音を改善した歌声、出力のリズムと長さの操作性向上を含む。
Google DeepMind は次世代ロボット知能層 Gemini Robotics 2 を公開した。初めて人型ロボット全体の全身制御を実現し、両手とグリッパーの精密操作に対応する。
NVIDIAは手術ロボット向けの動作条件付きリアルタイム生成シミュレーターCosmos-H-Dreamsを公開した。FlashDreams推論ライブラリーでRTX PRO 6000 GPU1枚で動き、人と方策による閉ループの操作に対応する。
Google DeepMindはGemini 3.6 Flash、3.5 Flash-Lite、サイバーセキュリティー向け3.5 Flash Cyberの3モデルを公開した。
Google DeepMindは3.5 Flashを微調整した軽量サイバーセキュリティモデルGemini 3.5 Flash Cyberを公開した。脆弱性を素早く発見、検証、修正し、CyberGymなどでは複数回の呼び出しにより大規模モデルに近い成績を示す。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。
MistralはApache-2.0のLeanstral 1.5を公開した。総パラメーター119B、稼働パラメーター6Bで形式検証を大幅強化した。miniF2Fで100%、PutnamBenchの672問中587問を解き、FATE-Hで87%、FATE-Xで34%の現時点の最高成績を達成した。
Google DeepMindはNano Banana 2 Lite(gemini-3.1-flash-lite-image)とGemini Omni Flash(gemini-omni-flash-preview)の2モデルを公開した。
Google Researchは表データの分類と回帰向けTabFMを公開した。予測を文脈内学習として捉え直し、手動学習、ハイパーパラメーター調整、特徴量設計なしで、1回の順伝播で予測する。
Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。
Google DeepMindは実験的オープンソースモデルDiffusionGemmaを公開した。テキスト拡散で文章の塊を並列生成し、専用GPUで推論速度を最大4倍に高める。
Google DeepMind は Gemini 3.5 Live Translate を公開した。70超の言語に対応するほぼリアルタイムの音声対音声翻訳モデルで、言語を自動検出し、話者の抑揚、リズム、声の高さを保つ。
Google DeepMindはノートパソコンでのローカル実行向けマルチモーダルモデルGemma 4 12Bを公開した。エッジ向けE4Bと26B MoEの中間に位置し、エンコーダーを使わない統一構造で、視覚・音声入力をLLMの本体へ直接渡す。
Mistralは指示への追従、推論、コーディングを初めて統合した128Bの稠密モデルMistral Medium 3.5を公開した。修正版MITライセンスで重みを公開し、256kコンテキストに対応する。GPU4基以上で自社ホスティングが可能だ。
Google DeepMind は Gemini Omni シリーズ最初のモデル Gemini Omni Flash を公開した。画像、音声、動画、テキストを組み合わせて高品質の動画を生成し、自然言語の会話で段階的に編集できる。
Google DeepMind は Gemini 3.5 シリーズの最初のモデル3.5 Flash を公開した。エージェントとコーディングを重視し、本日から Gemini app、Google Search の AI Mode、Google Antigravity、Gemini API、Gemini Enterprise で提供する。
Google DeepMind は新しいテキスト音声変換モデル Gemini 3.1 Flash TTS を公開し、制御性、表現力、音質の向上を打ち出した。本日から開発者は Gemini API と Google AI Studio、企業は Vertex AI でプレビューでき、Workspace ユーザーは Google Vids で利用できる。
Google DeepMindはロボット向けの推論重視モデルGemini Robotics-ER 1.6を公開した。空間推論と複数視点の理解を強化し、円形圧力計、液面表示器、デジタル表示を読む計器読み取り能力を追加した。
Google DeepMindはGemma 4モデル群を公開した。E2B、E4B、26B MoE、31B Denseの4サイズを用意し、Apache 2.0ライセンスを採用する。
Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。
Mistral AIはMistral Smallシリーズの次の主要版Mistral Small 4を公開した。Magistralの推論、Pixtralのマルチモーダル、Devstralのエージェント型コーディングを初めて単一モデルに統合し、Apache 2.0を採用する。
Mistral AIはLean 4向け初のオープンソースコーディングエージェントLeanstralを公開した。6Bの有効パラメーターを持つ疎な構造を採用し、重みはApache 2.0で公開した。Mistral vibeと無料APIエンドポイントlabs-leanstral-2603に接続されている。
MistralはVoxtral Transcribe 2を公開した。バッチ文字起こし向けVoxtral Mini Transcribe V2と、リアルタイム向けVoxtral Realtimeの2モデルからなる。
Mistral AIはMistral OCR 3を公開した。帳票、スキャン、複雑な表、手書き内容でMistral OCR 2に対する全体の勝率は74%で、企業向け文書処理やAIネイティブOCRより高い精度だという。
Mistral AIは次世代コーディングモデルDevstral 2を公開した。123BのDevstral 2は修正版MIT、24BのDevstral Small 2はApache 2.0で、どちらもオープンソースだ。
Mistral は Mistral 3 シリーズを公開した。14B、8B、3B の小型 dense モデルと、過去最強の Mistral Large 3 を含む。後者は稼働41B・総675Bの疎な MoE で、すべて Apache 2.0 で公開する。
Mistral AI は Voxtral を24B と3Bの二版で公開し、いずれも Apache 2.0 で自社 API でも提供した。32k トークンのコンテキストを持ち、最大30分の音声転写または40分の音声理解を扱う。質問応答・要約、多言語の自動検出、音声による関数呼び出しを内蔵し、文字の能力は Mistral Small 3.1 を継承する。
Mistral AIはAll Hands AIと共同でDevstral Mediumを公開し、Devstral Small 1.1を更新した。
Mistral AI は初の推論モデル Magistral を公開した。24B パラメーターの公開版 Magistral Small と企業向け Magistral Medium がある。
Mistral AIは初のコード向け埋め込みモデルCodestral Embedを公開した。実際のコード検索でVoyage Code 3、Cohere Embed v4.0、OpenAIの大型埋め込みモデルを上回る。
Mistral AIとAll Hands AIはソフトウェア開発向けのエージェント型LLM Devstralを共同公開した。Apache 2.0のオープンソースだ。
Mistral AIはMistral Medium 3を公開し、複数のベンチマークでClaude Sonnet 3.7の90%以上の性能に達すると説明した。100万トークン当たり入力0.4ドル、出力2ドルである。
Mistral AI は Mistral Small 3.1 を公開した。Small 3 から文字性能とマルチモーダル理解を高め、コンテキストを128k トークンに拡張し、推論は毎秒150トークン。Apache 2.0 で公開する。