Mistral AI、具身ナビゲーションモデル Robostral Navigate を公開
Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。
Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。
Hugging Face と Cerebras はリアルタイム音声対音声パイプラインを共同で実演した。Cerebras で Gemma 4 31B の推論を加速し、Nvidia Parakeet の音声認識と Alibaba Qwen3TTS の音声合成をつなぐ。
Google DeepMindはNano Banana 2 Lite(gemini-3.1-flash-lite-image)とGemini Omni Flash(gemini-omni-flash-preview)の2モデルを公開した。
Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。
Google ResearchはFarmscapes 2020の高解像度ラスターマップを、生け垣、石垣、低木林の扱いやすい一覧に変えたベクトルデータを公開した。英国の13万平方キロメートル超を対象とする。世界の衛星画像3億枚超で事前学習したRSF Vision-Transformerを約247平方キロメートルの注釈で微調整し、Polsby–Popperコンパクト性スコアで森林、木の集まり、生け垣を区別する。線状特性の閾値は0.5未満だ。
英国AISIのアラインメントチームとTimaeusは非営利Sequentを共同設立した。超知能に備える研究は不十分とし、2~3年で常勤40~80人、初期調達1億~1億5000万ドルを計画する。
Google は二つの研究を公表した。2,345人の調査では、AI を使った参加者の62%超が皮膚の状態の名前を挙げようとし、対照群は41%だった。正解率は23%で、対照群の8%の約3倍。もう一つの混合手法研究は、自分の皮膚の問題にツールを使う方法、理解の変化、医師との対話の違いを調べた。一方、次の受診行動を判断する支援は限定的だった。
Google DeepMind は Gemini 3.5 Live Translate を公開した。70超の言語に対応するほぼリアルタイムの音声対音声翻訳モデルで、言語を自動検出し、話者の抑揚、リズム、声の高さを保つ。
Google DeepMindはノートパソコンでのローカル実行向けマルチモーダルモデルGemma 4 12Bを公開した。エッジ向けE4Bと26B MoEの中間に位置し、エンコーダーを使わない統一構造で、視覚・音声入力をLLMの本体へ直接渡す。
Google ResearchはNatureにPHRMシステムの研究を発表した。顔認証によるロック解除後の数秒間に前面カメラで動画を撮影し、深層学習で心拍数と安静時心拍数をバックグラウンド推定する。
Google ResearchはI/O 2026でGemini for Scienceの実験ツール群を公開した。ERAとAlphaEvolveのComputational Discovery、Co-ScientistのHypothesis Generation、NotebookLMのLiterature Insightsを含む。
Google DeepMindは実験的プロトタイプProject GenieにStreet View groundingを導入した。Mapsのピンで米国内の実在地点を選び、スタイルとキャラクターを指定すると、Genieが実写を出発地点の基準にした操作可能な世界を生成する。
Google DeepMind は Gemini Omni シリーズ最初のモデル Gemini Omni Flash を公開した。画像、音声、動画、テキストを組み合わせて高品質の動画を生成し、自然言語の会話で段階的に編集できる。
Googleはコンテンツの透明性・検証ツールをSearch、Gemini、Chrome、Pixel、Cloudへ拡大すると発表した。SynthIDは1000億超の画像と動画、6万年分の音声に透かしを付けた。Geminiアプリ内のSynthID検証は5000万回利用され、今後数週間でSearchとChromeにも導入される。
Google DeepMind とシンガポール政府は国家 AI 連携を結び、医療、研究、教育、気候の新事業を始める。AI 支援の「三者ケア」を検討し、AlphaFold と Google Earth で東南アジアの感染症研究を進め、Gemma ベースのランニング支援で視覚障害のある選手の自主訓練を助ける。
Google DeepMind は Gemini 3.5 シリーズの最初のモデル3.5 Flash を公開した。エージェントとコーディングを重視し、本日から Gemini app、Google Search の AI Mode、Google Antigravity、Gemini API、Gemini Enterprise で提供する。
Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。
Google DeepMind は新しいテキスト音声変換モデル Gemini 3.1 Flash TTS を公開し、制御性、表現力、音質の向上を打ち出した。本日から開発者は Gemini API と Google AI Studio、企業は Vertex AI でプレビューでき、Workspace ユーザーは Google Vids で利用できる。
Google DeepMindはロボット向けの推論重視モデルGemini Robotics-ER 1.6を公開した。空間推論と複数視点の理解を強化し、円形圧力計、液面表示器、デジタル表示を読む計器読み取り能力を追加した。
Googleは論文の図を作るPaperVizAgentと自動査読のScholarPeerを公開した。PaperVizAgentは検索、計画、スタイル、可視化、審査の5エージェントで協働する。100点評価で60.2を得てGPT-Image-1.5、Nano-Banana-Pro、Paper2Anyを上回り、人の基準50.0を超えた唯一の枠組みだった。
Google DeepMindはGemma 4モデル群を公開した。E2B、E4B、26B MoE、31B Denseの4サイズを用意し、Apache 2.0ライセンスを採用する。
GoogleはGeminiとWebXR、three.js、LiteRT.jsを使うXR Blocksを組み合わせたVibe Coding XRを公開した。自然言語の指示を物理的な状況を認識するAndroid XRアプリに変え、公式には60秒以内で完了する。
Google Research は The Check Up で複数の医療 AI の進展を示した。Fitbit と研究した Personal Health Agent(PHA)を含み、単一用途アプリより長期的健康を支えやすいと分かった。
Google Researchと複数のNHS機関によるAIMS研究は、Nature Cancerに2件の姉妹研究を発表し、NHS乳がん検診の手順におけるAI検出システムの性能を評価した。
Mistral AIはMistral Smallシリーズの次の主要版Mistral Small 4を公開した。Magistralの推論、Pixtralのマルチモーダル、Devstralのエージェント型コーディングを初めて単一モデルに統合し、Apache 2.0を採用する。
Mistral AIはMistral OCR 3を公開した。帳票、スキャン、複雑な表、手書き内容でMistral OCR 2に対する全体の勝率は74%で、企業向け文書処理やAIネイティブOCRより高い精度だという。
Mistral は Mistral 3 シリーズを公開した。14B、8B、3B の小型 dense モデルと、過去最強の Mistral Large 3 を含む。後者は稼働41B・総675Bの疎な MoE で、すべて Apache 2.0 で公開する。
MistralはLoRAでPixtral-12Bを微調整し、Aerial Image Dataset(AID)の衛星画像分類で未調整の基準を大きく上回り、幻覚による無効な分類名を減らした。Mistralの微調整APIかLaPlateforme UIを使い、大規模なハイパーパラメーター調整は不要だ。学習8000、テスト2000に分割した。
MistralはLe Chatに、プレビューのDeep Research、Voxtralによる音声モード、Magistralによる多言語推論、会話を整理するProjects、Black Forest Labsと協力した画像編集などを追加した。
Mistral AIはMistral Medium 3を公開し、複数のベンチマークでClaude Sonnet 3.7の90%以上の性能に達すると説明した。100万トークン当たり入力0.4ドル、出力2ドルである。
Mistral AI は Mistral Small 3.1 を公開した。Small 3 から文字性能とマルチモーダル理解を高め、コンテキストを128k トークンに拡張し、推論は毎秒150トークン。Apache 2.0 で公開する。
Mistral AIは画像とPDFを読み、文字と画像を順番に交互出力するMistral OCR APIを導入した。Le Chatの数百万人にとって既定の文書理解モデルになっている。