Google Research、日常の症状評価向け対話 AI エージェント SymptomAI を公開
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
テキスト以外の能力:画像理解、画像とテキストの混在、音声と動画の入出力に関するモデルとプロダクト。
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
Google DeepMindはGemini 3.6 Flash、3.5 Flash-Lite、サイバーセキュリティー向け3.5 Flash Cyberの3モデルを公開した。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。
Hugging Face と Cerebras はリアルタイム音声対音声パイプラインを共同で実演した。Cerebras で Gemma 4 31B の推論を加速し、Nvidia Parakeet の音声認識と Alibaba Qwen3TTS の音声合成をつなぐ。
Google DeepMindはNano Banana 2 Lite(gemini-3.1-flash-lite-image)とGemini Omni Flash(gemini-omni-flash-preview)の2モデルを公開した。
Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。
Google DeepMind は Gemini 3.5 Live Translate を公開した。70超の言語に対応するほぼリアルタイムの音声対音声翻訳モデルで、言語を自動検出し、話者の抑揚、リズム、声の高さを保つ。
Google DeepMindはノートパソコンでのローカル実行向けマルチモーダルモデルGemma 4 12Bを公開した。エッジ向けE4Bと26B MoEの中間に位置し、エンコーダーを使わない統一構造で、視覚・音声入力をLLMの本体へ直接渡す。
Google ResearchはNatureにPHRMシステムの研究を発表した。顔認証によるロック解除後の数秒間に前面カメラで動画を撮影し、深層学習で心拍数と安静時心拍数をバックグラウンド推定する。
Google DeepMindは実験的プロトタイプProject GenieにStreet View groundingを導入した。Mapsのピンで米国内の実在地点を選び、スタイルとキャラクターを指定すると、Genieが実写を出発地点の基準にした操作可能な世界を生成する。
Google DeepMind は Gemini Omni シリーズ最初のモデル Gemini Omni Flash を公開した。画像、音声、動画、テキストを組み合わせて高品質の動画を生成し、自然言語の会話で段階的に編集できる。
Googleはコンテンツの透明性・検証ツールをSearch、Gemini、Chrome、Pixel、Cloudへ拡大すると発表した。SynthIDは1000億超の画像と動画、6万年分の音声に透かしを付けた。Geminiアプリ内のSynthID検証は5000万回利用され、今後数週間でSearchとChromeにも導入される。
Google DeepMind は Gemini 3.5 シリーズの最初のモデル3.5 Flash を公開した。エージェントとコーディングを重視し、本日から Gemini app、Google Search の AI Mode、Google Antigravity、Gemini API、Gemini Enterprise で提供する。
Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。
Google DeepMind は新しいテキスト音声変換モデル Gemini 3.1 Flash TTS を公開し、制御性、表現力、音質の向上を打ち出した。本日から開発者は Gemini API と Google AI Studio、企業は Vertex AI でプレビューでき、Workspace ユーザーは Google Vids で利用できる。
Google DeepMindはロボット向けの推論重視モデルGemini Robotics-ER 1.6を公開した。空間推論と複数視点の理解を強化し、円形圧力計、液面表示器、デジタル表示を読む計器読み取り能力を追加した。
Google DeepMindはGemma 4モデル群を公開した。E2B、E4B、26B MoE、31B Denseの4サイズを用意し、Apache 2.0ライセンスを採用する。
GoogleはGeminiとWebXR、three.js、LiteRT.jsを使うXR Blocksを組み合わせたVibe Coding XRを公開した。自然言語の指示を物理的な状況を認識するAndroid XRアプリに変え、公式には60秒以内で完了する。
Google Researchと複数のNHS機関によるAIMS研究は、Nature Cancerに2件の姉妹研究を発表し、NHS乳がん検診の手順におけるAI検出システムの性能を評価した。