Google、生成 AI で将来の技能を評価する Vantage を公開
Google は、高校生・大学生の問題解決や協働を生成 AI の模擬対話で評価する研究実験 Vantage を公開した。Google Labs で英語の登録を受け付ける。Executive LLM が会話を動的に進め、AI Evaluator が評価表で採点する。NYU との米国18~25歳188人の研究では、AI と専門家の採点一致度は専門家同士に近かった。
Google は、高校生・大学生の問題解決や協働を生成 AI の模擬対話で評価する研究実験 Vantage を公開した。Google Labs で英語の登録を受け付ける。Executive LLM が会話を動的に進め、AI Evaluator が評価表で採点する。NYU との米国18~25歳188人の研究では、AI と専門家の採点一致度は専門家同士に近かった。
Google DeepMindはロボット向けの推論重視モデルGemini Robotics-ER 1.6を公開した。空間推論と複数視点の理解を強化し、円形圧力計、液面表示器、デジタル表示を読む計器読み取り能力を追加した。
Google Researchは衣料品購入の4000以上の人・機械の複数ターン会話、約15000ターンのConvApparelを公開した。LLM利用者シミュレーターと人の現実感の差を測る。
Googleは論文の図を作るPaperVizAgentと自動査読のScholarPeerを公開した。PaperVizAgentは検索、計画、スタイル、可視化、審査の5エージェントで協働する。100点評価で60.2を得てGPT-Image-1.5、Nano-Banana-Pro、Paper2Anyを上回り、人の基準50.0を超えた唯一の枠組みだった。
Google ResearchはIRI、ERQなどの心理質問票を改変した状況判断テスト(SJT)で、実際のユーザー・助手の場面の行動傾向が人の共通認識に合うか評価する枠組みを提案した。
Google DeepMindはGemma 4モデル群を公開した。E2B、E4B、26B MoE、31B Denseの4サイズを用意し、Apache 2.0ライセンスを採用する。
Google Research は『Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation』で評価項目数と項目ごとの注釈者数を比較した。一般的な1人、3人、5人では足りないことが多く、人の意見の違いを反映するには10人超が必要な場合が多い。
Mistral AIは人の開発者とコーディングエージェント向けSpaces CLIを公開した。spaces initやspaces devなどで雛形作成、開発環境、配置を進め、対話プロンプトごとに対応するflagがあるため、エージェントが全工程を自律実行できる。initはcontext.jsonとAGENTS.mdを生成し、構造と規則を伝える。
Google Quantum AI は白書で、将来の量子コンピューターが暗号資産を守る楕円曲線暗号を破るために必要な量子ビットとゲートの数は、従来の見積もりより少ないとした。
Google DeepMindはGeminiで動く実験的なAIポインターを公表した。指しているものだけでなく、ユーザーにとっての意味も理解する。作業を中断しないこと、周囲の視覚・意味的文脈を捉えること、「これ」「あれ」のような自然な略し方に対応すること、ピクセルを場所、日付、物体など操作可能な実体へ変えることの4原則を示した。
GoogleはGeminiとWebXR、three.js、LiteRT.jsを使うXR Blocksを組み合わせたVibe Coding XRを公開した。自然言語の指示を物理的な状況を認識するAndroid XRアプリに変え、公式には60秒以内で完了する。
Google Research は TurboQuant を公開した。訓練や微調整なしで、モデル精度を損なわず KV キャッシュを3 bitに量子化できる。QJL と PolarQuant の二手法も提案した。
S2VecはS2 Geometryによる区画とラスタライズで建物・道路を多層画像へ変え、マスク付き自己符号化(MAE)で汎用埋め込みを学ぶ。米国人口密度や所得中央値など、未見地域のゼロショット社会経済予測でSATCLIP、GEOCLIPを上回るが、樹木被覆や標高では改善が必要だ。
Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。
Google Research は The Check Up で複数の医療 AI の進展を示した。Fitbit と研究した Personal Health Agent(PHA)を含み、単一用途アプリより長期的健康を支えやすいと分かった。
Google Researchと複数のNHS機関によるAIMS研究は、Nature Cancerに2件の姉妹研究を発表し、NHS乳がん検診の手順におけるAI検出システムの性能を評価した。
Mistral AI は独自知識に基づく最先端級 AI モデル構築システム Forge を公開した。事前訓練、事後訓練、強化学習に対応し、dense と MoE の構造を扱う。必要に応じてマルチモーダル入力にも対応し、企業内の基盤でモデルの訓練とガバナンスを行える。
Mistral AIはMistral Smallシリーズの次の主要版Mistral Small 4を公開した。Magistralの推論、Pixtralのマルチモーダル、Devstralのエージェント型コーディングを初めて単一モデルに統合し、Apache 2.0を採用する。
Mistral AIはNVIDIA Nemotron Coalitionの創設メンバーとなった。共同で最先端オープンAIモデルを開発する計画で、Mistralは構造、マルチモーダル能力、微調整ツール、NVIDIAは計算資源、開発ツール、合成データパイプラインを提供する。
GoogleとCornellはGPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM、独自RAGに高温超伝導の専門問題67問を解かせた。12人の国際専門家がバランス、網羅性、簡潔性、証拠、画像の関連性、定性的意見の6指標で盲検評価した。研究はPNASに掲載された。
Mistral AIはLean 4向け初のオープンソースコーディングエージェントLeanstralを公開した。6Bの有効パラメーターを持つ疎な構造を採用し、重みはApache 2.0で公開した。Mistral vibeと無料APIエンドポイントlabs-leanstral-2603に接続されている。
Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。
Google は Flood Hub で都市の鉄砲水予報を公開した。新しい AI 手法により、都市部で最大24時間先の鉄砲水リスクを予測できる。
Google ResearchはGeminiで世界のニュースから過去の災害の構造化データを抽出するGroundsourceを公開した。最初のオープンデータは都市の鉄砲水260万件を収め、150か国以上、2000年から現在までを対象とする。
Google ResearchとBeth Israel Deaconess Medical Centerは、単一施設で前向きの実現可能性研究を実施した。外来のプライマリケア受診前にAMIEが患者とテキストで問診し、医師が動画でリアルタイムに監督した。
Mistral は公開コーディングアシスタント Vibe から自律エージェントを構築した。Rails ソースを読み、RSpec テストを生成・改善し、CI/CD で人の介入なしに実行する。
Google Researchは大規模な公開音声データセットWAXALを公開した。初期版は1億人超が使うサハラ以南アフリカの27言語を対象とし、CC-BY-4.0で提供する。
MistralはVoxtral Transcribe 2を公開した。バッチ文字起こし向けVoxtral Mini Transcribe V2と、リアルタイム向けVoxtral Realtimeの2モデルからなる。
Mistral は Devstral 2 シリーズによる端末コーディングエージェント Mistral Vibe 2.0 を公開した。独自サブエージェント、複数選択式の確認、スラッシュコマンドのスキル、統合エージェントモード、自動更新を追加する。
Mistral AIはMedium 3.1のPrefill/Decode分離配置でvLLMのメモリーリークを調査した。システムメモリーが毎分400MB増え、数時間で不足する。グラフコンパイルを有効化しNIXLでKVCacheを送るdecode側だけに現れた。Heaptrackではヒープが安定しており、問題はヒープ外にあった。
Berkeley AI Researchは相互情報量で画像システムを評価・最適化する枠組みを提案した。雑音付き測定と雑音モデルだけで情報量を測る。NeurIPS 2025でカラー写真、電波天文、レンズなし撮像、顕微鏡の復号器性能を予測した。設計は最先端の全工程学習に匹敵し、メモリーと計算量が少なく、課題別の復号器設計を要しない。
Mistral AIはMistral OCR 3を公開した。帳票、スキャン、複雑な表、手書き内容でMistral OCR 2に対する全体の勝率は74%で、企業向け文書処理やAIネイティブOCRより高い精度だという。
Mistral AIは次世代コーディングモデルDevstral 2を公開した。123BのDevstral 2は修正版MIT、24BのDevstral Small 2はApache 2.0で、どちらもオープンソースだ。
Mistral は Mistral 3 シリーズを公開した。14B、8B、3B の小型 dense モデルと、過去最強の Mistral Large 3 を含む。後者は稼働41B・総675Bの疎な MoE で、すべて Apache 2.0 で公開する。
Mistral AI は SAP と複数年契約を結び、AI Foundation にモデルを統合し、欧州の複雑な産業と公的部門向け独自方式を共同開発する。Helsing とは防衛・安全向け vision-language-action モデルの研究を加速する。今後数か月にドイツ拠点を開き、現地人員も大幅に増やす。
Berkeley AI ResearchはTD学習に依存しない分割統治のオフポリシー強化学習を提案した。Bellman再帰の回数を線形から対数へ減らし、長い期間のタスクへ拡張する。
Mistralは企業チーム向けの本番用AIプラットフォームMistral AI Studioを公開した。Observability、Agent Runtime、AI Registryの3つを柱とする。
Mistral AIはシリーズCで17億ユーロを調達し、調達後評価額は117億ユーロとなった。半導体装置メーカーASMLが主導し、DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed、NVIDIAなど既存投資家が参加した。
Le Chat Memoriesは自動保存、賢い想起、出所の常時表示を組み合わせる。記憶を停止し、記憶を使わない非公開会話を始め、個別に編集・削除、出力や他所からの入力もできる。同時導入のMemory Insightsは本人のデータから傾向と要約を示す。今後は分類整理と即時忘却に対応する。
Mistral は Le Chat に MCP ベースの安全なコネクター20超の beta カタログを導入した。データ、生産性、開発、自動化、ビジネスなどを扱い、Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier などにつなぐ。独自 MCP コネクターや任意のリモート MCP サーバーも追加できる。