Hume、音声AIの人間的品質を測るReal World VoiceEQを公開
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
読む価値のある AI 論文と研究成果:アーキテクチャの工夫、学習手法、能力の測定、理論の進展を厳選して解説。
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
Google ResearchとGoogle DeepMindは、ラベルなしのウェアラブルデータから直接学習する大型センサー基盤モデルSensorFMを提案した。500万人の同意済み参加者による1兆分超のマルチモーダル信号で事前学習し、100か国以上、20機種以上のFitbitとPixel Watchを対象とする。
Google Research は、凍結した Gemini Nano v3 に複数トークン予測(MTP)ヘッドを接続する新構造を公開した。本体のウェイトを変えずに端末上の推論を加速し、Pixel 9 と10シリーズで提供済みだ。
Google DeepMindはGoogle内部で使う高度なAIの構築と管理に向け、AI Control Roadmapを公開した。多層防御の考え方でモデルのアラインメントに加えてシステム単位の安全層を設け、アラインメントが不完全でも保護を提供する。
Google DeepMindはシエラレオネの事前登録済み無作為化比較試験の結果を公開した。8週間の試験でGuided Learning利用者の数学成績が対照群より0.258標準偏差高まり、通常の学習1.2~1.7年分に相当した。
Google ResearchはNatureにPHRMシステムの研究を発表した。顔認証によるロック解除後の数秒間に前面カメラで動画を撮影し、深層学習で心拍数と安静時心拍数をバックグラウンド推定する。
Google DeepMindはNatureでCo-Scientistの研究を発表した。Geminiを基盤とする複数エージェントのAIシステムで、科学的仮説を繰り返し生成、議論、進化させる。
Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。
Google Research は、科学者が Empirical Research Assistance(ERA)で研究を進める方法を紹介した。感染症予測、宇宙論、炭素監視、神経科学の四分野を扱う。
Google DeepMind は Decoupled DiLoCo の論文を公開した。大規模訓練を分離した計算の島々に分け、非同期データストリームで通信し、局所的なハードウェア障害を隔離する。
Google ResearchはICLR論文ReasoningBankを公開した。成功と失敗の経験から高次の推論パターンを抽出するエージェントメモリーの枠組みで、オープンソース化済みだ。
Google Quantum AI は白書で、将来の量子コンピューターが暗号資産を守る楕円曲線暗号を破るために必要な量子ビットとゲートの数は、従来の見積もりより少ないとした。
Google Research は TurboQuant を公開した。訓練や微調整なしで、モデル精度を損なわず KV キャッシュを3 bitに量子化できる。QJL と PolarQuant の二手法も提案した。
Google Researchと複数のNHS機関によるAIMS研究は、Nature Cancerに2件の姉妹研究を発表し、NHS乳がん検診の手順におけるAI検出システムの性能を評価した。
Google ResearchはGeminiで世界のニュースから過去の災害の構造化データを抽出するGroundsourceを公開した。最初のオープンデータは都市の鉄砲水260万件を収め、150か国以上、2000年から現在までを対象とする。
Google ResearchとBeth Israel Deaconess Medical Centerは、単一施設で前向きの実現可能性研究を実施した。外来のプライマリケア受診前にAMIEが患者とテキストで問診し、医師が動画でリアルタイムに監督した。