NVIDIA、DSX による AI 工場の1 MW 当たり生産性向上を解説
NVIDIA は AI Infra Summit で、一定の電力予算内で AI 工場のトークンスループットを高める DSX を紹介した。Lambda は5ラック・19ノードの HGX B200 クラスターで DSX MaxLPS を検証し、16ノードの最大電力と同じ予算で19ノードを稼働させた。トークンスループットは毎秒約400万から500万に24%増え、1ワット当たり性能は23%向上した。
NVIDIA は AI Infra Summit で、一定の電力予算内で AI 工場のトークンスループットを高める DSX を紹介した。Lambda は5ラック・19ノードの HGX B200 クラスターで DSX MaxLPS を検証し、16ノードの最大電力と同じ予算で19ノードを稼働させた。トークンスループットは毎秒約400万から500万に24%増え、1ワット当たり性能は23%向上した。
IBMの研究チームはALTK-Evolveに一貫性ガイドを追加した。Consistency Analyzerを使い、エージェントのトレース内で判断が反転しやすい箇所を診断する。
FyxerはOpenAIモデル、微調整、メモリーと実際のユーザーの意見を組み合わせ、各人の受信箱を整理し、本人の語り口でメールを下書きする。
Perplexity は GPT-6 Astra で連絡文の作成、ソフトウェアの変更、本番システムの監視を行い、以前のモデルより大幅に低い頻度で確認している。
GitHubの日本・韓国マーケティング担当はCopilotでイベント運営を自動化した。Issueを作業単位に、formsで構造化情報を集め、labelでActionsを起動し、UTMリンク、紹介ページ、招待メール、申込者一覧の整理を自動生成する。
Google ResearchはACL 2026でToolGradを提案した。「回答から質問へ」の手法で実際のツール呼び出し列を先に生成し、ユーザーの質問を逆算する。従来のDFSによる試行錯誤的な注釈付けを置き換える。
Copilotアプリはdiff、端末、ブラウザーを内蔵し、画面を切り替えずAIコードの確認、実行、プレビューを行える。diffは追加を緑、削除を赤で示し、採用、コメント、追加修正に対応する。端末はコマンド実行と複数ウィンドウ切替、ブラウザーはPick & Polishで要素を選びエージェントに調整させられる。
OpenAIはChatGPT WorkのData agentをすべての人に開放すると発表した。企業データに接続し、知見を発見し、自然言語とAIで対話型ダッシュボードを構築できる。
OpenAI は金融データを内蔵し GPT-6 Astra に接続する金融サービス向け ChatGPT を公開した。調査、モデリング、顧客にそのまま渡せる資料の作成に使う。
Hugging Face チームは Gradio Workflow で AUTOMATIC1111 の機能の大半を一つの Workflow1111 キャンバスに再構築した。11本のメディアパイプラインと73ノードで、テキストから画像、高解像度修復、画像から画像、プロンプト行列、VLM による逆解析、検出からの inpaint マスク生成、ControlNet 型アノテーター、背景除去、PNG Info、画像から動画を扱う。
OpenAIはクラウドエージェントの構築と運用開始に向け、Codexハーネスを基盤とするマネージドサービスAgents APIを公開した。オーケストレーション、長時間セッション、ツール呼び出しに対応する。
Mistralは欧州のエネルギー事業者が4万行のFortran 77をC++へ移行するのを支援した。対象はテストや集約された文書がない、物理計算中心の油層シミュレーターだった。チームはまず数値一致を確認するテスト基盤を作り、Skill.mdでエージェントに状態スナップショットの出力と移行モジュールの検証を指示した。その後Vibe CLIで100超のエージェントを起動し、呼び出しツリーを解析し、Mistral OCRで散在する文書を整理した。
OpenAIはGPT-6 Astraを公開し、企業向けで最も高性能なモデルと説明した。高度な推論とコンピューター操作能力を持ち、文章作成とデザイン判断も強化した。
OpenAIは内部データを公開し、エージェントの利用、実験速度、タスクの複雑さ、研究加速などでコーディングエージェントがAI研究を変えていると示した。
GitHubはProject HydraFusionの研究プレビューを公開した。実行時の複数モデルの編成でCopilotに最先端のコーディング能力を提供する。Copilot CLIで/experimentalから有効化でき、各モデルが実際に使うトークンの標準料金で課金される。
Copilot appは独立したGit worktreeで複数セッションを同時に動かし、干渉せず各文脈を保つ。sessions viewで名前と進捗を見て、いつでも切り替え、中断から再開でき、依頼を説明し直す必要はない。tailspin-toysでfunded sort機能、アクセシビリティー確認、テストを同時進行する例を示す。
Hugging FaceはClaude Code、Codex、pi、Hermesなどに永続メモリーを提供するfunesを公開した。ローカルの既存セッションから索引を作り、既定では埋め込みと再ランキングもローカルで行う。
Hugging Face のブログ筆者は、Surya Narreddi の言語モデルで水彩画を描く発想を TRL と OpenEnv で再現した。モデルは p5.brush で約150行の JavaScript を書いて描画する。データセット、RL 環境、訓練スクリプト、モデルをすべて公開する。
GoogleはFairwind Programを開始し、Google Cloud顧客、政府機関、サイバーセキュリティのパートナーに防御能力へのアクセスを限定提供する。第1弾としてGemini 3.8 Flash CyberモデルとCodeMenderツールチェーンを提供し、脆弱性の自律的な発見、検証、修正に用いる。
Google DeepMind は Gemini 3.8 Flash と Gemini 3.8 Flash Cyber を公開した。前者は長時間のコーディングと自律エージェント向けで、料金は3.7 Flash と同じく入力100万トークン当たり0.75ドル、出力100万トークン当たり3.75ドルだ。
Google DeepMindはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteにエージェント型動画理解を導入した。動画分析のトークン消費を最大88%、費用を最大66%削減し、正確さを最大7%高める。
Google ResearchはGoogle Earth AIに実験的研究機能Planetary Prediction Engine(PPE)を導入した。自然言語の質問に基づき、地理空間データの発見、特徴量設計、モデル学習と評価を自律的に進め、報告を生成する。数週間の手作業を要したデータ処理を数分に縮める。
Google DeepMindはGemini 3.5 Transcribeを公開し、現在最も正確な音声文字起こしモデルと説明した。生の音声を直接、正確で整形済みの文字に変換する。
GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Hugging FaceはGradioにgr.Workflowを導入した。複数段階のAIパイプラインを型付きノードのグラフで表し、ドラッグ可能な画面を提供する。各ノードを実行でき、中間結果もすべて見える。
Googleは、人の監督の下で候補バイオマーカーの優先付けを反復研究として進める複数エージェントのBiomarker Discovery Frameworkを公開した。3コホートの計9279観測から、精神的健康の候補41件と代謝の候補25件を自動発見した。睡眠時間の変動とPHQ-8重症度の関係(ρ = 0.252)などを含む。
Google DeepMindとFenris CreationsはEVE Onlineを含むEVE UniverseでAIによる新たな遊びの試作を探る研究協力を結んだ。
Mistralは複数段階の検索ループで情報を探し、調べ、検証する検索層Agentic Searchを公開した。Mistral Search Toolkitで提供し、StudioとVibeのLibrariesにも組み込む。
IBM Research は Hugging Face ブログで ALTK-Evolve の研究を公開した。AppWorld の585の複数ステップ課題で八つのモデルをテストし、エージェント記憶はオン・オフのスイッチではなく、モデル別に量を調整すべきものだと分かった。
Hugging Face は2026年1~8月の観測レポートを公開した。Hub データでは、多くの月で中国の研究所が公開した最大モデルのパラメーター数が米国を上回る。中国の月間上限は7,540億~2兆7,800億パラメーター、米国は7か月中5か月が1,300億未満だった。
Hugging FaceのブログはStrands Robotsのストリーミングデータ循環のチュートリアルを公開した。同じRobot()オブジェクトで実演を記録し、Storage Bucketへ同期し、Hubからストリーミングで読み込んで学習し、チェックポイントをハードウェアへ戻して配置する。全工程でLeRobotのディスク形式は変えない。
Google DeepMind は Gemini 3.7 Flash を公開し、コーディングとエージェント向けの最強の主力モデルと位置付けた。Gemini 3.6 Flash 公開からわずか3週間だ。
Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
Hugging Face の ALTK-Evolve と ACE はともにウェイト更新なしの記憶方式だが、提供方法が異なる。ACE は各ステップで playbook 全体を投入し、ALTK-Evolve は課題に応じて裏付けの強い少数の guideline を取得する。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
Microsoft ResearchはオープンソースのOrchardフレームワークを公開した。中心はKubernetes環境サービスOrchard Envで、タスク間で環境、データパイプライン、評価手順を再利用し、Codex、OpenClaw、ZeroClawなどの実際の配置フレームワーク内で直接エージェントを学習できる。
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Microsoft Researchはコンピューター操作エージェント向けに12の学習世界を構築するEchoverseを提案した。10の深い分野別世界と2つの能力別世界からなり、うち4世界のコード、データ、採点器を公開する。