本文へ移動

#デプロイ・運用

今日 3 件

9月17日

木曜日

9月16日

水曜日
  1. NVIDIA、DSX による AI 工場の1 MW 当たり生産性向上を解説

    NVIDIA は AI Infra Summit で、一定の電力予算内で AI 工場のトークンスループットを高める DSX を紹介した。Lambda は5ラック・19ノードの HGX B200 クラスターで DSX MaxLPS を検証し、16ノードの最大電力と同じ予算で19ノードを稼働させた。トークンスループットは毎秒約400万から500万に24%増え、1ワット当たり性能は23%向上した。

9月15日

火曜日
  1. Philadelphia 小児病院、公開 NVIDIA AI で心臓モデルと手術シミュレーション

    Philadelphia 小児病院(CHOP)は NVIDIA が共同創設した公開医用画像基盤 MONAI で、子どもの心臓モデル作成を4時間から数秒に短縮し、複雑な心室中隔欠損の手術計画に使っている。NVIDIA と協力し、NVIDIA Warp に基づく公開物理エンジン Newton を SlicerHeart に接続して、心臓器具のシミュレーションを最大4時間からほぼリアルタイムに短縮している。

9月12日

土曜日

9月11日

金曜日

9月10日

木曜日
  1. ClouderaとMistral、企業データに特化した主権知能を提供

    MistralとClouderaはモデルをハイブリッドデータ基盤へ統合する提携を結んだ。企業は私有・公開クラウド、ローカル、完全隔離環境で推論を配置し、制御を保てる。管理環境で自社データを使う独自モデルの学習もでき、データと生じた知能の所有権を維持する。Clouderaでは30エクサバイトの顧客管理データが稼働する。

9月5日

土曜日
  1. GitHub、複数モデルの編成で最先端のコーディング品質を実現するProject HydraFusionを公開

    GitHubはProject HydraFusionの研究プレビューを公開した。実行時の複数モデルの編成でCopilotに最先端のコーディング能力を提供する。Copilot CLIで/experimentalから有効化でき、各モデルが実際に使うトークンの標準料金で課金される。

9月3日

木曜日

9月1日

火曜日
  1. Hugging Face、@huggingface/kernelsを公開:207のWebGPUカーネルとFleetベンチマーク

    Hugging FaceのWebAIチームは、Hubから最適化済みWebGPUカーネルを読み込み実行する軽量ライブラリ@huggingface/kernelsを公開した。初期の207カーネルも、それぞれ独立したリポジトリでApache-2.0ライセンスにより公開した。

8月25日

火曜日

8月21日

金曜日

8月18日

火曜日

8月14日

金曜日
  1. Strands Agents、LeRobot、Hugging Face Storage Bucketsで記録・学習・配置を一巡させる

    Hugging FaceのブログはStrands Robotsのストリーミングデータ循環のチュートリアルを公開した。同じRobot()オブジェクトで実演を記録し、Storage Bucketへ同期し、Hubからストリーミングで読み込んで学習し、チェックポイントをハードウェアへ戻して配置する。全工程でLeRobotのディスク形式は変えない。

8月11日

火曜日
  1. NVIDIA、12言語対応のオープンウェイト音声モデルMagpie TTS Multilingualを公開

    NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。

8月6日

木曜日

7月30日

木曜日

7月27日

月曜日

7月16日

木曜日

7月13日

月曜日

7月10日

金曜日

7月9日

木曜日
  1. Mistral Studio、Prompts と Skills の記録をシステムで管理

    Mistral Studio は Prompts と Skills の集中管理を顧客に提供した。各資産には版の履歴、明確な責任者、追跡可能性がある。不変版、ロールバック、分類タグ、監査ログで AI の行動を管理・発見でき、Observability で本番出力を該当版まで追える。Skills は Studio から MCP サーバーとして直接呼び出せ、本番で同じ管理対象資産が実行される。

7月8日

水曜日
  1. Hugging Face、ネイティブ並みの速度のvLLM transformersモデリングバックエンドを公開

    Hugging Faceは、vLLMのtransformersモデリングバックエンドが複数のLLM構造で、vLLMの手書きネイティブ実装と同等以上の処理速度に達したと発表した。torch.fxによる静的グラフ解析とastによるソース書き換えで、推論向けの層融合を実行時に動的適用し、専用コードと同等の性能を実現する。

7月7日

火曜日
  1. 知能が無料になった後、エージェント向け・エージェント運用・エージェント構築のデータシステム

    推論費用が2023年初めの GPT-4 級の100万トークン約30ドルから、現在は1ドル未満、一部企業では0.10ドル未満に下がるなか、UC Berkeley の Aditya G. Parameswaran らはエージェント時代のデータシステムに For Agents、Of Agents、By Agents の三方向を提案した。

  2. Hugging Face と SkyPilot、外向き通信料ゼロのストレージ連携を公開

    Hugging Face と SkyPilot は連携を公開した。hf:// URL と既存の HF_TOKEN で Hugging Face Bucket または任意のモデル・データセット・Space リポジトリーを SkyPilot の作業にマウントし、20超のクラウド、Kubernetes、Slurm、ローカル環境で実行できる。

7月6日

月曜日

6月27日

土曜日

6月25日

木曜日
  1. Google、線形弾性キャッシュでクラウド費用を改善、ページ退避をスキーレンタル問題に

    Google Research は線形弾性キャッシュを提案した。ページ退避をスキーレンタル問題として扱い、浅い決定木で TTL を予測して容量を動的に変え、総保有費用を最小化する。Spanner 本番で数か月運用し、メモリーを15.5%削減、ミスは5.5%増にとどまり、TCO は約5%下がり、実際の I/O 費用影響は0.5%だった。複数の公開キャッシュトレースでも検証した。