本文へ移動

#画像生成

今日 0 件

9月30日

水曜日
  1. Photo Scrubber:顔のぼかしとメタデータ削除をローカルで行うツール

    Simon WillisonはGPT-6 Astraを使い、顔を自動検出してぼかす実験的なツールPhoto Scrubberを作った。GoogleのMediaPipe C++ライブラリを基盤とし、@mediapipe/tasks-visionを通じてWebAssemblyにコンパイルされている。BlazeFace顔検出モデルを使い、処理はすべてローカルで実行する。

  2. Google Research、AI 画像生成の制御を統一・簡素化する Diffusion Controller を提案

    Google Research は Diffusion Controller を提案した。拡散モデルのノイズ除去を連続制御問題として捉え直し、基盤モデルを凍結したまま軽量な「ステアリングダンパー」ネットワークで生成軌道を動的に調整する。Stable Diffusion v1.4 を HPS-v2 で評価したところ、完全に解放した版は基準モデルに対する勝率90%を達成した。内部ウェイトにアクセスできないクローズドモデルのカスタム制御にも対応する。

9月29日

火曜日
  1. SageMaker AIでvLLM-Omniによる画像・動画生成(第2部)

    AWSは、同じvLLM-Omni DLCイメージを使った2つのエンドポイントをSageMaker AIへ配置するチュートリアルを公開した。リアルタイム側はFLUX.2-klein-4Bで画像を生成し、非同期側はWan2.1-VACE-1.3Bで画像条件付き動画を生成する。テキスト指示からPNGを生成し、動きの指示とともにAmazon S3経由で動画側へ渡し、最終的にS3からMP4を取得する。例にはコマンドライン手順と任意のStreamlit画面を含む。

9月8日

火曜日

7月23日

木曜日

7月16日

木曜日

7月1日

水曜日

4月23日

木曜日
  1. Google Photos、撮影後に視点を変えるAuto frameを導入

    Google ResearchはGoogle PhotosのAuto frameに、撮影後のカメラ視点を変える新手法を導入した。内部の3D点マップ推定モデルで場面と焦点距離を再構成し、生成型潜在拡散モデルで新たな視点から露出する空白領域を埋める。顔の位置と広角の歪みを自動検出して理想的な構図を提案する。人物を含む写真には既に自動適用され、ユーザーはAuto frameの候補から構図を変えた版を選べる。

1月10日

土曜日
  1. Berkeley、情報駆動の画像システム設計で4分野の性能を予測

    Berkeley AI Researchは相互情報量で画像システムを評価・最適化する枠組みを提案した。雑音付き測定と雑音モデルだけで情報量を測る。NeurIPS 2025でカラー写真、電波天文、レンズなし撮像、顕微鏡の復号器性能を予測した。設計は最先端の全工程学習に匹敵し、メモリーと計算量が少なく、課題別の復号器設計を要しない。