Photo Scrubber:顔のぼかしとメタデータ削除をローカルで行うツール
Simon WillisonはGPT-6 Astraを使い、顔を自動検出してぼかす実験的なツールPhoto Scrubberを作った。GoogleのMediaPipe C++ライブラリを基盤とし、@mediapipe/tasks-visionを通じてWebAssemblyにコンパイルされている。BlazeFace顔検出モデルを使い、処理はすべてローカルで実行する。
Simon WillisonはGPT-6 Astraを使い、顔を自動検出してぼかす実験的なツールPhoto Scrubberを作った。GoogleのMediaPipe C++ライブラリを基盤とし、@mediapipe/tasks-visionを通じてWebAssemblyにコンパイルされている。BlazeFace顔検出モデルを使い、処理はすべてローカルで実行する。
Google Research は Diffusion Controller を提案した。拡散モデルのノイズ除去を連続制御問題として捉え直し、基盤モデルを凍結したまま軽量な「ステアリングダンパー」ネットワークで生成軌道を動的に調整する。Stable Diffusion v1.4 を HPS-v2 で評価したところ、完全に解放した版は基準モデルに対する勝率90%を達成した。内部ウェイトにアクセスできないクローズドモデルのカスタム制御にも対応する。
AWSは、同じvLLM-Omni DLCイメージを使った2つのエンドポイントをSageMaker AIへ配置するチュートリアルを公開した。リアルタイム側はFLUX.2-klein-4Bで画像を生成し、非同期側はWan2.1-VACE-1.3Bで画像条件付き動画を生成する。テキスト指示からPNGを生成し、動きの指示とともにAmazon S3経由で動画側へ渡し、最終的にS3からMP4を取得する。例にはコマンドライン手順と任意のStreamlit画面を含む。
OpenAIはChatGPT Images 2.5を公開した。アイデア、スケッチ、参考写真を、より個性的で洗練された画像に変換でき、ユーザーの考えをよりよく表す画像になるという。
Hugging FaceはDiffusersにNunchaku Liteを導入した。from_pretrained()で量子化チェックポイントを直接読み込み、独自パイプラインやローカルのCUDAコンパイルを必要としない。
Google ResearchのICLR 2026論文は、ウェイト減衰などの正則化がscore functionを滑らかにし、ノイズ除去で学習データ間を補間するscore smoothingが創造性の源だと示す。単純な記憶ではなく新たな例を生成する。
Google DeepMindはNano Banana 2 Lite(gemini-3.1-flash-lite-image)とGemini Omni Flash(gemini-omni-flash-preview)の2モデルを公開した。
Google ResearchはGoogle PhotosのAuto frameに、撮影後のカメラ視点を変える新手法を導入した。内部の3D点マップ推定モデルで場面と焦点距離を再構成し、生成型潜在拡散モデルで新たな視点から露出する空白領域を埋める。顔の位置と広角の歪みを自動検出して理想的な構図を提案する。人物を含む写真には既に自動適用され、ユーザーはAuto frameの候補から構図を変えた版を選べる。
Berkeley AI Researchは相互情報量で画像システムを評価・最適化する枠組みを提案した。雑音付き測定と雑音モデルだけで情報量を測る。NeurIPS 2025でカラー写真、電波天文、レンズなし撮像、顕微鏡の復号器性能を予測した。設計は最先端の全工程学習に匹敵し、メモリーと計算量が少なく、課題別の復号器設計を要しない。