跳到正文

#图像生成

今日 0 条

9月30日

星期三
  1. Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的闭源模型上实现定制控制。

9月29日

星期二
  1. 在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)

    AWS 发布教程,演示在 SageMaker AI 上部署同一个 vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,最终从 S3 取回 MP4,示例含命令行流程和可选的 Streamlit 界面。

9月8日

星期二

7月23日

星期四

7月16日

星期四

7月1日

星期三

4月23日

星期四
  1. Google Photos 上线 Auto frame,可事后调整照片视角

    Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,可在照片拍摄后调整相机视角。该方法先用内部 3D 点图估计模型重建场景与焦距,再用生成式潜在扩散模型补全新视角下暴露出的空白区域,并自动检测人脸位置与广角畸变来推荐理想取景。该功能已面向含人物的照片自动生效,用户可在 Auto frame 候选中选择重新构图后的版本。

1月10日

星期六
  1. 伯克利提出信息驱动成像系统设计框架,可跨四类成像任务预测性能

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,并在 NeurIPS 2025 论文中验证其能预测彩色摄影、射电天文、无镜头成像和显微镜四个领域的解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。