谷歌研究院发布Diffusion Controller:冻结主干模型也能精确调控图像生成 - *

麦站管理员 50 2026-09-30 17:50:02

内容页头部广告位(PC)
内容页头部广告位(WAP)

  一键部署OpenClaw

*9月30日消息,谷歌研究院在官方博客介绍了一套名为Diffusion Controller的图像生成控制框架。它把图像生成当成一个可以连续调节的控制问题来处理,而不是一堆互不相干的技巧。目标也不是再造一个模型,而是解决一个长期存在的麻烦:想让图像生成模型精确满足用户意图,往往是件顾此失彼的事。

麻烦出在方法太碎。工程师手上有一堆互不相关的工具:推理期用的无分类器引导,靠调文字提示的影响强度来左右生成;LoRA这类轻量适配器,靠改一部分权重来贴合风格;还有一批基于奖励的微调手段。它们各自有效,却没有统一的语言来描述、比较和组合。结果就是在平衡听指令和画得好看这两件事时,很大程度靠经验试错,引导一强,画质就容易崩。

Diffusion Controller换了个视角。扩散模型的反向去噪过程,可以看成一个连续的随机控制问题,控制的作用方式是重新给预训练的转移核加权,同时用一个f-散度惩罚项约束偏离原来模型有多远,让优化目标与画面稳定性之间有个可算的平衡点。在这套框架下,作者推导出两类能落地的微调算法:一类是f-散度正则化的策略梯度更新,包含PPO风格的做法;另一类是奖励加权回归。

更有工程价值的是参数化方式。按这套框架推导出的最优解,可以拆成固定不动的预训练基座,加一个轻量的控制修正,于是实现上只需要在中间去噪结果上接一个小的控制网络,主干模型全程冻结。论文里这个附加网络大约一千二百万参数。好处是对不开放权重的闭源模型也能用——接入方拿不到模型内部,照样可以在外面挂一层控制。

实验在Stable Diffusion v1.4上完成。在只暴露部分中间输出的灰盒设定下,这套方法在监督微调与奖励加权损失两条线上都超过LoRA,HPS-v2指标上的胜率为0.6815,对比LoRA的0.6109;在可以改动内部权重的白盒设定下,对基线模型取得90%的胜率。需要说明的是,这些是论文里的实验结果,属于研究进展,并不是可以直接上线的产品工具。

作者列出的后续方向包括个性化、安全机制与***生成。论文与代码已经公开,在Stable Diffusion v1.4上的实验可以复现。真正值得观察的,是这套控制层在Flux等更新架构上的表现,以及独立复现能不能给出同样的结论。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关标签
stable
diffusion
v1.4
图像生成控制框架
谷歌研究院发布Diffusion Controller:冻结主干模型也能精确调控图像生成 - *
内容页头部广告位(PC)
内容页头部广告位(WAP)
上一篇:苹果***首次支持国补,最高补贴不超 2000 元,适用范围有哪些?***补贴后价格有优势吗? 下一篇:电影《碟中谍》系列中哪一部最好?
相关文章
最新评论

评论记录:

未查询到任何数据!