用户发现 ChatGPT 生图存在隐性画布锁定模式
Reddit 用户实验发现,ChatGPT 生成的所谓「纯黑」图像中存在可复现、画布对齐的低层空间模式,并推测其与多次编…
一位 Reddit 用户在 r/MachineLearning 板块发布了一组针对 ChatGPT 图像生成与编辑的实验观察,提出生成图像中可能存在一种「弱但可复现、且与画布坐标系对齐」的低层空间信号。该信号在多次迭代编辑后会在平滑区域逐渐显现为肉眼可见的斑驳纹理,而在「纯黑」图像中以非零像素的形式静默存在。这一发现尚未得到 OpenAI 官方回应,亦未被独立验证。
起因:编辑后出现的斑驳纹理
用户最初在反复对肖像进行「生成式编辑」时注意到,原本应当平滑的背景、墙面和皮肤区域会逐渐出现一层淡淡的云雾状或斑驳状纹理。多次近乎相同的编辑操作有时会让伪影减轻,有时则会加重。他尝试对整张图平移后再做修复,发现伪影的强度会随图像与「画布隐含坐标」之间的相位关系而变化;在一次实验中,仅删除最后一步「再平移回去」的指令,结果便显著改善。
实验:被「保护」的区域更像人像轮廓
进一步的对比实验显示,编辑过程中人脸和身体部分通常比墙面更稳定,仿佛被某种内部掩码或分割步骤优先保留,而背景等区域则被重新合成。用户推测,这可以解释为何斑驳纹理在多次迭代中呈现「不均匀累积」的现象。
关键测试:让模型生成「纯黑」图像
最具说服力的实验是请模型多次独立生成完全相同的「纯黑」图像。肉眼看上去均为纯黑,但像素层面存在稀疏的非零值与微小波动。对两张独立生成的同尺寸「黑图」做对比,结果如下:
- 非零像素掩码相关性:0.848
- Jaccard 重合度:0.766
- 若像素完全随机独立,期望重合度约为 0.071
- R / G / B 通道相关性约为 0.82–0.83
- 主要空间频率在两张图中高度一致,分别约 2.45 px 与 5.57 px
对两张图分别施加 sigma = 16 的大高斯模糊后,均显现出相似的「大尺度云状结构」,且互相关峰值出现在零滞后位置,说明该结构在独立生成之间已经对齐到同一画布坐标。
可能的解释与对编辑的影响
用户明确表示,这并不构成对 OpenAI 水印、SynthID 或任何专有机制的直接证明,但他认为「普通随机噪声」已经难以解释上述数据。备选解释包括:
- 类似水印的信号
- 确定性抖动(dithering)
- 量化或解码器伪影
- 生成管线中的某种后处理步骤
- 其他尚未识别的机制
若该信号确实存在,迭代编辑可被理解为:首张图像附带结构化信号 → 部分区域被保留、其余被重新生成 → 新图像再次叠加相同或相关的信号 → 数轮之后信号在平滑区域被增强为可见斑驳。这也与「平移图像可改变伪影」「交替平移有助于解相关」「部分区域漂移较慢」等观察相吻合。
当前局限
该帖为社区讨论性质,作者自陈仍处于调查阶段,尚未能确认:产生该信号的具体机制;是否为水印;是否仅存在于 ChatGPT 或 OpenAI 模型中;是否在其他多模态系统中具有相似行为。由于缺乏 OpenAI 的官方说明与第三方复现实验,相关结论仍应视为一种合理猜想而非定论。
