AI 生成商品图为什么总出错:小字崩、比例乱、越改越差

AI 生商品图,难的不是出一张图,而是一整套图里商品细节对得上、商品上的小字不写错。这篇讲字为什么会崩、比例为什么乱、为什么越改越差,以及一条实测 7 个品类一次过的六步流程。

用 AI 生成商品图,现在谁都能出一张「看着还行」的图。真正拉开差距的是三件事:同一个商品跨 9 张图细节对不对得上,人和商品的比例合不合理,商品上那行小字还认不认得出来。

这篇是第二期训练营 Week 3 的公开整理。我们把一套商品图拆成六步流水线,7 个品类端到端各跑 9 张,全部一次过。下面的数字都是课上实测的。

为什么商品上的字总是写错?

不是模型不会写字,是那几个字母在成图里没分到足够的像素。扩散模型是把字母当形状来画的,画布小、商品在画面里占得小,字就崩。

同一个 Non-GMO 认证标,我们对比过:

画布结果
1024×1024崩成 Nan-G8OD
2048×2048完全正确

模型和提示词都没变,变的只是绝对像素。

第二个变量是商品占画面高度的比例,这是文字保真度的总闸门:

商品占比结果
85%全对
70%全对
60%认证标开始崩
55%Vegetarian 变成 Vegetariou
28%规格 360 变成 300

最后一行最危险:规格数字写错就是虚假宣传,会被投诉下架。

做法:

  • 有字的图用 2048×2048 出图
  • 商品上有重要文字的图,商品占比压在 70% 以上
  • 成分表、营养表、配料表、认证证书这类法规图用实拍,不生成。错一个字就是虚假宣传,收益为零,风险无穷

为什么比例老是不对?

因为你没把比例写死,模型就自作主张。

同样的需求,不写比例,出来是 16:9 横版,商品缩到画面的 45%。写死 1:1,比例命中率 1.000;写死 3:4,命中率 0.747。

做法: 每张图在开生之前就写清楚比例和商品占比,不要留给模型猜。

为什么在一个对话里越改越差?

这叫上下文污染。第二次修改时,模型的输入已经变成「被 AI 处理过一遍的图」加上前面全部脏上下文。人脸最明显:第一张最像,之后越改越不像;商品图上是噪点变多、文字变扭曲。

做法: 返修一律新开会话,不是「最好新开」,是必须。批量出图时每张图单开一个干净会话并行跑。人做不到这一点,让 agent 开子会话就做得到:它开 5 个、10 个,每个都是全新的第一次,而第一次一定是最听话的。

多试几次、换个中转站行不行?

重试只对「独立的随机失败」有效。中转渠道整体状态在变的时候,连续失败是相关的,重试只是在烧时间。

我们测过:同一个中转渠道的 gpt-image-2 带图生成,命中率从 3/6 掉到 1/4,再掉到 0/8;同期 Codex 原生生图 9/9。一个中转站列了 286 个模型,我们横评了其中 14 个图像模型,真正能稳定出图的只有 3 条路。货架上有,不等于你有权限,更不等于渠道有货。

还有两个常见的坑:

  • 为了省钱在 Codex 的 config.toml 里配了中转 provider,Codex 内置的 image_gen 就被隐藏了。订阅里本来包含的生图,被自己配没了
  • 「生一张图要试好几次」:Codex 有时判断这张图能用网页排版做出来,就去写 HTML 再截图。省了生图额度,但出来的图没有光影,一眼假

一套商品图的六步流水线

步干什么人要做的
1 找对标去同类目 Best Sellers 榜取 Top3,把整套图拼成九宫格一次看完有想对标的就给链接
2 拆品类画像回答六个问题,推导这一套要做哪几张不用管
3 建商品档案对着实拍逐项写死:材质、配色分区、logo、商品上的每一个字补规格和认证,有就写,没有绝不编
4 规划表 + 样张每张图的职责、占比、有没有字先写清楚,再出 1 张样张看样张,不对就说哪不对
5 批量生成每张单开会话并行跑等 3–6 分钟
6 审图返修AI 逐张对着档案审,不过的新开会话重生成看缺陷清单,决定返修还是收货

三条不能破的规矩:

  1. 没有对标不开工。 AI 目前没有纯原创能力,给它对标让它发散没问题,让它凭空想象一定平庸。抄作业就抄 Top3,腰部卖家没有参考价值
  2. 先确认再花钱。 样张不对,后面 8 张全废
  3. 商品档案是唯一的对错标准。 生成照着档案生,审图照着档案审

换品类时,靠哪六个问题决定做哪几张图?

不是靠模板,是靠这六个问题:

  1. 买家掏钱前最担心哪三件事?每条疑虑至少一张图回答它
  2. 商品是穿在身上、拿在手里,还是摆着用?穿戴类必须真人上身;手持类只出手不出脸
  3. 重要的字是不是印在商品上?决定占比卡多严
  4. 商品是硬的还是软的?柔性商品(衣服鞋包)必须垫多角度实拍
  5. 有没有并行变体、最近换没换包装?变体每个 1 张,换过包装要加过渡说明图
  6. 这个品类有哪些合规元素?看 Top 品图上出现的免责声明、认证标、警示语,那就是这个品类的合规下限

AI 审图靠得住吗?

分品类看。

  • 字印在商品上的品类(保健品、食品、3C):基本可以信。我带着商品档案逐张放大看过,仍然漏掉了一个 logo 缺陷,AI 审图器一次抓到
  • 商品上没字的品类(服装、家居、珠宝):当嫌疑清单,别当判决。它在比例、疏密、质感这类连续量上会编

还有一个反直觉的结论:审图器报不合格,先怀疑档案。我们只改了商品档案里 logo 那一行事实,同一批图的通过率从 3/9 变成 7/9,有 4 张本来就是对的,被错档案冤枉了。档案写错一行,生成和审图两道防线同时失效。

哪些图 AI 现在还做不好?

  • 线性重复元素的准确数量。 表带「一排 6 个孔」,跨 9 张图出现 5、6、7、8 个,88% 占比的特写也照错。别把这类数量写进卖点
  • 软包装上的密集小字。 主视觉画得漂亮,但会静默漏掉净含量、认证小标这类必需项,这类走实拍合成
  • 商品、商品信息、实景交互三者叠在一张图里。 最容易翻车,纯信息设计图反而很稳

成本和时间大概多少?

  • 一张 2048×2048 走 Codex 订阅额度,基本不额外花钱,折算不到 1 毛
  • 单张 3–5 分钟,所以必须并行;一套 9 张、并发 5,约 5 分钟
  • 生成成本足够低,10% 良品率都可以接受。让它一直撞到出成品,这才是工程化

出完图上架前,可以用免费的 商品图 AI 检测 在浏览器本地查一遍 AI 来源信号和 Amazon、TikTok 的平台风险,图片不上传服务器。

这套流程我做成了一个装进 Codex / Claude Code 就能用的 skill,是第二期训练营 Week 3 的课程包,课上用学员自己的商品从实拍跑到成套图。