AI 生成商品图为什么总出错:小字崩、比例乱、越改越差
AI 生商品图,难的不是出一张图,而是一整套图里商品细节对得上、商品上的小字不写错。这篇讲字为什么会崩、比例为什么乱、为什么越改越差,以及一条实测 7 个品类一次过的六步流程。
用 AI 生成商品图,现在谁都能出一张「看着还行」的图。真正拉开差距的是三件事:同一个商品跨 9 张图细节对不对得上,人和商品的比例合不合理,商品上那行小字还认不认得出来。
这篇是第二期训练营 Week 3 的公开整理。我们把一套商品图拆成六步流水线,7 个品类端到端各跑 9 张,全部一次过。下面的数字都是课上实测的。
为什么商品上的字总是写错?
不是模型不会写字,是那几个字母在成图里没分到足够的像素。扩散模型是把字母当形状来画的,画布小、商品在画面里占得小,字就崩。
同一个 Non-GMO 认证标,我们对比过:
| 画布 | 结果 |
|---|---|
| 1024×1024 | 崩成 Nan-G8OD |
| 2048×2048 | 完全正确 |
模型和提示词都没变,变的只是绝对像素。
第二个变量是商品占画面高度的比例,这是文字保真度的总闸门:
| 商品占比 | 结果 |
|---|---|
| 85% | 全对 |
| 70% | 全对 |
| 60% | 认证标开始崩 |
| 55% | Vegetarian 变成 Vegetariou |
| 28% | 规格 360 变成 300 |
最后一行最危险:规格数字写错就是虚假宣传,会被投诉下架。
做法:
- 有字的图用 2048×2048 出图
- 商品上有重要文字的图,商品占比压在 70% 以上
- 成分表、营养表、配料表、认证证书这类法规图用实拍,不生成。错一个字就是虚假宣传,收益为零,风险无穷
为什么比例老是不对?
因为你没把比例写死,模型就自作主张。
同样的需求,不写比例,出来是 16:9 横版,商品缩到画面的 45%。写死 1:1,比例命中率 1.000;写死 3:4,命中率 0.747。
做法: 每张图在开生之前就写清楚比例和商品占比,不要留给模型猜。
为什么在一个对话里越改越差?
这叫上下文污染。第二次修改时,模型的输入已经变成「被 AI 处理过一遍的图」加上前面全部脏上下文。人脸最明显:第一张最像,之后越改越不像;商品图上是噪点变多、文字变扭曲。
做法: 返修一律新开会话,不是「最好新开」,是必须。批量出图时每张图单开一个干净会话并行跑。人做不到这一点,让 agent 开子会话就做得到:它开 5 个、10 个,每个都是全新的第一次,而第一次一定是最听话的。
多试几次、换个中转站行不行?
重试只对「独立的随机失败」有效。中转渠道整体状态在变的时候,连续失败是相关的,重试只是在烧时间。
我们测过:同一个中转渠道的 gpt-image-2 带图生成,命中率从 3/6 掉到 1/4,再掉到 0/8;同期 Codex 原生生图 9/9。一个中转站列了 286 个模型,我们横评了其中 14 个图像模型,真正能稳定出图的只有 3 条路。货架上有,不等于你有权限,更不等于渠道有货。
还有两个常见的坑:
- 为了省钱在 Codex 的
config.toml里配了中转 provider,Codex 内置的image_gen就被隐藏了。订阅里本来包含的生图,被自己配没了 - 「生一张图要试好几次」:Codex 有时判断这张图能用网页排版做出来,就去写 HTML 再截图。省了生图额度,但出来的图没有光影,一眼假
一套商品图的六步流水线
| 步 | 干什么 | 人要做的 |
|---|---|---|
| 1 找对标 | 去同类目 Best Sellers 榜取 Top3,把整套图拼成九宫格一次看完 | 有想对标的就给链接 |
| 2 拆品类画像 | 回答六个问题,推导这一套要做哪几张 | 不用管 |
| 3 建商品档案 | 对着实拍逐项写死:材质、配色分区、logo、商品上的每一个字 | 补规格和认证,有就写,没有绝不编 |
| 4 规划表 + 样张 | 每张图的职责、占比、有没有字先写清楚,再出 1 张样张 | 看样张,不对就说哪不对 |
| 5 批量生成 | 每张单开会话并行跑 | 等 3–6 分钟 |
| 6 审图返修 | AI 逐张对着档案审,不过的新开会话重生成 | 看缺陷清单,决定返修还是收货 |
三条不能破的规矩:
- 没有对标不开工。 AI 目前没有纯原创能力,给它对标让它发散没问题,让它凭空想象一定平庸。抄作业就抄 Top3,腰部卖家没有参考价值
- 先确认再花钱。 样张不对,后面 8 张全废
- 商品档案是唯一的对错标准。 生成照着档案生,审图照着档案审
换品类时,靠哪六个问题决定做哪几张图?
不是靠模板,是靠这六个问题:
- 买家掏钱前最担心哪三件事?每条疑虑至少一张图回答它
- 商品是穿在身上、拿在手里,还是摆着用?穿戴类必须真人上身;手持类只出手不出脸
- 重要的字是不是印在商品上?决定占比卡多严
- 商品是硬的还是软的?柔性商品(衣服鞋包)必须垫多角度实拍
- 有没有并行变体、最近换没换包装?变体每个 1 张,换过包装要加过渡说明图
- 这个品类有哪些合规元素?看 Top 品图上出现的免责声明、认证标、警示语,那就是这个品类的合规下限
AI 审图靠得住吗?
分品类看。
- 字印在商品上的品类(保健品、食品、3C):基本可以信。我带着商品档案逐张放大看过,仍然漏掉了一个 logo 缺陷,AI 审图器一次抓到
- 商品上没字的品类(服装、家居、珠宝):当嫌疑清单,别当判决。它在比例、疏密、质感这类连续量上会编
还有一个反直觉的结论:审图器报不合格,先怀疑档案。我们只改了商品档案里 logo 那一行事实,同一批图的通过率从 3/9 变成 7/9,有 4 张本来就是对的,被错档案冤枉了。档案写错一行,生成和审图两道防线同时失效。
哪些图 AI 现在还做不好?
- 线性重复元素的准确数量。 表带「一排 6 个孔」,跨 9 张图出现 5、6、7、8 个,88% 占比的特写也照错。别把这类数量写进卖点
- 软包装上的密集小字。 主视觉画得漂亮,但会静默漏掉净含量、认证小标这类必需项,这类走实拍合成
- 商品、商品信息、实景交互三者叠在一张图里。 最容易翻车,纯信息设计图反而很稳
成本和时间大概多少?
- 一张 2048×2048 走 Codex 订阅额度,基本不额外花钱,折算不到 1 毛
- 单张 3–5 分钟,所以必须并行;一套 9 张、并发 5,约 5 分钟
- 生成成本足够低,10% 良品率都可以接受。让它一直撞到出成品,这才是工程化
出完图上架前,可以用免费的 商品图 AI 检测 在浏览器本地查一遍 AI 来源信号和 Amazon、TikTok 的平台风险,图片不上传服务器。
这套流程我做成了一个装进 Codex / Claude Code 就能用的 skill,是第二期训练营 Week 3 的课程包,课上用学员自己的商品从实拍跑到成套图。