AI 生图"物理错误质检 → 自动重做"方案调研报告
2026-07-25 · 背景:petmoji 批量生成宠物表情包时偶发物理错误(黏土三花猫举爪那条前腿消失、身体悬空),希望在流水线里加一道"生成后自动质检,不合格自动打回重画"。三个并行调研方向:商用 API / 视觉大模型裁判 / 开源检测模型。
#一句话结论
市面上不存在能检测"缺腿/悬空/解剖错误"的现成商用 API;开源模型几乎全是针对人体/人手的,不适用宠物;最可行的方案是用便宜的视觉大模型(VLM)当裁判,接进 petmoji 做"生成 → 检查清单判定 → 不合格带原因重画(最多 2 次)"的闭环。质检成本约每张不到 1 分钱,相对 ¥0.02/张的生图费可忽略。
#方向一:商用 API —— 没有这种产品 ❌
| 服务 | 实际能力 | 能否测物理错误 |
|---|---|---|
| 腾讯云 图像质量评估(TIIA/COS) | 清晰度、美观度评分 | 否 |
| 阿里云 IMM 图片质量评分 | 清晰度、噪声、曝光、饱和度 | 否 |
| 火山引擎 veImageX 画质评估 | 美学、噪声、纹理、色调 | 否 |
| 阿里云/Sightengine AIGC 检测 | 只判断"是不是 AI 生成的" | 否 |
| Sightengine Image Quality | 模糊度、对比度等技术指标 | 否 |
| Clarifai / Google Vision | 通用标签、物体检测 | 否 |
| Google Visual Inspection AI | 制造业缺陷检测,需自己训练 | 不适用 |
为什么没有:需求太垂直(要懂目标物种的解剖结构 + 3D 空间关系),厂商没有商业动力做成标准 API;学术界有相关研究但未产品化。
- 内容安全类(绿网等)只管涉黄涉政,与画面质量无关。
#方向二:VLM 当裁判 —— 可行,推荐 ✅
核心范式:不问"这图有没有问题"(开放式问题误判率高),而是给视觉模型一份固定检查清单,逐条回答是/否,输出 JSON,任一条不过即打回。
已验证有效的技巧:
- 逐项检查清单比一句话总体判定误判率低 15~20%。示例:
- 这只猫/狗能看到几条腿?先描述每条腿的位置再回答。
- 所有腿都接触地面或物体吗?身体是否悬空?
- 头和身体的连接是否自然?有没有多余/融合的肢体?
- 是否出现人手、人的姿态、直立行走等拟人化错误?
- 毛色斑纹与参照图(定妆照)是否一致?
- 给参照图(原照片或定妆照)做锚点,准确率提升 20~30%。
- 限制输出格式:
{"passed": bool, "reasons": [...], "confidence": 0-1},便于脚本解析。 - 多模型投票(2~3 个 VLM 并行判定)可再压误判,但成本翻倍,量大再上。
能力边界(务实预期):
- 明显缺陷(缺腿、悬空、拟人化)能抓到 ~70%;
- VLM 数数是弱项(计数类准确率约 65~75%),所以清单要写"先描述位置再数";
- 细微问题(比例微歪、解剖细节)捕捉率只有 40~60%,别指望全自动完美。
成本:用 gemini-flash / qwen-vl-plus 级别的便宜视觉模型,单张判定约 ¥0.002~0.01。petmoji 全量一批 81 张 → 质检总成本几毛钱。
防成本失控:设"最多重做 N 次"(建议 2 次)上限,仍不过就标记留人工;重画时把失败原因拼进提示词(如"上次生成缺一条前腿,本次必须四腿齐全且全部落地")。
#方向三:开源检测模型 —— 对宠物场景不适用 ❌
| 项目 | 情况 | 为什么不选 |
|---|---|---|
| Distortion-5K / ViT-HD(2025 论文) | 检测肢体增生/缺失/融合,F1≈0.9 | 针对人体训练,代码刚要开源 |
| bad-anatomy-realism-classifier(HF) | ViT 微调的坏解剖分类器 | 针对人像写实图 |
| SynArtifact | 用标注数据微调 VLM 分类伪影 | 要自备训练集,不值当 |
| YOLOv8 手部/关键点检测 | 成熟、快、可本地跑 | 检测的是人手,宠物无现成权重 |
| ImageReward / PickScore / HPSv2 等评分模型 | 偏好/美学打分 | 对"缺腿"只会"黑盒降分",不可靠 |
结论:宠物 + 九种风格化(黏土/像素/水墨…)的组合没有任何现成开源检测器;自己训练一个的成本远超收益。此路排除。
#落地方案(待实施)
petmoji 生成一张图
↓
qc_check():图 + 定妆照参照 → 云雾便宜视觉模型 + 固定检查清单 → JSON 判定
↓ passed=false
把 reasons 拼进提示词重画(最多 2 次)
↓ 仍不过
文件名标记 _待人工,落盘不丢弃要点:
- 定妆照阶段也要过质检——定妆照坏了,下游 8 张动作图全坏;
- 模型选云雾中转里的便宜视觉模型(gemini flash / qwen-vl 级别),一把 key 已有,无需新开账号;
- 上线前先拿已有批次(好图+翻车图混合)做离线测试,确认判定准确率再启用;
- 三花猫翻车图(举爪腿消失、身体悬空)属于该方案最能稳定抓住的缺陷类型。
#风险与缓解
| 风险 | 缓解 |
|---|---|
| VLM 数数不准 | 清单写"先描述腿的位置再数";不单独依赖数量 |
| VLM 幻觉(自信地说错) | 给参照图;只问是/否;必要时双模型投票 |
| 重做循环烧钱 | 重试上限 2 次 + 超限标记人工 |
| 判定标准漂移 | 检查清单写死在代码常量里,改动走版本管理 |
来源:沉淀/02-AI与API/AI生图质检API调研报告.md(整理于 2026-08-18)