📚 离职知识库

AI 生图"物理错误质检 → 自动重做"方案调研报告

2026-07-25 · 背景:petmoji 批量生成宠物表情包时偶发物理错误(黏土三花猫举爪那条前腿消失、身体悬空),希望在流水线里加一道"生成后自动质检,不合格自动打回重画"。三个并行调研方向:商用 API / 视觉大模型裁判 / 开源检测模型。

#一句话结论

市面上不存在能检测"缺腿/悬空/解剖错误"的现成商用 API;开源模型几乎全是针对人体/人手的,不适用宠物;最可行的方案是用便宜的视觉大模型(VLM)当裁判,接进 petmoji 做"生成 → 检查清单判定 → 不合格带原因重画(最多 2 次)"的闭环。质检成本约每张不到 1 分钱,相对 ¥0.02/张的生图费可忽略。


#方向一:商用 API —— 没有这种产品 ❌

服务 实际能力 能否测物理错误
腾讯云 图像质量评估(TIIA/COS) 清晰度、美观度评分
阿里云 IMM 图片质量评分 清晰度、噪声、曝光、饱和度
火山引擎 veImageX 画质评估 美学、噪声、纹理、色调
阿里云/Sightengine AIGC 检测 只判断"是不是 AI 生成的"
Sightengine Image Quality 模糊度、对比度等技术指标
Clarifai / Google Vision 通用标签、物体检测
Google Visual Inspection AI 制造业缺陷检测,需自己训练 不适用

为什么没有:需求太垂直(要懂目标物种的解剖结构 + 3D 空间关系),厂商没有商业动力做成标准 API;学术界有相关研究但未产品化。

  • 内容安全类(绿网等)只管涉黄涉政,与画面质量无关。

#方向二:VLM 当裁判 —— 可行,推荐 ✅

核心范式:不问"这图有没有问题"(开放式问题误判率高),而是给视觉模型一份固定检查清单,逐条回答是/否,输出 JSON,任一条不过即打回。

已验证有效的技巧:

  1. 逐项检查清单比一句话总体判定误判率低 15~20%。示例:
    • 这只猫/狗能看到几条腿?先描述每条腿的位置再回答。
    • 所有腿都接触地面或物体吗?身体是否悬空?
    • 头和身体的连接是否自然?有没有多余/融合的肢体?
    • 是否出现人手、人的姿态、直立行走等拟人化错误?
    • 毛色斑纹与参照图(定妆照)是否一致?
  2. 给参照图(原照片或定妆照)做锚点,准确率提升 20~30%。
  3. 限制输出格式{"passed": bool, "reasons": [...], "confidence": 0-1},便于脚本解析。
  4. 多模型投票(2~3 个 VLM 并行判定)可再压误判,但成本翻倍,量大再上。

能力边界(务实预期)

  • 明显缺陷(缺腿、悬空、拟人化)能抓到 ~70%;
  • VLM 数数是弱项(计数类准确率约 65~75%),所以清单要写"先描述位置再数";
  • 细微问题(比例微歪、解剖细节)捕捉率只有 40~60%,别指望全自动完美。

成本:用 gemini-flash / qwen-vl-plus 级别的便宜视觉模型,单张判定约 ¥0.002~0.01。petmoji 全量一批 81 张 → 质检总成本几毛钱。

防成本失控:设"最多重做 N 次"(建议 2 次)上限,仍不过就标记留人工;重画时把失败原因拼进提示词(如"上次生成缺一条前腿,本次必须四腿齐全且全部落地")。

#方向三:开源检测模型 —— 对宠物场景不适用 ❌

项目 情况 为什么不选
Distortion-5K / ViT-HD(2025 论文) 检测肢体增生/缺失/融合,F1≈0.9 针对人体训练,代码刚要开源
bad-anatomy-realism-classifier(HF) ViT 微调的坏解剖分类器 针对人像写实图
SynArtifact 用标注数据微调 VLM 分类伪影 要自备训练集,不值当
YOLOv8 手部/关键点检测 成熟、快、可本地跑 检测的是人手,宠物无现成权重
ImageReward / PickScore / HPSv2 等评分模型 偏好/美学打分 对"缺腿"只会"黑盒降分",不可靠

结论:宠物 + 九种风格化(黏土/像素/水墨…)的组合没有任何现成开源检测器;自己训练一个的成本远超收益。此路排除。


#落地方案(待实施)

petmoji 生成一张图
   ↓
qc_check():图 + 定妆照参照 → 云雾便宜视觉模型 + 固定检查清单 → JSON 判定
   ↓ passed=false
把 reasons 拼进提示词重画(最多 2 次)
   ↓ 仍不过
文件名标记 _待人工,落盘不丢弃

要点:

  • 定妆照阶段也要过质检——定妆照坏了,下游 8 张动作图全坏;
  • 模型选云雾中转里的便宜视觉模型(gemini flash / qwen-vl 级别),一把 key 已有,无需新开账号;
  • 上线前先拿已有批次(好图+翻车图混合)做离线测试,确认判定准确率再启用;
  • 三花猫翻车图(举爪腿消失、身体悬空)属于该方案最能稳定抓住的缺陷类型。

#风险与缓解

风险 缓解
VLM 数数不准 清单写"先描述腿的位置再数";不单独依赖数量
VLM 幻觉(自信地说错) 给参照图;只问是/否;必要时双模型投票
重做循环烧钱 重试上限 2 次 + 超限标记人工
判定标准漂移 检查清单写死在代码常量里,改动走版本管理

来源:沉淀/02-AI与API/AI生图质检API调研报告.md(整理于 2026-08-18)