📚 离职知识库

云雾 API 供应商与模型清单(references)

快照抓取于 2026-07-20,数据源:模型广场页面 https://yunwu.ai/pricing + 接口 GET /v1/models。 价格会变、模型会上下架,以控制台实时为准;本文件是留档参考,程序里别硬编码价格。 全量原始数据见同目录 models-raw.json(接口返回,402 个模型,含 id/类型/描述/tags)。

#怎么刷新这份清单

# 拉全量模型(接口是通的,402 个;owned_by 字段多为 custom 不可靠,供应商以下表为准)
curl -s "https://yunwu.ai/v1/models" -H "Authorization: Bearer $YUNWU_API_KEY" -o models-raw.json
# 看总数 / 按类型
python3 -c "import json;d=json.load(open('models-raw.json'))['data'];print(len(d))"

价格接口不返回,需到 https://yunwu.ai/pricing 页面看(登录后,左侧按供应商/类型/令牌分组筛选)。

#一、供应商全景(共 22 家 / 422 条计费项)

以模型广场左侧「供应商」分组为准(比接口 owned_by 准):

供应商 数量 主力模型(举例)
OpenAI 101 gpt-5.6 系列(luna/sol/terra)、gpt-image-2、o 系列、dall-e
Bailian (阿里云百炼) 85 qwen3.7-max/plus、qwen-image、wan 万相、happyhorse
Google 26 gemini-3.5-flash、gemini-3.1-pro/flash、nano-banana 系列图像、veo
DeepSeek 21 deepseek-v4-flash / v4-pro、v3.2、r1 系列(详见第四节)
Doubao (豆包) 22 doubao-seed-2-1-pro、seed-evolving、seedream 图像
ChatGLM (智谱) 16 glm-5.2、glm-4.6/4.5 系列
Kling (可灵) 16 kling-3.0-turbo 视频、对口型、音频
xAI 16 grok-4.5、grok-4.3、grok-build、grok-imagine 视频
Minimax 14 MiniMax-M 系列、hailuo 视频、speech 语音
Midjourney 14 mj_imagine / mj_blend / niji 等绘画接口
Anthropic 14 claude-sonnet-5、claude-opus-4-8、claude-fable-5、haiku-4-5
Ollama 13 开源模型本地格式代理
Vidu 12 viduq2/q3 视频、vidu-tts
Moonshot 12 kimi-k2.7-code、k2.5/k2.6
PixVerse 10 视频模板 / 对口型 / mask 编辑
Wenxin (文心) 9 ERNIE-4.0/3.5/Speed 系列
OpenAI Plus 8 OpenAI 高可用/特殊通道
SiliconFlow (硅基流动) 4 bge 重排、embedding
Spark (讯飞星火) 4 SparkDesk v1.1~v3.5
XiaomiMiMo 3 mimo-v2-pro / v2.5
Suno 2 suno 音乐生成
—(其他/自定义) 若干 llama、happyhorse、embedding 等

类型分布:文本 285 · 音视频 78 · 图像 40(按次计费)· 检索/embedding 11 · chat 3。

#二、令牌分组倍率(影响实际扣费,重要)

同一把 key 下不同「令牌分组」倍率不同,实际扣费 = 标价 × 倍率:

分组 倍率 说明
default ×1 默认,走这个即可
企业级高可用大模型 ×1 稳定通道
Codex 专属 ×0.8 更便宜
MJ 慢速 ×0.6 Midjourney 慢速档
限时体验 ×1.4
纯AZ ×1.5
Claude Code 专属 ×2.4 走 Claude Code 通道更贵
官转 ×3 官方直转
官转 OpenAI / Vertex claude / az claude ×6 最贵,官方源头通道

默认用 default(×1)。除非要官方源头稳定性,别用 ×3/×6 分组。

#三、计费单位说明

  • 文本模型:输入价格 / 补全价格 / 缓存命中价格,单位 /M = 每百万 token,数字是站内额度单位(⚡)。
  • 图像/视频:多为按次计费(每张/每秒/按尺寸),标「模型价格」。
  • 缓存命中价极低(如 deepseek 0.02/M),长上下文重复调用能省很多。

#四、DeepSeek 全量定价(你主用,21 款,2026-07-20 快照)

模型 输入/M 补全/M 缓存/M 备注
deepseek-v4-flash 1.0 2.0 0.02 默认首选,快而省,结构化稳;聊天解读就用它
deepseek-v4-pro 3.0 6.0 0.0252 旗舰推理模型(先思考后答),慢且贵,长文一次喂易超时
deepseek-v4-flash-202605 1.0 2.0 0.02 flash 带日期版
deepseek-v4-pro-202606 3.0 6.0 0.0252 pro 带日期版
deepseek-v3.2 2.0 3.0 首个「思考融入工具」模型
deepseek-v3.2-exp 2.0 3.0 0.2 稀疏注意力实验版
deepseek-v3.1 / v3-1 2.4 7.2 混合推理(思考/非思考)
deepseek-v3-1-think-250821 4.0 12.0 terminus 思考版
deepseek-chat 2.0 3.0 0.5 官方别名,现指向 V3.2
deepseek-v3 / v3-0324 / v3-250324 2.0 8.0 V3 旧版
deepseek-r1 / r1-0528 / reasoner / r1-250xxx 2.4 9.6 0.6 R1 深度思考系列
MAI-DS-R1 0.7884 3.154 微软后训练的 R1

#五、各家旗舰文本模型定价样例(2026-07-20)

模型 供应商 输入/M 补全/M 缓存/M
gpt-5.6-sol(≈gpt-5.6) OpenAI 4.0 24.0 0.4
gpt-5.6-terra OpenAI 2.0 12.0 0.2
gpt-5.6-luna(低成本) OpenAI 0.8 4.8 0.08
gpt-chat-latest OpenAI 5.0 30.0
claude-sonnet-5 Anthropic 2.0 10.0 0.2
claude-opus-4-8 Anthropic 5.0 25.0 0.5
claude-fable-5 Anthropic 10.0 50.0 1.0
gemini-3.5-flash Google 1.5 9.0 0.15
gemini-3.1-flash-lite(最省) Google 0.25 1.5 0.025
grok-4.5 xAI 2.0 6.0 0.5
grok-4.3 xAI 1.25 2.5
qwen3.7-max 阿里百炼 7.2 21.6
glm-5.2 智谱 8.0 28.0 2.0
kimi-k2.7-code Moonshot 6.5 27.0 1.3
doubao-seed-2-1-pro 豆包 9.0 45.0

#六、按品牌的完整模型 id 清单(接口归类,402 个)

按模型名前缀归类,便于 model 字段直接填。完整明细见 models-raw.json

  • OpenAI/GPT(约 118):gpt-3.5/4/4o/4.1/5/5.6 全系、o1/o3/o4、dall-e-3、gpt-image-2、sora、whisper、text-embedding-3、codex…
  • Claude(12):claude-fable-5、claude-sonnet-5、claude-haiku-4-5、claude-opus-4-{1,5,6,7,8}、claude-3-5/3-7 旧版…
  • Gemini/Google(26,页面口径):gemini-3.5-flash、gemini-3.1-pro/flash/flash-lite、nano-banana(图像)、veo、gemma…
  • DeepSeek(24):见第四节。
  • 通义千问 Qwen(约 77):qwen3.7-max/plus、qwen-flash、qwen-image、qwq/qvq、wan 万相、Qwen3-Reranker…
  • 智谱 GLM(17):glm-5.2、glm-4.6/4.5/4.5-air、glm-4-flash/long/air、cogview/cogvideo…
  • Kimi/Moonshot(7):kimi-k2.7-code、k2.5、k2.6、k2、k2-instruct…
  • 豆包 Doubao(22,页面口径):doubao-seed-2-1-pro、seed-evolving、seedream 3/4/5 图像…
  • xAI/Grok(11):grok-4.5、grok-4.3、grok-4-fast、grok-3、grok-build、grok-imagine 视频…
  • MiniMax(19):MiniMax-M2/M2.5/M3、hailuo 视频、speech-2.x 语音、music…
  • 可灵 Kling(16) / MidJourney(16) / Vidu(11) / PixVerse(11):图像/视频/对口型/音频类。
  • 文心 ERNIE(8) / 讯飞 Spark(4) / 小米 MiMo(3) / Llama(13) / Suno(8) / 硅基 bge 重排·embedding(若干)

#七、给「聊天记录解读 / 长文本任务」的选型结论

  • 默认 deepseek-v4-flash:非推理、快、便宜(1/2 每百万 token),5 万字一次吃下,不用分段。
  • deepseek-v4-pro 谨慎用:是推理模型,先吐 reasoning 再出正文,长文一次喂会被中转网关超时掐断(需 map-reduce 分段)。只在确需强推理时用。
  • 要更便宜可选 gemini-3.1-flash-lite(0.25/1.5)或 gpt-5.6-luna(0.8/4.8)。
  • 结构化 json_schema:flash / v4-pro 稳定;千问 max、Kimi k2.x 不遵循,避开。

来源:配置信息/云雾API-中转/供应商与模型清单.md(整理于 2026-08-18)