最新:〈2026 主流大模型 API 价格对比:GPT、Claude、Gemini、DeepSeek、Kimi〉 →博客

GPT、Claude、Gemini、DeepSeek、Kimi 怎么选:按场景选,不按跑分选

大模型怎么选才靠谱?抛开跑分榜,按场景给候选,再用聚合网关同一 key 实测 100 条真实 prompt,按混合价算及格成本。

十字路口的木制路标指向四个方向

每次有读者问「大模型怎么选」,我的回答都是同一句:先把跑分榜放下。GPT、Claude、Gemini、DeepSeek、Kimi 哪家强这种问题没有全局答案,只有「在你的任务分布上、在你的预算内,哪个及格」的答案。这篇文章给一套可以直接抄走的选型方法,而不是一份会过期的排名。

跑分榜为什么参考价值有限

三个结构性原因。

饱和。主流 benchmark(MMLU、HumanEval 那一代)的头部分数已经挤在误差带里,第一和第五的差距可能小于同一模型两次采样的波动。分数还在涨,但涨的部分对你的任务未必有感知。

污染。榜单题在互联网上公开存在,训练数据里混进去是行业公开的秘密。你看到的不一定是「会做题」,可能是「背过题」。

分布不同。这是最致命的一条。你的 prompt 分布——中文占比、平均长度、要不要看图、要不要调工具、失败形态长什么样——和任何公开榜单都不重合。一个模型在数学竞赛题上高两分,不代表它给你写周报写得更好。

你自己的 100 条真实 prompt,比任何榜单都准。这不是修辞,是后面第 3 节要执行的方案。

按场景给候选

下面每个候选都取自我们实际上架的模型目录,理由只说该模型能力标签能支撑的点。注意「首选」是起点不是结论,最终要靠你自己的实测拍板。

场景 首选候选 备选 为什么
长文档摘要 Kimi K3 Gemini 3.1 Pro、GLM-5.2 三者上下文都到百万级,整本合同不用切块;Kimi K3 目录定位就是长文档处理,Gemini 3.1 Pro 附赠音视频理解
代码生成与审查 Claude Sonnet 5 GPT-5.6 sol、DeepSeek V4 Pro Sonnet 5 是性能与成本的平衡档,带 reasoning 标签;需要独立第二视角审查时换厂商上 GPT-5.6 sol;预算紧就 DeepSeek V4 Pro,reasoning 加极低价
中文写作 DeepSeek V4 Pro Kimi K3、Qwen3.7 Max 都是中文母语语境训练的厂商;Qwen3.7 Max 目录定位即中文理解与指令遵循
工具调用 / Agent Claude Opus 5 GPT-5.6 terra、GLM-5.2 长程 agent 需要 reasoning 加稳定的 tools 标签,Opus 5 定位复杂编排;GLM-5.2 目录描述就是工具调用与 agent 场景稳定
成本敏感的批量任务 Gemini 3.5 Flash-Lite DeepSeek V4 Flash、GPT-5.6 luna 三者都带 cache 标签,批量任务里命中缓存的输入价格能再砍一个数量级;Flash-Lite 的目录定位就是高吞吐低单价
多模态(看图) Gemini 3.1 Pro GPT-5.6 sol、Qwen3.7 Max vision 标签三者都有;Gemini 3.1 Pro 额外带 audio、video 标签,截图之外还有录音录像就走它

两条选候选时的通用纪律:

  • 同场景至少留两家厂商。不是性能原因,是供给原因——任何单一上游都可能限流或调价,备选是容灾的一部分。
  • 能力标签是硬门槛,跑分是软参考。要读图就必须有 vision,要进 agent 流水线就必须有 tools,这两条件先筛完,剩下的才轮到比质量。

一个可执行的选型流程

拿到候选之后,花一个下午跑这个实验:

  1. 取样。从你的真实流量里取 100 条 prompt。注意是真实流量,不是你临时编的——编的样本会系统性偏简单。
  2. 轮打。用聚合网关的同一个 API key,把 100 条分别打给 3 个候选模型。这里的关键是成本极低:接入方式不变,切模型只改请求体里的 model 字段,key、余额、日志全都不动。具体怎么切见 /integrate/
  3. 打分。人工评,或者写死规则评(JSON 能解析、包含必填字段、字数在区间内这类)。100 条不多,认真评一小时够。别用另一个大模型自动评——你在选裁判,不是找裁判的裁判。
  4. 算及格成本。设一个及格线(比如 90 条达标),对达标的模型按 7:3 的输入输出混合价算每条平均成本,取最便宜的。混合价口径和你日常账单对齐,因为真实流量大致就是输入多、输出少。具体数字在 /pricing/ 页对着自己的分组算。

整个实验的花费通常是几美分到几美元,换来的是「在我们的任务上,这个模型真的行」这句话的证据。

什么时候该换模型

选定不是终点,三类信号出现就该重跑上面的流程:

  • 价格调整。厂商改价是常态,上次选型时垫底的可能这轮成了最划算的及格者。
  • 新代发布。新一代模型上市时,上一代往往降价让位,两个方向都值得重测。
  • 任务分布变化。你的产品在变,三个月前的 100 条样本可能已不代表今天的流量。

建议每季度重跑一次第 3 节。它便宜到没有理由不做。

收尾

方法已经给你了:100 条真实 prompt、3 个候选、一个下午、几美元。剩下的只是跑起来。注册 metaproxy,拿到那把可以切遍全目录模型的 key,把你自己的榜单跑出来。

跑通第一条请求,只要一分钟。

免费注册
第一条请求
base_url = "https://api.metaproxy.ai/v1"
model = "claude-opus-5"
POST https://api.metaproxy.ai/v1/chat/completions