核心 GUIDE
Model Selection 是 Workload Trade-off
Model 应该根据真实 Workload 与约束选择,而不是默认认为最大、最新或 Benchmark 最高的模型一定最好。
核心心智模型
Model Selection 是 Quality、Latency、Cost、Context Need、Tool Behavior、Deployment Constraint 与 Failure Risk 之间的 Pareto Decision;真正最好的 Model,是能以足够 Margin 满足 Product Contract 的那个。
为什么重要
Benchmark 会把复杂行为压缩成一个方便比较的 Score,但生产 Workload 有具体 Prompt、Language、Tool Schema、Latency Target 与 Error Cost。Benchmark 领先的 Model 可能更慢、Structured Output 更不稳定,或者成本远超需求。只有在 Representative Task 与真实 Operational Constraint 下比较 Candidate,Model Selection 才是 Engineering Decision。
01
在真实 Operating Envelope 中比较 Candidate
建立 Representative Task Suite,包含 Required Quality Threshold、Difficult Slice 与已知 Failure Mode。所有 Candidate 使用同一个 Harness、Context Policy 与 Tool Contract。除了平均 Task Quality,还要比较 Tail Latency、Variance、Cost per Successful Task、Rate Limit 与 Recovery Behavior。只有当 Routing 带来的额外复杂度能够产生可测量收益时,才值得引入。
02
例子:Support Classification 的两个 Model
一个更大的 Model 把 Classification Accuracy 提高 1 个百分点,但 Latency 与 Cost 都变成三倍;较小 Model 已经满足 Product Error Budget。系统因此继续用小 Model 处理 Routine Classification,只在高 Ambiguity、会影响 Customer Outcome 的 Slice 上升级到大 Model。
常见失败模式
- 只看 Leaderboard Rank 就选择 Model。
- Candidate 使用不同 Prompt 或 Harness,却把差异全部归因给 Model。
- 忽略 Tail Latency、Variance 与 Cost per Successful Task。
工程启发
- 比较 Model 之前先定义最低可接受 Quality 与 Operational Constraint。
- 重要 Difficult Slice 要与 Aggregate Average 分开评估。
- 优先选择能够满足 Contract 的最简单 Model 或 Routing Policy。
关键结论
- 01脱离 Workload 不存在 universally best Model。
- 02Model Choice 必须绑定可测量的 Product Requirement。
- 03Routing Complexity 必须证明自己值得 Coordination 与 Evaluation Cost。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。