洞察
研究报告2026-08-05 · 16 分钟读

基线决定结论:模型路由的成本经济学

同一类路由技术,与随机分配相比是「提升六成」,与一个不需要训练的单模型相比是「落后两成」。两份公开评测的分歧不在方法,在对照基线的选择——而基线通常写在论文的正文里,不在被引用的那句结论里。


把每个请求分派给最合适的模型,用便宜的模型处理简单请求,把昂贵的模型留给困难请求——这个想法在成本上的吸引力是直接的:公开定价中,强弱模型的单价可以相差两个数量级。

公开评测对这个想法给出了两种方向相反的结论。本文的做法是把两份评测的对照基线取出来对比,结果显示分歧并非来自路由方法本身。

口径:本文引用两份公开评测(均为 arXiv 论文,出处见文末),以及其中给出的公开定价。正文中的模型以强弱代号出现,不复述具体型号与厂商的排名;被评测的商用路由产品同样以代号出现。第一方实践观察与引用数据分列。

一、两份评测,两个方向

第一份是路由方法的代表性工作,其结论是路由有效:在偏好数据上训练一个轻量路由器,可以在保持大部分质量的前提下显著降低成本。

第二份是 2026 年初发布的统一评测框架,覆盖约 39 万条实例(其摘要表述为 40 万以上)、21 个数据集、33 个模型,纳入 10 个代表性路由方法。其结论是:多个近期路由方法——包括一款商用路由产品——未能稳定超过一个简单基线。

两者都不是边缘研究,实验规模也都足够。它们之间存在多项差异:模型集合、任务集合、发布时间点都不相同,这些差异各自都具备解释力,本文无法排除。但其中有一项差异是结构性的,且可以单独讨论——两者选择的对照基线不同,而基线决定了「有效」这个词在各自语境下指什么。

二、两个基线

2.1 随机路由器

第一份评测的对照是随机路由器:在相同的成本约束下随机决定每个请求交给强模型还是弱模型。这个基线衡量的是「路由器的判断力是否强于抛硬币」。

2.2 事后最优单模型

第二份评测的对照是「最佳单模型」:在全部数据集上事后选出平均准确率最高的那一个模型,然后所有请求都交给它。这个基线不需要训练、不需要推理时的额外判断,实现成本接近于零。

它衡量的是另一个问题:「引入路由这套机制,是否比不引入更好」。

两个基线回答的不是同一个问题。前者问路由器内部的判断质量,后者问整套路由方案是否值得存在。企业选型关心的是后者,而公开传播中被引用的结论多数来自前者。

三、同一份数据里,成本节省相差 2.6 倍

第一份评测在三个基准上分别给出了成本节省数字。这些数字通常被合并引用为一个「节省 X 成」的结论,但它们各自附带的质量前提并不相同:

基准恢复 50% 性能差距时恢复 80% 性能差距时
对话类基准3.66 倍(达到强模型 95% 表现)2.49 倍
知识类基准1.41 倍(达到强模型 92% 表现)1.14 倍
数学类基准1.49 倍(达到强模型 87% 表现)1.27 倍
来源:第一份评测公开的成本分析表(数据增强后的最佳路由器)。口径:该节省倍数的分母是随机路由器在同等成本约束下的强模型调用量,不是「全部请求都用强模型」——论文的算法是「路由器的强模型调用数与随机基线之比,再取倒数」。要求恢复的性能差距越大,节省幅度越小。

这张表有三层信息,通常只有第一层被引用。

第一层是横向差异:三个基准上的节省幅度相差约 2.6 倍,且节省最大的那一行质量前提也最宽松。只引用最好的数字,得到的是一个在其余两个基准上不成立的结论。

第二层是纵向差异:把要求从「恢复 50% 性能差距」提高到「恢复 80%」,同一批路由器的节省幅度全线下降,知识类基准从 1.41 倍降至 1.14 倍。节省幅度不是方法的固有属性,而是你允许损失多少质量的函数。

第三层是分母:这些倍数是相对随机路由器算的,而非相对「全部使用强模型」。换一个分母,同一批实验会得到不同量级的数字——这与本文第二节讨论的是同一个问题在指标层面的重现。

同一份材料中另有一项数据:在不使用数据增强的条件下,知识类基准上所有路由器的表现都处于随机路由器的水平,数学类基准上与随机相当或略低(原文两处表述分别为「接近随机」与「差于随机」)。也就是说,路由器的判断力并非天然存在,它依赖训练数据与目标任务分布的匹配程度——该研究还给出了一个基准与训练集相似度的量化指标,用以解释路由器在不同基准上的表现差异。

四、换一个基线,结论反向

第二份评测把对照换成事后最优单模型后,同类方法的表现发生了方向性的变化。该评测对成本节省的定义带有一个约束:只有在准确率不低于最佳单模型的前提下,才计算成本的下降幅度。

在这一约束下,多个方法无法同时满足两个条件。评测中那款商用路由产品的表现比最佳单模型低约 24.7%;另有方法被指出无法在保持基线准确率的同时降低成本。需要补充该评测自己的一条说明:这款商用产品使用的是其平台自有的模型池,与评测的候选池不同,因此该数字含有口径差异。

这一约束是合理的:如果一套路由方案省了成本但准确率低于「随便挑一个好模型一直用」,那么它节省的成本无法与损失的准确率相抵——因为后者本可以零成本获得。

五、路由为什么难:需要它的时候它最不准

第二份评测给出了一个解释性发现,本文认为它是理解路由经济学的关键。

评测将查询按「有多少个候选模型能答对」分层后发现:对于只有极少数模型能答对的查询,当前路由器的识别能力很差。在仅有不超过三个模型答对的那一批查询上(410 条,占测试集 11.9%),以其中两个方法为例,准确率分别只有 24.6% 与 23.2%。评测把这一现象称为模型召回失败。该分层分析基于其 7B 模型池的设定。

把这个发现与路由的收益结构放在一起,可以看到成本与准确率这两项收益并不来自同一批查询:

查询类型在路由中的作用路由器的实际表现
多数模型都能答对成本节省的主要来源——数量大,且可安全分派给低价模型容易判断,收益可稳定拿到
只有个别模型能答对准确率的风险所在——选错即答错,无法由数量摊薄识别准确率约四分之一
成本收益与准确率风险分布在不同的查询上。这一对照是本文基于评测分层数据的归纳,不是原评测的表述。

成本节省主要由第一类查询贡献:它们数量大,且把它们从高价模型移到低价模型几乎不损失准确率,单价差乘以数量即为节省的主体。路由器在这类查询上也容易做对——判断本身不难。

准确率的风险则集中在第二类查询上,而这正是识别准确率约为四分之一的那一批。它们数量少(11.9%),无法贡献多少成本节省,却足以把整体准确率拉到基线之下。

这解释了第四节那个约束为什么难以满足:一套路由方案要成立,必须同时拿到第一类查询的成本节省、且不在第二类查询上失分。前者不难,后者是当前方法的薄弱处——而评测的成本节省指标只在准确率不低于基线时才计分,两个条件是与的关系。

同一份评测还给出一条相关结论:扩大候选模型池的收益递减,而经过挑选的小规模模型池能够取得明显更好的结果。这与上述结构一致——决定上限的不是可选模型的数量,而是路由器能否在关键查询上认出那个唯一正确的候选。

六、成本侧的另一半:单价差不等于账单差

路由的成本论证通常从单价差出发。第一份评测所用的强弱模型,公开单价相差约两个数量级——这是一个足以支撑整套论证的价差。

但从单价差到账单差之间,有几个环节会吃掉一部分收益,这些环节在多数成本测算中不出现:

  • 路由决策本身的开销。基于模型的路由器在每个请求上引入一次额外推理,基于嵌入的路由器引入一次向量化与检索。需要说明的是,在强弱模型单价相差两个数量级的前提下,这一项通常占比很小——它是成本项,但不是主要成本项。
  • 错判的重试成本。当路由把一个困难请求交给弱模型并得到错误结果时,若系统检测到并升级到强模型重试,这次请求的实际成本是两次调用之和,高于直接使用强模型。
  • 级联结构的固有代价。以先试弱模型、不满意再升级的方式实现的路由,在升级发生时必然产生双倍调用;其经济性取决于一次判定的准确率与升级发生的频率。
  • 工程与维护成本。路由器需要随候选模型的更新而重新评估——公开评测指出,不同路由器在同一基准上的表现差异很大且缺少清晰解释,这意味着选型与调优难以一次做完。

这四项里,真正决定账单的是中间两项——错判后的重试与级联升级,因为它们的成本按「升级发生的频率」放大,而这个频率恰恰由第五节那个薄弱环节决定:判定越不准,升级越频繁,双倍调用的比例越高。第一项与第四项是固定成本,在两个数量级的价差面前占比有限。

本文没有这四项开销的公开量化数据,因此不对路由的整体经济性做测算,此处只说明它们的存在与计入方式。

七、两种路由不是一回事

上述全部评测针对的是同一类做法:按请求内容预测哪个模型会答得更好,逐请求做决策。这类做法的难点在预测,而前几节的数据说明这个预测目前并不可靠。

工程实践中还存在另一类做法,公开讨论中常与前者混为一谈:按能力类型静态分派——文本对话、图像理解、图像生成、语音识别、语音合成、向量检索各自绑定固定的模型,配置一次后不再逐请求判断。

按请求预测按能力分派
决策时机每个请求配置时一次
决策依据预测哪个模型会答对任务属于哪一类能力
失败模式预测错误导致答错或重试无预测环节
额外开销每请求一次判定
本文所引评测是否覆盖
两类做法的区别。前几节的全部结论只适用于左列。

第二类做法不做预测,因此不存在模型召回失败,也没有逐请求的判定开销。但需要说明的是:它同样没有被上述评测覆盖——「未被评测」不等于「已被验证」,其收益缺少公开数据支撑,这一点与本文第一节对路由宣称收益提出的要求是同一条标准。

而且第二份评测里有一项证据对它同样构成约束:该评测指出没有任何单一模型在所有领域领先,数学、代码、逻辑等领域各由不同模型领跑。而「文本对话」作为一个能力类型,其内部就包含这些子域。这意味着按能力类型绑定固定模型,在文本域内部实质上退回到了单模型策略,放弃了评测所证实的模型互补性收益。粒度越粗,这部分机会成本越大。

把两者混在一起讨论会导致一个具体的误判:看到「路由能省八成成本」而引入逐请求预测,或者看到「路由跑不赢单模型」而放弃按能力分派。这两个结论各自成立于不同的对象上。

八、可推出的判断

判断一:先问对照基线是什么

评估任何路由方案的宣称收益时,第一个要确认的不是节省幅度,而是它与什么比。与随机分配比得到的提升,不能推出「优于不使用路由」;只有与「固定使用一个合适的单模型」相比得到的差值,才对应真实的采纳决策。

判断二:成本节省与质量前提必须成对出现

第三节的三行数据说明,同一套方法在不同任务上的节省幅度可以相差 2.6 倍,且各自对应不同的质量损失。单独引用节省倍数而不给出质量前提,这个数字不构成可用信息。

判断三:先做能力分派,再考虑逐请求预测

按能力静态分派不承担预测环节的失败模式与额外开销,但其收益同样缺少公开评测的验证,且在能力类型内部存在粒度过粗的机会成本。逐请求预测的收益则已被评测测量过,结论是当前方法在关键查询上的识别能力不足。两者都需要在自有任务分布上验证,区别在于待验证的问题不同:前者要问「按这个粒度绑定,域内损失了多少」,后者要问「在关键查询上能否识别正确候选」。

判断四:候选模型池宜精不宜多

评测显示扩大模型池收益递减,而经过挑选的小池表现更好。在采购与接入层面,这意味着接入更多模型本身不产生价值,价值来自对少数模型能力边界的准确了解。

九、局限

  • 本文未做自有实验,全部证据来自两份公开评测。两者的模型集合、任务集合与时间点均不同,本文只对比其对照基线的设定,未对其结果做跨评测的直接比较。
  • 第五节「路由收益与路由难度反向分布」是本文基于评测分层数据的归纳,原评测未以此形式表述。该归纳依赖于「候选模型答对数量」能够代表查询难度这一假设,本文未验证该假设。
  • 第六节列出的四项成本项没有公开量化数据支撑,仅指出其存在与计入方式,不构成对路由整体经济性的测算。
  • 第一份评测自述其局限包括:实际应用的分布可能与所测基准差异很大;其路由为两模型间的二元路由,未扩展到多模型;以及不同路由器在同一基准上表现差异大而缺少清晰解释。这三条同样限制本文对其结果的引用范围。
  • 两份评测均发布于本文写作之前,路由方法与候选模型都在快速变化,其结论的时效性未知。

十、结论

关于模型路由的两类公开结论方向相反,其分歧可以由对照基线的选择解释:与随机分配相比,路由器的判断力有可观提升;与事后选出的最佳单模型相比,多个方法——包括一款商用产品——未能稳定胜出。两个基线回答的问题不同,而采纳决策对应的是后者。

路由的困难有结构性来源:收益最高的查询是只有个别模型能答对的那一类,而这类查询上当前方法的识别准确率约为四分之一;收益最低的查询则是多数模型都能答对的那一类,路由在其上容易做对但省不下多少。

这一结构不否定路由的价值,但它指出了价值的条件:成本节省能否落袋,取决于路由器在那 11.9% 的关键查询上是否守得住准确率。因此引入逐请求预测之前,需要先在自有任务分布上验证这一点——本文引用的两份评测都没有给出可以直接套用的结论,它们各自的任务分布与候选模型集合都与具体业务不同。

参考来源

  • 《RouteLLM: Learning to Route LLMs with Preference Data》(arXiv:2406.18665,初版 2024-06,v4 2025-02):基于偏好数据训练路由器;对照基线为随机路由器;三个基准上的成本节省分别约为 3.66 倍(对应 95% 强模型表现)、1.41 倍(92%)、1.49 倍(87%);未使用数据增强时,其中两个基准上路由器与随机相当或略低;论文自述三项局限。
  • 《LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing》(arXiv:2601.07206,2026-01):21 个数据集、33 个模型、10 个路由基线的统一评测(摘要称 40 万以上实例,其表列合计约 39 万);对照基线 Best Single 为「事后选出全数据集平均准确率最高的单个模型」;CostSave 定义为在准确率不低于该基线的约束下的最低成本配置;一款商用路由产品的 PerfGain 为 −24.7%(该产品使用平台自有模型池,与评测池不同);模型召回失败的分层数据出自 7B 模型池设定(410 条查询占 11.9%,两个方法准确率 24.6% 与 23.2%);候选池扩大收益递减,且无单一模型在所有领域领先。

想把这些落到你的业务里?

少谈概念,先聊清你的场景。

继续阅读 / More