模型融合值得付费吗?OpenRouter 与 Devin Fusion 成本效果对比及落地风险
模型融合通过多模型并行与评审合成提升 AI 任务表现,但 OpenRouter 与 Cognition 展现了两种相反经济逻辑。实测显示其成本可达普通生成的 4-5 倍,而模型联合失败率与评审可靠性仍是瓶颈。本文从成本、延迟、信息互补性与付费逻辑展开分析。
- 模型融合
- OpenRouter
- Devin Fusion
- AI 成本
- 模型路由
作者:Yiping & David,IOSG
模型融合是什么
2026 年 6 月,AI 市场在不到三周内出现了两款名为“Fusion”的产品。
6 月 12 日,OpenRouter 发布 Fusion Router,标题为《Surpassing Frontier Performance with Fusion》。在其 DRACO 深度研究评测中,由 Fable 5 与 GPT-5.5 组成的模型组获得 69.0 分,超过了单模型 Fable 5 的 65.3 分。OpenRouter 的卖点很直接:当单一模型不够强时,让多个模型回答同一问题,再由评审模型对比并综合结果。

6 月 29 日,Cognition 发布 Devin Fusion,标题为《Frontier Performance at 35% Lower Cost》。它并非让多个模型重复执行完整任务,而是将规划与判断交给前沿模型,把测试、机械性修改等工作委派给更便宜的辅助模型,在执行过程中动态切换模型。

同一个术语指向了两种相反的经济逻辑。OpenRouter 用更多算力购买更高的上限;Cognition 则在保持现有质量的同时设法减少昂贵计算。这种对比比任何模型排名都更能说明问题。模型融合的技术命题确实成立:多次尝试有机会超越单次尝试。但市场真正奖励的不是“调用更多模型”,而是在满足质量门槛后,谁能花得更少、交付得更快。
▲ 图 1:同月出现的两种 Fusion。本文对模型融合采用更窄的架构定义:多个模型并行回答同一任务,评审模型对比结果,最后由单一模型输出答案。Devin Fusion 不符合这一定义,它更接近动态路由与任务委派。之所以放在开头,是因为市场正将“Fusion”当作所有多模型编排的统称,而真正有效的产品往往正在脱离模型融合的狭义定义。

我们的判断偏悲观:模型融合是一种昂贵的质量保险。它能提升某些任务的绝对表现,却很少能将成本—质量—延迟的效率前沿向外推进。真正值得购买这份保险的任务并不多。它会继续存在,但更可能变成一种低频触发的功能,而非默认架构,也更难成为一个独立的品类。
当前模型市场有哪些选项
关于 Fusion 的讨论很容易陷入准确率排名,但企业购买的不是排名。企业购买的是任务合格结果,同时还要考虑价格、延迟、隐私和稳定性。只要更便宜的模型已经跨过业务接受线,继续为“更聪明”付费可能在经济上并不划算。成本效率才是模型市场的真正主线。
▲ 图 2:模型智能度与单任务成本(横轴为对数刻度)。这张图最值得关注的不是右上角最高分,而是偏离价格—能力趋势线的点:它们以更低价格提供了足够能力,是特定工作负载的效率异常值。综合指数无法直接回答哪个模型最适合代码审查、中文研究或合规部署,但它揭示了一个方向:模型供给正在商品化,“最强模型”正在与“最优选择”分离。

面对同样的质量缺口,目前市场上有四种主要采购方式。
第一种是直接升级到更强的单模型。这是最简单且最易审计的方式;只要高端模型的边际涨价低于错误或返工成本,这通常仍是首选。第二种是在测试阶段对同一模型增加计算量,例如延长推理、自洽性或多次采样。第三种是路由、级联与任务委派:先用便宜模型处理可验证或机械性部分,遇到困难时再升级。第四种是狭义的模型融合:让多个模型重复回答同一问题,再通过评审与合成模型形成最终答案。
四种方法都可以用“更多计算换质量”,区别在于算力花在哪里。单模型扩展购买的是更深的推理,路由购买的是更精准的资源分配,而融合购买的是更多候选答案。前三种方法将预算集中在最可能改变结果的环节;融合却先为重复意见付费,再押注评审模型能识别有效差异。只有当候选模型提供足够的独立信息,且评审能识别这些信息时,融合才可能超越前三种方案。
路由已经证明,模型之间的能力差异主要是一种调度机会。RouteLLM 在部分评测中降本超过 2 倍且未牺牲质量;Switchcraft 以 82.9% 的准确率实现了 84% 的成本降幅,按论文计算每百万次请求节省超过 3600 美元。这些结果仍需在企业自身流量上复现,但经济逻辑是直白的:没必要让多个模型开会,只需把每个任务派给最便宜的合格模型。
这意味着,市场会首先用升级、路由和验证来填补质量缺口;只有当这些方法仍然不足时,才有理由为融合购买更多候选答案。
为什么评分提升不等于商业价值
因为融合必须同时跨过三道门槛:增量质量必须覆盖额外成本与延迟;候选模型必须提供独立信息;评审必须可靠地识别更优答案。只要其中任何一项不成立,分数提升就无法转化为生产价值。
计算成本:需要增加多少预算和延迟?融合带来的分数提升主要是一种确定的计算支出。OpenRouter 会并行调用多个面板模型,再通过评审与合成模型生成答案。DRACO 中三组模型均提升了分数:Fable 5 + GPT-5.5 从 65.3 提升至 69.0;Opus 4.8 自融合从 58.8 提升至 65.5;低成本三模型组从 60.3 提升至 64.7。
然而,Opus 自融合的提升更大,这说明收益可能来自额外的搜索与采样,而非跨模型知识互补。公平比较应在同等 token 预算下评估自洽性、更长推理和强单模型。现有研究也显示:多智能体系统在约 20 倍计算负载下最多提升 7.1 个百分点;预算相同时,辩论和 Mixture-of-Agents 仅比自洽性高出 1.3 和 2.7 个百分点;另一项在同等推理 token 下的研究则发现单智能体表现相当或更好。许多“协作收益”在统一计算账目后会消失。
▲ 图 3:OpenRouter 的基准测试提升与产品成本。OpenRouter 三模型面板的默认成本约为普通生成的 4-5 倍,速度慢 2-3 倍,但未披露各 DRACO 配置的完整 token、成本与延迟数据,因此无法判断 3.7 分的提升是否值得。该评测仅包含 100 道纯文本英文任务,且涉及 Fable 的配置仅完成 93 道;更换评审模型可使绝对分数波动 10-25 个百分点。这证明了融合能提升分数,却无法证明融合提升了生产 ROI。

选择性调用只能稀释成本。据 OpenRouter 披露的范围,触发率为 1% 时,整体成本约为 1.03-1.04 倍;10% 时为 1.30-1.40 倍;25% 时已达到 1.75-2.00 倍。
▲ 图 4:选择性调用融合的整体经济性。最难的请求最有可能触发融合,但系统必须等待最慢的面板成员,再串行完成评审与生成,因此尾部延迟集中在最有价值的任务上。多供应商调用还会扩大故障面、审计复杂度和隐私暴露。融合的成本不只是 API 价格,还包括等待时间与额外的系统风险。
信息互补性:多个模型真的提供了不同信息吗?融合的价值取决于候选模型是否带来独立信息,但不同模型往往共享训练语料、网络来源和错误前提。在研究任务中,这可能导致“引用清洗”:多个模型追溯到同一来源,却被包装成多条独立证据。如果系统不保留声明级别的溯源与搜索路径,随着模型数量增加,API 成本几乎线性上升,而证据多样性未必增加。

KAIKAKU.AI 联合创始人兼 CEO Josef Chen 在 2026 年论文《When Does Combining Language Models Help?》中研究了 21 家服务商的 67 个模型。在开放数学任务中,所有模型同时答错概率的预测值为 2.3%,实测却达到 5.2%——约为预测值的 2.3 倍;代码评分任务与自由回答版 GPQA-Diamond 的联合失败率进一步升至 7.9% 和 12.7%。换成 100 道 GPQA-Diamond 题目,约有 13 道题会导致所有候选模型同时答错,投票、评审或合成都将无正确答案可选。模型在简单题上的分歧可以放大组合价值,但在最需要保险的尾部问题上,它们可能一起失效。
评审可靠性:系统能否识别并合成更优答案?即使候选答案互补,价值仍取决于评审。候选一致时,评审可能误将相关错误认定为高置信度;候选分歧时,它必须具备足够的专业知识才能选对。合成模型还可能抹掉关键的少数意见,或将真实的分歧改写成确定性结论。
在编码任务中,编译器、测试和静态分析往往比另一个模型的意见更可靠;在创意任务中,评审与合成容易将差异压缩成平庸答案。LitBench 中最强的现成评审模型与人类创意写作偏好的一致率仅 73%。当任务本身已有廉价的外部验证器,或“好”本身依赖主观判断时,融合的分数提升很难转化为可付费的价值。
谁会为模型融合付费
融合的需求取决于两道门槛:任务能否从多模型中受益;这种收益是否足以形成持续付费。前者是技术问题,后者是市场问题。
从技术适用性到经济可行性:纠错概率乘以单次可避免损失,必须超过额外的 API 成本、延迟、运维复杂度和隐私风险。
基准分数无法回答这道盈亏题。只有当错误成本很高、候选模型提供互补搜索路径、没有更便宜的外部验证器,且业务能接受额外延迟与供应商风险时,融合才具备经济可行性;最终结果仍应由人类或外部证据确认。
▲ 图 5:从技术适用性到可持续需求。满足这些条件的主要任务是高价值研究与尽职调查、架构与安全审查,以及不可逆决策前的“第二意见”。它们的共性是约束不完整且遗漏成本高,另一条独立思路本身就具有价值。相反,常规编码、实时消费级应用、高吞吐量低利润工作流,以及可直接由测试或规则验证的任务通常不需要融合。监管机构也可能因数据边界与审计要求而拒绝多供应商面板。

从付费意愿到可持续需求:技术上好用可以带来高付费意愿,但不等于可扩展的需求。要形成持续需求,错误损失必须可量化、任务必须反复发生、组织内必须有明确的预算所有者,且融合必须持续跑赢人类专家、强单模型和外部验证。然而,尽职调查预算往往流向分析师和可信来源,安全预算流向专业审计,而不可逆决策发生得太少。
因此,我们不看好只做多模型包装层、默认运行面板或将静态模型选择算法当作护城河的公司。连接 API 易于复制,固定策略会随着模型能力与价格变化迅速失效;如果不知道一个错误值多少钱,或融合实际纠正了多少次,就无法给这份保险定价。最可能捕获价值的是那些了解真实结果的参与者:网关与智能体平台、垂直应用、工作流所有者,以及评估与可观测性产品。它们知道错误成本,能观察结果,并能优化触发策略。真正难以复制的不是面板清单,而是判断何时不调用融合的能力。
市场验证:公开市场仍不足以判断融合的需求规模,但其使用方式已经清晰。Perplexity Model Council 仅向月费 200 美元的 Max 用户和企业 Max 用户开放,用户手动选择三个模型用于投资研究、复杂决策和信息验证;公开用户案例包括通过浏览器自动化将 Model Council 整合进股票研究流程。Hermes Mixture of Agents 将融合变成智能体内可选的虚拟模型:用户可以通过 /moa 仅对一道难题升级,或在复杂会话中持续启用,多个参考模型提供分析,再由聚合器调用工具完成任务。Hermes 随后降低了默认扇出频率,复用上一轮模型意见以控制成本。这些案例说明,融合的真实需求集中在研究、调试、审查和重要决策等低频难题上,典型用法是单模型遇到瓶颈时的主动升级,而非默认的高频自动化流程。现有证据表明这种需求存在,但公开信息仍不足以判断其能否形成一个独立、可扩展的付费市场。
模型融合的未来走向
推理价格下降表面利好融合,但同时也会降低强单模型、路由和外部验证的成本。融合不是在跟昨天的单模型调用竞争,而是在跟持续进步的下一代单模型和编排基线竞争。
Cognition 的 Devin Fusion 展示了这一竞争方向:将昂贵模型留给判断阶段,把可验证和机械性工作委派给更便宜的模型。在厂商自测中,Fusion + Fable 5 的总分从 57.0 微升至 57.6,而平均成本从 5.12 美元降至 3.00 美元;但在五个已发布的案例中,成本下降 25%-62%,任务分数则在 +12 到 -27 之间波动。边界明确且经过充分测试的 ES6 重构从 98 分升至 100 分;依赖交互理解与隐含需求的 React/Redux 功能在错误委派后从 54 分跌至 27 分。
▲ 图 6:Devin Fusion 的任务分数与成本。这些是厂商自行挑选的案例,不代表整体分布,但指向清晰:未来多模型系统的核心能力不是调用更多模型,而是划定正确的降级边界。可验证和机械性任务可以分配给更便宜的模型,而判断密集型任务必须留给前沿模型。OpenRouter 卖的是“更多智能”,Cognition 卖的是“同等智能、更低成本”;后者的命题更接近长期方向。系统越接近生产经济,就越不像狭义的模型融合,而越像路由、委派和验证。

七月下旬,媒体报道称 Stripe 正谈判以约 100 亿美元收购 OpenRouter,但该交易尚未确认。这一信号不应被解读为融合已获得市场验证:OpenRouter 的核心价值不是某个特定面板,而是连接超过 500 万开发者与 400 多个模型的中立调用层。Stripe 已为 OpenRouter 提供计费、税务和风控,开发者可通过 Stripe Projects 直接创建账户、获取 API 密钥并连接支付。Stripe 真正可能购买的是 AI 推理的交易入口:OpenRouter 掌控模型选择、token 使用和成本,Stripe 负责定价、计费和支付。这为前文的价值判断提供了市场信号:多模型时代的价值更可能留在能够观察任务、分配调用并完成结算的编排层,而融合只是其上层的高成本升级策略。
未来的多模型系统不会默认召集面板,而是先评估任务难度、验证成本和错误损失;只有当更强的单模型、延长推理和外部工具仍然不足时,才会进入多模型分歧搜索。触发率、增量成功率和经核实的单位结果成本将是更有意义的产品指标。融合将继续存在,但不会成为默认架构或独立品类。
事件要点
2026 年 6 月,OpenRouter 与 Cognition 在不到三周内相继发布 Fusion 产品,分别代表“堆算力提分”与“任务委派降本”两种路径。同期,RouteLLM、Switchcraft 等路由方案已验证可通过智能调度降本 80% 以上,且未牺牲质量。
关键数据怎么看
OpenRouter 三模型组在 DRACO 评测中分数从 65.3 提升至 69.0,但成本约为普通生成的 4-5 倍,延迟增加 2-3 倍。KAIKAKU.AI 对 67 个模型的实测显示,GPQA-Diamond 任务中联合失败率达 12.7%,意味着约 13% 的问题所有候选模型同时答错,评审无正确答案可选。Cognition 的五个案例中,成本降幅 25%-62%,但任务分数波动区间为 +12 至 -27。
风险关注点
模型融合存在三方面隐性成本:其一,尾部延迟集中,最难请求触发融合后需等待最慢模型完成;其二,多供应商调用扩大故障面、审计复杂度和隐私暴露;其三,评审可靠性有限,LitBench 显示最强现成评审模型与人类创意写作偏好一致率仅 73%,可能将相关错误误判为高置信度答案。
后续观察指标
判断模型融合能否从功能升级为品类,可关注三个指标:实际触发率、增量成功率(相较于单模型与路由方案的真实纠错比例),以及单位验证结果成本。若无法在特定任务上持续证明 ROI,其定位将长期停留在低频触发的高级功能。
信息来源
OpenRouter: Surpassing Frontier Performance with Fusion
OpenRouter Fusion Router documentation
Cognition: Devin Fusion — Frontier Performance at 35% Lower Cost
Microsoft Research: Switchcraft — AI Model Router for Agentic Tool Calling
When Does Combining Language Models Help?
Multi-Agent Reasoning Improves Compute Efficiency
Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets
Mixture-of-Agents Enhances Large Language Model Capabilities
RouteLLM: Learning to Route LLMs with Preference Data
LitBench: A Benchmark for Creative-Writing Evaluation
Artificial Analysis model comparison
The Price of Progress: Price Performance and the Future of AI
Perplexity: What is Model Council?
Perplexity user example: Model Council for financial research
Hermes Agent: Mixture of Agents documentation
Stripe powers OpenRouterʼs global AI model access
Axios: Whatʼs behind Stripeʼs reported OpenRouter move