基础设施与工程

Ramp推出AI模型路由服务Router,试图把模型选择变成企业成本管理工具

Ramp于2026年8月推出AI模型路由服务Router,通过一个API接入并在OpenAI、Anthropic、NVIDIA等多家模型间动态切换,旨在把模型选择纳入企业成本和可靠性管理。Router在推出期免收路由费,但用户仍需支付实际模型推理费用,并强调将路由与支出追踪、延迟和质量评测结合以节省AI推理成本。

Ramp推出AI模型路由服务Router,试图把模型选择变成企业成本管理工具

Ramp于2026年8月推出AI模型路由服务Router,通过一个API接入并在OpenAI、Anthropic、NVIDIA等多家模型间动态切换,旨在把模型选择纳入企业成本和可靠性管理。Router在推出期免收路由费,但用户仍需支付实际模型推理费用,并强调将路由与支出追踪、延迟和质量评测结合以节省AI推理成本。

美国企业财务管理平台Ramp于2026年8月20日推出AI模型路由服务Router,允许开发者通过一个API接入并切换OpenAI、Anthropic、DeepSeek、Moonshot、MiniMax、NVIDIA、xAI和Z.ai等模型。该服务目前面向美国市场,Ramp表示将在2026年剩余时间内免收路由服务费,但用户仍需支付实际模型推理费用。

这项产品的核心并不是再提供一个模型,而是让企业根据任务难度、成本、延迟、可靠性和模型评测结果,自动决定一次请求应该交给哪个模型处理。随着企业同时使用的模型数量增加,模型选择正逐渐从开发者个人的技术决策,变成一项与预算、服务稳定性和生产效率相关的管理问题。

从一个API接入多个模型

根据Ramp的官方发布文章,Router提供统一接口,让开发者可以在不重写应用集成的情况下测试新模型、比较不同模型的质量和延迟,并把生产流量切换到更合适的模型上。Ramp官网则将其描述为一个面向多种闭源和开放模型的LLM路由层。

TechCrunch报道,Router目前可以接入来自OpenAI、Anthropic、DeepSeek、Moonshot、MiniMax、NVIDIA、xAI和Z.ai的模型。用户可以在不同提供商之间切换,也可以让Router在提供商出现限流或故障时自动尝试备用路线。

Ramp公布的路由策略包括几种不同方向。用户可以优先选择模型提供商的弹性服务层,以换取更低价格;也可以通过“影子模型”把真实请求的一部分发送给候选模型,在不改变线上服务的情况下比较结果。另一种策略允许用户指定最多三个基准测试,并按照权重让Router为特定工作负载选择模型。

对于复杂的代理任务,Router还提供类似“NVIDIA Switchyard”的分层策略:让日常步骤留在较便宜的模型上,只有在任务变得困难时,才升级到更昂贵、能力更强的模型。Ramp在发布文章中给出的内部示例显示,一次编码代理流程中,大部分回合由较低成本模型处理,最后几个更复杂的回合才交给高端模型。

Ramp称内部系统已运行三年

Ramp表示,Router并不是刚刚搭建的实验项目。公司称,这套路由基础设施已经在自身AI业务中运行约三年,用于处理超过100种AI应用场景。

Ramp官网显示,其内部系统每月路由的token数量超过2.75万亿,并称内部使用Router后,LLM成本下降约30%。公司的新闻稿则表示,已经使用Router的客户平均将推理成本降低了40%。这些数字均来自Ramp自身披露,反映的是公司或客户样本中的结果,并不等同于所有用户都能获得相同幅度的节省。

Ramp还在其技术博客中介绍了路由系统的一种实现方式。该系统会根据模型和服务层的实时失败率、延迟分布以及请求的截止时间,动态评估不同路线出现“失败或超时”的概率,再结合相对成本进行排序。如果首选路线不可用,系统会尝试备用路线。

文章提到,Ramp曾在一个有六秒时限的重新排序任务中,通过对模型标准服务层和弹性服务层的延迟进行在线学习,把请求转向价格更低、但当时速度相近的选项。Ramp称,在更大规模的流量实验中,这套策略带来了超过25%的成本节省,之后在其流式处理场景中实现了约30%的节省。

这类做法的关键,不是简单地为每项任务指定一个固定模型,而是持续观察价格、延迟和失败率的变化。模型提供商的价格、限流状况和服务质量会不断变化,因此静态的模型配置很容易在数周或数月后失效。

路由服务免费,但模型推理并不免费

Ramp表示,Router在推出阶段不收取路由服务费,用户仍需按所调用模型的公开价格支付token费用。Ramp的新闻稿称,服务在2026年年底前提供免费路由,并向新用户提供26美元的额度;TechCrunch则报道了同样的免费期限和启动额度。

Ramp官网目前将Router描述为面向首批用户的邀请制服务,并表示用户不需要持有Ramp银行卡、拥有Ramp企业账户,甚至不需要注册公司即可申请早期访问。TechCrunch则称,服务当前仅在美国提供。至于2027年之后的收费方式,Ramp尚未公布明确价格。

数据留存是企业用户需要特别注意的另一项限制。TechCrunch报道,Router默认会保留模型输入、输出和工具调用记录一年,用户可以选择退出。Ramp表示,在使用这些数据改进产品之前,会移除个人身份信息。不过,是否满足特定行业的合规要求,还取决于企业自身的数据处理范围、合同条款和部署方式,不能仅凭“移除个人身份信息”这一表述作出判断。

AI支出管理正在成为新的竞争入口

Ramp原本的核心业务是企业支出、采购和财务管理。公司此次进入AI推理基础设施领域,反映出AI支出正在从研发团队的技术预算,扩展为企业财务部门需要追踪和控制的成本项目。

Ramp在新闻稿中援引自身AI Index称,企业AI支出自2025年6月以来增长了20.7倍。这个数据的统计口径和样本范围由Ramp自行定义,因此更适合作为公司对市场趋势的判断,而不是整个行业的统一指标。但企业同时采购多个模型、面对不同价格和服务层的现实,确实增加了成本归因和预算控制的复杂度。

Router试图把模型选择与Ramp原有的token使用监控和支出管理产品连接起来。其控制台可以显示token消耗、成本、延迟、回退尝试,以及请求所使用的模型和提供商。对于企业来说,这种可见性比“接入更多模型”本身更接近采购和运营问题:哪一个团队在使用模型,哪些任务最昂贵,何时发生了回退,以及低价模型是否真的达到了所需质量。

此前,AIFlux曾报道OpenAI下调部分模型API价格并为旗舰模型增加更高价的加速模式,这也显示模型市场的竞争正在从单一的能力比较转向价格、速度和任务适配度的组合比较。企业最终选择的可能并不是“最强模型”,而是能在特定质量标准下,以可接受成本稳定完成任务的模型。

Router与OpenRouter等服务的差异仍待验证

从产品形态看,Router与OpenRouter等多模型聚合和路由服务存在明显相似之处:开发者通过一个入口访问不同模型,并由平台处理模型切换、提供商连接和部分故障转移。TechCrunch也将两者进行了比较,并指出OpenRouter当前提供的模型选择更多。

Ramp希望强调的差异,则是它把路由与企业级的支出追踪、成本归因和生产工作负载评测结合起来。公司还表示,Router不生产模型,因此没有理由优先推荐某一家模型提供商,并会根据质量、延迟、可靠性和成本来选择路线。

不过,这种“独立路由”的承诺仍需要通过实际使用验证。路由平台如何定义质量门槛,基准测试是否能代表企业自身任务,输入和工具调用数据如何被处理,以及平台在模型提供商之间如何协调价格和服务稳定性,都会影响企业是否愿意把生产流量交给它。

目前可以确认的是,Ramp已经将其内部使用的模型路由基础设施对外开放,并把产品定位在不断变化的模型市场与企业AI预算之间。至于Router能否形成足以挑战现有聚合平台的规模,以及免费期结束后企业是否愿意继续支付服务费用,仍有待后续用户数据和商业化进展观察。

来源:TechCrunch关于Ramp推出Router的报道Ramp Router官方产品页Ramp官方发布文章Ramp Builders关于动态模型路由的技术说明Ramp新闻稿

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读