“先判断请求难度、风险、成本和格式要求,再决定调用一个模型,还是组织多个模型分工、验证和合成答案”
founder@vLLM Semantic Router · vLLM 生态开源研究项目 · 现居开源项目(全球)
Builder
这是 vLLM 生态中的开源研究型项目,目前在 GitHub 上已获 4.9k Star。在技术路线上,Semantic Router 先抽取领域、难度、安全和上下文等语义信号,再根据这些信号选择不同的「路由配方」——既可以选择单一模型,也可以运行模型升级、并行集成、重复推理、Fusion 或带有 planner、worker、verifier 的受控工作流。
vLLM Semantic Router 不只决定「把请求发给谁」,而是决定「这次请求需要怎样的推理过程」。简单任务可以直接交给一个低成本模型;不确定时逐级升级;复杂任务则启动多个模型协作,同时控制预算、并发、超时和回退。
QUICK FACTS
Product
语义信号驱动的推理过程路由,可单模型也可多模型协作
🧭
语义信号抽取
领域、难度、安全、上下文等信号驱动路由
🧩
多种路由配方
单模型 / 升级 / 并行集成 / 重复推理 / Fusion
🤝
受控工作流
带 planner / worker / verifier 的多模型协作
⏱️
预算控制
同时控制预算、并发、超时和回退
Journey
2026/7/1
GitHub 4.9k Star
硅星人 Lens
我们的分析与判断
vLLM Semantic Router 的独特之处在于,它不只是决定「把请求发给谁」,而是决定「这次请求需要怎样的推理过程」。简单任务直接交给一个低成本模型;不确定时逐级升级;复杂任务则启动多个模型协作,同时控制预算、并发、超时和回退。表面上看,整个过程仍然表现为一次普通的模型调用,但深层上代表 Router 从模型选择层进一步进入能力构造层。
我们同时也担心:本项目意味着 Router 正在承担原本属于 Agent 框架、推理服务和安全系统的职责,这可以减少应用层重复搭建工作流,却也可能形成一个非常复杂的新中间层。此类不同路由配方能否在真实业务中稳定提升效果、抵消额外成本,仍需要更多独立验证。
yoky
硅星人 联合创始人 · 主笔
独立思考,为 Builder 发声