HybridInference

HybridInference 是一个开源的 LLM 推理网关。它在一批自建推理服务器(vLLM、SGLang、Ollama,或任何其他讲 OpenAI API 的服务)和托管的 provider API 之前,统一摆上一套 OpenAI 兼容的 HTTP API,再逐请求决定由其中哪一个来应答。

整个系统的立足点是:客户端请求的模型 id,与真正服务它的端点是解耦的。一个对外发布的 id 可以同时由多条路由承载,于是这些路由之间的流量可以加权、可以在某个端点劣化时回退、可以计价、可以记录日志——而客户端一行都不用改。

本文档讲的是网关软件本身:如何运行它、理解它、扩展它,以及如何为它贡献代码。

开箱内容

  • 一套 OpenAI 兼容的接口——包括 POST /v1/chat/completionsPOST /v1/embeddingsPOST /v1/responsesGET /v1/models;另外还在 /v1/messages/anthropic/v1/messages 上提供一套 Anthropic Messages 接口,供改讲该协议的客户端使用。

  • 一套路由引擎——按模型选择 router、在一个 id 的多条路由之间加权选择、自动回退到下一条路由,以及按端点计的熔断器(circuit breaker),把持续失败的端点摘出轮转。

  • 一组 provider adapter——一个通用的 OpenAI 兼容 adapter(自建的本地服务器也走它),外加面向 OpenRouter、Anthropic 直连 API、经 Google Vertex 的 Claude 以及 Gemini 的专用 adapter。

  • 一套 Web 与管理控制台——一个 Next.js 应用,提供注册登录、API key、用量与最近请求、聊天试验场,以及涵盖用户、模型可见性、provider key、路由权重和分析的管理区。

  • 运行数据存储——用 Postgres 存放账号、API key 和请求日志;表结构在启动时创建,而不是交给迁移工具。

后端是 apps/backend/ 下的 Python(3.10–3.13),分成 serving/(HTTP 接口、鉴权、adapter、存储、可观测性)和 routing/(路由表、策略、端点健康、回退)两半。控制台是 apps/frontend/ 下的 Next.js。仓库采用 MIT 许可证。

从哪里开始

如果你想

从这里开始

不用账号、不用 key、不用 GPU,看一个网关处理一次请求

快速开始

用真实的 provider 跑起你自己的网关

安装

跟着一次请求,从 HTTP 一路走到上游调用

架构

发布一个新的模型 id,或接上网关从未对接过的 provider

添加新模型

改变端点的选中方式,或自己写一个策略

路由

提交一个补丁

参与贡献

本站的范围

这些页面记录的是软件本身,而不是它的某一次具体安装。某个网关服务哪些模型、怎样在它上面拿到账号,由运营方另行公布。

这条分界是写进仓库结构里的:一个部署把自己的身份、配置文件位置和功能开关放在 distributions/ 下的distribution overlay里,而不是放进代码,所以新克隆出来的仓库跑起来不属于任何人,只属于你自己。配置 讲解这些 overlay 是怎样解析出来的。