本地跑模型的人应该都懂这种痛:前面都好好的,结果一个长提示词发过去,模型直接悄无声息地卡死,或者 GPU 爆显存,最后请求挂在那儿,啥输出都没有。
我就是为了解决这个才写了 HybridInfer,是个很小的可靠性路由。
它先把每个请求发给本地的 Ollama 模型;然后盯着运行时状态,要是本地卡了(比如 N 秒没出新 token)、OOM 或者报错,就在同一次请求里自动切到远程模型。
它还会学你机器哪些提示词扛不住(一般是长的),看过几次失败之后,后面就直接把这类请求提前扔出去。卡死的模型会被踢出队列,冷却之后再探活加回来。
这东西是个 OpenAI 兼容的服务器,所以任何兼容 OpenAI 的客户端或应用直接指向它就行,白嫖本地优先加自动兜底。本地就是你自己 ollama pull 的模型,远程随便什么 OpenAI 兼容端点都行,OpenAI、OpenRouter、vLLM 机器都可以。
装的话就是 pip install hybridinfer,然后 hybridinfer init、hybridinfer serve。
说白了它就是个路由,不是推理引擎,只负责编排 Ollama 加你的远程端点,自己不跑权重。现在还是早期 v0.1,Apache-2.0 协议,另外还有个 Kotlin/Android 版给端上应用用。
仓库里有演示 GIF 和代码。天天跑这个的朋友多给点反馈呗,尤其是兜底那套启发式逻辑。你们希望它还能干点啥不一样的?