首页
学习
活动
专区
圈层
工具
发布

做了个路由器,本地模型跑提示词卡住就自动切云端(Apache-2.0)

本地跑模型的人应该都懂这种痛:前面都好好的,结果一个长提示词发过去,模型直接悄无声息地卡死,或者 GPU 爆显存,最后请求挂在那儿,啥输出都没有。

我就是为了解决这个才写了 HybridInfer,是个很小的可靠性路由。

它先把每个请求发给本地的 Ollama 模型;然后盯着运行时状态,要是本地卡了(比如 N 秒没出新 token)、OOM 或者报错,就在同一次请求里自动切到远程模型。

它还会学你机器哪些提示词扛不住(一般是长的),看过几次失败之后,后面就直接把这类请求提前扔出去。卡死的模型会被踢出队列,冷却之后再探活加回来。

这东西是个 OpenAI 兼容的服务器,所以任何兼容 OpenAI 的客户端或应用直接指向它就行,白嫖本地优先加自动兜底。本地就是你自己 ollama pull 的模型,远程随便什么 OpenAI 兼容端点都行,OpenAI、OpenRouter、vLLM 机器都可以。

装的话就是 pip install hybridinfer,然后 hybridinfer init、hybridinfer serve。

说白了它就是个路由,不是推理引擎,只负责编排 Ollama 加你的远程端点,自己不跑权重。现在还是早期 v0.1,Apache-2.0 协议,另外还有个 Kotlin/Android 版给端上应用用。

仓库里有演示 GIF 和代码。天天跑这个的朋友多给点反馈呗,尤其是兜底那套启发式逻辑。你们希望它还能干点啥不一样的?

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OV-D52sDDFHZBHDAEJqKOJ0Q0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券