亲身体验 Elasticsearch:深入探索 Elasticsearch Labs 代码库中的示例 Notebook,开始 免费云试用,或者现在就在您的本地机器上试用 Elastic。
Jina AI 的全部 28 款 embedding 和 reranking 模型现在都以完全离线的 Docker 容器形式提供,支持本地部署。这包括 jina-embeddings-v5-omni 和 jina-reranker-v3。只需下载其中一个容器,将其传输到本地的物理隔离或防火墙系统,即可在五分钟内运行本地 推理。这些容器是完全独立的,不进行任何外部连接,无需调用 Hugging Face 或任何模型注册表。此外,它们也没有许可证服务器、遥测或日志记录端点。对于受监管行业、有数据主权要求或互联网访问不可靠甚至不可用的环境,这消除了对第三方 AI 服务的依赖。Jina On-Prem 支持 Elastic Inference Service (EIS)、OpenAI、Cohere、Voyage AI 和 Gemini API 规范,因此现有应用无需修改代码即可正常工作。
目前,最强大的 AI 模型通常运行在远程云端,并通过 Web API 提供访问。这意味着您必须信任您的 AI 服务提供商在安全性、服务可用性和价格稳定性方面表现良好。要平衡对可靠性、隐私、可控成本和良好数据治理的合理需求,同时应对日益强大、复杂且资源密集型的 AI 使用,并非易事。
最近,政府法规、法院裁决以及出于他人利益的商业考量,都导致了对特定服务的访问限制。即使您可以切换到其他服务,AI 模型也并非可以随时替换的组件。使用语义 embeddings 的应用程序,在查询时必须能够访问与数据摄入时相同的模型。一旦失去对 embedding 模型的访问,您的搜索系统就会停摆。
AI 定价模型进一步加剧了这种风险。主要 AI 供应商最近的财务披露,让客户有充分理由担忧潜在的价格上涨。依赖成本不可预测的产品,会给那些可能无法产生明确回报的资本密集型 AI 投资带来更多风险。
Jina On-Prem 是 Elastic 应对这些挑战的解决方案。
本地托管并直接控制您的 AI 模型,可以满足各种技术需求、行业要求和业务利益。
本地安装可以减少您支付给 AI 服务提供商的费用,但会将硬件和可靠访问的成本转嫁给您的组织。根据您的使用量,本地部署可能更便宜。不过,还有其他更紧迫的理由需要考虑运行您自己的 AI。如果以下描述的任何问题与您的企业相关,请考虑像 Jina On-Prem 这样的本地 AI 解决方案。此列表并非详尽无遗。
用例 | 为何选择本地部署 | 示例 |
|---|---|---|
物理隔离 / 高安全性 | 无出站数据传输;完全网络隔离 | 国防、情报、机密研究 |
法规遵从性 | 数据主权;无跨境传输或第三方暴露 | 医疗保健 (Health Insurance Portability and Accountability Act [HIPAA])、金融、欧盟企业 (General Data Protection Regulation [GDPR]) |
延迟敏感型 | 零网络依赖;无法容忍连接故障 | 机器人、边缘计算、车辆、船舶 |
成本可预测性 | 固定基础设施成本 vs. 按 token 计费且未来费率不确定 | 高容量连续推理工作负载 |
责任减少 | 无第三方数据暴露;维护法律特权和审慎义务 | 律师事务所、政府机构 |
物理隔离和防火墙系统无法使用外部 AI API。Jina On-Prem 完全在您的基础设施内部运行,不进行任何出站连接。
对于管理特别敏感数据的组织来说,安全和隐私考量至关重要。如果您将敏感数据轻易交给可能安全措施不足或受外国政府要求的远程第三方,那么您在保护敏感数据方面的投资将收效甚微。
处理敏感数据的组织员工通常会接受安全数据处理培训,但当他们在使用这些数据的同时,Web 浏览器可能打开着互联网上的任何页面时,这种培训效果并不理想。隔离是最有效的安全措施,无论是通过物理隔离还是极其严格的防火墙,但这使得使用任何外部服务都变得困难。
软件即服务 (SaaS) 和云计算代表了一种折衷:在您自己的计算机上提供高度可访问、可靠服务的成本,以及将问题外包给他人之间的权衡。但它们伴随着可变的延迟、中断以及在出现问题时完全失去控制的风险。AI 服务也不例外。如果您的搜索系统在无法访问 embedding 模型时离线,那么这可能就不再是一个好的权衡了。
此外,依赖外部 AI 总是会带来您难以预见或管理的风险。互联网访问和网络延迟可能会在不知不觉中下降,这可能是政治事件、恶劣天气或船只拖锚损坏海底光缆造成的。政府可以,而且最近也确实利用出口禁令突然阻止对 AI 模型的访问。AI 服务提供商有时会撤回模型,以诱导您切换到更新的模型。外部服务的灵活性和可管理成本必须与依赖性风险进行权衡。
收集个人数据的组织受到日益严格的法规约束,这些法规在不同司法管辖区之间通常存在差异,并可能具有相互矛盾的要求。值得注意的是,HIPAA 规则对美国医疗保健提供商施加了非常严格的数据保护;加拿大、欧盟和许多亚洲司法管辖区的强有力通用数据保护法要求所有处理个人信息的企业安全地进行处理,并限制将数据传输给其他方或跨越其他司法管辖区。这些规则甚至可以对在这些司法管辖区内拥有客户的外国实体施加义务。金融机构经常受到更严格的规则约束,并承担与防范其他形式犯罪活动相同的直接信息安全责任。
法规遵从性可能与第三方 AI 服务不兼容,特别是如果使用它们涉及跨境数据传输。
此外,最近的事件表明,当国际云运营商受到外国政府压力时,限制数据存储物理位置的规则可能不是可靠的保护来源。当地法律可能在不同司法管辖区之间冲突,要求本地数据存储和处理,使得第三方服务无法使用。在某些情况下,唯一的解决方案是将所有流程,包括您的 AI 系统,都内部化。
数据保护法和公认的对敏感数据的审慎义务通常具有责任含义,有时甚至非常严重。您可能需要为第三方服务提供商处理您数据的方式负责。虽然法院和法律程序可能会为不安全的服务提供商提供一些追溯性保护,但这些补救措施对国家安全行为者、执法部门或犯罪黑客无效,也通常不可用。
对于政府而言,已经发生过跨境云服务提供商向外国行为者泄露敏感国家信息的情况。
但即使您不担心外国政府或黑客,并且您的外部 AI 服务提供商本身是安全的,仅仅是它们是外部的这一事实也可能产生责任。
例如,在大多数司法管辖区,律师与客户之间的通信享有特殊的法律保护,律师事务所在记录或存储这些信息时负有严格的责任。在美国,“律师-客户特权”非常有名,它是电影和电视剧情的核心。但特权可能丧失的一种方式是与非特权人士交流信息,最近的发展表明,外部 AI 服务提供商可能符合这一条件。
至少在美国,仅仅通过互联网 API 使用第三方 AI 服务,例如提供索引服务的 embedding 模型,就可能违反关键的保密规则。律师事务所可能仅仅因为使用外部托管软件而被起诉、纪律处分或取消律师资格,即使没有发生安全漏洞。
计算机系统并非仅仅出于安全原因而隔离。例如,移动车辆不能依赖互联网访问来执行任何基本功能。船舶和飞机拥有非常广泛的板载计算机系统,这些系统必须在没有互联网连接的情况下运行,因此无法使用外部 AI 服务。海上平台、荒野地区的远程设施、北极、南极和没有足够物理连接到全球网络的小岛上的计算机服务,都是从本地托管其所需所有服务中受益的安装示例。随着 AI 在企业计算中作用的增长,解决这些限制变得越来越重要。
AI 在物理系统中的新兴应用(机器人技术和其他空间受限或以外部世界为重点的用例,如物流管理系统甚至超市收银台)可能连接到全球互联网,但它们无法容忍连接故障或延迟峰值。如果它们依赖 AI 系统运行,那么该 AI 系统需要尽可能本地化和可靠。
远程软件服务和异地 AI 确实有其优势。运行 AI 模型可能需要昂贵、耗电的处理器,而这些处理器的寿命通常很短。由于市场因素和外部经济冲击,目前获取高质量硬件尤其困难。在这种情况下,按 token 支付以使用外部 API,而不是支持本地 AI 的高昂资本成本,可能更具意义。
外部 API 对间歇性用户来说最有意义。如果您主要使用 AI 模型进行批量数据处理和分析,而不是运行一个必须始终在线的搜索系统,那么投资资本密集型硬件和本地安装就没有多大意义。
此外,当您的数据处理已经基于云端时,例如,出于可靠性和可访问性原因托管在云端的 电商 网站,使用位于相同云基础设施中的 AI 服务可能比引入您自己的许可 AI 模型部署更具性价比。您已经依赖您的云服务提供商,因此依赖其 AI 服务并不会增加太多风险。
如果您的用例听起来符合上述描述,那么 Jina AI 模型可以在 EIS、AWS Marketplace 和 Google Cloud Platform 上获取,以专门满足您的需求。
下表总结了关键因素。您的选择取决于您的数据、基础设施和使用模式。
因素 | 倾向于本地部署 | 倾向于云 API |
|---|---|---|
使用模式 | 连续或高容量推理 | 间歇性或批量处理 |
数据敏感性 | 受监管、主权或机密 | 无跨境或第三方限制 |
网络环境 | 物理隔离、防火墙或不可靠 | 稳定、始终在线的互联网 |
现有基础设施 | 拥有或可采购 GPU 硬件 | 已云托管并配有协同 AI |
成本模型 | 固定硬件 + 许可证;规模化后可预测 | 按 token 计费;前期成本低,长期可变 |
延迟容忍度 | 无 (机器人、边缘、实时) | 可接受网络可变性 |
运营责任 | 您的团队管理硬件和可用性 | 提供商管理硬件和更新;您管理集成 |
您必须根据您的具体情况和用例,权衡成本和收益,并考虑上一节中提到的适用于您的问题。成本效益分析无疑会随着时间而变化。即使在短期内,我们也无法预测 AI 行业或硬件价格的未来。
对于可以从本地 AI 服务中受益的用户,我们推出了 Jina On-Prem,这是一个用于 Jina AI 高性能模型的完全独立安装套件。
Jina AI 的模型在准确性上可与体积大许多倍的 embedding 模型媲美,从而降低了计算成本、内存占用和硬件要求。这使得它们成为希望或需要将 AI 保留在本地的用户理想选择。我们提供商业许可证,其价格解决方案可扩展且按比例计费,适用于各种规模的用例。

MMTEB Multilingual v2 leaderboard showing Jina AI embedding model rankings: jina-embeddings-v5-omni-small and jina-embeddings-v5-text-small ranked 13th, jina-embeddings-v5-omni-nano and jina-embeddings-v5-text-nano ranked 19th, competing against models from Microsoft, Google, Tencent, NVIDIA and Qwen
大规模多语言文本 Embedding 基准 (MMTEB) 排行榜,截至 2026 年 7 月 8 日。
HF_HUB_OFFLINE=1 和 TRANSFORMERS_OFFLINE=1 已内置)。jina-embeddings-v5-omni 多模态 embedding 模型和 jina-reranker-v3。不同 Jina 模型的硬件要求各不相同。下表显示了使用 GPU 设置的最新模型的建议。您不需要比 NVIDIA L4 GPU 更强大的硬件,但对于 v5 embedding 模型,建议使用 A100。我们最新的 embedding 模型目前至少需要 8 GB 的显存。
模型 | 最低显存 | 推荐 GPU |
|---|---|---|
jina-embeddings-v5-text-nano | 2 GB | T4 / L4 |
jina-embeddings-v5-text-small | 3 GB | L4 / A10G |
jina-embeddings-v5-omni-small | 8 GB | L4 / A10G / A100 |
jina-reranker-v3 | 3 GB | L4 |
jina-clip-v2 | 4 GB | L4 |
jina-code-embeddings-1.5b | 4 GB | L4 |
ReaderLM-v2 | 4 GB | L4 |
如果您同时使用多个模型,显存要求将增加。有关更多信息,请参阅 Sizing and Hardware 页面。

最快的入门方法是安装 Docker(如果您尚未安装),然后按照 Jina On-Prem 快速入门页面上的说明进行操作。
所有 28 款 Jina 模型都有预构建的 Docker 容器。下载其中一个并将其传输到您的安装目标,您就可以在五分钟内运行 Jina AI 模型。
对于多模态或自定义构建,或者要下载完整的依赖项集以在容器外部安装,请按照打包指南中概述的步骤进行操作。
您需要一个 GitHub 帐户和访问令牌才能下载 Jina On-Prem。要创建免费帐户,请访问 https://github.com/signup。要生成或管理您的访问令牌,请按照 GitHub 文档中的说明进行操作。
您的 Jina On-Prem 安装支持所有 Jina API 和 EIS 功能,以及通过 OpenAI、Cohere、Voyage AI 和 Gemini API 生成 embedding,因此它可以集成到使用标准接口的现有应用程序中。有关更多信息,请参阅 API 文档。
Jina 模型,包括通过 Jina On-Prem 安装的模型,可根据不同的许可条款提供。最新的模型根据 CC BY-NC 4.0 许可证免费用于非商业用途。如需将 Jina On-Prem 用于商业用途,请联系 Elastic 销售团队。
优化说明:
bash、python 等),并优化格式和换行,避免单行过长。