首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏深度学习与python

    一文看懂业界在离线技术

    而在离线技术作为提升资源利用率、降低成本的有效方案,受到业界的一致认可和推荐。 什么是在离线 企业的 IT 环境通常运行两大类进程,一类是在线服务,一类是离线作业。 由此可见,在离线的成本价值是清晰可计算且收益巨大的。 业界实践来看,谷歌利用技术将资源利用率从 10% 提升到 60%,每年节省上亿美金。 阿里等大厂也成功借助部将资源利用率提升了 3 倍以上,成本节省可观。 在离线技术门槛 在离线虽然有明显的成本价值,但目前真正落地到生产环境的还是只有头部的一些大厂。 究其原因,主要是在离线涉及服务观测、调度部署、容灾治理等多方面底层技术难题,甚至还包括组织成本核算、跨部门协同等非技术问题,有较高的实施门槛。 如果公司研发团队在底层技术积累比较少,想快速、安全、低成本地用上在离线,先享受部分的成本优化红利,则独占内核 + 容器 + 动态决策组合的方案是首选。

    1.9K31编辑于 2022-03-22
  • 来自专栏腾讯云原生团队

    之殇-论云原生资源隔离技术之CPU隔离(一)

    导语 ,通常指在离线(也有离在线之说),意指通过将在线业务(通常为延迟敏感型高优先级任务)和离线任务(通常为 CPU 消耗型低优先级任务)同时混合部署在同一个节点上,以期提升节点的资源利用率 其中的关键难点在于底层资源隔离技术,严重依赖于 OS 内核,而现有的原生 Linux kernel 提供的资源隔离能力在面对需求时,再次显得有些捉襟见肘(或至少说不够完美),仍需深度 Hack,方能满足生产级别的需求 也是业界非常热门的话题和技术方向,当前主流的头部大厂都在持续投入,价值显而易见,也有较高的技术门槛(壁垒)。 相关技术起源甚早,颇有渊源,大名鼎鼎的 K8s(前身 Borg)其实源于 Google 的场景,而从的历史和效果看,Google 算是行业内的标杆,号称 CPU 占用率(均值)能做到60%,具体可参考其经典论文 技术挑战 如前面所说,场景中,底层资源隔离技术至关重要,其中的“资源”,整体上分为4个大类: CPU Memory IO 网络 本文聚焦于 CPU 隔离技术,主要分析在 CPU 隔离层面的技术难点、

    4K94发布于 2021-05-10
  • 来自专栏腾讯云原生团队

    年终大禧 | 腾讯云 Crane 国内首批通过云原生技术评估

    腾讯云自 2015 年起在混领域进行探索,在支撑海量自研业务上云的过程中广泛使用。目前管理规模已达数千万核,能力使服务器资源利用率从30% 提升至 65%。 《云原生技术能力要求》标准的由来 随着企业数字化转型工作深入推进,企业正在通过精细化的资源管理、跨集群跨地域资源协同、灵活快捷的资源编排调度,以及异构资源共享复用等方式,实现灵活的弹性资源供给、更加智能的应用自动部署 云原生解决方案依托容器、微服务、平台编排调度等云原生技术,帮助用户将业务负载与大数据分析、人工智能计算等不同优先级的应用混合部署到共享的基础设施上,提高资源利用率,实现“降本增效”。 在此背景下,中国信通院牵头,联合腾讯云等多家云服务商,经过多轮研讨,形成了《云原生技术能力要求》标准。 标准涉及基础设施能力要求、平台能力要求、业务应用能力要求,以及效果评价四个部分,从资源隔离、资源复用、干扰检测、负载反馈、任务调度、资源预测、应用服务质量等不同维度,对产品及解决方案进行全面评估

    1.8K30编辑于 2023-01-30
  • 来自专栏张善友的专栏

    搭.NET技术

    因此我也在社区里极力推广Mono平台,这篇短文就想和大家一起讨论一下搭.NET技术搭(Mashup)架构是一种新型的集成各种技术的应用开发架构。 3、搭.NET开源社区技术 Stack Overflow 主要使用微软的.NET技术搭.NET开源社区的技术。 ServiceStack.redis,它是Stack Exchange的一位开发者Demis Bellot 所开发的开源的、支持.NET与Mono平台的REST Web Services框架ServiceStack 的一分 不过只有象StackExchange 具备丰富的技术能力的专业团队,才能很好的完成搭,让后期的使用安枕无忧。 任何一个技术方案,管理都会有风险,搭当然也会有。 因此,在进行搭创新之前,首先要对搭的技术有一个准确的评估,比如你的技术方案与要搭创新的技术之间有没有优势互补,微软在2011年以前经常是复制社区的技术,一个微软技术的使用者局限于微软的技术,这就好比是近亲繁殖

    1.5K60发布于 2018-01-19
  • 来自专栏腾讯大数据的专栏

    Caelus—全场景在离线解决方案

    引言:集群管理的一个重要目标是提高资源利用率,随着集群规模的扩大,基础设施成本上涨,资源利用率问题逐步突显,为降低成本,技术应运而生。 本篇文章结合腾讯技术团队在混方面的落地和实战经验,来介绍各类场景下在线离线的相关概念、面临的问题及技术方案,抛砖引玉,供大家交流。 领域的喜马拉雅山是Google Borg,其在2019年发布的论文Borg中,集群的cpu利用率通过技术达到50%。 如何通过技术提高集群利用率,是每家集群大规模后不可避免的问题。      各家大厂都对投入了相当长的时间研究,才开始放量铺开。随着技术的发展,k8s也越来越成熟,将来也会有更多的场景落地。

    9.9K71发布于 2020-12-14
  • 来自专栏深度学习与python

    4 个月节省千万成本的机器学习实践

    在今年 9 月份的 QCon 全球软件开发大会(北京站),贝联珠贯 (www.lccomputing.com) 合伙人王元良老师以《增强型 RunC 的最佳实践:克服离线高压力场景的关键挑战》为题, 二级告警,LCC-Agent 通知 NM NM 会调整心跳时间 NM 会根据任务的优先级,优先 KILL 低优先级任务 三级告警,LCC-Agent 直接 kill 非白名单进程 机器夯死问题得到解决,解决掉最关键的资源卡点问题 集群维度感知,先于业务发现问题 前期为了了解客户集群中的各种资源问题状态,我们采用手动脚本单台机器日志并聚类的方式来拿到结果;这种方式耗时长 (两周一次)、只能分析问题大类、没法观察问题走势和分布等 后单机压力与复杂度指数级上升,需要高频全视角的分析问题,这种方式不再适用。需要一套能分钟级展示、多视角、自动聚类分析的手段,包括时间对比、子系统分布、问题大类、问题子类、业务角度等。 尽管这个方案技术上很合理,但工作量较大,无法满足业务四个月上线的目标。 将 YARN 部署为 Kubernetes 中的服务,并由 Kubernetes 进行管理。

    85010编辑于 2023-10-02
  • 来自专栏架构狂人

    集群 CPU 利用率均值达 45% ,揭秘小红书规模化技术实践

    基于以上背景,为了帮助业务降低资源使用成本,小红书容器团队从 2022 年开始规模化落地技术,提升集群 CPU 利用率。 技术演进 小红书技术演进分为以下四个阶段(如图所示): 阶段一:闲置资源再利用 在早期,小红书的集群资源管理相对粗放,集群中存在大量业务独占的资源池。 通过合池、资源超卖等技术手段,我们有效提升了 CPU 分配率,但依旧无法解决合并后的资源池夜间利用率较低等问题。另外,在合池后的复杂场景下,整机腾挪、分时离线的调度策略很难再继续实施。 通过采用更先进的弹性、、超卖等技术手段,进一步提升集群资源利用率,实现资源成本的大幅度下降。 作者简介 桑铎(宋泽辉):基础技术/云原生平台 小红书资源调度负责人,在容器资源调度、部署、资源隔离等方面有丰富的实践经验,目前主要负责小红书大规模容器资源调度、在离线等方向的技术研发工作。

    1.5K10编辑于 2023-11-29
  • 来自专栏云计算技术笔记

    谷歌Borg论文阅读笔记(二)—— 任务和资源隔离

    相关笔记:谷歌Borg论文阅读笔记(一)—— 集群操作系统 Google的情况 Google几乎所有的机器都是的,在一台机器上,可能运行着不同jobs的tasks。 因此,Google有完善的隔离技术来保证task之间不相互影响。目前,Google使用的隔离技术是Chroot和Cgroup。Cgroup是Google最先提交到内核社区的。 性能影响 对于性能的影响,Google使用了很多技术来减少影响,这个是文章后面详细讲的。这里主要讲的是Google对任务对CPU性能影响的研究。 资源分类 的一大问题是某个资源不足的情形。但是,不同的资源有不同的特点,有的资源能快速调整,而有的则需要很大的代价来调整。 总结 应用,尽可能使用多线程。 使用轻量级的隔离机制,而不是VM。 合理的对资源超分配,以此提高资源利用率。很多任务并不是任何时刻都会用到很多资源。 对任务和资源进行分级。

    1.2K30编辑于 2022-09-07
  • 来自专栏腾讯云原生团队

    6月直播专场来了|腾讯基于 K8s 的全场景在离线技术实践

    6月初初到来,我们集结了一批技术专家,为技术爱好者们精心策划了一场大数据云原生专场——腾讯基于K8s的全场景在离线技术实践。 腾讯大数据,基于多年在混技术积累的实践经验与基于 Kubernetes 的全场景在线离线解决方案,对 K8s 零入侵,兼容各种场景(容器化、非容器化等),已经在腾讯内部业务多方落地,节约了上亿成本 · 直播流程 · 19:30-20:15 讲师分享  20:15-20:30 互动问答 · 听众收益 · 了解云原生场景下在线离线的意义、全场景,及设计原则; 了解Caelus方案的整体设计思路 ,及关键功能模块解析,包括在线预测、资源隔离、干扰检测等; 了解Caelus在落地过程的实践经验,及未来的发展方向。 · 直播流程 · 19:30-20:15 讲师分享  20:15-20:30 互动问答 · 听众收益 · 了解在离线场景中调度系统的需求与痛点 了解在离线场景中调度系统的整体设计思路,离线调度器的整体架构与优化点

    1.3K20发布于 2021-06-10
  • 来自专栏Vehicle攻城狮

    聊聊48V技术

    48V技术作为节油减排的一种有效手段,在日益严苛的排放要求,由其是我国国六排放法规的推行下,已得到国内大多数OEM的青睐,今天就跟大家聊聊48V技术。 2、节能减排的压力,近年来各国的排放法规已日益严苛,单纯通过提高发动机热效率的技术手段已非常困难和有限。 近段时间以来,由其是国六排放法规推行之际,可以明显感受到OEM对48V技术的热情,OEM越来越青睐于48V的原因是对成本和收益的双重考虑和权衡。 首先,48V系统只需对整车做小幅的改造即可集成,而且48V相比高压技术不需要额外的保护措施,零件成本也明显低于高压动部件,大约是其1/3,但收益却接近高压技术的2/3。 例如奥迪在其A6、A8及SQ7等不同车型上都标配48V轻技术,不同车型上会有不同的48V系统集成方案。

    97640编辑于 2022-04-19
  • 来自专栏深度学习与python

    集群 CPU 利用率均值一年提升 25%,小红书技术的优解方案

    基于以上背景,为了帮助业务降低资源使用成本,小红书容器团队从 2022 年开始规模化落地技术,提升集群 CPU 利用率。 技术演进 小红书技术演进分为以下四个阶段(如图所示): 阶段一:闲置资源再利用 在早期,小红书的集群资源管理相对粗放,集群中存在大量业务独占的资源池。 通过合池、资源超卖等技术手段,我们有效提升了 CPU 分配率,但依旧无法解决合并后的资源池夜间利用率较低等问题。另外,在合池后的复杂场景下,整机腾挪、分时离线的调度策略很难再继续实施。 通过采用更先进的弹性、、超卖等技术手段,进一步提升集群资源利用率,实现资源成本的大幅度下降。 作者简介 桑铎(宋泽辉):基础技术 / 云原生平台 小红书资源调度负责人,在容器资源调度、部署、资源隔离等方面有丰富的实践经验,目前主要负责小红书大规模容器资源调度、在离线等方向的技术研发工作

    1.1K10编辑于 2023-12-01
  • 来自专栏三掌柜的技术空间

    【玩转腾讯元大模型】腾讯元大模型:技术代码实践与应用

    目录前言国产大模型进入长跑期,从参数至上转向实用优先有价值的技术代码实战经验分享基于腾讯元大模型的技术开发实践、新颖的技术场景应用对腾讯元大模型的深入理解和代码使用技巧番外篇:发现腾讯元的友好之处结束语前言随着去年腾讯推出的元大模型以来 ,越来越多的开发者都在使用它,通过大家使用之后的反馈来看,腾讯元的表现非常抢眼,而且腾讯元大模型作为国内领先的自然语言处理模型之一,已经在技术圈和业界引起了大家广泛的关注和应用。 本文将从三个方向分享与腾讯元大模型相关的实际开发中代码的使用实践,其中包括有价值的实战经验、基于该模型的技术开发实践与应用,以及对腾讯元大模型的深入理解和代码使用技巧的分享等。 下面分享一下腾讯元大模型微信小程序的应用界面一角:有价值的技术代码实战经验分享先来通过技术代码实践相关来分享使用腾讯元大模型的体验,在与腾讯元大模型的技术代码实践中,以自然语言处理为例,我们可以了解如何使用腾讯元大模型进行文本生成 基于腾讯元大模型的技术开发实践、新颖的技术场景应用再来分享一下基于腾讯元大模型的技术开发实践、新颖的技术场景应用的体验,大家都知道腾讯元大模型的强大功能为开发者提供了广阔的技术开发实践和应用空间,

    2.3K53编辑于 2024-01-31
  • 来自专栏腾讯大数据的专栏

    助力成本优化,腾讯全场景在离线系统Caelus正式开源

    由于很多大数据任务具有实时性要求不高、运行时间较短、使用碎片资源等特点,而在线应用的资源使用通常具有潮汐的特点,因此大数据任务比较适合复用在线应用的空闲资源,但也面临诸多核心技术难题,具体包括: 大部分系统只针对云原生场景 ,限制了可以的场景; 在内核层、容器层缺乏完善的资源隔离、热迁移等机制,导致容易发生干扰,且处理干扰代价高; 调度器缺乏在离线应用调度的兼容性、高性能以及SLA保证。 解决这些问题,也是Caelus研发的初衷。 充分兼容的架构设计 Caelus Caelus为了适应各种的场景,遵循了几个关键原则,主要包括: 不改变业务使用方式,便于业务迁移到Caelus平台。 扫码关注 | 即刻了解腾讯大数据技术动态

    1.6K40发布于 2021-11-10
  • 来自专栏腾讯开源的专栏

    助力成本优化,腾讯全场景在离线系统Caelus正式开源

    对此,业内一直在进行诸多探索,在线离线被认为是解决该问题的终极方案。 由于很多大数据任务具有实时性要求不高、运行时间较短、使用碎片资源等特点,而在线应用的资源使用通常具有潮汐的特点,因此大数据任务比较适合复用在线应用的空闲资源,但也面临诸多核心技术难题,具体包括: 1 .大部分系统只针对云原生场景,无法利用大量非容器化的在线空闲资源; 2. 调度器缺乏在离线应用调度的兼容性、高性能以及SLA保证。 解决这些问题,也是Caelus研发的初衷。 充分兼容的架构设计 Caelus为了适应各种的场景,遵循了几个关键原则,主要包括: 1. 不改变业务使用方式,便于业务迁移到Caelus平台。

    82041发布于 2021-11-18
  • 来自专栏腾讯云原生团队

    TKE 算力集群:新一代跨集群资源引擎

    针对上述难题,业界公认的解决方式是 “在离线技术(如 Koordinator,Caelus,Katalyst,Crane)。 但并非“银弹”,当企业将能力从单个集群扩展到全局多个集群时,资源仍然被物理集群边界锁死。 面对企业级多元业务的资源运营困境,TKE 首创全新产品形态“算力集群”,通过整合“在离线(深度利用)” 与 “跨集群调度(广度扩展)” 两大技术支柱,致力于整合全局资源,在统一的调度平面下将分散在不同业务集群中的闲置算力池化 方案默认集成了多集群资源管理、Crane 扩展调度 、隔离保障的 RUE 内核以及超大规模集群管控功能,全面降低用户在跨集群管理、资源调度和在离线上的维护复杂度。 全局视图统一管理资源:通过穿透集群边界将分散在各个集群的闲置CPU、GPU节点资源抽象为虚拟节点(vNode),在上层形成全局算力池统筹管理闲置资源。

    1.2K20编辑于 2025-10-31
  • 来自专栏腾讯云原生团队

    qGPU 容器产品全量上线,重磅发布 GPU 在离线功能

    徐蓓,腾讯云容器技术专家,腾讯云异构计算容器负责人,多年云计算一线架构设计与研发经验,长期深耕 Kubernetes、在离线与 GPU 容器化领域,Kubernetes KEP Memory QoS GPU 在离线技术,在充分保证业务安全、稳定的前提下,将 GPU 利用率提升到了极致。 除此之外,腾讯云 qGPU 创新性的将在离线混合部署技术与 GPU 相结合,在业界首次实现了 GPU 在离线的方案,将 GPU 容器共享技术推进到了下一个纪元。 可以说,腾讯云 qGPU 在离线是提升 GPU 利用率的创新性的突破技术。 腾讯云 qGPU 立足 AI 领域,依托 GPU 资源细粒度调度、GPU 资源强隔离、GPU 在离线技术产品,通过为企业提升 GPU 使用效率,释放 AI 算力生产力,最终帮助企业带来持续和不断的巨大商业价值

    1.6K30编辑于 2022-03-10
  • 来自专栏云原生

    腾讯云Serverless容器实战(如何提升集群利用率至65%)

    本文将深入剖析腾讯云团队如何借助Serverless容器技术与深度策略,在保障核心业务SLA的前提下,将生产集群利用率稳定提升至65%以上,并分享实战中沉淀的关键技术与踩坑经验。 四、稳定性守卫:多维熔断与逃生机制的最大风险在于资源争抢导致在线业务抖动。 五、效果验证:从理论到生产的数据飞跃在日均百亿请求的电商核心集群落地方案:指标 后 提升幅度集群CPU利用率 22% 68% 监控告警黄金指标在线业务: API延迟(P99)、错误率、Pod Throttle次数离线任务: Job完成率、周期内完成时长、OOM Kill次数系统层: 节点(逻辑)资源争抢率、调度器Pending时长不是单纯的技术叠加 腾讯云的实践印证:在Serverless架构的深水区,精细化运营与技术创新同等重要。本文基于腾讯云某头部电商客户真实场景实践,数据已脱敏。方案需结合业务特性深度调优,不可直接复制参数。

    65810编辑于 2025-07-08
  • 来自专栏腾讯云原生团队

    【云原生下离在线实践系列】深入浅出 Google Borg

    作者徐蓓,腾讯云专家工程师,长期从事云计算 IaaS、PaaS 架构和研发工作,现负责腾讯云 TKE 资源调度、离在线、大数据云原生化等领域。 Google Borg 是资源调度管理和离在线领域的鼻祖,同时也是 Kubernetes 的起源与参照,已成为从业人员首要学习的典范。 Isolation 由于 Google Borg 天生就考虑场景,所以资源隔离对其尤为重要。 Google Borg 作为 Google 内部的经验结晶,系统的阐述了应有的基本形态,很有启发意义。 后续会持续分享相关的理论和实战经验。

    2.3K21发布于 2020-05-26
  • 趣丸科技:基于TKE三层架构实现CPU利用率跃升至50%以上的技术实践

    为了通过“错峰填谷”提升集群资源利用率并降低运营成本,企业必须引入离在线(将在线与离线应用部署在同一集群/节点)。 部署三层架构:以“调度优先、隔离辅助”重塑资源分配 针对上述痛点,趣丸科技依托腾讯云实施了“依托于云,拥抱社区”的策略,确立了调度优先、隔离为辅助的总体方案。 该方案通过构建完整的三层架构,实现了从集群级调度到节点级隔离的全面覆盖: 集群级调度优化(TTSet离在线调度系统): 企业自研了TTSet调度系统。 依托千万核级技术沉淀:提供原生化与高可靠的底层支撑 架构的成功落地,不仅依赖于上层的调度策略,更需要坚实的底层基础设施保障。 趣丸科技选择基于腾讯云底座进行改造,核心逻辑在于: 深厚的技术沉淀背书: 腾讯云TKE容器服务团队依托千万核容器运维的技术沉淀,为云原生节点提供了原生化、高稳定、快响应的K8s节点管理能力。

    18110编辑于 2026-05-30
  • 来自专栏伪架构师

    Volcano:在离线作业管理平台,实现智能资源管理和作业调度

    随着云原生技术的发展,混合部署成为了降低成本的一大手段。本文结合华为云云原生团队在混合部署方面的研究和实战,介绍了混合部署的背景、概念、技术的设计方案和实际落地情况,以及对未来的计划和展望。 基于Volcano混合部署解决方案如下图所示: 图 3 基于Volcano混合部署架构 02 Volcano调度能力 目前Kubernetes的默认调度器是以Pod为单位进行调度的,不区分Pod中运行的业务类型 因此无法满足场景对资源分配的特殊要求。 资源超卖及在离线作业必然会导致不同作业之间的相互干扰,因此除了通过cgroup进行资源隔离之外,kubelet同时会实时采集节点上物理资源使用率,根据不同的情况驱逐离线作业,提前释放相应资源,防止对在线作业的 htm [4] 中国数据中心行业研究报告2020年: https://pdf.dfcfw.com/pdf/H3_AP202012161440695500_1.pdf [5] 王康瑾,贾统,李影.在离线作业调度与资源管理技术研究综述

    2.1K20编辑于 2022-04-15
领券