暂无搜索历史
CPU 100%、接口 502、数据库连接池耗尽、消息堆积……值班同学第一反应往往是:先把服务重启了再说。
接口 P99 从 200ms 飙到 5s,错误率一路上涨。值班同学冲进群里,开始查日志、重启服务、扩容、回滚。
最后大家发现:真正的问题不是没人知道怎么处理,而是知道的东西根本没有变成可以执行的东西。
很多公司都知道 SLO 很重要,但真正让他定 SLO 的时候,最后往往变成一句话:
你以为自己是在排查故障,实际上可能顺手把手机号、身份证号、邮箱、Token、Cookie、用户地址、订单信息、支付信息,甚至整个请求体,都复制到了自己的电脑、群...
我是 Echo_Wish,关注我,聊点真正落地的 AI、Python、云原生、DevOps 和数据平台实战。
很多公司一看到 Spark、Flink、Hive、Trino 作业跑得慢,第一反应是什么?
Kafka、Flink、Spark、Hive、ClickHouse、Doris、Elasticsearch、对象存储……一个个都接进来了。
今天我们就聊聊,时序数据库到底在监控系统里干什么,以及 Prometheus TSDB 到底是怎么通过压缩,让几十亿个监控数据点不至于把你的硬盘吃光。
所以生产环境更推荐使用 Vitess Operator 或官方生态提供的 Kubernetes 管理方式。
于是开始上调度平台、写 ETL、接 Kafka、搞 Airflow、配监控,再整几个告警机器人。
数据库运维自动化,到底应该怎么做 Schema 在线变更,以及如何保证新旧代码兼容?
为什么 Kubernetes 里面挂一个 PVC,看起来都是磁盘,背后却可能是完全不同的存储系统?
但如果把场景换成边缘设备——工厂里的工业网关、摄像头、AGV、边缘服务器、门店终端、IoT 网关……
大家做边缘计算、IoT、工业互联网的时候,经常会遇到一个看起来特别简单、实际上非常容易踩坑的问题:
可一旦到了工业现场、智能摄像头、IoT 网关、5G MEC 这些场景,问题就出来了:
以前我们做安全,天天盯着服务器、容器、端口、防火墙;到了 Serverless,攻击面开始往函数代码、第三方依赖、身份权限、事件入口这些地方转移。
冷启动、事件丢失、消息重复、幂等、可观测性、链路追踪、事件顺序、失败重试、死信队列……
暂未填写公司和职称
暂未填写学校和专业