我正试图确定为什么这个警报(NodeClockNotSynchronising)要为我准备好的几个VM开火。(不只是少数人,这很奇怪)
根据导出的指标,我看到:
# HELP node_timex_sync_status Is clock synchronized to a reliable server (1 = yes, 0 = no).
# TYPE node_timex_sync_status gauge
node_timex_sync_status 0我可以在其中一个VM中执行ssh,ntpd正在运行,date命令返回正确的时间。
因此,深入研究timex收集器文档和代码,这里是“失败”的地方:
var syncStatus float64
var divisor float64
var timex = new(unix.Timex)
status, err := unix.Adjtimex(timex)
if err != nil {
return fmt.Errorf("failed to retrieve adjtimex stats: %w", err)
}
if status == timeError {
syncStatus = 0
} else {
syncStatus = 1
}由于syncStatus为0,因此正在触发警报。对adjtimex() syscall的返回代码做了一些深入研究:
#define TIME_ERROR 5 /* clock not synchronized */为什么内核在运行TIME_ERROR和时钟同步时返回ntpd?任何帮助都是非常感谢的。
发布于 2020-11-22 19:43:01
无论您正在运行的ntpd是什么,内核时间规则都是报告一个错误。
有关API和相关常量,请参见man ntp_adjtime。
在Linux上,这可能来自NTP或PPS。让我们假设NTP,并进一步假设错误状态是STA_UNSYNC,不同步。这是设置在启动。如果系统调用是用ADJ_OFFSET模式完成的,换句话说,如果ntpd试图逐步更改时钟,则清除。这是没有道理的,所有的时钟将至少有点差。
回顾一下你的/etc/ntp.conf。通过server或pool指令确保它包含4个或4个以上的源。删除以不受约束的本地时钟开头的任何server 127.127.1。LOCL已经过时,大多数服务器时钟并不令人惊异,而且0偏移量可能正在阻止不同步被清除。
重新启动ntpd并等待两分钟。与使用ntpq -p或chronyc sources -v的NTP服务器相比,观察偏移量应该是单数或两位数ms,而不是零。
再查一遍日期。尝试一下,不要混淆时区:date --utc
https://serverfault.com/questions/1043358
复制相似问题