负载均衡 | Answer

WebSocket连接为何总是在关键时刻断开：从代理超时到心跳机制的完整生存指南

2017年，Chromium团队在Chrome 56版本中做了一个激进的决定：对后台标签页实施严格的定时器节流。这个旨在提升电池续航的改动，意外暴露了一个被忽视多年的问题——大量依赖WebSocket的实时应用在标签页切换后突然失联。 ...

2018年，一个技术团队在生产环境遇到了一个诡异的现象：每当数据库响应变慢，整个服务集群就会在几分钟内完全瘫痪。排查后发现，罪魁祸首是健康检查——当数据库变慢时，应用的健康检查端点开始超时，负载均衡器将服务器标记为不健康，剩余服务器承受更多流量，进一步恶化，形成恶性循环。 ...

一个运行良好的 WebSocket 服务，突然在凌晨三点开始大面积掉线。日志里只有 “connection reset” 的报错，没有任何其他线索。你检查了服务器状态——CPU 正常，内存充足，网络畅通。重启服务后一切恢复，但第二天凌晨同一时间，问题再次出现。 ...

凌晨3点，你被电话叫醒——生产环境的核心服务大面积报错，错误日志里全是Connection reset by peer和ETIMEDOUT。你花了四个小时排查，发现罪魁祸首是一个从未被关注的超时配置：某台负载均衡器的空闲超时从60秒被改成了30秒，而你的数据库连接池配置的是55秒心跳间隔。 ...