-
在阿里云上装 Tailscale,阿里云自己的内网服务全被挡掉了
想把一台闲置的阿里云机器改成服务监控,装上 Tailscale 之后,DNS、apt 镜像、镜像仓库接连不通。原因是阿里云把内网服务放在 100.64.0.0/10,和 Tailscale 用的是同一个网段,Tailscale 的一条防伪造规则把它们的回包全丢了。记录一下排查过程,以及最后用的 Tailscale 官方方案。
-
升级完客户端,redis 又开始大量返回 MOVED:一个埋了七个月的本地配置
上一篇把 redis-py 升到 8.x 之后卡死的问题收住了,但集群上还剩一条错误曲线:42% 的读命令被 MOVED 重定向,连接活不过 1 秒,用户画像在业务无感知的情况下丢失。先后怀疑了 socket 超时、拓扑重建、客户端内部状态,每一个都能在跳板机上做出类似的现象,但都和线上的证据对不上。最后把问题定下来的,是容器启动日志里的一行 INFO。
-
redis加了个分片,把线上写挂了一个多小时
Redis 内存满了,清了一轮冷数据只下来 5 个 G,索性直接加一个分片扩容。结果 slot 刚开始迁移 12 秒,推荐服务的 ZADD 就开始疯狂报错。以为是服务没感知到新节点,重启一下就好,结果重启完还在报。顺着那句"reachable node:None"往下挖,最后挖到 redis-py 客户端里一行"节点超时就从名单里删掉"的代码上。
-
一次同步阻塞的调用,冻住了整个事件循环
服务莫名其妙被批量摘流重建,数据库看着也挺稳定,排查了半天才发现是一个第三方 SDK 在 async 函数里悄悄做了同步阻塞调用,把事件循环冻住了几秒钟,牵连出一整条雪崩链路
-
如何优雅地在本地 GUI 客户端连接 AWS / GCP 的内网 Redis
告别繁琐易断的 SSM 端口转发,教你用 SSH 隧道给桌面客户端配置丝滑的多环境 Redis 直连
-
一次生产 Redis 内存打满的排查、清理和复盘
线上 Redis 内存到了 99.98%,开始逐出数据。先用 SCAN 把内存分布摸清楚,再按 LRU 空闲时间清掉一半冷数据释放 4GB,最后复盘背后的几个架构问题
精选文章
联想510smini小主机
自己总结的命名规范希望能给大家参考
为什么电子垃圾往往会有第二春
开源软件
自动缓存方法数据注解