1. 升级完客户端,redis 又开始大量返回 MOVED:一个埋了七个月的本地配置

    上一篇把 redis-py 升到 8.x 之后卡死的问题收住了,但集群上还剩一条错误曲线:42% 的读命令被 MOVED 重定向,连接活不过 1 秒,用户画像在业务无感知的情况下丢失。先后怀疑了 socket 超时、拓扑重建、客户端内部状态,每一个都能在跳板机上做出类似的现象,但都和线上的证据对不上。最后把问题定下来的,是容器启动日志里的一行 INFO。

    2026/09/05

  2. redis加了个分片,把线上写挂了一个多小时

    Redis 内存满了,清了一轮冷数据只下来 5 个 G,索性直接加一个分片扩容。结果 slot 刚开始迁移 12 秒,推荐服务的 ZADD 就开始疯狂报错。以为是服务没感知到新节点,重启一下就好,结果重启完还在报。顺着那句"reachable node:None"往下挖,最后挖到 redis-py 客户端里一行"节点超时就从名单里删掉"的代码上。

    2026/09/03

  3. 一次同步阻塞的调用,冻住了整个事件循环

    服务莫名其妙被批量摘流重建,数据库看着也挺稳定,排查了半天才发现是一个第三方 SDK 在 async 函数里悄悄做了同步阻塞调用,把事件循环冻住了几秒钟,牵连出一整条雪崩链路

    2026/08/22

  4. 如何优雅地在本地 GUI 客户端连接 AWS / GCP 的内网 Redis

    告别繁琐易断的 SSM 端口转发,教你用 SSH 隧道给桌面客户端配置丝滑的多环境 Redis 直连

    2026/08/21

  5. 一次生产 Redis 内存打满的排查、清理和复盘

    线上 Redis 内存到了 99.98%,开始逐出数据。先用 SCAN 把内存分布摸清楚,再按 LRU 空闲时间清掉一半冷数据释放 4GB,最后复盘背后的几个架构问题

    2026/08/21

  6. 一次内存缓慢泄漏的排查:每次都 new 一个 OpenAI 客户端,问题出在事件循环上

    排查一个服务的内存缓慢泄漏,翻到同事写的一段后台富化逻辑:每次调用都现造一个 AsyncOpenAI 客户端,连接池悄悄堆成了泄漏。想直接缓存客户端复用却发现根本行不通,根子出在事件循环的生命周期上

    2026/08/19

联想510smini小主机

自己总结的命名规范希望能给大家参考

为什么电子垃圾往往会有第二春


自动缓存方法数据注解