目前完成了
- 修好并上线了 Go selector,过程中挖出两个真实 bug:
第一个是 relay 挂起(handleHTTP 把 bufio 缓冲里的 TLS ClientHello 丢了),之前就是它导致 100% 失败。第二个更隐蔽:两个版本的 inflight 计数都在拨号成功后就减掉了,而不是等 relay 结束。所以它只统计"连接建立"那一瞬,完全不统计"等待模型生成"这段真正耗时——这正是之前 120 并发负载下 inflight 还是 0 的原因,也让 watchdog 的触发信号变成废的。
修完后 100 并发下 inflight 真实显示 105-119/144,饱和度 73-83%。
指标 Python(旧) Go(新)
RSS 20MB 13MB
relay p50 2448ms 1014-2224ms
inflight 准确性 错 对 - 建好了容量感知的自动故障转移(pool-watchdog 服务):
参数 值 说明
检查周期 15s
追加阈值 饱和度 >65% 连续 4 次(1 分钟) 或 2 分钟内出现 ≥5 次 429
撤销阈值 饱和度 <25% 连续 8 次(2 分钟) 滞回避免抖动
容量计算 健康隧道数 × 每隧道上限 动态,隧道增减自动跟随
福利环节
请大家随意测试(除了grok以外的任意一个模型)
最高并发,无限额度
使用余额花费0能量购买即可
打开 TokenTokenBond · AI API 网关
选择 套餐 [疯狂(限时 5H) ]
选择使用余额支付即可(并不会扣费)

