就是https://index-translate.bilibili.com/v1
这个接口
而B站把内部训练中的一堆模型都暴露出来了。总共7 个模型,其中 6 个明显是实验版本。
/v1/models 返回的完整列表
| 模型 ID | 猜测性质 |
|---|---|
Index-Translate-35B-A3B |
正式版,官方说的那个,35B MoE |
qwen35-2b-linear-merge |
2B 小模型,linear-attention 合并版实验 |
qwen35-9b-6624275-iter999 |
9B,第 999 步迭代的训练中间产物 |
qwen35-9b-v34-i0400-v1 |
9B,v34 版本,第 400 步 |
qwen35-2b-v34-i0480-v1 |
2B,v34 版本,第 480 步 |
qwen35-2b-grpo-hindsight |
2B,GRPO 强化学习 + hindsight 实验 |
index-homura-9b |
9B,"homura"是一个代号,不是翻译系列命名 |
几个猜想
1. 这些大概率是训练过程中的 checkpoints,不是正式发布版
命名规律是明显的:iter999、i0400、i0480 都是训练步数,v34 是版本号,grpo-hindsight 是强化学习算法。这是典型的实验产物 checkpoint 命名,不是对外承诺的产品名。
2. index-homura-9b 值得注意
其余都是 qwen35-* 或 Index-Translate-* 前缀,只有它叫 index-homura-9b。“Homura” 是个独立代号,说明 B站可能在做另一条产品线的东西,和翻译模型不是一回事。这可能是你感兴趣的部分。
3. 版本迭代很密
v34 这个数字说明至少迭代了 34 个版本。这套东西还在活跃训练中——也就是说:
- 你现在看到的能力随时会变
- 某个 checkpoint 随时可能被删
- 服务可能在训练期间重启或限流
#实际模型测试
| 模型 | 翻译 | 自我认知 | 通用能力 | 状态 |
|---|---|---|---|---|
Index-Translate-35B-A3B |
推荐 | |||
qwen35-9b-6624275-iter999 |
— | 可用 | ||
qwen35-9b-v34-i0400-v1 |
— | — | 可用 | |
qwen35-2b-v34-i0480-v1 |
— | — | 可用 | |
qwen35-2b-linear-merge |
— | 可用 | ||
index-homura-9b |
部分损坏 | |||
qwen35-2b-grpo-hindsight |
损坏 |
二、两个损坏样本
- qwen35-2b-grpo-hindsight
—— 灾难性退化同一个问题 1+1等于几?只回答数字。(temperature=0.8)
采样 5 次:
自我认知更是直接答成:
我是模型,开发者是 DeepMind,用于生成图像。
它不知道自己是谁,不知道自己是干嘛的,还会随机复读用户输入、混语言。
这是可能一次失败的 RL 实验——grpo-hindsight 这个命名说明是 GRPO 强化学习 + hindsight 经验回放,从结果看训练崩了,奖励模型可能把"重复用户输入"当成了高奖励行为。 - index-homura-9b —— 不稳定
首次测试时它对 写一个Python函数计算斐波那契数列第n项,用递归。 的响应是原样复读用户输入,一个字没改。
但换三个其他问题再测,又全部正常(还答对了 25×4=100,深度学习定义也表述准确)。
说明它是间歇性异常,不稳定,但没到 grpo 那种彻底崩坏。
三、对"homura 是什么"的判断修正
我前面猜测 index-homura-9b 是另一条产品线
现在看:
•它有完整的通用对话能力(不是纯翻译模型)
•自称通义千问
•翻译、数学、知识问答都行
但它的代号 homura 仍然是唯一不带 qwen35- 前缀的,而且行为有间歇异常。更可能的解释是:这是内部实验性命名(“焰”),规格上仍是 9B 量级的 Qwen 微调版,只是没走正式命名规范。
总结
这批 endpoint 是训练集群的裸暴露,不是产品化的 API。
原因如下:1.模型名带 iter999 / i0400 这种训练步数
2.混着 v34 这种内部版本号
3.有意料之外的损坏 checkpoint 被一并挂出来
4.无鉴权、无文档、模型列表里没有任何"正式/实验"标记也就是说:B站把一个训练中的模型注册表直接暴露在公网了。
你能调通的每个名字,都可能是某个还没验证完的中间产物。
实际使用建议:如果是翻译只认 Index-Translate-35B-A3B,其余六个别碰——尤其是 grpo-hindsight,拿它做任何生产用途都会出事。而且整个服务随时可能因为训练集群调整而变更或下线。
emmm……这对吗?


