模型生命周期

Kimi K3

发布于 2026-07-16 · 返回 Kimi

精确版本信号覆盖 2026-08-07–2026-09-03 · n=481

统计窗口:2026-08-07 00:00:00 至 2026-09-04 00:00:00 UTC · 评分方法:experience_score_v2。

趋势历史仍在收集中 当前窗口已达到要求;用于判定的独立分段已有 2/4 个。

生命周期每日更新 · 最新完整 UTC 日期 2026-09-03

固定 14 天基准
60.6
n=156
最近 28 天
62.7
n=481
较基准变化
+2.1
90 天斜率
分 / 30 天

14 天滚动体感趋势

每个每日更新的点汇总此前 14 个完整 UTC 日。虚线是固定发布基准;正式趋势判决仍使用互不重叠的独立 14 天分段。

从 2026-08-13 到 2026-09-03 的 14 天滚动体感趋势;最新分数 64.3,固定基准 60.6。40506070固定基准 60.62026-07-30–2026-08-13 · 60.6 · n=1562026-07-31–2026-08-14 · 60.5 · n=1832026-08-01–2026-08-15 · 61.8 · n=1922026-08-02–2026-08-16 · 61.1 · n=2072026-08-03–2026-08-17 · 60.5 · n=2282026-08-04–2026-08-18 · 61.3 · n=2422026-08-05–2026-08-19 · 61.0 · n=2682026-08-06–2026-08-20 · 61.2 · n=2802026-08-07–2026-08-21 · 62.6 · n=2812026-08-08–2026-08-22 · 62.2 · n=2792026-08-09–2026-08-23 · 60.8 · n=2702026-08-10–2026-08-24 · 61.9 · n=2662026-08-11–2026-08-25 · 62.5 · n=2622026-08-12–2026-08-26 · 64.2 · n=2452026-08-13–2026-08-27 · 64.0 · n=2162026-08-14–2026-08-28 · 64.8 · n=1932026-08-15–2026-08-29 · 64.5 · n=1992026-08-16–2026-08-30 · 65.5 · n=1902026-08-17–2026-08-31 · 64.2 · n=1952026-08-18–2026-09-01 · 61.7 · n=2072026-08-19–2026-09-02 · 64.0 · n=1982026-08-20–2026-09-03 · 64.3 · n=20008-1308-1708-2108-2508-2909-0209-03

用于趋势判定的独立 14 天分段已就绪 2/4 个。

哪些维度解释了变化

分别展示各维度内部的口碑变化与讨论构成变化。这是观察性贡献,不是因果证明。

主要负向口碑贡献:速度与延迟。

维度 基准 → 当前 维度变化 权重占比 口碑变化贡献 讨论构成贡献
速度与延迟 基准 → 当前34.9 → 34.1n=30 → 95 维度变化−0.8 权重占比21.4% → 20.7% 口碑变化贡献−0.16 讨论构成贡献+0.18
编程 基准 → 当前63.6 → 68.5n=20 → 60 维度变化+5.0 权重占比13.4% → 13.1% 口碑变化贡献+0.65 讨论构成贡献−0.02
推理 基准 → 当前80.3 → 86.4n=36 → 97 维度变化+6.1 权重占比24.1% → 20.8% 口碑变化贡献+1.36 讨论构成贡献−0.77
通用文本 基准 → 当前57.6 → 65.2n=53 → 189 维度变化+7.7 权重占比31.4% → 37.7% 口碑变化贡献+2.64 讨论构成贡献+0.07
图像/视觉 基准 → 当前样本不足n=0 → 3 维度变化 权重占比 口碑变化贡献 讨论构成贡献
本地部署 基准 → 当前样本不足n=7 → 18 维度变化 权重占比 口碑变化贡献 讨论构成贡献
角色扮演/创作 基准 → 当前样本不足n=4 → 9 维度变化 权重占比 口碑变化贡献 讨论构成贡献
安全与拒答 基准 → 当前样本不足n=6 → 10 维度变化 权重占比 口碑变化贡献 讨论构成贡献
视频生成 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献

样本不足维度的未解释贡献:−1.86 分。

生命周期分沿用主指数的体验信号权重,n≥30 后不做样本收缩。它衡量公开用户感知,不代表模型能力,也不能证明后端原因。