← 全部模型

Claude · 近 7 天

Claude Opus 5

0–100 分,越高代表社区使用体验越正面,不代表能力测试成绩。

更新于 2026-09-09 16:10 UTC · 2026-09-02 – 2026-09-09 UTC
社区口碑分32.7/100184 条评论 · 近 7 天

截至 2026-09-09 16:00:04 UTC,Claude 家族的 Claude Opus 5 在近 7 天有 184 条明确归属该版本的社区反馈,社区口碑分为 32.7/100。部分有效分类评分:通用文本 16.4/100 (n=96);编程 52.9/100 (n=30);推理 56.2/100 (n=34)。 评分方法与数据来源

社区评论

精选近 7 天的不同意见,摘录条数不代表真实好评比例。

7 条精选摘录

负面通用文本

“最令人费解且充满行话的输出”

Redditen机器翻译
展开原文

most convoluted and jargon-filled output

负面通用文本

“在Opus 5这类情况下,几乎不可能超越”

Hacker Newsen机器翻译
展开原文

In cases like Opus 5 it's near impossible to overcome

负面安全与拒答

“"啊,但Fable超级超级危险,Opus 5也是"这根本就是糟糕的敷衍之词”

Redditen机器翻译
展开原文

"ah, but Fable is sooooooo dangerous, as is Opus 5" is just a terrible hand wave

负面推理

“Opus 5往往给次要的拼写错误/语言选择过多的优先级,采取迂腐且对抗性的方式来进行文档审查,提出不明智的策略并忽略重要细节。它对E的理解也有些站不住脚”

Redditen机器翻译
展开原文

Opus 5 tends give too much priority to minor typos/linguistic choices, adopts a pedantic and adversarial approach to doc reviews, proposes unwise strategies and glosses over important details. It also has a somewhat shaky understanding of E

负面编程

“100%同意你对Opus 5的描述 笑死”

Redditen机器翻译
展开原文

100% agree with your description of Opus 5 lol

负面编程

“Opus 5和Sonnet 5大家的体验差异很大。对有些人来说Opus 5很可靠,但像我这样的人除了原型图和计划模式外都不信任它”

Redditen机器翻译
展开原文

Opus 5 and Sonnet 5 the experiences people have are very inconsistent. For some people Opus 5 is solid, others like me do not trust it outside of mockups and plan mode

负面速度与延迟

“这里也是同样的体验。用量消耗也太快了,几天前还不是这样的。”

Redditen机器翻译
展开原文

Same experience here. Usage drain too fast as well which wasn't the case before or few days ago.

查看长期变化与分析

模型生命周期

Claude Opus 5

发布于 2026-07-24 · 返回 Claude

精确版本信号覆盖 2026-08-07–2026-09-08 · n=622

统计窗口:2026-08-12 00:00:00 至 2026-09-09 00:00:00 UTC · 评分方法:experience_score_v2。

趋势历史仍在收集中 当前窗口已达到要求;用于判定的独立分段已有 2/4 个。

生命周期每日更新 · 最新完整 UTC 日期 2026-09-08

固定 14 天基准
45.5
n=37
最近 28 天
28.2
n=594
较基准变化
−17.3
90 天斜率
分 / 30 天

14 天滚动体感趋势

每个每日更新的点汇总此前 14 个完整 UTC 日。虚线是固定发布基准;正式趋势判决仍使用互不重叠的独立 14 天分段。

从 2026-08-13 到 2026-09-08 的 14 天滚动体感趋势;最新分数 28.3,固定基准 45.5。2030405060固定基准 45.52026-07-30–2026-08-13 · 45.5 · n=372026-07-31–2026-08-14 · 46.7 · n=402026-08-01–2026-08-15 · 47.8 · n=412026-08-02–2026-08-16 · 47.8 · n=452026-08-03–2026-08-17 · 49.1 · n=502026-08-04–2026-08-18 · 49.9 · n=562026-08-05–2026-08-19 · 49.4 · n=622026-08-06–2026-08-20 · 49.4 · n=622026-08-07–2026-08-21 · 41.2 · n=982026-08-08–2026-08-22 · 37.3 · n=1122026-08-09–2026-08-23 · 31.4 · n=1352026-08-10–2026-08-24 · 29.4 · n=1842026-08-11–2026-08-25 · 27.7 · n=2172026-08-12–2026-08-26 · 26.9 · n=2422026-08-13–2026-08-27 · 26.1 · n=2592026-08-14–2026-08-28 · 24.9 · n=2702026-08-15–2026-08-29 · 26.7 · n=3032026-08-16–2026-08-30 · 25.8 · n=3262026-08-17–2026-08-31 · 25.7 · n=3452026-08-18–2026-09-01 · 25.1 · n=3712026-08-19–2026-09-02 · 24.8 · n=3902026-08-20–2026-09-03 · 25.9 · n=4242026-08-21–2026-09-04 · 25.2 · n=4162026-08-22–2026-09-05 · 26.0 · n=4202026-08-23–2026-09-06 · 26.4 · n=4162026-08-24–2026-09-07 · 27.4 · n=3882026-08-25–2026-09-08 · 28.3 · n=36808-1308-1808-2308-2809-0209-0709-08

用于趋势判定的独立 14 天分段已就绪 2/4 个。

哪些维度解释了变化

分别展示各维度内部的口碑变化与讨论构成变化。这是观察性贡献,不是因果证明。

主要负向口碑贡献:通用文本。

维度 基准 → 当前 维度变化 权重占比 口碑变化贡献 讨论构成贡献
通用文本 基准 → 当前36.5 → 16.4n=18 → 285 维度变化−20.1 权重占比44.9% → 46.8% 口碑变化贡献−9.23 讨论构成贡献−0.20
编程 基准 → 当前样本不足n=3 → 101 维度变化 权重占比 口碑变化贡献 讨论构成贡献
图像/视觉 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献
本地部署 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献
推理 基准 → 当前样本不足n=9 → 126 维度变化 权重占比 口碑变化贡献 讨论构成贡献
角色扮演/创作 基准 → 当前样本不足n=0 → 9 维度变化 权重占比 口碑变化贡献 讨论构成贡献
安全与拒答 基准 → 当前样本不足n=2 → 14 维度变化 权重占比 口碑变化贡献 讨论构成贡献
速度与延迟 基准 → 当前样本不足n=5 → 59 维度变化 权重占比 口碑变化贡献 讨论构成贡献
视频生成 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献

样本不足维度的未解释贡献:−7.88 分。

生命周期分沿用主指数的体验信号权重,n≥30 后不做样本收缩。它衡量公开用户感知,不代表模型能力,也不能证明后端原因。

你今天的 AI 手感如何?