← 全部模型

Claude · 近 7 天

Claude Opus 5

0–100 分,越高代表社区使用体验越正面,不代表能力测试成绩。

更新于 2026-09-09 15:48 UTC · 2026-09-02 – 2026-09-09 UTC
社区口碑分33.0/100185 条评论 · 近 7 天

截至 2026-09-09 15:00:04 UTC,Claude 家族的 Claude Opus 5 在近 7 天有 185 条明确归属该版本的社区反馈,社区口碑分为 33.0/100。部分有效分类评分:通用文本 16.4/100 (n=96);编程 52.9/100 (n=30);推理 57.0/100 (n=35)。 评分方法与数据来源

社区评论

精选近 7 天的不同意见,摘录条数不代表真实好评比例。

16 条精选摘录

正面编程

“opus 5在编程方面很厉害,只要你用hooks让他闭嘴并屏蔽注释,因为他倾向于每3行代码写3条注释”

Redditen机器翻译
展开原文

opus 5 is great at coding, as long as you use hooks to make him shut the fuck up and to block commentary as well since he tends to write 3 comments for every 3 lines of code

褒贬兼有通用文本

“尽管Opus 5的语气令人不适且冗长,但我也取得了不错的效果。非常胜任的模型。”

Redditen机器翻译
展开原文

I had good results with Opus 5 too in spite of its painful tone & verbosity. Very competent model.

正面推理

“5.6 Sol/Opus 5及更高级的模型能更好地处理我所在政府的荒谬电子表格和所有相关官僚程序”

Redditen机器翻译
展开原文

5.6 Sol/Opus 5 and better models can for example handle my governments ridiculous electronic forms and all associated bureaucracy much better than I can

负面通用文本

“最令人费解且充满行话的输出”

Redditen机器翻译
展开原文

most convoluted and jargon-filled output

负面通用文本

“在Opus 5这类情况下,几乎不可能超越”

Hacker Newsen机器翻译
展开原文

In cases like Opus 5 it's near impossible to overcome

正面推理

“Opus会认真验证他们的说法并修复问题”

Redditen机器翻译
展开原文

Opus diligently verifies their claims and fixes things

负面安全与拒答

“"啊,但Fable超级超级危险,Opus 5也是"这根本就是糟糕的敷衍之词”

Redditen机器翻译
展开原文

"ah, but Fable is sooooooo dangerous, as is Opus 5" is just a terrible hand wave

正面通用文本

“在可预见的未来,我将成为Opus 5的忠实用户”

Redditen机器翻译
展开原文

I will be a Opus 5 slave for the foreseeable future

正面编程

“Opus 5 仍然是我最好的编码器,但 Astra 终于能产生与之相当的结果。它们在全新上下文启动时消耗的 token 数量相当,但一旦我在现有上下文中迭代,Opus 消耗的更少。”

Redditen机器翻译
展开原文

Opus 5 is my best coder still, but Astra is finally producing comparable results to it. They both burn comparable tokens on a clean context spin-up, but Opus burns less once I'm iterating on an existing context.

负面推理

“Opus 5往往给次要的拼写错误/语言选择过多的优先级,采取迂腐且对抗性的方式来进行文档审查,提出不明智的策略并忽略重要细节。它对E的理解也有些站不住脚”

Redditen机器翻译
展开原文

Opus 5 tends give too much priority to minor typos/linguistic choices, adopts a pedantic and adversarial approach to doc reviews, proposes unwise strategies and glosses over important details. It also has a somewhat shaky understanding of E

正面推理

“用 Opus 5 作为子代理”

Redditen机器翻译
展开原文

Opus 5 as subagents

负面编程

“100%同意你对Opus 5的描述 笑死”

Redditen机器翻译
展开原文

100% agree with your description of Opus 5 lol

负面编程

“Opus 5和Sonnet 5大家的体验差异很大。对有些人来说Opus 5很可靠,但像我这样的人除了原型图和计划模式外都不信任它”

Redditen机器翻译
展开原文

Opus 5 and Sonnet 5 the experiences people have are very inconsistent. For some people Opus 5 is solid, others like me do not trust it outside of mockups and plan mode

中性速度与延迟

“Opus 5高强度推理速度慢了好几个数量级——但我确实看到结果质量的差异”

Redditen机器翻译
展开原文

Opus 5 on High is orders of magnitude slower burn - but I do see a difference in result quality

负面速度与延迟

“这里也是同样的体验。用量消耗也太快了,几天前还不是这样的。”

Redditen机器翻译
展开原文

Same experience here. Usage drain too fast as well which wasn't the case before or few days ago.

褒贬兼有推理

“opus 5比两者都好,但你需要让它用冷静的审查者重新检查它做的一切,因为它总是犯错”

Redditen机器翻译
展开原文

opus 5 is better than both but you need to make it recheck everything it made with cold reviewer because it always makes mistake

查看长期变化与分析

模型生命周期

Claude Opus 5

发布于 2026-07-24 · 返回 Claude

精确版本信号覆盖 2026-08-07–2026-09-08 · n=622

统计窗口:2026-08-12 00:00:00 至 2026-09-09 00:00:00 UTC · 评分方法:experience_score_v2。

趋势历史仍在收集中 当前窗口已达到要求;用于判定的独立分段已有 2/4 个。

生命周期每日更新 · 最新完整 UTC 日期 2026-09-08

固定 14 天基准
45.5
n=37
最近 28 天
28.2
n=594
较基准变化
−17.3
90 天斜率
分 / 30 天

14 天滚动体感趋势

每个每日更新的点汇总此前 14 个完整 UTC 日。虚线是固定发布基准;正式趋势判决仍使用互不重叠的独立 14 天分段。

从 2026-08-13 到 2026-09-08 的 14 天滚动体感趋势;最新分数 28.3,固定基准 45.5。2030405060固定基准 45.52026-07-30–2026-08-13 · 45.5 · n=372026-07-31–2026-08-14 · 46.7 · n=402026-08-01–2026-08-15 · 47.8 · n=412026-08-02–2026-08-16 · 47.8 · n=452026-08-03–2026-08-17 · 49.1 · n=502026-08-04–2026-08-18 · 49.9 · n=562026-08-05–2026-08-19 · 49.4 · n=622026-08-06–2026-08-20 · 49.4 · n=622026-08-07–2026-08-21 · 41.2 · n=982026-08-08–2026-08-22 · 37.3 · n=1122026-08-09–2026-08-23 · 31.4 · n=1352026-08-10–2026-08-24 · 29.4 · n=1842026-08-11–2026-08-25 · 27.7 · n=2172026-08-12–2026-08-26 · 26.9 · n=2422026-08-13–2026-08-27 · 26.1 · n=2592026-08-14–2026-08-28 · 24.9 · n=2702026-08-15–2026-08-29 · 26.7 · n=3032026-08-16–2026-08-30 · 25.8 · n=3262026-08-17–2026-08-31 · 25.7 · n=3452026-08-18–2026-09-01 · 25.1 · n=3712026-08-19–2026-09-02 · 24.8 · n=3902026-08-20–2026-09-03 · 25.9 · n=4242026-08-21–2026-09-04 · 25.2 · n=4162026-08-22–2026-09-05 · 26.0 · n=4202026-08-23–2026-09-06 · 26.4 · n=4162026-08-24–2026-09-07 · 27.4 · n=3882026-08-25–2026-09-08 · 28.3 · n=36808-1308-1808-2308-2809-0209-0709-08

用于趋势判定的独立 14 天分段已就绪 2/4 个。

哪些维度解释了变化

分别展示各维度内部的口碑变化与讨论构成变化。这是观察性贡献,不是因果证明。

主要负向口碑贡献:通用文本。

维度 基准 → 当前 维度变化 权重占比 口碑变化贡献 讨论构成贡献
通用文本 基准 → 当前36.5 → 16.4n=18 → 285 维度变化−20.1 权重占比44.9% → 46.8% 口碑变化贡献−9.23 讨论构成贡献−0.20
编程 基准 → 当前样本不足n=3 → 101 维度变化 权重占比 口碑变化贡献 讨论构成贡献
图像/视觉 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献
本地部署 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献
推理 基准 → 当前样本不足n=9 → 126 维度变化 权重占比 口碑变化贡献 讨论构成贡献
角色扮演/创作 基准 → 当前样本不足n=0 → 9 维度变化 权重占比 口碑变化贡献 讨论构成贡献
安全与拒答 基准 → 当前样本不足n=2 → 14 维度变化 权重占比 口碑变化贡献 讨论构成贡献
速度与延迟 基准 → 当前样本不足n=5 → 59 维度变化 权重占比 口碑变化贡献 讨论构成贡献
视频生成 基准 → 当前样本不足n=0 → 0 维度变化 权重占比 口碑变化贡献 讨论构成贡献

样本不足维度的未解释贡献:−7.88 分。

生命周期分沿用主指数的体验信号权重,n≥30 后不做样本收缩。它衡量公开用户感知,不代表模型能力,也不能证明后端原因。

你今天的 AI 手感如何?