Claude · 近 7 天
Claude Opus 5
0–100 分,越高代表社区使用体验越正面,不代表能力测试成绩。
更新于 2026-10-03 14:32 UTC · 2026-09-26 – 2026-10-03 UTC讨论概览
主要讨论什么
全部平台 · 近7天 69 条合格评论,包含额度反馈;按来源与评论去重。
- 通用文本 · 43 条:正面 5 / 负面 34 / 褒贬或中性 4
- 推理 · 14 条:正面 5 / 负面 9 / 褒贬或中性 0
- 速度与延迟 · 5 条:正面 0 / 负面 4 / 褒贬或中性 1
- 使用额度 · 4 条:正面 1 / 负面 2 / 褒贬或中性 1
同一评论可涉及多个维度,各项不可相加;方向计数不等于加权评分。链接展示该维度的精选原文。
近期变化
近7天滚动体感分较7天前 −7.1 分。讨论构成也会影响分数,这不是原因诊断。
样本分布与讨论集中度
Hacker News 5 · Reddit 58 · 小红书 1 · 知乎 5
可识别 49 个讨论,覆盖 64/69 条评论;最大单帖 5 条。其余讨论归属未知,不推算独立用户数。
个体观点选摘
有用户让 Opus 5 与 Opus 5.5 解读一段取两个数最大值的脚本,认为 Opus 5 判断正确,而 Opus 5.5 误判其输出 1/0。 有用户回复称,即使在削弱之后,Opus 5.5 仍然远好于 Opus 5。
样本与评分说明
截至 2026-10-03 14:32:03 UTC,Claude 家族的 Claude Opus 5 在近 7 天有 69 条明确归属该版本的社区反馈,社区口碑分为 22.5/100。部分有效分类评分:通用文本 20.5/100 (n=43);推理 40.5/100 (n=14);速度与延迟 37.0/100 (n=5)。 评分方法与数据来源
近期走势
口碑在如何变化
近 30 天,每点代表截至该日采样时刻的近 7 天滚动体感分。纵轴随数据调整;缺失或样本不足处断开,今天仍在更新。
点按或用 ← → 查看日期、分数与样本量;空白日期暂无足够数据。
暂无可用趋势
小红书 · 暂无足够评价 · 1 条评分评论 · 查看该平台评价 →
不同社区,同一模型
各平台怎么看
各平台独立计算,样本量和讨论人群不同。平台分数不取简单平均;评分评论不包含仅讨论额度的评论。
分数范围 0–100。点击平台查看趋势及对应评价。最新评论时间不代表爬虫运行状态。
查看长期变化与分析
模型生命周期
Claude Opus 5
发布于 2026-07-24 · 返回 Claude
精确版本信号覆盖 2026-09-21–2026-10-02 · n=127
统计窗口:2026-09-05 00:00:00 至 2026-10-03 00:00:00 UTC · 评分方法:experience_score_v3。
生命周期每日更新 · 最新完整 UTC 日期 2026-10-02
当前分类口径在原基线窗口内的评价不足。原时间窗保留,暂不判断长期改善或下降;旧口径分数不参与比较。
- 固定 14 天基准
- – n=0
- 最近 28 天
- 22.0 n=119
- 较基准变化
- –
- 90 天斜率
- – 分 / 30 天
14 天滚动体感趋势
每个每日更新的点汇总此前 14 个完整 UTC 日。虚线是固定发布基准;正式趋势判决仍使用互不重叠的独立 14 天分段。
用于趋势判定的独立 14 天分段已就绪 0/4 个。
哪些维度解释了变化
分别展示各维度内部的口碑变化与讨论构成变化。这是观察性贡献,不是因果证明。
暂无维度在基准与当前窗口同时达到样本门槛。
| 维度 | 基准 → 当前 | 维度变化 | 权重占比 | 口碑变化贡献 | 讨论构成贡献 |
|---|---|---|---|---|---|
| 编程 | 基准 → 当前样本不足n=0 → 9 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 图像生成 | 基准 → 当前样本不足n=0 → 0 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 图像理解 | 基准 → 当前样本不足n=0 → 0 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 本地部署 | 基准 → 当前样本不足n=0 → 0 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 推理 | 基准 → 当前样本不足n=0 → 27 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 角色扮演/创作 | 基准 → 当前样本不足n=0 → 0 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 安全与拒答 | 基准 → 当前样本不足n=0 → 6 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 速度与延迟 | 基准 → 当前样本不足n=0 → 9 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 通用文本 | 基准 → 当前样本不足n=0 → 69 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
| 视频生成 | 基准 → 当前样本不足n=0 → 0 | 维度变化– | 权重占比– | 口碑变化贡献– | 讨论构成贡献– |
生命周期分沿用主指数的体验信号权重,n≥30 后不做样本收缩。它衡量公开用户感知,不代表模型能力,也不能证明后端原因。
社区评论
精选近 7 天的不同意见,摘录条数不代表真实好评比例。
1 条精选摘录
额度评价来自社区体验,不能据此推算官方实际配额。
展开原文
Mostly Claude, Opus 5 and Fable 5, then Astra for a bit, now Opus 5.5 for pretty much everything.
查看评论上下文
一个macos照片编辑器。Swift和Rust。主要是一个实验,想看看不查看任何代码能做出多大的项目,以及如何处理规模问题。
机器翻译展开原文
A macos photo editor. Swift and Rust. Mostly an experiment to see how large of a project I could make without looking at any code, and how to approach scale issues.
展开原文
Still much better than opus5.
查看评论上下文
Opus 5.5被nerf了——如何衡量、如何发现、如何起诉
机器翻译展开原文
Opus 5.5 nerfing - how to measure, how to spot, how to sue
很想知道其他人用被nerf后的Opus 5.5体验如何。
机器翻译展开原文
Interested to hear how others are getting on with post-nerf Opus 5.5.
展开原文
keeps more of the actual defects vs 5.5, by a small margin
查看评论上下文
例如,如果你让Opus 5处理一堆来自审查代码的子代理扩散的审查,然后将它们合成一份最终报告。与5.5相比,它能保留更多的实际缺陷,但差距不大。但它也会保留更多的误报,而且耗时大约是5.5的两倍,消耗的token也大约是5.5的两倍。
机器翻译展开原文
For example if you have Opus 5 process a bunch of reviews from an subagent fanout that is reviewing code, then synthesizing those into a final report. It keeps more of the actual defects vs 5.5, by a small margin. But it also keeps more false positive and takes about twice as long and twice as many tokens as 5.5
展开原文
It feels very much like opus 5 wrote it, unreadable wall of text garbage.
展开原文
it just made more mistakes than usual
展开原文
Opus 5 is back
查看评论上下文
但就在今晚我的月度限额重置的时候,我注意到交流风格和编码行为发生了*极端*的变化,感觉可疑地像Opus 5 (O5)。在过去一周里,O5.5会接受我的需求后立即开始工作,通常在几分钟内完成一个功能,在实现、用户体验、架构和token效率方面都做得非常出色。今晚,我看到的完全不同。 第一个迹象是交流风格。O5.5突然开始用这些听起来很空洞的实施方案前叙事来回应功能请求,说一些泛泛的估计,比如*"这是个很棒的想法。这需要两天的工作,会很棒,"*然后用最糟糕的代码实现方式来实现这个功能。这是O5一个非常具体且特别烦人的特征,所以我立刻注意到了。下一个迹象是:当被追问细节时,突然回复变成大段文字...*任何*事情都是如此。
机器翻译展开原文
But right around the time my monthly limit reset this evening, I noticed an extreme shift in communication style and coding behavior that feels suspiciously like Opus 5 (O5). For the last week, O5.5 would take my requirements and immediately get to work, usually knocking out a feature in minutes and doing an incredible job across implementation, UX, architecture, and token efficiency. Tonight, I’m seeing something very different. The first tell was the communication style. O5.5 suddenly started responding to feature requests with these glazing pre-implementation narratives and generic estimates like, “That’s a great idea. That’s two days’ worth of work and it will be amazing,” and then proceeding to implement the feature in the most slopcode-slathered way possible. That was a very specific and particularly annoying characteristic of O5, so I clocked it immediately. The next tell: a sudden reversion to walls-of-text responses when prodded for details on...*anything*.
展开原文
Opus 5 broke ten things every turn while speaking incomprehensible babble
展开原文
any gap in specificity in my statement of a task would lead Opus 5 to invent an interpretation to fill the gap, frequently creating lots of extra work for itself in the process, and often deviating from my intent
展开原文
was dogshit to work with
展开原文
Opus 5 gets it right
查看评论上下文
我给它一个脚本,该脚本接收两个数字并打印两个数字中的最大值。Opus 5.5认为它打印的是1/0而不是最大值。
机器翻译展开原文
I feed it a script which takes two numbers and prints the max of the two numbers. Opus 5.5 thinks it prints 1/0 instead of the max numbers.
展开原文
I was still getting way more value in terms of usage and almost always never ran out of usage by alternating between Fable 5 and Opus 5.
展开原文
Opus 5 was awesome
展开原文
Fable is good but the usage limit is too low for it
展开原文
Actually I thought Opus 5 was great
查看评论上下文
实际上我觉得 Opus 5 很棒,并不觉得 5.5 是它的一次不可思议的飞跃
机器翻译展开原文
Actually I thought Opus 5 was great, and don't feel like 5.5 is some incredible leap forward from it
展开原文
found a different real issue that muse didn't
查看评论上下文
尝试用 muse 做 PR 审查,opus 5 对反馈很不满,反而 opus 发现了一个 muse 没发现的不同真实问题。
机器翻译展开原文
Tried to use muse for PR review and opus 5 was hating on the feedback and instead opus found a different real issue that muse didn't.
展开原文
i dont want the spyware/watermark rng-mutation of the transformer in my output
近 7 天暂时没有符合此筛选条件的精选评论。