DeepSeek R 周末低谷价背后:高峰加价为 GPU 训练让路,GPT 价格战压力倒逼定价调整
DeepSeek 8月23日起实施周末全天低谷价,内部文件揭示工作日高峰加价旨在为模型训练腾出 GPU 算力;8月22日服务故障与定价调整时间高度吻合,GPT API 价格下调加剧竞争压力。
今日概览
DeepSeek 宣布 8 月 23 日起周末 API 全天执行低谷价格,内部透露工作日高峰加价旨在为模型训练腾出 GPU 算力,8 月 22 日 API 服务故障与定价政策调整时间高度吻合。
Claude Code 面临大规模用户流失,老用户转向 GPT-5.3-Codex 等竞品,社区指控 Anthropic 背叛合作伙伴关系,同时批评 Claude 模型从 4.6 到 5.0 版本的质量退化。
Claude Opus 5 的沟通问题引发开发者大规模反馈,用户报告使用过程造成显著精神疲劳,社区已开发临时工具应对,部分用户开始试用 GPT 5.6 或 Gemma 变体作为替代方案。
Claude Code 用户报告 Opus 4.8 在经历可靠表现期后突然出现行为退化,社区猜测 Anthropic 可能根据预期收入调整模型的"投入度"设置。
GPT 5.6 Sol 模型在未正式宣布的情况下获得重大升级,速度、准确性明显改善,OpenAI 同时宣布 API 价格下调 20-30%,加剧与国内模型的竞争。
社区对 Artificial Analysis 智能指数的评分方法提出强烈质疑,指出云端模型与本地模型测试条件不一致导致结果失真,Qwen 3.8 27B 登顶引发争议。
用户探索 AI 新用途:ChatGPT 播客工作流、GPT Image 2 视觉能力与 Claude Code 初级开发者表现,反映 AI 在最后一公里交付上的局限性。
中美 AI 竞争从模型能力对比转向实际部署成本,DeepSeek 处理全球约三分之一 AI API 调用,豆包位居 AI 平台访问量首位。
产品与平台变化
DeepSeek周末统一低谷价定价:内部文件揭示高峰时段加价实为GPU训练预留
事件经过
- DeepSeek于2026年8月22日宣布,自北京时间2026年8月23日(周日)00:00起调整API峰谷计费规则:工作日(周一至周五)继续执行原有峰谷分段计费,周末(周六、周日)全天不再区分峰谷时段,统一按低谷时段价格收取调用费用。
- DeepSeek员工在官方交流群中亲口确认,工作日高峰时段涨价的核心目的是腾出GPU算力用于训练新模型,而非单纯反映运营成本。
- 8月22日当天DeepSeek API服务出现故障,发生时间与定价政策调整公告高度重合,业界分析认为可能与模型训练出现故障、基础设施被迫调整有关。
社区反响
- 用户对此表示不满,认为所谓高峰时段加价实际上是在利用用户的调用费用为DeepSeek自身的大模型训练提供GPU资源支持,有用户直言:“所谓高峰时段涨价实际上就是为了工作时段给他们留卡训练,是真不打算靠API挣钱。”
- 不少用户质疑周末定价方案对全球不同地区用户的不公平性,指出中国用户处于夜间时段需支付高峰价格,而位于白天的其他国家地区用户却能享受低谷价,有评论称“别赚我们的钱,还便宜那些老外”。
- 社区猜测8月22日服务故障的真正原因是原计划周末白天继续进行模型训练,但因模型出现故障导致服务异常,团队不得不紧急回撤人手加班补救,最终放弃周末训练计划。
实践要点
- 此次定价调整本质上是运营层面的重新校准,而非单纯的降价竞争策略。内部披露表明工作日高峰加价的真实意图是管理GPU资源分配,优先保障模型训练需求。
- 8月22日服务中断与定价政策变更有直接关联,说明DeepSeek正在同步调整API服务与模型训练的底层基础设施架构,两者之间存在资源竞争与协调关系。
应用场景
- 理解API定价结构与AI基础设施算力管理之间的内在关联,可用于评估云端AI服务商的运营策略与成本结构。
- 分析AI公司在API收入优化与内部模型开发资源需求之间的平衡策略,有助于洞察大模型厂商的商业模式与技术路线之间的关系。
实际价值
- 该定价转变表明API收费模式可同时服务于双重目标:既可实现收入优化,也可作为基础设施算力调配的调控手段,揭示了AI服务定价的深层运营逻辑。
- 定价公告与8月22日服务中断的时间关联性暗示DeepSeek正在实施协调统一的运营变革,API服务与模型训练工作负载的调度策略正在同步调整。
社区证据
前情提要:deepseek员工在官方交流群里亲口承认涨价就是为了腾卡出来训练新模型。
模型体验追踪
Claude Code深陷用户流失危机:质量下滑与合作伙伴背叛争议持续发酵
用户流失与竞品迁移
- 知乎帖子"Claude Code增长熄火,网传现大规模退订,为啥会这样?如何看待其诸多老用户开始转用Codex?"获得230互动评分和259总互动量,将此定性为用户从Claude Code向包括GPT-5.3-Codex在内的竞品的大规模迁移。
- 中文社区指控Anthropic背叛了与Cursor的合作关系,在最初将Claude定位为Cursor编程智能体后端模型并承诺合作后,秘密开发Claude Code作为竞争产品。
- 讨论指出Claude从4.6到5.0的升级过程充满古怪气息,Anthropic日益封闭,大量训练数据只能从代码质量存疑的Claude Code获取,社区认为其穷途末路已可预见。
用户体验与伦理批评
- 知乎评论指出:"后面那截图真是使用体验了[捂脸]我让它删东西都只能加一句,删除需要删除一切关联内容,彻底不要在文档和设置提及它",表明用户在进行删除等基本操作时不得不采用变通话术。
- 社区批评Anthropic"没有商业道德",将其与马斯克对比:"给了cursor团队落地的体面,让他们不至于在这波AI探索中白忙一场"。
- 用户将Claude Code本身形容为"屎山",指出Cursor在保持竞争力的同时还带动了composer和Grok的能力提升,而Claude模型却在"越来越古怪的道路上越走越远"。
用户迁移与产品风险
- 由于Claude模型从4.6到5.0的质量退化,用户正迁移至GPT-5.3-Codex及其他替代方案。
- 据报道,连删除等基础操作都需要明确的工作指引("删除所有关联内容,不要在文档和设置中提及"),反映出用户体验可靠性的显著下降。
- 此次争议凸显了基于第三方模型合作构建产品时,若提供商推出竞争产品可能带来的风险。
企业评估与合作决策
- 评估AI编程助手时,企业开发者应将供应商锁定风险和合作伙伴稳定性置于模型原始性能之上进行综合考量。
- 使用第三方模型的AI助手开发者,在投入整合之前应就竞争产品条款进行明确谈判。
行业洞察与生态影响
- 用户因质量退化和用户体验问题而迁移的证据,为评估Claude系列模型在生产级编程工作流中的可靠性提供了具体参考。
- Cursor合作背叛叙事为研究AI平台竞争如何影响开发者生态系统和工具采纳模式提供了典型案例。
社区证据
anthropic 本身就是踩着 cursor,靠背刺自己的合作方逆袭的,属于是没有商业道德的那一挂。你要是觉得人家的东西好,可以收购啊,这么搞是真不要脸。
Claude沟通问题持续:社区推出临时工具,呼吁模型级修复
事件经过
- 一位拥有15年以上经验的高级工程师表示正在工作中试用GPT 5.6,认为Claude使用起来"太耗脑力",而Opus 4.6在提供清晰简洁输出方面"好得多"。
- Reddit用户反映已转向Claude Fable,因为后者在解释概念方面表现更优。
- 社区已推出多个临时解决方案:Vomit(github.com/zachahn/vomit)、Claudish-to-english(github.com/gvzdv/claudish-to-english)和Claudette,均旨在强制Claude停止产生BuzzFeed风格或过度冗长的响应。
- 一位Hacker News评论者在测试Vomit和Claudish-to-english后,结合两者提示词创建了综合方案。通过本地测试框架对多个模型进行评估,发现gemma4-26b变体(Macbook用gemma4-26b-mlx,24GB显存用gemma4-26b-a4b)添加不良行为最少。
- 社区共识认为沟通问题需要模型级修复,当前所有变通方案都被描述为存在缺陷的临时方案,包括增加更多上下文、切换到其他模型翻译、使用技能或每次提示都强调要求等。
社区反馈
- 用户将当前Claude行为描述为"像一个刚读太多书却缺乏理解能力和简单解释能力的初级开发者"。
- 术语"承载接缝式呓语"(load-bearing seam babble)已成为社区对Opus输出风格难以理解的专有描述。
- 一位评论者指出"这是Opus的本质",即使使用变通方案,足够多的来回对话后Claude仍会恢复其典型的难以理解的输出模式。
- 开发者报告使用Opus 5处理复杂工程任务时产生"显著精神疲劳",促使他们寻求替代方案。
适用场景
- 当API模型表现出问题输出风格时,评估本地模型替代方案。
- 通过结构化测试框架测试本地模型,以衡量冗长性和清晰度。
- 评估Gemma变体是否可作为中间翻译层。
实践价值
- 用于识别具有特定行为特征模型的本地方案测试方法论。
- 对比数据表明更高显存模型在清晰度和简洁性任务上并不一定表现更好。
实用建议
- 对于使用24GB显存且遇到Claude沟通问题的用户,推荐gemma4-26b-a4b作为添加冗长行为较少的本地模型,同时保持性能。
- Macbook用户可使用gemma4-26b-mlx获得类似优势,资源占用合理。
推荐提示词
- Use only plain English. Be direct and concise. Do not add unnecessary elaboration, defensive reasoning, or creative flourishes. Give the answer first, then optionally explain briefly if needed.
提示词分析
- 该提示词源自Vomit工具和Claudish-to-english项目的社区推荐。提示词针对核心行为问题:冗长的内部草稿式输出、防禦性推理倾倒以及对简单概念的过度解释。
社区证据
我总体感觉,这个问题真的需要在模型层面解决。
Anthropic 被指在 Claude Code 中进行降低投入度的 A/B 测试,Opus 4.8 出现行为回归
发生了什么
- 在经历一段稳定可靠的表现期后,Opus 4.8 开始突然忽视用户提供的明确设计指南,并引入新的样式选择,包括在同一页面内对相似元素使用多种字体、不同的字号以及不一致的边距。
- Opus 4.8 放弃了已建立的 CSS 类,转而使用内联样式。
- 这种行为退化在新模型发布后才变得明显,即使在模型意识到需要回归设计指南后,仍继续出现问题的模式。
社区反应
- 用户猜测投入度旋钮可能根据预期收入进行调整,一位每月20美元订阅用户反映准确性出现退化,需要在审查阶段自行发现明显的问题。
- 有用户观察到 Opus 5 过度文档化一切,在输出中重新生成会话讨论的上下文,导致输出更加不透明,调整尝试也变得无效。
- 社区成员质疑基准测试的可靠性,考虑到有报告称模型尽管基准分数提高但实际表现反而变差。
- 多位用户注意到模型即使在同一版本和投入度设置下也会改变行为——有时变好,有时变差。
- 有用户报告从 Opus 4.6 切换离开后,Opus 5 的表现起初可以接受,但在 4.8 上也遇到了类似的退化问题。
实践要点
- 行为退化可能不会在新模型发布后立即发生,而是倾向于最终显现,暗示着随时间累积的变更(对底层框架或指令的调整)。
- 用户可能需要在新模型发布后重新评估模型选择和投入度设置,因为之前可靠的配置可能会降级。
适用场景
- 需要严格遵循设计指南和 CSS 一致性的工作。
- 需要一致样式模式进行长期代码维护的场景。
实用价值
- 理解投入度水平可能受到用户无法控制的因素影响,包括明显的 A/B 测试或基于收入的调整。
- 认识到投入度波动可能影响需要严格设计一致性的复杂多文件编码任务。
社区证据
可以说,我注意到准确度下降了。
GPT 5.6 Sol 被曝静默升级:速度与准确性显著提升,但出现行为异常
发生了什么
- 用户反馈 GPT 5.6 Sol 在近几天内经历了未正式宣布的能力变化,感觉像是从 GPT 5.6 直接跃升到了 GPT 5.7。明显改善包括响应速度大幅提升、回答更加深入、幻觉显著减少,以及此前回答错误的提示词现在能够正确处理。
- 这次变化与大约两周前的官方"更准确"升级不同,用户在使用一两周前的旧提示词进行测试后确认确实发生了变化。此外还出现了新功能,如研究任务定时执行和兴趣话题通知。
- 但与此同时,部分用户也报告了新的行为问题,包括语言习惯变化、记忆异常和上下文丢失。有用户表示:"它忘了很多东西,甚至连项目文件中存储的上下文都不记得了。"还有用户提到需要额外添加指令来限制随机出现的不当表达和无关记忆调取。
社区反应
- 正面反馈居多。有用户兴奋地确认了这次升级,并表示"ChatGPT 现在在日常任务上明显更好用了",另一位用户则称"这种情况已经持续一段时间了"。同时出现了与竞品 Claude Opus 5 的对比,有同时订阅两款服务的用户认为 GPT 5.6 Sol "明显优于 Claude 的任何产品"。
- 负面反馈主要集中在行为异常上。有用户抱怨"非常烦人,不得不立即添加指令告诉它不要随机说脏话或随机调取无关的记忆"。还有用户指出上下文丢失问题严重到需要反复纠正。
使用场景
- 日常休闲使用、研究任务以及一般性的日常交互是改善最为明显的领域。
实际价值
- 日常任务的速度和准确性感知提升;此前失败提示词的幻觉率降低;新增的研究任务定时执行和兴趣话题通知功能。
实用建议
- 如果遇到语言习惯变化或上下文丢失等问题,可能需要通过在系统提示词或项目设置中添加明确的指令来缓解这些问题。
测试提示词
- 用一两周前曾经失败或存在问题的提示词进行测试,检验模型的准确性或处理能力是否有所改善。
提示词分析
- 使用过去已知失败点的提示词进行对比,能够更客观地检测能力变化。多位用户正是通过这种方法确认了这些变化并非安慰剂效应。
社区证据
ChatGPT对日常任务来说就是更好用。
社区质疑Artificial Analysis基准测试公信力:Qwen 3.8 27B登顶引发评分方法争议,AI API价格战持续升温
社区反应
- Reddit用户强烈批评Artificial Analysis基准测试方法,称其为"垃圾"和"狗屎",质疑该指标实际衡量的内容。
- 用户发现系统性偏差:Claude Sonnet等竞品模型使用RAG检索增强和搜索能力获取额外知识,而本地模型在没有检索增强的情况下进行对比测试。
- Perplexity用户指责公司"煤气灯效应"和"暗中削减"服务,同时否认使用问题;有用户反映Codex with Sol进展缓慢且过度谨慎,浪费大量Token。
- 社区成员指出中国开源模型在实际生产中仍存在可靠性问题:GLM 5.3和DeepSeek v4进入无限循环并消耗Token直至钱包归零,而美国模型顺利完成任务。
- 用户批评盲目因意识形态原因(开源/弱者叙事)支持模型,强调只想要"能用的、价格便宜的"产品。
- 社区成员注意到基准测试异常的规律,包括DeepSeek V3得分与Qwen3 VL 32B相当,以及ServiceNow 15B模型超过完整版DeepSeek R1。
实践要点
- 评估AI模型基准测试时,需验证竞品模型是否使用RAG/搜索增强功能,而本地模型是否未使用,因为这样会造成系统性偏差。
- AI API价格战(GPT 5.6 Sol降价20-30%、DeepSeek周末费率调整)可能无法反映总体拥有成本,可靠性和Token浪费等因素需纳入考量。
- 显示小型27B模型超越更大云端模型的基准排名需要审视测试方法论,而非简单归因于模型能力。
实践价值
- 社区提供的方法论批评:识别基准测试中RAG偏差的具体证据。
- 实际生产可靠性报告:对比中国模型与美国模型在生产环境中的表现差异。
- 具体模型Token浪费和无限循环问题的案例:GLM 5.3和DeepSeek v4的生产故障实例。
社区核心质疑
- "这个指标究竟在衡量什么?因为对AA及其企业VC/记者/普通观众来说,'智能'的定义与我们应该使用的定义绝对不是一回事。"
质疑分析
- 这条Reddit评论直接质疑Artificial Analysis智能指数的有效性,指出该指标似乎是为"企业VC/记者/普通观众"优化的,而非技术用户。评论捕捉到技术社区对基准测试合法性提出质疑的核心情绪。
适用场景
- 评估AI模型基准测试方法论的公信力。
- 理解模型性能比较中的系统性偏差。
- 评估AI API使用真实成本:超越标价考量。
事件经过
- Qwen 3.8 27B作为单GPU 27B参数模型在Artificial Analysis智能指数中排名榜首,超越DeepSeek V4 Flash、DeepSeek V4 Pro、Kimi 2.7 Code、GPT-5.2、Claude Opus 4.6和Claude Sonnet 5。
- Reddit用户批评Artificial Analysis基准测试毫无意义,指出Claude Sonnet等竞品模型使用RAG和搜索获取额外知识,然后与没有检索增强功能的本地LLM进行对比。
- Reddit用户记录Claude Sonnet使用RAG和搜索获取额外知识,却与没有检索增强的本地LLM进行比较,导致基准结果失真。
- GPT 5.6 Sol API降价20-30%(Reddit和Hacker News双方确认)。
- Perplexity CEO(Tibo/sottiaux)承认平台使用问题。
- DeepSeek V3基准结果显示与Qwen3 VL 32B相当,ServiceNow的15B模型得分超过完整版DeepSeek R1,表明基准方法论此前已出现异常结果。
- 有用户反映GLM 5.3和DeepSeek v4在实际生产工作中进入无限循环并浪费Token,而美国模型成功完成任务。
- DeepSeek调整周末费率作为AI API市场更广泛价格竞争的一部分。
社区证据
他们偷偷降低了性能,被逮了个正着,现在只能往回找补。
生态迁移与开放模型
AI竞争叙事转向:价格与部署成本成新焦点
社区声音
- 评论者指出DeepSeek高使用量源于低定价策略,价格上调后使用量随即下降。
- 转向中国开源模型的开发者普遍强调价格敏感性和成本效益。
- 企业部署正越来越多地选择国内模型,因其具备自由选择的灵活性。
实践要点
- 85分模型以十分之一的成本正在抢占token执行工作负载。
- 美国与中国前沿曲线之间的垂直距离已显著缩小。
实际价值
- 从100万美元降至10万美元代表90%的成本节省。
金句
- 你写邮件不需要上帝。
金句解读
- 市场正从能力优先转向经济优先的评估框架。
应用场景
- Polsia的迁移案例展示了在海外服务器上部署中国模型同时实现成本降低的可行性。
- "Brewberg"实验(Bloomberg/Vels AI)证明七个中美模型在电商工作流中达到100%功能准确率。
事件梳理
- Bloomberg报道美国AI优势正在缩小,中国模型通过激进定价吸引开发者流量。
- AI竞争叙事正从"谁拥有最强模型"转向"谁能提供平价智能"。
- Polsia通过迁移至中国模型(包括MiniMax M2.7),将月AI成本从100万美元降至10万美元。
- DeepSeek处理全球约三分之一的AI API调用。
- 豆包在AI平台访问量中位居首位。
- 基准测试分数与实际效用日益脱节,更便宜的模型正在抢占执行工作负载。
社区证据
那是梁白开没卡了,服务器顶不住了,你给他卡多点,他给你看看什么叫斩杀型大模型。
真实用法与意外收获
用户发现AI意想不到的生产力应用:播客生成、微缩模型与代码助手的真实效果
社区反馈
- ChatGPT播客工作流引发用户热烈回应,纷纷分享具体应用场景:克苏鲁神话、维斯特洛历史、伊曼·凯利夫争议事件、阿拉斯加早期探险史、太平洋鲑鱼生命周期等,并表示这彻底改变了长途驾驶中的学习体验。
- GPT Image 2微缩城市生成引发批评性审视,热评指出输出内容在事实上完全错误,地理完全不准确:悉尼歌剧院和海港大桥被放在了水面的对立两侧,而非现实中同侧。
- 开发者讨论指出,虽然能用Claude Code飞速推进,但功能最终落地仍然困难,因为AI在最后一公里交付上存在瓶颈。完全不懂代码的人无法维护Claude生成的代码;但对于有经验的开发者来说,能做到的事情令人惊叹。
实践要点
- 使用Claude Code时,应将其视为一位编码速度极快但不了解公司内部规则的初级开发者——先做好架构设计、在提示词中明确安全约束、为每个功能编写测试,这样才能充分发挥其能力。
- 使用图像生成功能时,务必核实地理准确性;GPT Image 2生成的微缩模型需要与参考资料进行事实核查,不能仅凭视觉效果判断准确性。
实际价值
- 播客创建工作流将深度研究能力与语音播报相结合,可将任何主题转化为通勤场景的音频学习内容。
- 开发者工作流展示了AI在与正确工程纪律(架构设计、安全约束、测试)配合时的加速效果,尽管最后一公里交付仍是局限。
- 图像生成技术支持创意微缩可视化,但需要人工验证才能确保真实世界地理表示的准确性。
应用场景
- 通过指示ChatGPT对某个主题进行深度研究并生成30-45分钟音频内容,为长途驾驶创建教育性播客。
- 生成逼真的微缩城市模型用于创意或艺术目的,但需注意地理准确性需要人工核实。
- 将Claude Code作为有适当监督、架构指导、安全提示和测试驱动工作流程的编码助手使用。
事件经过
- ChatGPT用户发现了一种生成自定义播客的工作流:先进行深度研究,再通过朗读按钮进行语音播放,生成任意主题的30-45分钟音频内容,已被分享为长途驾车的学习解决方案。
- GPT-5.4 Image 2生成逼真的微缩城市模型时出现明显的地理幻觉,包括将地标建筑(如悉尼歌剧院和海港大桥)放置在水面的对立两侧。
- 开发者报告将Claude Code视为需要明确架构思考、显式安全约束和全面测试的上下文盲区初级开发者,以确保输出质量。
社区证据
只是这些全都说错了。