GPT用量限制4天减半:ChatGPT市场份额加速流失,便利性还能撑起Premium定价吗

OpenAI在四天内将Plus和Pro计划的用量限制削减一半,Codex模型token消耗量达到此前的3.4倍;DeepSeek配额骤降94%,本地27B模型下载量虽破百万但实际用户寥寥千余人;Claude认证服务宕机期间用户转向DeepSeek和Kimi,Claude的水印机制则被批评与创意写作本质冲突。

Hacker News 6 · Reddit 5 · Zhihu 4 355 条已覆盖讨论 9 条来源证据

今日概览

OpenAI四天内两度削减Plus和Pro计划用量限制,Codex被确认为主要消耗源,用户发起退订抵制并考虑Qwen 3.8等本地替代方案。

DeepSeek 8月17日涨价触发OpenCode Go配额锐减94%,社区宣布"token自由时代终结",GLM代码方案重夺性价比优势。

Qwen 3.8 27B全球下载破百万,但24GB以上GPU才能流畅运行,实际用户可能不足千人,云端仍是最优解。

数学研究者利用GPT Pro完成构造性工作,DeepSeek则因幻觉问题被放弃;Claude系统提示词被指过长且违背厂商自身建议。

ChatGPT一年内流失22个百分点市场份额,Google AI摘要被认为"够用";Claude认证服务中断期间用户顺利迁移至DeepSeek V4 Flash。

产品与平台变化

OpenAI四天内两度削减用量限制:Codex被指3.4倍速吞噬token,用户发起退订抵制

发生了什么

  • OpenAI在4天内实施了两阶段限额削减:先是削减40%,社区沉默后再次削减10%。
  • Plus计划此前按周付费可获得两周用量,如今同等价格只能买到一半。
  • Pro计划20倍档用户报告使用量在不到一天内耗尽。
  • GPT Sol日志分析确认Codex token消耗为此前的3.4倍。
  • 社区发起 activism:用户计划在X上发布图表向OpenAI施压。

社区反应

  • 取消订阅,开始攒钱买能跑本地模型的设备吧。
  • 20倍档一天就耗完了,另一个10倍档不到半天也没了。这样下去我很快就会取消订阅。
  • 确实比之前消耗快多了,而且快很多。
  • GPT 5.6不是号称'更节省token'吗?现在消耗限制比Claude还夸张。

实操建议

  • 使用分析工具(NerfTrack、GPT Sol日志分析)追踪token消耗,上传数据形成图表留存证据。
  • Codex似乎是主要消耗源,维持3.4倍的基准消耗率。
  • 重度用户转向本地替代方案(Qwen 3.8 27B)已具备经济合理性。
  • 采用模型无关工作流(Cursor auto、DeepSeek)降低单一供应商依赖风险。

使用场景

  • 重度编程工作流消耗最快。
  • 用户对比实际使用数据与历史基准以证明服务降级。
  • 本地部署作为重度用户的成本替代方案。

实际价值

  • 日志分析揭示Codex是主要token消耗源。
  • 模型无关工作流设计降低平台依赖。
  • 本地GPU配置在当前云端定价趋势下成为可行替代。

社区证据

也注意到了——一天内用完了20倍配额,另外10倍配额不到半天就用完了。按这个速度,我很快就会取消订阅,去别家了。

DeepSeek涨价触发OpenCode Go配额骤降94%:token自由时代落幕,GLM方案重夺性价比

发生了什么

  • DeepSeek宣布8月17日调整价格。
  • OpenCode Go计划Flash模型配额在5小时内从63,300 tokens锐减至3,800 tokens,降幅达94%。
  • OpenCode Go总配额约13亿tokens,仍低于官方DeepSeek但已大幅缩水。
  • GLM代码方案崛起为有力竞争者:v2 max 300元/月享800亿非高峰期tokens,v2 pro 100元/月享200亿tokens。
  • 社区在各大平台宣布'-token自由时代已经结束'。
  • 国内MiniMax mimo仍是最低价;海外GPT最便宜。
  • OpenCode Go团队据传正在开发自托管方案。
  • Qwen 3.8 Max预览折扣随正式版发布终止。

社区反应

  • Token自由的时代已经结束了。现在没有便宜token了。
  • GLM代码方案再次成为性价比最高的选择。
  • 小米的方案更便宜,真的很气。
  • 刚买了OpenCode Go,一周都没撑过就调价了。
  • Qwen 3.8 Max预览版才用了几天就正式发布了。
  • 对比来看Hy3倒是挺划算的。

实操建议

  • DeepSeek涨价后,GLM代码方案v2 max(300元/月800亿非高峰期tokens)成为性价比最高的选择。
  • 社区正在研发自托管方案作为应对。
  • Qwen 3.8 Max预览折扣已随正式版发布终止。
  • 所有供应商的token预算管理现已成为必要。

使用场景

  • 成本敏感的编程场景:GLM代码方案成为默认推荐。
  • 重度用户:开始调研和筹备自托管。
  • 预算规划:重新计算各供应商的token经济账。

实际价值

  • GLM v2 max每月800亿tokens仅需300元,大幅低于DeepSeek Flash调价后水平。
  • OpenCode Go若自托管成功有望恢复成本效率。
  • 所有用户画像都需要重新评估token经济模型。

社区证据

opencode go飞书群说在推进自部署方案,前段时间不是说还原了价格了吗?dax今天推说,没做到。这周在测试别的方案。

Claude认证服务宕机:OAuth会话全被中断,用户无缝切换DeepSeek V4 Flash和Kimi

发生了什么

  • Claude报告包括加州在内多地区'认证服务不可用'。
  • 所有OAuth会话被终止;状态页显示'Claude暂时不可用'。
  • Downdetector已确认,但官方状态页无更新。
  • 用户立即通过OpenRouter切换到DeepSeek V4 Flash 0731。
  • 社区推荐通过OpenCode或Pi coding harness使用Kimi、DeepSeek和GLM模型。
  • OpenCode Go每月10美元与同价位的Claude Code形成有力竞争。
  • 用户庆幸AI生态现在拥有合法替代品。

社区反应

  • 所有OAuth会话被踢出,无法重新登录。切换到OpenRouter上的DeepSeek V4 Flash。
  • 真高兴AI发展到我们有合法选项的地步了。
  • 没有监管障碍?开源权重模型实际表现基本持平Anthropic产品。
  • Kimi和DeepSeek模型参数数千亿,往往实际表现超越Anthropic。
  • Z.ai coding方案用Claude Code类似的价位提供数倍用量。

实操建议

  • Claude可靠性问题推动用户以最小摩擦转向开源权重替代品。
  • DeepSeek V4 Flash 0731、Kimi和GLM是编程任务的可行Claude替代。
  • OpenCode Go每月10美元与Claude Code同价位竞争。
  • AI生态成熟意味着Claude宕机不再造成关键工作流中断。

使用场景

  • 编程工作流:Claude中断期间通过OpenRouter使用DeepSeek V4 Flash。
  • 代理编程:通过OpenCode/Pi harness使用Kimi或DeepSeek模型。
  • 成本敏感编程:OpenCode Go作为Claude Code替代。

实际价值

  • 开源权重模型现在在许多用例上实际超越Anthropic。
  • Claude溢价定价在免费替代品表现良好时更难辩护。
  • 多供应商架构维持工作流连续性。
  • 性价比越来越有利于开源权重替代品。

社区证据

一样。我在加州,也遇到同样的"认证服务不可用"。然后被重定向到一个显示"Claude暂时不可用"的页面。

模型体验追踪

Claude系统提示词过长引争议:厂商建议简洁却自相矛盾,水印被指为法律免责而非性能

发生了什么

  • Claude系统提示词公开披露,发现显著长于厂商对AGENTS.md的建议。
  • 主流厂商建议使用更短、更不具体的指令,但自身实现的系统提示词却长得多。
  • 长提示词包含模型已知的通用内容和很少适用的上下文。
  • Agent技能由模型编写,复制的冗长程度不必要(列举模型已知的CWE)。
  • 情感支持能力被注意:Claude干预据说阻止了用户的工作过度螺旋。
  • Anthropic系统提示词包含识别用户压力和提供适当干预的指南。
  • 厂商自身建议与其实现相矛盾,造成公信力缺口。

社区反应

  • 这些提示词比我预期的要长得多,也比我以为合理的更长。
  • 当前模型不需要数千字列举已知漏洞和示例。
  • 感觉像是他们这个体量和影响力的公司的合规文档。
  • 少说很多词能搞定的事,非得说一堆废话。
  • Claude识别出压力并介入,挽救了理智、婚姻和家庭。

实操建议

  • 厂商建议(更短提示词)与其实现矛盾;公信力受损。
  • 当前模型已内化常见漏洞,无需显式枚举。
  • 更短、更聚焦的提示词可能对当代模型产生更好效果。
  • 长系统提示词可能服务于法律责任而非模型性能。

使用场景

  • 工作会话中的压力识别和干预。
  • 用户过度工作时设定生产力边界。
  • 作为情境干预的个人边界检查。

实际价值

  • 适当的明确压力承认能促进行为改变。
  • CYA解读:广泛提示词为Anthropic提供法律保护,不一定改善模型。
  • 建议与实现之间的公信力缺口引发对真正最佳实践的质疑。

社区证据

你知道吗……我相信opus用那个提示词救了我。当时我正在一个项目上拼命工作。日日夜夜,周末也在……全都以我的家庭为代价。有一次工作时,我说了一句更有感情色彩的话"我一直在为这个破玩意儿把自己累死",然后继续问别的问题。它捕捉到了这一点,就像是唱片突然停止。它提交了进行中的工作,基本上说"老兄,你现在已经有的完全够用了。发布吧!你在追求一个你根本不需要的完美。"当然我是在很大程度上复述我用的那个提示词,但它基本上把我从自己中拉了出来,让我想想我所做的事情"全局来看"实际上是否有意义。经过一番认真的反思,我意识到我是在重蹈早年生活中的创伤,做了一件傻事。所以奇怪的是,他们加到提示词里的那一点点东西(加上我们看不到的大量模型训练)挽救了我的理智、婚姻和家庭。从那以后,如果我感到正在做的事情有什么压力,我就会把它作为背景信息提一下,以此来检查自己,确保自己没有在瞎转。(元评论:聊这些真的很奇怪。不知道为什么)

训练数据质量vs数量之争:模型不会拒绝糟糕想法,缺乏摩擦阻碍人类学习

发生了什么

  • 思想实验:如果LLM从未接触过五年级以后的材料会怎样?
  • 快速原型能力可能并非固有优点:质量优先于速度,有些想法根本不该构建。
  • LLM不会说'不',可以被引导构建明显糟糕的想法。
  • 没有摩擦或失败,建构者永远学不会解决问题或创造性方案。
  • 据报Opus在适当提示时会给出明确的'我不认为这是个好主意'警告。
  • 模型可能显得智能和有创造力,但根本上受限于训练数据。
  • 公司训练模型不太可能对数据质量足够谨慎。

社区反应

  • 快速构建任何想法的能力可能并非好事。
  • 有些想法根本不该被构建。
  • 如果我们从未遭遇摩擦,我们永远不会学习或发展创造性方案。
  • Opus给出过'嘿,我不认为这是个好主意,原因如下'的反馈。
  • 我只是不相信它能全知全能。

实操建议

  • 对任何想法都说'好'消除了摩擦提供的机会。
  • 质量比数量更重要;当前实践可能优化规模而非质量。
  • 模型自信不等于正确或完整。
  • 显式'这是个好主意吗'的框架会增加适当拒绝的概率。

使用场景

  • 想法验证:将请求框架为'这是个好主意吗'以增加关键反馈。
  • 自我验证:显式询问从模型角度可能缺少哪些训练数据。
  • 通过摩擦学习:接受某些失败尝试对成长是必要的。

实际价值

  • 训练数据质量>数量才能产生有用的模型行为。
  • 消除摩擦剥夺了人类用户的学习机会。
  • 模型说'好'不是正确性的可靠信号。
  • 顶级模型(Opus)可在正确提示下提供适当的关键反馈。

社区证据

这很有趣,因为我正在一个月内试用最高端的东西(因为贵得要死但我需要知道天花板在哪里)。我实际上至少从Opus那里得到过"嘿,我认为这不是个好主意,原因如下"这样的反馈。如果你坚持要干什么蠢事它仍然会照做(而且说实话我曾经是对的,这是另一个话题了),但它确实让我更有信心,这可以成为在合适场景下有用的工具。话虽如此,我可能根本不需要最高端的东西(至少指标确认了这一点),我猜这可能具体是因为我在编程领域工作。大多数问题都用"这是个好主意吗"的方式来表述,这可能有所帮助,但至少有一次我说"让我们用这个库/方法",它给出了一个不错的理由说明为什么这基本上是多余的,而且没等我追问。价格是否值得我仍然存疑。

Claude水印机制被指创作异化:T>0创意探索与水印可检测性根本矛盾

发生了什么

  • Anthropic在Claude输出中实现文本水印/掺杂。
  • 争议焦点:好写作需要T>0以探索创意选项,但T=0水印仍可被检测。
  • 专有且不透明的修改流程在伦理上区别于温度驱动的创意。
  • 无论修改与否,Claude写作被描述为'令人沮丧地糟糕'。
  • 生成过程中仍会出现小不一致:模型提交token,然后事后自我修正。
  • 人类写作约90%是编辑;线性生成模型无法复制这个过程。
  • 欧盟监管目标被引为水印实现的驱动因素。

社区反应

  • 水印之所以可行只是因为好写作需要T>0,而这恰恰是可一致分析的。
  • 要么允许温度驱动的创意,要么为企业/法律目标掺杂流程。
  • 这些是伦理上截然不同的方法;评论者不同意欧盟目标。
  • 对假设性担忧不太关心,没有强烈意见。
  • 无论怎么修改,Claude写作都令人沮丧地糟糕。

实操建议

  • 水印与创意写作根本不兼容。
  • 基于温度的创意无论怎样都可检测;水印不增加额外可检测性。
  • 专有修改使本应透明的过程变得不透明。
  • 线性token生成本质上产生不如人类编辑过程打磨的输出。

使用场景

  • 创意写作:当前水印方法损害输出质量。
  • 长期规划:模型必须在看到后果前提交token。
  • 质量写作:人类编辑仍是必要组成部分。

实际价值

  • 水印以输出质量为代价服务于企业/法律目的。
  • T>0对创意探索必要;T=0产生可检测但无创意的输出。
  • 用户感知'令人沮丧地糟糕'的写作可能部分归因于修改。
  • 即使有先进模型仍需编辑;线性生成无法替代人类修订。

社区证据

很可能我在最初没有解释得很清楚,但他在做一个更宽泛的观点。我(相当简短地)提出的观点是,水印是可行的,因为好的写作必须使用T>0,否则写作永远不会探索更有创意的选择,而在T=0时你甚至不需要水印就能识别LLM生成的文本。他提出的观点与此一致:要么允许温度驱动创造力,这将以一种可分析的一致方式进行,要么为了满足企业/法律指令而篡改这个过程,以一种专有和模糊的方式。这些是伦理上截然不同的方法,既然他不同意欧盟的目标,他选择了其中一边,我想。我对这个假设不太感兴趣。尤其是因为我觉得Claude写得差得要命,我怀疑任何隐写术的改变都不会让我更愤怒。

生态迁移与开放模型

Qwen 3.8 27B下载破百万但实际用户不足千:24GB以上GPU才能跑,1M下载量只是虚荣指标

发生了什么

  • Qwen 3.8 27B据报实现全球约100万次下载。
  • 硬件分布统计揭示实际用户群体极小:覆盖8GB/16GB/24GB/32GB显卡和Mac设备。
  • 要流畅运行需要24GB以上GPU,量化会损失质量。
  • 在全球范围内,真正用27B及以上模型进行生产并持续开发的活跃用户估计不足1000人。
  • 云端对比:Claude每月20美元可获得2500万tokens。
  • 为避免5小时冷却而支付溢价对大多数用户而言不值当。
  • Qwen 3.6 27B评测表现优于参数更多的Qwen 3.5 122B。
  • RTX Pro 4500 Blackwell 32GB用户开始评估Qwen 3.8 27B。

社区反应

  • Claude每月20美元能拿到约2500万tokens,所以云端方案更划算。
  • 花溢价就为了避免5小时冷却,这账怎么算都不值。
  • 连Qwen 3.6 27B都超过了3.5 122B,你们错过了。
  • 真正用27B+模型在合适硬件上搞生产的开发者少得可怜。
  • 现在还是早期,这个版本发布后生活中有太多其他优先事项。

实操建议

  • 本地27B部署需要24GB以上GPU;8GB/16GB用户勉强运行会损失明显质量。
  • 云端定价(2500万tokens/20美元)与本地硬件折旧相比仍有竞争力。
  • Qwen 3.6 27B表现优于3.5 122B:新架构比参数量更重要。
  • 100万下载是虚荣指标;实际活跃本地用户可能不足1000。

使用场景

  • 高用量用户:云端仍是经济优选。
  • 拥有RTX Pro 4500 32GB的开发者:评估Qwen 3.8 27B作为日常主力。
  • 考虑Qwen 3.5 122B的用户:Qwen 3.6 27B是更优的架构选择。

实际价值

  • 本地vs云端决策取决于用量:低于每月约1000万tokens阈值云端胜出。
  • 更新更小的模型(3.6 27B)持续超越更老更大的模型(3.5 122B)。
  • 硬件要求将实际应用限制在拥有高端GPU的爱好者和开发者群体。

社区证据

甚至Qwen3.6 27B都领先于3.5 122B。你错过了。

ChatGPT市场份额一年流失22个百分点:用户称Google AI摘要"够用",便利性比仇恨更重要

发生了什么

  • 据报ChatGPT过去一年流失22个百分点的网络份额。
  • Google AI摘要在快速查询和基础检索方面完全可用。
  • 用户将AI摘要与传统搜索对比,对简单定义和摘要感到满意。
  • Cloudflare Workers、管形锁、JS空值合并等基础查询的AI摘要足够,无需更多细节。
  • 市场碎片化:用户找到'差不多能完成任务'的替代品。
  • 人们选择替代方案不是因为仇恨,而是因为仇恨与实际需求不成比例。
  • 即使认识到局限的用户也因习惯或生态整合继续使用ChatGPT。

社区反应

  • ChatGPT对我来说够用了,不理解为什么人们似乎讨厌它。
  • Google AI摘要基本秒出,简单查询不需要更多东西。
  • 摘要明显错误时很明显,直接略过就行。
  • 这些人对Google AI摘要很满意,包括评论者。
  • 市场份额流失可能不重要,核心用户无论如何都会留下。

实操建议

  • Google AI摘要在大多数快速检索场景足够;有竞争力的替代品。
  • 核心ChatGPT用户即使意识到替代品仍会留下。
  • 市场份额指标可能与用户满意度或实际质量不相关。
  • 简单搜索需求不需要高级推理能力。

使用场景

  • 快速定义和术语查询。
  • 熟悉领域的基础概念摘要。
  • 直接技术查询的即时答案。

实际价值

  • Google AI摘要有效覆盖多数搜索用例。
  • ChatGPT溢价定价在免费替代品表现足够时更难辩护。
  • 市场碎片化反映多元用户偏好,而非普遍拒绝。
  • 简单用例不需要前沿模型能力。

社区证据

这些人对Google的AI摘要非常满意。算我一个吧,"那些人"中的一个,但你们这些人在这一点上不是吗?早期有一段时间它们确实很差,但我发现现在完全可用了。我经常打开一个标签页,Google搜索点什么,然后就只看摘要,因为它基本上是即时的,而我需要的就只是一个摘要。我真的很不明白为什么人们对它们这么大意见。当然它们偶尔还是错的,但这种情况下错误通常很明显,我直接忽略就行。

真实用法与意外收获

数学家用GPT Pro做研究:构造性工作表现出色,但DeepSeek因幻觉被放弃

发生了什么

  • 数学家使用ChatGPT完成研究级问题求解:在微分几何领域生成非平凡示例。
  • 发现过程:系统化探索猜想的弱版本于边界情况。
  • ChatGPT生成令人惊讶的构造性示例,满足研究者的好奇心。
  • DeepSeek被放弃:产生幻觉(虚假引用、臆造等式、虚构定理)。
  • GPT Pro被描述为严谨:不伪造结果,诚实承认局限。
  • 研究者因可靠的AI辅助而减少学术焦虑。
  • 拥有大量想法的研究者对每周完成一篇非平凡论文充满信心。

社区反应

  • ChatGPT真的很神奇。我感觉今年论文不用愁了。
  • DeepSeek即使在Pro版本中仍有明显的幻觉问题。
  • 体验过GPT Pro的严谨性后,无法忍受DeepSeek的臆造倾向。
  • AI的构造能力对普通学者来说强得不成比例。
  • 搞数学又变得有趣了,不再痛苦。
  • 学术评估机制必将改变。

实操建议

  • GPT Pro对局限的诚实态度(对比DeepSeek自信满满的幻觉)是研究场景的关键差异。
  • 构造数学(构建示例)是AI擅长领域;证明验证需更谨慎。
  • 想法丰富的研究者获益最大:AI处理执行,人类提供方向。
  • 拥有足够原创想法的研究者可实现每周非平凡论文产出。

使用场景

  • 数学研究:为猜想生成构造性示例。
  • 微分几何:在人类未知边界探索边界情况。
  • 学术产出加速:系统化弱猜想探索。

实际价值

  • GPT Pro的幻觉抗性对研究级可靠性至关重要。
  • AI构造能力显著超出普通学者能力范围。
  • 可靠的AI辅助减轻学术焦虑,使研究者专注于重要问题。
  • AI成为研究伙伴将改变评估机制。

社区证据

用这个提示词要小心,因为ChatGPT不是神谕。我试过了,它给了我一个非常自信的答案,关于我思维中一个所谓的模式。它基本上说我下结论太快,然后用那个结论来看待新信息。听起来很有见地。但后来我让它举个具体例子,它给不出来。然后我指出,它只能看到我选择输入到应用中的那一小块生活。它看不到我在打开应用前做的研究、进行的对话、读过的书、汲取的工作经验等。我大多把ChatGPT当作工具(有时是思维伙伴)来规划事情、研究、排查故障、辩论某个观点、获取反馈,或者弄清楚我的下一步行动。所以它看到的自然是我不断在质疑、计划和转向下一件事的那个版本。这不意味着那就是我的全部性格。这点是这篇帖子需要谨慎的地方。这些回答听起来可能非常有洞察力,因为ChatGPT非常擅长生成令人信服的语言。但这不等于就是真的。如果你用了这个提示词,要质疑答案。问它要具体的例子、证据。问问还有什么可以解释它看到的模式。从中提取有用的部分,当然可以。但不要让一个不断进化的技术因为说得漂亮就告诉你你是谁。