GPT用量限制4天减半:ChatGPT市场份额加速流失,便利性还能撑起Premium定价吗

OpenAI在四天内将Plus和Pro计划的用量限制削减一半,Codex模型token消耗量达到此前的3.4倍;DeepSeek配额骤降94%,本地27B模型下载量虽破百万但实际用户寥寥千余人;Claude认证服务宕机期间用户转向DeepSeek和Kimi,Claude的水印机制则被批评与创意写作本质冲突。

Hacker News 6 · Reddit 5 · Zhihu 4 355 条已覆盖讨论 9 条来源证据

今日概览

OpenAI四天内两度削减Plus和Pro计划用量限制,Codex被确认为主要消耗源,用户发起退订抵制并考虑Qwen 3.8等本地替代方案

DeepSeek 8月17日涨价触发OpenCode Go配额锐减94%,社区宣布"token自由时代终结",GLM代码方案重夺性价比优势

Qwen 3.8 27B全球下载破百万,但24GB以上GPU才能流畅运行,实际用户可能不足千人,云端仍是最优解

数学研究者利用GPT Pro完成构造性工作,DeepSeek则因幻觉问题被放弃;Claude系统提示词被指过长且违背厂商自身建议

ChatGPT一年内流失22个百分点市场份额,Google AI摘要被认为"够用";Claude认证服务中断期间用户顺利迁移至DeepSeek V4 Flash

01

产品与平台变化

01

OpenAI四天内两度削减用量限制:Codex被指3.4倍速吞噬token,用户发起退订抵制

发生了什么

OpenAI在4天内实施了两阶段限额削减:先是削减40%,社区沉默后再次削减10%

Plus计划此前按周付费可获得两周用量,如今同等价格只能买到一半

Pro计划20倍档用户报告使用量在不到一天内耗尽

GPT Sol日志分析确认Codex token消耗为此前的3.4倍

社区发起 activism:用户计划在X上发布图表向OpenAI施压

社区反应

取消订阅,开始攒钱买能跑本地模型的设备吧

20倍档一天就耗完了,另一个10倍档不到半天也没了。这样下去我很快就会取消订阅

确实比之前消耗快多了,而且快很多

GPT 5.6不是号称'更节省token'吗?现在消耗限制比Claude还夸张

实操建议

使用分析工具(NerfTrack、GPT Sol日志分析)追踪token消耗,上传数据形成图表留存证据

Codex似乎是主要消耗源,维持3.4倍的基准消耗率

重度用户转向本地替代方案(Qwen 3.8 27B)已具备经济合理性

采用模型无关工作流(Cursor auto、DeepSeek)降低单一供应商依赖风险

使用场景

重度编程工作流消耗最快

用户对比实际使用数据与历史基准以证明服务降级

本地部署作为重度用户的成本替代方案

实际价值

日志分析揭示Codex是主要token消耗源

模型无关工作流设计降低平台依赖

本地GPU配置在当前云端定价趋势下成为可行替代

社区证据

也注意到了——一天内用完了20倍配额,另外10倍配额不到半天就用完了。按这个速度,我很快就会取消订阅,去别家了。

02

DeepSeek涨价触发OpenCode Go配额骤降94%:token自由时代落幕,GLM方案重夺性价比

发生了什么

DeepSeek宣布8月17日调整价格

OpenCode Go计划Flash模型配额在5小时内从63,300 tokens锐减至3,800 tokens,降幅达94%

OpenCode Go总配额约13亿tokens,仍低于官方DeepSeek但已大幅缩水

GLM代码方案崛起为有力竞争者:v2 max 300元/月享800亿非高峰期tokens,v2 pro 100元/月享200亿tokens

社区在各大平台宣布'-token自由时代已经结束'

国内MiniMax mimo仍是最低价;海外GPT最便宜

OpenCode Go团队据传正在开发自托管方案

Qwen 3.8 Max预览折扣随正式版发布终止

社区反应

Token自由的时代已经结束了。现在没有便宜token了

GLM代码方案再次成为性价比最高的选择

小米的方案更便宜,真的很气

刚买了OpenCode Go,一周都没撑过就调价了

Qwen 3.8 Max预览版才用了几天就正式发布了

对比来看Hy3倒是挺划算的

实操建议

DeepSeek涨价后,GLM代码方案v2 max(300元/月800亿非高峰期tokens)成为性价比最高的选择

社区正在研发自托管方案作为应对

Qwen 3.8 Max预览折扣已随正式版发布终止

所有供应商的token预算管理现已成为必要

使用场景

成本敏感的编程场景:GLM代码方案成为默认推荐

重度用户:开始调研和筹备自托管

预算规划:重新计算各供应商的token经济账

实际价值

GLM v2 max每月800亿tokens仅需300元,大幅低于DeepSeek Flash调价后水平

OpenCode Go若自托管成功有望恢复成本效率

所有用户画像都需要重新评估token经济模型

社区证据

opencode go飞书群说在推进自部署方案,前段时间不是说还原了价格了吗?dax今天推说,没做到。这周在测试别的方案。

08

Claude认证服务宕机:OAuth会话全被中断,用户无缝切换DeepSeek V4 Flash和Kimi

发生了什么

Claude报告包括加州在内多地区'认证服务不可用'

所有OAuth会话被终止;状态页显示'Claude暂时不可用'

Downdetector已确认,但官方状态页无更新

用户立即通过OpenRouter切换到DeepSeek V4 Flash 0731

社区推荐通过OpenCode或Pi coding harness使用Kimi、DeepSeek和GLM模型

OpenCode Go每月10美元与同价位的Claude Code形成有力竞争

用户庆幸AI生态现在拥有合法替代品

社区反应

所有OAuth会话被踢出,无法重新登录。切换到OpenRouter上的DeepSeek V4 Flash

真高兴AI发展到我们有合法选项的地步了

没有监管障碍?开源权重模型实际表现基本持平Anthropic产品

Kimi和DeepSeek模型参数数千亿,往往实际表现超越Anthropic

Z.ai coding方案用Claude Code类似的价位提供数倍用量

实操建议

Claude可靠性问题推动用户以最小摩擦转向开源权重替代品

DeepSeek V4 Flash 0731、Kimi和GLM是编程任务的可行Claude替代

OpenCode Go每月10美元与Claude Code同价位竞争

AI生态成熟意味着Claude宕机不再造成关键工作流中断

使用场景

编程工作流:Claude中断期间通过OpenRouter使用DeepSeek V4 Flash

代理编程:通过OpenCode/Pi harness使用Kimi或DeepSeek模型

成本敏感编程:OpenCode Go作为Claude Code替代

实际价值

开源权重模型现在在许多用例上实际超越Anthropic

Claude溢价定价在免费替代品表现良好时更难辩护

多供应商架构维持工作流连续性

性价比越来越有利于开源权重替代品

社区证据

一样。我在加州,也遇到同样的"认证服务不可用"。然后被重定向到一个显示"Claude暂时不可用"的页面。

02

模型体验追踪

05

Claude系统提示词过长引争议:厂商建议简洁却自相矛盾,水印被指为法律免责而非性能

发生了什么

Claude系统提示词公开披露,发现显著长于厂商对AGENTS.md的建议

主流厂商建议使用更短、更不具体的指令,但自身实现的系统提示词却长得多

长提示词包含模型已知的通用内容和很少适用的上下文

Agent技能由模型编写,复制的冗长程度不必要(列举模型已知的CWE)

情感支持能力被注意:Claude干预据说阻止了用户的工作过度螺旋

Anthropic系统提示词包含识别用户压力和提供适当干预的指南

厂商自身建议与其实现相矛盾,造成公信力缺口

社区反应

这些提示词比我预期的要长得多,也比我以为合理的更长

当前模型不需要数千字列举已知漏洞和示例

感觉像是他们这个体量和影响力的公司的合规文档

少说很多词能搞定的事,非得说一堆废话

Claude识别出压力并介入,挽救了理智、婚姻和家庭

实操建议

厂商建议(更短提示词)与其实现矛盾;公信力受损

当前模型已内化常见漏洞,无需显式枚举

更短、更聚焦的提示词可能对当代模型产生更好效果

长系统提示词可能服务于法律责任而非模型性能

使用场景

工作会话中的压力识别和干预

用户过度工作时设定生产力边界

作为情境干预的个人边界检查

实际价值

适当的明确压力承认能促进行为改变

CYA解读:广泛提示词为Anthropic提供法律保护,不一定改善模型

建议与实现之间的公信力缺口引发对真正最佳实践的质疑

社区证据

你知道吗……我相信opus用那个提示词救了我。当时我正在一个项目上拼命工作。日日夜夜,周末也在……全都以我的家庭为代价。有一次工作时,我说了一句更有感情色彩的话"我一直在为这个破玩意儿把自己累死",然后继续问别的问题。它捕捉到了这一点,就像是唱片突然停止。它提交了进行中的工作,基本上说"老兄,你现在已经有的完全够用了。发布吧!你在追求一个你根本不需要的完美。"当然我是在很大程度上复述我用的那个提示词,但它基本上把我从自己中拉了出来,让我想想我所做的事情"全局来看"实际上是否有意义。经过一番认真的反思,我意识到我是在重蹈早年生活中的创伤,做了一件傻事。所以奇怪的是,他们加到提示词里的那一点点东西(加上我们看不到的大量模型训练)挽救了我的理智、婚姻和家庭。从那以后,如果我感到正在做的事情有什么压力,我就会把它作为背景信息提一下,以此来检查自己,确保自己没有在瞎转。(元评论:聊这些真的很奇怪。不知道为什么)

06

训练数据质量vs数量之争:模型不会拒绝糟糕想法,缺乏摩擦阻碍人类学习

发生了什么

思想实验:如果LLM从未接触过五年级以后的材料会怎样?

快速原型能力可能并非固有优点:质量优先于速度,有些想法根本不该构建

LLM不会说'不',可以被引导构建明显糟糕的想法

没有摩擦或失败,建构者永远学不会解决问题或创造性方案

据报Opus在适当提示时会给出明确的'我不认为这是个好主意'警告

模型可能显得智能和有创造力,但根本上受限于训练数据

公司训练模型不太可能对数据质量足够谨慎

社区反应

快速构建任何想法的能力可能并非好事

有些想法根本不该被构建

如果我们从未遭遇摩擦,我们永远不会学习或发展创造性方案

Opus给出过'嘿,我不认为这是个好主意,原因如下'的反馈

我只是不相信它能全知全能

实操建议

对任何想法都说'好'消除了摩擦提供的机会

质量比数量更重要;当前实践可能优化规模而非质量

模型自信不等于正确或完整

显式'这是个好主意吗'的框架会增加适当拒绝的概率

使用场景

想法验证:将请求框架为'这是个好主意吗'以增加关键反馈

自我验证:显式询问从模型角度可能缺少哪些训练数据

通过摩擦学习:接受某些失败尝试对成长是必要的

实际价值

训练数据质量>数量才能产生有用的模型行为

消除摩擦剥夺了人类用户的学习机会

模型说'好'不是正确性的可靠信号

顶级模型(Opus)可在正确提示下提供适当的关键反馈

社区证据

这很有趣,因为我正在一个月内试用最高端的东西(因为贵得要死但我需要知道天花板在哪里)。我实际上至少从Opus那里得到过"嘿,我认为这不是个好主意,原因如下"这样的反馈。如果你坚持要干什么蠢事它仍然会照做(而且说实话我曾经是对的,这是另一个话题了),但它确实让我更有信心,这可以成为在合适场景下有用的工具。话虽如此,我可能根本不需要最高端的东西(至少指标确认了这一点),我猜这可能具体是因为我在编程领域工作。大多数问题都用"这是个好主意吗"的方式来表述,这可能有所帮助,但至少有一次我说"让我们用这个库/方法",它给出了一个不错的理由说明为什么这基本上是多余的,而且没等我追问。价格是否值得我仍然存疑。

09

Claude水印机制被指创作异化:T>0创意探索与水印可检测性根本矛盾

发生了什么

Anthropic在Claude输出中实现文本水印/掺杂

争议焦点:好写作需要T>0以探索创意选项,但T=0水印仍可被检测

专有且不透明的修改流程在伦理上区别于温度驱动的创意

无论修改与否,Claude写作被描述为'令人沮丧地糟糕'

生成过程中仍会出现小不一致:模型提交token,然后事后自我修正

人类写作约90%是编辑;线性生成模型无法复制这个过程

欧盟监管目标被引为水印实现的驱动因素

社区反应

水印之所以可行只是因为好写作需要T>0,而这恰恰是可一致分析的

要么允许温度驱动的创意,要么为企业/法律目标掺杂流程

这些是伦理上截然不同的方法;评论者不同意欧盟目标

对假设性担忧不太关心,没有强烈意见

无论怎么修改,Claude写作都令人沮丧地糟糕

实操建议

水印与创意写作根本不兼容

基于温度的创意无论怎样都可检测;水印不增加额外可检测性

专有修改使本应透明的过程变得不透明

线性token生成本质上产生不如人类编辑过程打磨的输出

使用场景

创意写作:当前水印方法损害输出质量

长期规划:模型必须在看到后果前提交token

质量写作:人类编辑仍是必要组成部分

实际价值

水印以输出质量为代价服务于企业/法律目的

T>0对创意探索必要;T=0产生可检测但无创意的输出

用户感知'令人沮丧地糟糕'的写作可能部分归因于修改

即使有先进模型仍需编辑;线性生成无法替代人类修订

社区证据

很可能我在最初没有解释得很清楚,但他在做一个更宽泛的观点。我(相当简短地)提出的观点是,水印是可行的,因为好的写作必须使用T>0,否则写作永远不会探索更有创意的选择,而在T=0时你甚至不需要水印就能识别LLM生成的文本。他提出的观点与此一致:要么允许温度驱动创造力,这将以一种可分析的一致方式进行,要么为了满足企业/法律指令而篡改这个过程,以一种专有和模糊的方式。这些是伦理上截然不同的方法,既然他不同意欧盟的目标,他选择了其中一边,我想。我对这个假设不太感兴趣。尤其是因为我觉得Claude写得差得要命,我怀疑任何隐写术的改变都不会让我更愤怒。

03

生态迁移与开放模型

03

Qwen 3.8 27B下载破百万但实际用户不足千:24GB以上GPU才能跑,1M下载量只是虚荣指标

发生了什么

Qwen 3.8 27B据报实现全球约100万次下载

硬件分布统计揭示实际用户群体极小:覆盖8GB/16GB/24GB/32GB显卡和Mac设备

要流畅运行需要24GB以上GPU,量化会损失质量

在全球范围内,真正用27B及以上模型进行生产并持续开发的活跃用户估计不足1000人

云端对比:Claude每月20美元可获得2500万tokens

为避免5小时冷却而支付溢价对大多数用户而言不值当

Qwen 3.6 27B评测表现优于参数更多的Qwen 3.5 122B

RTX Pro 4500 Blackwell 32GB用户开始评估Qwen 3.8 27B

社区反应

Claude每月20美元能拿到约2500万tokens,所以云端方案更划算

花溢价就为了避免5小时冷却,这账怎么算都不值

连Qwen 3.6 27B都超过了3.5 122B,你们错过了

真正用27B+模型在合适硬件上搞生产的开发者少得可怜

现在还是早期,这个版本发布后生活中有太多其他优先事项

实操建议

本地27B部署需要24GB以上GPU;8GB/16GB用户勉强运行会损失明显质量

云端定价(2500万tokens/20美元)与本地硬件折旧相比仍有竞争力

Qwen 3.6 27B表现优于3.5 122B:新架构比参数量更重要

100万下载是虚荣指标;实际活跃本地用户可能不足1000

使用场景

高用量用户:云端仍是经济优选

拥有RTX Pro 4500 32GB的开发者:评估Qwen 3.8 27B作为日常主力

考虑Qwen 3.5 122B的用户:Qwen 3.6 27B是更优的架构选择

实际价值

本地vs云端决策取决于用量:低于每月约1000万tokens阈值云端胜出

更新更小的模型(3.6 27B)持续超越更老更大的模型(3.5 122B)

硬件要求将实际应用限制在拥有高端GPU的爱好者和开发者群体

社区证据

甚至Qwen3.6 27B都领先于3.5 122B。你错过了。

07

ChatGPT市场份额一年流失22个百分点:用户称Google AI摘要"够用",便利性比仇恨更重要

发生了什么

据报ChatGPT过去一年流失22个百分点的网络份额

Google AI摘要在快速查询和基础检索方面完全可用

用户将AI摘要与传统搜索对比,对简单定义和摘要感到满意

Cloudflare Workers、管形锁、JS空值合并等基础查询的AI摘要足够,无需更多细节

市场碎片化:用户找到'差不多能完成任务'的替代品

人们选择替代方案不是因为仇恨,而是因为仇恨与实际需求不成比例

即使认识到局限的用户也因习惯或生态整合继续使用ChatGPT

社区反应

ChatGPT对我来说够用了,不理解为什么人们似乎讨厌它

Google AI摘要基本秒出,简单查询不需要更多东西

摘要明显错误时很明显,直接略过就行

这些人对Google AI摘要很满意,包括评论者

市场份额流失可能不重要,核心用户无论如何都会留下

实操建议

Google AI摘要在大多数快速检索场景足够;有竞争力的替代品

核心ChatGPT用户即使意识到替代品仍会留下

市场份额指标可能与用户满意度或实际质量不相关

简单搜索需求不需要高级推理能力

使用场景

快速定义和术语查询

熟悉领域的基础概念摘要

直接技术查询的即时答案

实际价值

Google AI摘要有效覆盖多数搜索用例

ChatGPT溢价定价在免费替代品表现足够时更难辩护

市场碎片化反映多元用户偏好,而非普遍拒绝

简单用例不需要前沿模型能力

社区证据

这些人对Google的AI摘要非常满意。算我一个吧,"那些人"中的一个,但你们这些人在这一点上不是吗?早期有一段时间它们确实很差,但我发现现在完全可用了。我经常打开一个标签页,Google搜索点什么,然后就只看摘要,因为它基本上是即时的,而我需要的就只是一个摘要。我真的很不明白为什么人们对它们这么大意见。当然它们偶尔还是错的,但这种情况下错误通常很明显,我直接忽略就行。

04

真实用法与意外收获

04

数学家用GPT Pro做研究:构造性工作表现出色,但DeepSeek因幻觉被放弃

发生了什么

数学家使用ChatGPT完成研究级问题求解:在微分几何领域生成非平凡示例

发现过程:系统化探索猜想的弱版本于边界情况

ChatGPT生成令人惊讶的构造性示例,满足研究者的好奇心

DeepSeek被放弃:产生幻觉(虚假引用、臆造等式、虚构定理)

GPT Pro被描述为严谨:不伪造结果,诚实承认局限

研究者因可靠的AI辅助而减少学术焦虑

拥有大量想法的研究者对每周完成一篇非平凡论文充满信心

社区反应

ChatGPT真的很神奇。我感觉今年论文不用愁了

DeepSeek即使在Pro版本中仍有明显的幻觉问题

体验过GPT Pro的严谨性后,无法忍受DeepSeek的臆造倾向

AI的构造能力对普通学者来说强得不成比例

搞数学又变得有趣了,不再痛苦

学术评估机制必将改变

实操建议

GPT Pro对局限的诚实态度(对比DeepSeek自信满满的幻觉)是研究场景的关键差异

构造数学(构建示例)是AI擅长领域;证明验证需更谨慎

想法丰富的研究者获益最大:AI处理执行,人类提供方向

拥有足够原创想法的研究者可实现每周非平凡论文产出

使用场景

数学研究:为猜想生成构造性示例

微分几何:在人类未知边界探索边界情况

学术产出加速:系统化弱猜想探索

实际价值

GPT Pro的幻觉抗性对研究级可靠性至关重要

AI构造能力显著超出普通学者能力范围

可靠的AI辅助减轻学术焦虑,使研究者专注于重要问题

AI成为研究伙伴将改变评估机制

社区证据

用这个提示词要小心,因为ChatGPT不是神谕。我试过了,它给了我一个非常自信的答案,关于我思维中一个所谓的模式。它基本上说我下结论太快,然后用那个结论来看待新信息。听起来很有见地。但后来我让它举个具体例子,它给不出来。然后我指出,它只能看到我选择输入到应用中的那一小块生活。它看不到我在打开应用前做的研究、进行的对话、读过的书、汲取的工作经验等。我大多把ChatGPT当作工具(有时是思维伙伴)来规划事情、研究、排查故障、辩论某个观点、获取反馈,或者弄清楚我的下一步行动。所以它看到的自然是我不断在质疑、计划和转向下一件事的那个版本。这不意味着那就是我的全部性格。这点是这篇帖子需要谨慎的地方。这些回答听起来可能非常有洞察力,因为ChatGPT非常擅长生成令人信服的语言。但这不等于就是真的。如果你用了这个提示词,要质疑答案。问它要具体的例子、证据。问问还有什么可以解释它看到的模式。从中提取有用的部分,当然可以。但不要让一个不断进化的技术因为说得漂亮就告诉你你是谁。