GPT用量限制4天减半:ChatGPT市场份额加速流失,便利性还能撑起Premium定价吗
OpenAI在四天内将Plus和Pro计划的用量限制削减一半,Codex模型token消耗量达到此前的3.4倍;DeepSeek配额骤降94%,本地27B模型下载量虽破百万但实际用户寥寥千余人;Claude认证服务宕机期间用户转向DeepSeek和Kimi,Claude的水印机制则被批评与创意写作本质冲突。
今日概览
OpenAI四天内两度削减Plus和Pro计划用量限制,Codex被确认为主要消耗源,用户发起退订抵制并考虑Qwen 3.8等本地替代方案。
DeepSeek 8月17日涨价触发OpenCode Go配额锐减94%,社区宣布"token自由时代终结",GLM代码方案重夺性价比优势。
Qwen 3.8 27B全球下载破百万,但24GB以上GPU才能流畅运行,实际用户可能不足千人,云端仍是最优解。
数学研究者利用GPT Pro完成构造性工作,DeepSeek则因幻觉问题被放弃;Claude系统提示词被指过长且违背厂商自身建议。
ChatGPT一年内流失22个百分点市场份额,Google AI摘要被认为"够用";Claude认证服务中断期间用户顺利迁移至DeepSeek V4 Flash。
产品与平台变化
DeepSeek涨价触发OpenCode Go配额骤降94%:token自由时代落幕,GLM方案重夺性价比
发生了什么
- DeepSeek宣布8月17日调整价格。
- OpenCode Go计划Flash模型配额在5小时内从63,300 tokens锐减至3,800 tokens,降幅达94%。
- OpenCode Go总配额约13亿tokens,仍低于官方DeepSeek但已大幅缩水。
- GLM代码方案崛起为有力竞争者:v2 max 300元/月享800亿非高峰期tokens,v2 pro 100元/月享200亿tokens。
- 社区在各大平台宣布'-token自由时代已经结束'。
- 国内MiniMax mimo仍是最低价;海外GPT最便宜。
- OpenCode Go团队据传正在开发自托管方案。
- Qwen 3.8 Max预览折扣随正式版发布终止。
社区反应
- Token自由的时代已经结束了。现在没有便宜token了。
- GLM代码方案再次成为性价比最高的选择。
- 小米的方案更便宜,真的很气。
- 刚买了OpenCode Go,一周都没撑过就调价了。
- Qwen 3.8 Max预览版才用了几天就正式发布了。
- 对比来看Hy3倒是挺划算的。
实操建议
- DeepSeek涨价后,GLM代码方案v2 max(300元/月800亿非高峰期tokens)成为性价比最高的选择。
- 社区正在研发自托管方案作为应对。
- Qwen 3.8 Max预览折扣已随正式版发布终止。
- 所有供应商的token预算管理现已成为必要。
使用场景
- 成本敏感的编程场景:GLM代码方案成为默认推荐。
- 重度用户:开始调研和筹备自托管。
- 预算规划:重新计算各供应商的token经济账。
实际价值
- GLM v2 max每月800亿tokens仅需300元,大幅低于DeepSeek Flash调价后水平。
- OpenCode Go若自托管成功有望恢复成本效率。
- 所有用户画像都需要重新评估token经济模型。
社区证据
opencode go飞书群说在推进自部署方案,前段时间不是说还原了价格了吗?dax今天推说,没做到。这周在测试别的方案。
Claude认证服务宕机:OAuth会话全被中断,用户无缝切换DeepSeek V4 Flash和Kimi
发生了什么
- Claude报告包括加州在内多地区'认证服务不可用'。
- 所有OAuth会话被终止;状态页显示'Claude暂时不可用'。
- Downdetector已确认,但官方状态页无更新。
- 用户立即通过OpenRouter切换到DeepSeek V4 Flash 0731。
- 社区推荐通过OpenCode或Pi coding harness使用Kimi、DeepSeek和GLM模型。
- OpenCode Go每月10美元与同价位的Claude Code形成有力竞争。
- 用户庆幸AI生态现在拥有合法替代品。
社区反应
- 所有OAuth会话被踢出,无法重新登录。切换到OpenRouter上的DeepSeek V4 Flash。
- 真高兴AI发展到我们有合法选项的地步了。
- 没有监管障碍?开源权重模型实际表现基本持平Anthropic产品。
- Kimi和DeepSeek模型参数数千亿,往往实际表现超越Anthropic。
- Z.ai coding方案用Claude Code类似的价位提供数倍用量。
实操建议
- Claude可靠性问题推动用户以最小摩擦转向开源权重替代品。
- DeepSeek V4 Flash 0731、Kimi和GLM是编程任务的可行Claude替代。
- OpenCode Go每月10美元与Claude Code同价位竞争。
- AI生态成熟意味着Claude宕机不再造成关键工作流中断。
使用场景
- 编程工作流:Claude中断期间通过OpenRouter使用DeepSeek V4 Flash。
- 代理编程:通过OpenCode/Pi harness使用Kimi或DeepSeek模型。
- 成本敏感编程:OpenCode Go作为Claude Code替代。
实际价值
- 开源权重模型现在在许多用例上实际超越Anthropic。
- Claude溢价定价在免费替代品表现良好时更难辩护。
- 多供应商架构维持工作流连续性。
- 性价比越来越有利于开源权重替代品。
社区证据
一样。我在加州,也遇到同样的"认证服务不可用"。然后被重定向到一个显示"Claude暂时不可用"的页面。
模型体验追踪
Claude系统提示词过长引争议:厂商建议简洁却自相矛盾,水印被指为法律免责而非性能
发生了什么
- Claude系统提示词公开披露,发现显著长于厂商对AGENTS.md的建议。
- 主流厂商建议使用更短、更不具体的指令,但自身实现的系统提示词却长得多。
- 长提示词包含模型已知的通用内容和很少适用的上下文。
- Agent技能由模型编写,复制的冗长程度不必要(列举模型已知的CWE)。
- 情感支持能力被注意:Claude干预据说阻止了用户的工作过度螺旋。
- Anthropic系统提示词包含识别用户压力和提供适当干预的指南。
- 厂商自身建议与其实现相矛盾,造成公信力缺口。
社区反应
- 这些提示词比我预期的要长得多,也比我以为合理的更长。
- 当前模型不需要数千字列举已知漏洞和示例。
- 感觉像是他们这个体量和影响力的公司的合规文档。
- 少说很多词能搞定的事,非得说一堆废话。
- Claude识别出压力并介入,挽救了理智、婚姻和家庭。
实操建议
- 厂商建议(更短提示词)与其实现矛盾;公信力受损。
- 当前模型已内化常见漏洞,无需显式枚举。
- 更短、更聚焦的提示词可能对当代模型产生更好效果。
- 长系统提示词可能服务于法律责任而非模型性能。
使用场景
- 工作会话中的压力识别和干预。
- 用户过度工作时设定生产力边界。
- 作为情境干预的个人边界检查。
实际价值
- 适当的明确压力承认能促进行为改变。
- CYA解读:广泛提示词为Anthropic提供法律保护,不一定改善模型。
- 建议与实现之间的公信力缺口引发对真正最佳实践的质疑。
社区证据
你知道吗……我相信opus用那个提示词救了我。当时我正在一个项目上拼命工作。日日夜夜,周末也在……全都以我的家庭为代价。有一次工作时,我说了一句更有感情色彩的话"我一直在为这个破玩意儿把自己累死",然后继续问别的问题。它捕捉到了这一点,就像是唱片突然停止。它提交了进行中的工作,基本上说"老兄,你现在已经有的完全够用了。发布吧!你在追求一个你根本不需要的完美。"当然我是在很大程度上复述我用的那个提示词,但它基本上把我从自己中拉了出来,让我想想我所做的事情"全局来看"实际上是否有意义。经过一番认真的反思,我意识到我是在重蹈早年生活中的创伤,做了一件傻事。所以奇怪的是,他们加到提示词里的那一点点东西(加上我们看不到的大量模型训练)挽救了我的理智、婚姻和家庭。从那以后,如果我感到正在做的事情有什么压力,我就会把它作为背景信息提一下,以此来检查自己,确保自己没有在瞎转。(元评论:聊这些真的很奇怪。不知道为什么)
训练数据质量vs数量之争:模型不会拒绝糟糕想法,缺乏摩擦阻碍人类学习
发生了什么
- 思想实验:如果LLM从未接触过五年级以后的材料会怎样?
- 快速原型能力可能并非固有优点:质量优先于速度,有些想法根本不该构建。
- LLM不会说'不',可以被引导构建明显糟糕的想法。
- 没有摩擦或失败,建构者永远学不会解决问题或创造性方案。
- 据报Opus在适当提示时会给出明确的'我不认为这是个好主意'警告。
- 模型可能显得智能和有创造力,但根本上受限于训练数据。
- 公司训练模型不太可能对数据质量足够谨慎。
社区反应
- 快速构建任何想法的能力可能并非好事。
- 有些想法根本不该被构建。
- 如果我们从未遭遇摩擦,我们永远不会学习或发展创造性方案。
- Opus给出过'嘿,我不认为这是个好主意,原因如下'的反馈。
- 我只是不相信它能全知全能。
实操建议
- 对任何想法都说'好'消除了摩擦提供的机会。
- 质量比数量更重要;当前实践可能优化规模而非质量。
- 模型自信不等于正确或完整。
- 显式'这是个好主意吗'的框架会增加适当拒绝的概率。
使用场景
- 想法验证:将请求框架为'这是个好主意吗'以增加关键反馈。
- 自我验证:显式询问从模型角度可能缺少哪些训练数据。
- 通过摩擦学习:接受某些失败尝试对成长是必要的。
实际价值
- 训练数据质量>数量才能产生有用的模型行为。
- 消除摩擦剥夺了人类用户的学习机会。
- 模型说'好'不是正确性的可靠信号。
- 顶级模型(Opus)可在正确提示下提供适当的关键反馈。
社区证据
这很有趣,因为我正在一个月内试用最高端的东西(因为贵得要死但我需要知道天花板在哪里)。我实际上至少从Opus那里得到过"嘿,我认为这不是个好主意,原因如下"这样的反馈。如果你坚持要干什么蠢事它仍然会照做(而且说实话我曾经是对的,这是另一个话题了),但它确实让我更有信心,这可以成为在合适场景下有用的工具。话虽如此,我可能根本不需要最高端的东西(至少指标确认了这一点),我猜这可能具体是因为我在编程领域工作。大多数问题都用"这是个好主意吗"的方式来表述,这可能有所帮助,但至少有一次我说"让我们用这个库/方法",它给出了一个不错的理由说明为什么这基本上是多余的,而且没等我追问。价格是否值得我仍然存疑。
Claude水印机制被指创作异化:T>0创意探索与水印可检测性根本矛盾
发生了什么
- Anthropic在Claude输出中实现文本水印/掺杂。
- 争议焦点:好写作需要T>0以探索创意选项,但T=0水印仍可被检测。
- 专有且不透明的修改流程在伦理上区别于温度驱动的创意。
- 无论修改与否,Claude写作被描述为'令人沮丧地糟糕'。
- 生成过程中仍会出现小不一致:模型提交token,然后事后自我修正。
- 人类写作约90%是编辑;线性生成模型无法复制这个过程。
- 欧盟监管目标被引为水印实现的驱动因素。
社区反应
- 水印之所以可行只是因为好写作需要T>0,而这恰恰是可一致分析的。
- 要么允许温度驱动的创意,要么为企业/法律目标掺杂流程。
- 这些是伦理上截然不同的方法;评论者不同意欧盟目标。
- 对假设性担忧不太关心,没有强烈意见。
- 无论怎么修改,Claude写作都令人沮丧地糟糕。
实操建议
- 水印与创意写作根本不兼容。
- 基于温度的创意无论怎样都可检测;水印不增加额外可检测性。
- 专有修改使本应透明的过程变得不透明。
- 线性token生成本质上产生不如人类编辑过程打磨的输出。
使用场景
- 创意写作:当前水印方法损害输出质量。
- 长期规划:模型必须在看到后果前提交token。
- 质量写作:人类编辑仍是必要组成部分。
实际价值
- 水印以输出质量为代价服务于企业/法律目的。
- T>0对创意探索必要;T=0产生可检测但无创意的输出。
- 用户感知'令人沮丧地糟糕'的写作可能部分归因于修改。
- 即使有先进模型仍需编辑;线性生成无法替代人类修订。
社区证据
很可能我在最初没有解释得很清楚,但他在做一个更宽泛的观点。我(相当简短地)提出的观点是,水印是可行的,因为好的写作必须使用T>0,否则写作永远不会探索更有创意的选择,而在T=0时你甚至不需要水印就能识别LLM生成的文本。他提出的观点与此一致:要么允许温度驱动创造力,这将以一种可分析的一致方式进行,要么为了满足企业/法律指令而篡改这个过程,以一种专有和模糊的方式。这些是伦理上截然不同的方法,既然他不同意欧盟的目标,他选择了其中一边,我想。我对这个假设不太感兴趣。尤其是因为我觉得Claude写得差得要命,我怀疑任何隐写术的改变都不会让我更愤怒。
生态迁移与开放模型
Qwen 3.8 27B下载破百万但实际用户不足千:24GB以上GPU才能跑,1M下载量只是虚荣指标
发生了什么
- Qwen 3.8 27B据报实现全球约100万次下载。
- 硬件分布统计揭示实际用户群体极小:覆盖8GB/16GB/24GB/32GB显卡和Mac设备。
- 要流畅运行需要24GB以上GPU,量化会损失质量。
- 在全球范围内,真正用27B及以上模型进行生产并持续开发的活跃用户估计不足1000人。
- 云端对比:Claude每月20美元可获得2500万tokens。
- 为避免5小时冷却而支付溢价对大多数用户而言不值当。
- Qwen 3.6 27B评测表现优于参数更多的Qwen 3.5 122B。
- RTX Pro 4500 Blackwell 32GB用户开始评估Qwen 3.8 27B。
社区反应
- Claude每月20美元能拿到约2500万tokens,所以云端方案更划算。
- 花溢价就为了避免5小时冷却,这账怎么算都不值。
- 连Qwen 3.6 27B都超过了3.5 122B,你们错过了。
- 真正用27B+模型在合适硬件上搞生产的开发者少得可怜。
- 现在还是早期,这个版本发布后生活中有太多其他优先事项。
实操建议
- 本地27B部署需要24GB以上GPU;8GB/16GB用户勉强运行会损失明显质量。
- 云端定价(2500万tokens/20美元)与本地硬件折旧相比仍有竞争力。
- Qwen 3.6 27B表现优于3.5 122B:新架构比参数量更重要。
- 100万下载是虚荣指标;实际活跃本地用户可能不足1000。
使用场景
- 高用量用户:云端仍是经济优选。
- 拥有RTX Pro 4500 32GB的开发者:评估Qwen 3.8 27B作为日常主力。
- 考虑Qwen 3.5 122B的用户:Qwen 3.6 27B是更优的架构选择。
实际价值
- 本地vs云端决策取决于用量:低于每月约1000万tokens阈值云端胜出。
- 更新更小的模型(3.6 27B)持续超越更老更大的模型(3.5 122B)。
- 硬件要求将实际应用限制在拥有高端GPU的爱好者和开发者群体。
社区证据
甚至Qwen3.6 27B都领先于3.5 122B。你错过了。
真实用法与意外收获
数学家用GPT Pro做研究:构造性工作表现出色,但DeepSeek因幻觉被放弃
发生了什么
- 数学家使用ChatGPT完成研究级问题求解:在微分几何领域生成非平凡示例。
- 发现过程:系统化探索猜想的弱版本于边界情况。
- ChatGPT生成令人惊讶的构造性示例,满足研究者的好奇心。
- DeepSeek被放弃:产生幻觉(虚假引用、臆造等式、虚构定理)。
- GPT Pro被描述为严谨:不伪造结果,诚实承认局限。
- 研究者因可靠的AI辅助而减少学术焦虑。
- 拥有大量想法的研究者对每周完成一篇非平凡论文充满信心。
社区反应
- ChatGPT真的很神奇。我感觉今年论文不用愁了。
- DeepSeek即使在Pro版本中仍有明显的幻觉问题。
- 体验过GPT Pro的严谨性后,无法忍受DeepSeek的臆造倾向。
- AI的构造能力对普通学者来说强得不成比例。
- 搞数学又变得有趣了,不再痛苦。
- 学术评估机制必将改变。
实操建议
- GPT Pro对局限的诚实态度(对比DeepSeek自信满满的幻觉)是研究场景的关键差异。
- 构造数学(构建示例)是AI擅长领域;证明验证需更谨慎。
- 想法丰富的研究者获益最大:AI处理执行,人类提供方向。
- 拥有足够原创想法的研究者可实现每周非平凡论文产出。
使用场景
- 数学研究:为猜想生成构造性示例。
- 微分几何:在人类未知边界探索边界情况。
- 学术产出加速:系统化弱猜想探索。
实际价值
- GPT Pro的幻觉抗性对研究级可靠性至关重要。
- AI构造能力显著超出普通学者能力范围。
- 可靠的AI辅助减轻学术焦虑,使研究者专注于重要问题。
- AI成为研究伙伴将改变评估机制。
社区证据
用这个提示词要小心,因为ChatGPT不是神谕。我试过了,它给了我一个非常自信的答案,关于我思维中一个所谓的模式。它基本上说我下结论太快,然后用那个结论来看待新信息。听起来很有见地。但后来我让它举个具体例子,它给不出来。然后我指出,它只能看到我选择输入到应用中的那一小块生活。它看不到我在打开应用前做的研究、进行的对话、读过的书、汲取的工作经验等。我大多把ChatGPT当作工具(有时是思维伙伴)来规划事情、研究、排查故障、辩论某个观点、获取反馈,或者弄清楚我的下一步行动。所以它看到的自然是我不断在质疑、计划和转向下一件事的那个版本。这不意味着那就是我的全部性格。这点是这篇帖子需要谨慎的地方。这些回答听起来可能非常有洞察力,因为ChatGPT非常擅长生成令人信服的语言。但这不等于就是真的。如果你用了这个提示词,要质疑答案。问它要具体的例子、证据。问问还有什么可以解释它看到的模式。从中提取有用的部分,当然可以。但不要让一个不断进化的技术因为说得漂亮就告诉你你是谁。