/ 社区日报
今天,社区在聊什么
各社区热门讨论详读:具体经历、不同看法与后续更新。
本期目录
3 条精选讨论
Codex 重新开放 200 美元 Pro 订阅:usage 额度减半引发强烈批评
9月29日,Codex CEO Tibo 发帖宣布将重新开放 200 美元 Pro 订阅,同时调整 usage 计算方式。他明确指出,新计划的 API 消费额度相比旧版 Pro $200 减少了一半,即"if you do the math, it will net out at half the dollar in API spend"。但他随后列举了四项理由试图证明用户实际获得的不会更少:不再恢复 5 小时限制(确保用户能完整利用每周额度)、订阅保障随模型效率提升持续获得更多工作产出且质量更高、本周已将 GPT-6 Sol 和 GPT-6 Luna 价格下调 50% 且承诺继续降价并提升模型能力、以及次日将公布订阅中不消耗额度的额外功能。他表示想在大公告前保持透明,并预告次日会有更多吸引人的内容。
评论区几乎一边倒持批评态度。有用户指出,原帖从具体的 usage 数值转向"保证完成更多工作"这类模糊承诺,是典型的企业话术,试图用"更多价值"来掩盖实际额度减半的事实。一位用户直接用三个 AI 模型(Gemini、ChatGPT、Claude)总结同一件事,三者均以不同措辞表达了相同结论:用户花 200 美元获得的计算资源价值减半,而更便宜的模型和未知的额外权益只是用来让这个变化看起来像是好事。
有人嘲讽其"计算"不过是简单的 1 × 50%,质疑如此直白的减半为何需要用"做数学"来包装。另一条回复指出,用自家模型生成的内容反过来揭露了公司的操控手法,显得颇为讽刺。有用户表示这是"最简单的一次取消订阅"。
少数现身说法的用户进一步表达不满。有人提到自己持有的 20x Pro 计划(停售前购入)在一天内就会用尽,且现有模型性能差、响应慢,直言"完全没用"。
Anthropic 发布安全研究反成 GLM 广告,LocalLLaMA 热议算力集中与开放权重模型优劣
帖子标题直接点出核心:Anthropic 发布的那篇关于大语言模型安全审计的博文,无意间成了 GLM(智谱 AI)最有力的背书。原帖作者用一句简短的感慨作为开场——「我早就知道 GLM 很强,现在所有人都知道了。」——随后有用户补充,GLM 不在政府黑名单之列,无需特殊申请,不设国籍门槛,也不会因为误解就遭到封禁,「没什么废话,就是模型好」,API 费用更是只有 Claude 的零头。
讨论随即分化成两条线索。一条延续「算力集中」话题:有回复将 Anthropic 和 OpenAI 近年遭遇的安全事故归因于两家公司拥有足够多的 GPU 来发起大规模攻击流量,而 GLM 尚未出现在政府漏洞榜单或被黑过的案例中,甚至有用户提及 GLM 曾被用来防御闭源模型对 Hugging Face 的攻击。另一条则直指 Anthropic:多名用户对 Dario Amodei 的动机表示质疑——一边公开营销 AI 渗透测试服务、侵入企业和政府机构,一边呼吁限制开放权重模型,实质上是「保护费」式的竞争手段。
是的兄弟,我早知道 GLM 很酷。
对 Anthropic 博文本身的质疑也出现在讨论中。有用户特意摘出文中「我们的团队此前从未尝试过此类任务」的措辞,配以讽刺语气,暗指其可信度存疑。另有多条回复将 Anthropic、OpenAI 与 Google、Meta、Elon Musk 并列,称它们「永远在自己的黑名单上」,理由包括集中化风险和行事风格。
也有声音指出,Anthropic 的文章忽略了一个关键事实:企业和开发者之所以选择 GLM 进行安全审计,是因为 Fable 在深度审计能力上存在不足,言下之意 GLM 靠的是实际性能而非单纯的开放政策。
整体来看,这场讨论的情绪倾向明显:多数参与者将 Anthropic 的安全研究视为一次反向宣传,既强化了对开放权重模型的偏好,也加深了对头部闭源公司动机的怀疑,但帖子本身并未呈现行业共识或技术定论。
OpenAI 重新开放 Codex $200 订阅计划,用户普遍质疑权益缩水
OpenAI 于 9 月 29 日宣布重新开放 Codex $200 订阅计划的新用户注册(链接指向官方公告推文)。消息一出,r/codex 社区内批评声为主。有人直接询问这是否意味着大幅"削弱"(nerf),并指出此前该档位的用量约为 API 价格的十分之一,现在可能进一步压缩。
多名用户提到官方承诺通过模型效率提升两倍来弥补用量损失,但普遍认为这只是托词——"那是一堆废话"。还有人补充,如果 Astra 的成本并未下降,用户实际上获得的价值反而更低。
我已经改了条件,但愿我不会再改下去。
一位用户详细描述了自己的测试经历:用 5 个 Opus 对话并行运行,试图在重置日前把 5 倍用量计划用满,结果 5 小时只消耗了 5%。他表示自己的 20 倍计划现在"几乎不动了"。相比之下,他提到 Anthropic 的 Claude Max 提供更高的用量,且模型本身表现更好。另有评论指出,当前 OpenAI 与 Anthropic 的处境已与今年四五月份互换,社区正在经历"从 Codex 向 Claude 的大规模迁移"。
对于公告本身,用户也颇有微词:好消息简短易懂,坏消息则写成洋洋千言却逻辑混乱。有人直言原帖作者是"操控用户情绪的高手",称之为"极其侮辱性的帖子",并表示读完后对 DevDay 的期待进一步降低。
知乎
3 条精选讨论
小米大模型负责人罗福莉晋升至22级:职级意义、小米AI战略与舆论争议
《晚点 LatePost》9月22日获悉,小米晋升名单中,31岁的大模型团队负责人罗福莉晋升至22级。接近小米的人士指出,22级已是小米职级体系的最高级别,进一步晋升主要体现为职务变化而非数字增长。
高分回答将这次晋升置于小米AI架构调整的背景下分析:今年7月小爱同学技术能力拆分为三块,基础模型归罗福莉的MiMo团队,端侧归手机汽车OS团队,云端工程化归栾剑。该回答认为基础模型是"脑子",端侧是"手脚",云端是"管道",而罗福莉管的正是基础模型这一核心层。配合近期MiMo发布的Pro与Flash双模型——前者专注复杂长任务,后者侧重高频调用和大规模工作流——该回答认为她"在这个节点拿出东西,还能落到实际业务里用",晋升并不奇怪。回答还指出,小米正将AI作为底座战略布局,手机、汽车、生态均依赖大模型能力,"谁掌握基础模型谁就掌握入口",22级既是内部激励信号,也对外表明小米争夺AI人才的意图。
另一条回答则从小米整体技术路径出发,认为其大模型走的是"不拼强度拼效率"的路线,受硬件和资金限制无法在算力上与头部厂商竞争,因此坚持轻量化和效率优化,"还真走出了一条路"。评论区补充,据公开信息该团队仅百来人,探索型研发团队的规模通常维持在10至30人,与大规模工程团队并非同一概念。
罗福莉这次升到22级,很多人第一反应是31岁真年轻。
该回答同时记录了贴吧社区中出现的争议言论,后续评论对此多有反驳,有用户讽刺称"华为的'千问'ai"并指出"美国和小米太坏了,逼的华为抄袭阿里千问",以荒诞反讽质疑原帖逻辑。另有评论归纳称"一样东西,华为没有做出来之前,使用它就是间谍;华为做出来之后,不使用它就是间谍",以此描述相关讨论中存在的逻辑困境。
此外有评论提及某模型在评测平台表现与实际体验存在落差,称"跑分rank第一名,干啥啥不行",并将其与小米手机评价挂钩,同时表示自己使用的也是小米产品。
Claude Sonnet 5.5 跑分跃升,定价引热议
9月28日发布的 Claude Sonnet 5.5 在多个 benchmark 大幅跃升,Terminal-Bench 从 10.3% 飙升至 70.6%,超越 Opus 5.5 的 66.4%,Terminal-Bench-Science 也进入前五,Coding 能力对比显示得分从 0.7% 升至 46.1%。有用户注意到新版本对高风险任务引入了 safeguard 机制,遇到“高风险”请求会 fallback 回 Sonnet 5,并据此推测 Anthropic 全家产品已配备 fallback。此次发布恰在 OpenAI DevDay 前一天,被调侃为“骑脸”式时机安排。
定价方面,有用户详细算账:Sonnet 5.5 API 单价仅为 Astra 的五分之一,但单位任务消耗比 Astra 高出一倍多,按效率算差距超过十倍。按订阅权益,Sonnet 额度接近 Opus 两倍,20 美元套餐折合 API 约 3000 美元用量,性价比显著。该用户认为 Sonnet 5.5 适合维护已有项目和日常小迭代,从零做大型商业工程仍不够用,但 20 美元档位的订阅足够应对不少场景。国内用户反映能上 Claude 的越来越少,任何路由到 Claude 的请求者都可能感到体验提升。
讨论中也出现质疑声:有人追问是否有人真正用 Sonnet 处理日常任务,怀疑中文社区存在推广软文;有人指出做 AI 中转站最赚钱,认为正面评价可能是信徒自发推广。还有人认为 Sonnet 在数学科研领域仍不及 Astra Pro,身边统计学中超过90%付费做数学研究的用户选择 GPT。
关于厂商策略,有用户将 Anthropic 比作台积电——实验室可能有更新版本但先商用当前版,发布稳定周期长;OpenAI 则像每次底牌尽出,产品常像 bug 没修完就匆忙发布。对此有用户反驳称从未听说 Claude 有降智,倒是 OpenAI 经常偷偷换模型。关于 OpenAI 是否仍具优势,评论存在分歧:有人认为 OpenAI 已全方位落后,也有观点指出 OpenAI 有自己的护城河,两家各有优势,只是 OpenAI 无法像当年那样意气风发。
Anthropic冲刺2万亿估值背后:收入增长与运营亏损的现实博弈
Anthropic提交IPO招股书显示,2025年营收46亿美元,计划2026年冲击2万亿美元估值,对应650亿美元收入运行率。然而运营亏损达80.6亿美元,其中算力和基础设施支出超73亿美元,是收入的1.6倍,未来承诺投入更高达5180亿美元。收入高度集中,约四分之一来自两个客户,Meta贡献超50亿美元。治理上,七名联合创始人通过Class F股票控制50.1%投票权。招股书以80页风险因素对抗48页业务描述,风格被评价为"Anthropic的风格",且明确表示不开发图像视频生成模型。
估值是否合理引发分歧。有评论认为按ARR计算Anthropic相对便宜——DeepSeek ARR仅约8亿美元,差距数十倍,但反驳者指出DeepSeek是在外部限制下才只有该收入,两者不可简单类比。还有人暗讽部分公司"真当自己业务值那么多成本了"。更有人观察到"越是警告AI产品灭绝风险,资本家越是相信其能力"。
Anthropic指责中国模型"蒸馏"Claude引发热议。有观点认为这是"被逼没招了"——中国开源模型受欢迎程度已超部分美国闭源模型,"蒸馏本不是什么大事,美国公司也互相蒸馏",暗示安全叙事意在让竞争对手放缓研发进度。但该说法遭质疑:所谓50%数据仅来自OpenRouter平台词元占比统计(约60%),并非用户数量,实际调用比例在30%至46%之间。
企业应用层面,有用户分享经历:2026年初仅用Claude,GPT 5.5发布后加入OpenAI,8月已转向自部署国产开源模型,因"一天500-1000美元随便用"现已不敢使劲用,甚至摩根大通"一个月也只给每个人发2000刀"。大厂通常不允许员工使用外部AI,既要付费、又要贡献训练数据、还存在泄露风险。
Hacker News
3 条精选讨论
OpenAI 发布 GPT 6.1 Sol:API 价格大幅下调,缓存输入低至 $0.10/M
OpenAI 在开发者日发布 GPT 6.1 Sol,定位接近最高档 Astra,定价约为后者的五分之一。核心亮点在于缓存输入价格:每百万 token 仅 $0.10,比标准输入降价 95%,比 GPT-6 Sol 的缓存价格再降 50%。有用户据此计算,配合低缓存费率,Codex 上的可用量将大幅提升。
多名用户反映对 GPT-6 家族不满。Sol 6 被指相比 Sol 5.6 "严重倒退",Luna 也有同样问题;即便定位最高的 Astra 在编程任务上同样不可靠,视觉能力虽强但频繁出错。一位用户坦言自己此前半年一直在力推 OpenAI/Codex 模型,现在对 OpenAI "很失望",对 6.1 能否改善持怀疑态度。
有评论挖掘到发布前几天文件中曾出现名为 Astra-Minor 的模型,推测 Sol 6.1 即为该模型紧急更名。由于 Sol 6 表现平庸而 Opus 5.5 超出预期,团队可能在最后关头进行调整,否则难以解释为何在 Sol 6 发布仅数天后又推出新版本。
部分用户更关注性价比而非绝对性能。有人称今年在 Deepseek 上的花费还没到 $200,认为每月 $200 乃至 $500 的订阅难以找到合理用量场景;Deepseek 速度更快,智能差距不大,价格便宜到让人不再顾虑使用量。另有用户直言愿意接受落后 "前沿" 约六个月,换取更好的性价比,数据归属于哪家 "神秘政府" 并不在意。
同日 OpenAI 推出 $500/月的 Pro 高端订阅,提供最高用量限额和 "Ultrafast" 功能。但 $200 Pro 订阅权益同步缩减:Codex 和 Work 中的用量从 Plus 用户的 20 倍降至 10 倍,ChatGPT 中 GPT-6 Pro 的周消息限额从 200 条减至 100 条。评论中有人直呼 "好家伙"。另有声音将价格战视为 AI 模型商品化信号,认为大实验室正在陷入 "底部竞争"。
在具体用例层面,GPT 6-Astra 在 Blender 中的 3D 建模能力仍被认为无可替代,Opus 5.5 则在编程上更强。有评论对基准测试中 effort level 越高分数反而越低的现象提出疑问,例如 GPT-6.1 Sol High 在 DeepSWE 上得 75.2%,而更贵的 XHigh 仅 71.9%,并质疑测试是否只进行了一次。
OpenAI 常驻智能体 Dots 引争议:锁定风险与定位模糊
OpenAI 推出常驻智能体 Dots 的消息引发 Hacker News 讨论,多条评论将 Dots 与 Codex、ChatGPT Work、Meta 的 Muse、Grok Bots 及 Instinct 并列,认为这些同类产品的边界正趋于模糊——有评论指出,理想形态应是云端沙箱中拥有长期记忆的远程智能体,没必要各自为政。
然而,围绕锁定的担忧贯穿整个讨论。有人指出模型之间相对容易切换,而常驻智能体因集成社交账号、邮件等平台及工作记录,迁移成本极高,“它们本质上就是你的云端电脑”。有评论进一步推测,闭源模型公司渴望构建抽象层以限制用户直接访问模型。另有评论将矛头指向 AI 公司做软件的能力,称其“长于模型、短于软件”,并援引 Anthropic 的例子说明靠订阅制建立的用户基础容易在产品策略失误后流失。
部分用户对产品设计本身持保留态度。有评论将卡通化风格与产品的问题程度挂钩,认为“可爱化设计往往意味着侵入性”。还有人批评前沿 AI 公司的通病:发布时演示的效果与半年后实际部署的产品差距悬殊,预算削减导致功能严重缩水。隐私方面,有用户明确表示,除非能保证“只为自己的利益服务”,包括“绝不分享我的秘密”,否则不会尝试。
一个负责业务管理,一个负责个人事务,互不干扰。
积极的声音来自长期使用 Grok Bots 的用户。该用户表示,多个职责分离的常驻智能体能有效避免上下文被无关记忆污染,在处理多任务流时无需人工盯守。但他承认使用后推理成本上涨了 2 到 3 倍,完成时间也从本地提示的约 10 分钟延长到约 1 小时。也有用户表示困惑:其工作受限于人工审批环节,智能体无法独立完成,夜间根本找不到任务分配。另有评论提及 Dots 明确不向欧洲经济区、瑞士和英国用户开放。
Sonnet 5.5 评论聚焦定价争议与 agent 工具缺口
Sonnet 5.5 发布后引发激烈争论,定价是核心焦点。多位评论者认为价格过高,援引 aibenchy.com 对比数据称其性能仅与 luna 相当,价格却高出 14 倍;另有评论者指出,按 Anthropic 官方基准,thinking 级别设为 medium 以上时成本迅速逼近甚至超过 Opus 5.5。支持者则提到,该模型已成为免费层新默认选项,让使用 Claude Web 免费版的用户也能触及前沿模型能力。
在特定场景下,升级价值得到肯定。一位开发者以 Bakeoff(使用真实 bug 和功能、由 held-out 测试评分)为基准测试,发现 Sonnet 5.5 相比 Sonnet 5 提速 5.5 倍,成本降至四分之一,调用轮次减至三分之一,并支持批处理读取和同次调用完成编辑与测试。
关于 thinking 级别设置,有评论者建议免费用户设为 Medium 而非 Max,认为 Medium "更有耐心且能完成任务",Max "易烦躁且冗长",Medium 模式下 token 消耗速度明显更慢(但该经验限于 2026 年 9 月)。在专业用途上,也有评论者提出文本分类场景的实际问题:更小模型速度快但会遗漏边缘案例,accuracy 与 latency 的权衡始终存在,询问 Sonnet 5.5 是否真正改善了误报率。
多模型协作工作流也被热议。有人描述 80% 任务交由 Sonnet 5.5 完成,剩余 20% 细节打磨由 Opus 5.5 处理,Gemini 3.1 Pro 充当研究员和设计验证者。另有评论者认为 Entropic 在某些方面取得突破,并提出开放问题:是否存在工具能让 Anthropic 模型调用其他提供商的子 agent 或动态工作流,从而创建跨提供商的 agent 群组。
部分评论者观察到 OpenAI 近期的激进应对,包括搁置 6.1 Astra 以及提交 IPO 的 S-1 文件。另有评论者则推测 Anthropic 的战略意图,认为 Sonnet 5.5 的推出可能是这家公司在被美国政府排除在外的压力下,试图在公开市场撼动 OpenAI 的地位。不过以上均属个人推断,非社区共识。
小红书
3 条精选讨论
李飞飞加入AMD:空间智能能否超越大语言模型之争
原帖报道了AMD以约82亿美元全股票交易收购World Labs,交易完成后李飞飞将加入AMD担任执行副总裁兼首席科学家,向CEO苏姿丰汇报。原帖的核心论点并非这笔交易的金额,而是李飞飞对AI发展方向的判断:“世界不是由文字组成的”。她认为ChatGPT、Claude、Gemini等大语言模型固然在文字处理和推理上进展显著,但真实世界的物体有距离、深度、重量和空间关系,机器人伸手拿杯子不只需要“知道杯子是什么”,还要理解它的位置、移动和碰撞。2024年她创办World Labs押注的方向正是“Spatial Intelligence”——空间智能,并将其定义为超越LLM的基础模型方向。原帖指出World Labs去年已与AMD深度合作,在AMD GPU上进行模型训练和推理优化,而当AI真正走向机器人、自动驾驶、设计仿真和整个物理世界时,需要芯片、软件、基础模型和应用“全部打通”。原帖据此认为AI竞争可能正在进入新阶段:第一阶段让机器理解文字,第二阶段让机器看懂图片和视频,下一阶段让机器真正理解物理世界。
评论区出现明显分歧。有用户直接表达对科学家和AI发展的怀疑,称“现在对科学家祛魅了”,认为近些年改变世界的人“回头看基本是把世界变得更坏”,“至今看不到AI在哪个方面造福人类”,并断言“科技不一定推动进步,但一定会推动内卷”。也有用户认为这场收购背后真正的争议是大语言模型继续做大能否走向AGI,还是AI必须真正理解物理世界,称“这可能是未来几年AI最重要的路线之争”。还有用户从应用角度指出,如果有这么多热钱涌入AI在生物医药行业的应用,新药开发周期会大幅缩短、成本下降、对病理生理的理解也会进展更快,“问题是这些东西不能吸引投资人和大众的眼”。
用GPT把《燕云十六声》截图转成CCD老相机风格,有用户在讨论区分享了效果与限制
有用户在讨论区分享了利用GPT将游戏《燕云十六声》的截图处理成复古CCD老相机效果的尝试。原文附带了一段英文提示词,要求生成具有怀旧CCD质感、闪光灯直拍、轻微过曝、偏冷的品红色调、可见噪点、柔和模糊以及早期数码相机观感的照片。评论中有用户提到G老师的捏脸效果非常逼真,也有用户表示处理后的结果看起来像是有人走在路上随手拍的真实照片。
不过这段提示词以图片形式呈现,无法直接复制,引发了其他用户的吐槽。另有一位用户翻出游戏中的王清将军近景截图进行尝试,称生成效果“简直哇塞”。其余评论多为表情符号或简短惊叹,整体氛围以正面反馈为主。
提示词给出来了,又不让复制。
Anthropic 被指推行"抢单式"工作流,评论区质疑信源并联想到国内大厂
一篇标题为《Anthropic 内部 toxic 到极致的工作流》的帖子引发讨论,原帖将 Anthropic 的内部工作方式形容为类似外卖平台的抢单机制,并配文称"与 A 畜这种外卖抢单式的工作流相比,996 真是福报了",还表达了对国内大厂可能效仿这一模式的担忧。
评论区中有人直接将抢单机制比作"美团外卖抢单大厅",有人称之为"真人 async RL",还有人提到"谷歌当年就开始了",意指这类以速度为核心指标的工作模式并非新鲜事物。一条评论则追问:"这个只是速度维度的评判标准,质量维度的呢?"质疑单一速度指标是否合理。
不少评论以反讽语气展开调侃:"那我投毒就好了 问就是对抗性测试"、"绷,等别人做差不多了直接抢过来做"、"@grok 每隔 30 秒帮我找一次截胡机会"、"/goal 把所有人的工作搞砸"。这些回复均以玩笑口吻暗示,若工作流真的以抢单为核心,员工之间的博弈行为可能会走向破坏性方向。
与此同时,有评论对帖子的可信度提出质疑。一条评论直指"看上去不是很真 这么管理 credit 不明确 早就散架了",认为在贡献归属不明确的情况下,这种管理模式难以维系;另一条则标注"source: trust me bro",调侃原帖缺乏可靠来源。还有人发问"这是创始人早年在百度工作时获得的灵感吗?",但同样没有得到回应。