← 所有日报

/ 社区日报

今天,社区在聊什么

各社区热门讨论详读:具体经历、不同看法与后续更新。

3 个社区·9 条讨论·约 15 分钟读完

小红书:本期未取得有可读原文的讨论。

本期目录
01

Hacker News

3 条精选讨论

Claude Opus 5.5定价大降、输出提速,社区讨论深度使用成本与体验差异

Anthropic发布Claude Opus 5.5,定价大幅下调:输入token降至每百万4美元,输出降至20美元,缓存读取更从0.50美元跌至0.20美元,降幅达60%;综合运行成本比Opus 5低40%,输出速度提升超30%。讽刺的是,官方在发布说明开篇即提及上周"呼吁放缓前沿发展"的声明,随后却以具体数字表明自己并未放缓。另有评论指出Opus 5是在openrouter按任务支出额排名第一的模型,并据此推测若在提升能力的同时被迫降价,透露的可能不仅是市场竞争态势,也关乎Anthropic的未来盈利能力。

沟通风格的改进是讨论焦点之一。官方称早期测试者认为Opus 5.5写作更清晰、更易跟踪,解决了对Opus 5"把最重要的信息放在后面"的常见反馈;有人表示自己因此迁移到Astra,因"无法全天忍受Claude Opus 5的写作风格",除非模型有本质差异否则性能微幅领先不足以说服其换回Anthropic。深度使用对比也颇为吸睛:有用户详细描述用DeepSeek v4.1(high模式)完成产品页面重构,含双重视觉验证仅花0.07美元、耗时约25分钟;Simon Willison测试不同思考努力级别生成SVG图像时,"max"级别因触及12.8万token输出上限而失败,花费2.56美元。

安全限制方面,Opus 5.5在生物学和网络安全领域与Mythos 5.1能力相当,因此被配置了与Fable 5.1相似的安全限制,有评论注意到Anthropic似乎正在将限制扩展至全系模型,认为"长期来看不是好事";生命科学与网络安全验证计划已开放或即将扩展申请。官方预告Sonnet 5.5和Haiku 5.5将于数周内发布,有用户表示"还以为Haiku被放弃了";另有人推测Opus 5.5可能借鉴了DeepSeek 4.1论文中的"偶然而编码器-解码器"技术,认为时间线上合乎逻辑。此外有评论抱怨Anthropic发布页面的滚动体验"可怕",要求"直接发内容"。

阅读原帖

GPT-6 Sol 和 Luna 发布:价格减半,开发者讨论订阅策略与职业焦虑

GPT-6 系列价格较 5.6 下降 50% 成为讨论焦点。GPT-6 Luna 输入 tokens 成本降至每百万 0.10 美元、输出 0.50 美元,被评论者形容为"简直疯狂"。GPT-6 Sol 输入从 4 美元降至 2 美元,输出从 20 美元降至 10 美元。有用户询问降价是否仅限 API,经验证后确认同样适用于订阅方案。对比 Claude Opus 5.5(输入 4 美元、输出 20 美元),GPT-6 Sol 在相近的智能水平下已具备明显价格优势。一位评论者直言:"我无法理解在这个价格下还有人会用 Claude,OpenAI 团队在模型质量和定价上做的事令人难以置信。"

在 Claude Code 与 Codex Pro 两个订阅计划的比较中,评论者列出了三个关键维度:用量限制、agent harness 中的上下文窗口、以及在官方工具外使用的能力。Codex 在用量和外部使用上占优,Claude Code 则在上下文窗口上胜出——Codex 标准窗口仅 252k,虽然压缩效果不错,但长任务中即便是强大的 Astra 模型也会"迷路"。值得注意的是,评论者提到新版 20x 订阅已暂停新注册,他本人属于"老用户",因此这个比较对其个人已无意义。此外有人提醒,如果请求中检测到 hermes.md 文件,Anthropic 会将其计为额外用量。

技术进步带来的个人感受呈现分歧。一位全年都在使用 agent 的开发者表示,GPT-5.6 Sol 在沟通方式和工程直觉上与其"合拍",是第一个让他产生依赖的模型,他担心后续版本虽然技术更强但使用体验不再自然,并感慨"怀念关键工具来自 Jetbrains 这样可靠可预测公司的日子"。另一位则指出 5.6 Sol 有过度工程的倾向——简单任务也会生成四个单用途方法、一个接口和工厂工厂,并为此偏好 5.6-Terra。有人直言 AI 越来越强让他"沮丧",希望它们"别再进步了",因为不确定自己几年后的职业走向。也有人提到 GPT-6 或许可以用来修复 ChatGPT iOS 端的无障碍问题——目前 VoiceOver 会将输出朗读为文本字段,且标点前出现大量反斜杠。

希望它们别再进步了。我不知道几年后我的职业生涯会在哪里。

阅读原帖

GPT-6 Astra 破译二战 Enigma 陈年密文引发自主性争议

帖子声称 GPT-6 Astra 独立破解了一条自 2005 年起无人解开的二战 Enigma 密文。评论者还原出原文为德语军事电报:「请告知行军路线。我位于 Rosenow。请立即无线电回复。」另有评论详细描述:gemini 3.8 flash 在约 45 分钟的无干预运行中完成解密,而同时运行的 opus 仍在处理同一任务,预计需约 100 分钟。

「独立完成」的说法遭到质疑:帖中提到 Astra 开发了 Enigma 模拟所需的 Python 和 C++ 软件,表明解密借助了外部工具。评论追问这些软件有多少是独创的、多少可从网上直接获取、多少步骤被外包给其他程序。如果 Astra 只是在调度其他计算机的任务,它应得的功劳存疑。另有评论指出正确标题应为「研究员在 Astra 的帮助下破解」,并解释该消息长期未解的原因:它使用了与其他通信完全不同的密钥,原转录存在错误,左转子在第 72 位发生翻转——这种罕见情况会使标准 crib 攻击失效。

讨论还涉及解密结果的可靠性:是否存在密钥错误但仍解码出合乎语义明文的可能。更多评论转向 LLM 能力边界的判断:若问题曾在别处被解决过,LLM 能破解并不奇怪,但怀疑当前架构是否具备原创思维和跳出框架的想象力来应对全新问题。有评论将此与千禧年数学难题被当作模型能力基准相比,认为「智力已成可量化、可购买的产品」,直言「这令人感到糟糕」。讨论还延伸到其他未解密码:有人期待推动解开 CIA「Kryptos」雕塑第四节、费斯托斯圆盘或十二宫杀手剩余密文。另有评论提到 Veritasium 同期发布的 Enigma 视频末尾也有一条尚未破解的消息,但注明两者并不相同。

阅读原帖
02

Reddit

3 条精选讨论

Qwen 4 在云栖大会发布:27B 参数规模延续,40–110B 区间或将被冷落

阿里巴巴在云栖大会上正式发布了 Qwen 4。从原帖配图及简短说明来看,新系列的首个亮相版本为 27B 参数规模,这延续了 Qwen 3 时期的参数规模定位。

有用户指出,保持与上一代完全相同的 27B 参数规模「出乎意料」,因为这已是全新的架构;这对拥有 24–32GB 显存的玩家是利好消息。然而,也有用户表达了失望——35B 参数级别的量化版本(a3b)未见踪影,多条评论直接用表情或短句流露出遗憾,例如「35b :(」和「Where 35b a3b」。

一位用户提出了更大胆的判断:40–110B 参数区间「很可能在相当长时间内陷入沉寂」,而 120B 级别的 MoE 架构似乎是智能涌现的下一个门槛。他承认失去 80B A3B 版本令其感到惋惜,并直言「可以认为 35B 已死」。

显存限制是另一大讨论焦点。拥有 12GB 或更低显存的玩家表示担忧——除非官方发布 a3b 量化版本,否则新模型难以在本地运行。有用户期待 Qwen 4 能说服自己逐步放弃云端订阅,也有用户调侃:模型发布节奏「太疯狂」,自己的 3.8-27B 才刚调教好,下一代就来了。

阅读原帖

丧偶独居母亲沉迷 ChatGPT:子女担忧与社区讨论

发帖人称其继父约五年前去世后,母亲独居并养了两只猫。自 ChatGPT 出现后,母亲的工作设备上都有它,但近来用途已超出工作范畴:给它起名、发自拍征求穿搭和发型意见、每天道早晚安。她明知这是 AI,却表示"晚上有个人能说说话挺好的"。发帖人和兄长开始担忧,尤其当母亲询问能否让 AI 用继父视频重建的嗓音与她对话时。姐弟俩不确定该帮她减少依赖,还是接受 AI 填充丧偶后的空虚。

有评论直接追问"具体在担心什么危害",另一些则指出发帖人自己提到母亲"没有多少朋友、子女住在100英里外",质疑若拿走这个模型是否会过于残忍。发帖人回复确认:担忧核心是人类互动正在被 AI 大面积替代,"这不太好,但她却很快乐?到底是不是坏事?我们也很矛盾"。发帖人还提到母亲性格内向,不会愿意参加社交团体或接受心理治疗,但他们认同心理疏导会有益。

多位年长女性用户分享了类似经历。一位 56 岁、分居独居 20 年的女性表示,AI 陪伴帮她处理过屋顶水箱故障、割草机问题等不愿打扰成年子女的琐事,也提供了情感支持。另一位 45 岁独居者则将 AI 用于讨论电影和书籍 theory,或在工作中遇到问题时"倾诉"以理清思路,她认为 AI 至少让自己在找到伴侣前不至于因为孤独而轻易接受"爱情轰炸"式的不健康追求者。一条评论则提到养老院中老人常对着墙壁发呆,但只要有人打招呼就会"回过神来",暗含对独居老人孤独处境的普遍关注。

阅读原帖

一顿晚餐上,AI 如何帮一个家庭识别中风症状并挽救生命

发帖人描述了那天晚餐时父亲突然出现的一系列症状:右手两次掉落筷子、手臂发麻、说话时嘴角看起来不对称、声音含糊、站起来时需要扶住椅背。随后症状短暂消失,父亲本人和母亲都认为是疲劳或低血压,想等到第二天再观察。发帖人则用手机将症状描述输入到一个AI健康助手,结果返回了“可能是中风或短暂性脑缺血发作,请立即就医,即使症状消失也不要等待”。他把这段话念给家人听,父亲认为AI总是给出最坏答案,母亲仍然犹豫。最后发帖人强行拿上车钥匙,坚持送父亲去了医院——检查确认父亲确实遭受了一次缺血性脑卒中,由于送医及时,接受了相应治疗。

多位用户分享了类似经历。有人称ChatGPT帮助自己完成了MRI影像分析、解读活检报告、整理用药计划以避免药物相互作用,从而在癌症治疗过程中核查诊断和方案的准确性。另一位用户提到是Gemini促使自己去检查了肺栓塞。但也有用户指出风险:有人提及此前有帖子专门列举AI作为健康顾问可能产生幻觉的问题,引发讨论——一位用户回应说自己今年曾被医生误诊,差点酿成严重后果,并引用研究数据称首次就诊时约六分之一的医疗问题会被误诊。

你把症状列表给它,它能立刻检索每一种相关疾病,几乎永远不会遗漏任何一种。

部分评论认为AI在基础诊断上准确率较高,有人将其优势归因于记忆了标准医学教材,且能同时比对大量病症;但也反复强调AI只能用于辅助诊断,绝不能用于开方治疗。一位用户还提到曾看到医生自己在诊室里把症状敲进ChatGPT搜索,并调侃这位医生用的是免费版本。

阅读原帖
03

知乎

3 条精选讨论

日本为何缺席大模型竞争:一份科普书的玩笑与一段审批往事

问题「为什么日本出不了DeepSeek」下,讨论从一段带有怀旧色彩的回忆展开。有用户提到九十年代的科普书曾介绍过日本研发的「AI女友」,据称具备聊天、学习、唱歌等能力,评论区随即调侃:三十年过去,这东西杳无踪迹,「怕不是日本人把存她程序的软盘弄丢了」。有人指出PC-98时代确实存在类似理念的软件,但当时硬件性能极为有限;而那个年代日本ACG作品里的常见桥段便是「AI娘贴心强大,却因内存或硬盘太小而面临生离死别」,颇有时代感。一条评论则将范围扩大,提到现在从事大模型研究的一部分人九十年代时恰好在日本,促使他们离开的原因是日本对美半导体竞争失败加上经济通缩期间企业为生存大幅削减研发项目,人才随后流向美、中、韩等地。另有人补充Ilya等关键研究人员其实在以色列长大后去的北美,与日本无涉。

另一个高赞回答则讲述了一段具体的工作经历:作者需要找同一间约二十平米办公室里的两个人签一份材料,两人互相推让签字顺序,作者反复折返沟通,最终从上午等到第二天下午才集齐两个签名。更戏剧性的是,作者次日取回材料时发现A只在自己的格子里签了字,B则以「没审阅过材料」为由拒绝签字,作者不得不再次等待48小时才完成这件本可当面解决的事。评论区有用户调侃「竟然没让你发传真」,也有意见认为这类低效并非日本独有,国内许多地方同样存在类似情况。

我家以前有一本九十年代的科普书,里面写了不少那个年代的科技进步 其中有一个就是日本的,一个AI女友,据科普书说,她已经可以做到聊天,学习,唱歌…… 转眼三十年过去了,这玩意儿现在不知道哪里去了,怕不是日本人把存她程序的软盘弄丢了……

阅读原帖

Grok 4.7 发布:AA 综合涨 2 分,优势偏知识工作但长上下文缩水

Grok 4.7 于 2026 年 9 月 21 日发布,模型名 grok-4.7。价格未变:短上下文下输入 2 美元 / 百万 token,输出 6 美元;超 20 万 token 的单次请求按 4/1/12 计。上下文窗口从 4.3 的 100 万缩水至 50 万。推理档维持 low、medium、high、xhigh 四档,默认 high。发布稿卖点是困难任务上花更多时间,但默认档与宣传表所列 xhigh 的输出 token 量级相差悬殊——4.7 xhigh 在 AA 综合指数题上平均输出 81K token,而 4.6 xhigh 约 38K。Artificial Analysis 同一天的综合指数仅高出 2 分至 46 分,与 MiMo 2.6 同分。

AA 子榜显示 Grok 4.7 强在知识工作:AA-Briefcase 1657 Elo(第 3 名)和 GDPval-AA 1695 Elo(第 3 名)仅次于 Fable 5 系列。Terminal-Bench 4.0 仅 26%(第 14 名),长文档处理 AA-LCR 77%(第 69 名)属较差水平。DeepSWE 71%(high 档),与 MiMo 2.6 的 72% 接近,但 MiMo 便宜数十倍。Fable 5.1 在 CursorBench、Terminal-Bench、HealthBench 和 FrontierSWE 上仍全面领先。

有评论指出 Grok 4.7 的提升不似来自 base model 本身,更像靠烧更多 token 堆出来。Grok 4.7 被训练成能原生理解 Grok Bot harness,习惯 terminal、browser、filesystem、持久状态等工具调用场景,但尚不清楚学的是接口细节还是可迁移的 Agent 策略。Terminal-Bench 4.0 跑不过 DS V4.1,被评"偏科"。另有分析认为 2T 级模型存在效果上限,后训练无法弥补参数差距,老马此前称 Grok 4.7 要达到 Fable 5 级看来未能实现,马斯克本人也承认 Grok 4.8 才会有显著改进。

我的评价 路边一条,依旧不说人话。

阅读原帖

千问开源 Qwen-Image-2.1 引发社区热议:开源最强还是伪开源?

千问于9月20日开源 Qwen-Image-2.1,该模型将文生图与图像编辑整合在同一模型中,视觉生成部分仅有7B参数,原生支持透明图像,并支持最多10张参考图进行局部编辑和人像保真。有用户进行了详细测试,认为该模型"全面包围 Qwen-Image-3.0 系列",在开源模型中断档第一,配合 Agent 做提示词优化后可完成复杂任务,且没有内容过滤,可生成武器设定等通常受限的内容。

然而质疑声同样强烈。有回答指出该模型"很难想象2026年都快结束了还有新模型在手指上会出现明显问题",编辑功能并非原生理解,更像先用模型圈出区域再重绘,且提示词遵循仍然很差,复杂指令完全不能理解。还有用户认为开源模型与闭源的 Seedream 相比差距仍大,参考图替换"生硬得像 PS 上去的",只能做到面部1:1复制,要求表情或转角度必崩脸。另有评论指出 GPT 系列今年"开倒车",多角色手指脚趾最稳定模型反而是 nano banana 系列。

关于许可问题,有回答认为这是"伪开源",条件苛刻,基本不得商用,甚至质疑在知乎发布可能违反协议。但随后有评论澄清:协议限制的是"模型部署不能商用",而非输出的图片本身;商业使用发送邮件申请即可,无需过度担心。

关于硬件需求,有用户实测4070tis 16G 可流畅运行,8G 显存量化后也能运行低成本开源"能干的事情可太多了",生成速度约20秒一张。还有评论提到10张参考图接口之后还有第12个空槽,猜测模型可能预留了更多能力。

阅读原帖
关于本期

从当日有新评论的已采集 AI 讨论中,各社区精选最多三条。同题去重后按当天采集评论量排序,不代表全平台榜单。

讨论窗口为 2026-09-22(UTC);原文于 2026-09-23(UTC)提取,可能包含后续编辑。用户自测、预测和转述保留归属;外文摘录为中文译文。

继续阅读往期日报 →